07 算力与硬件底座
速览卡
| 项 | 内容 |
|---|---|
| 一句话定位 | 整个 AI 产业的物理约束层,决定了能力上限、成本下限与地缘风险 |
| 核心内容 | 训练 vs 推理的算力分化、芯片格局、端侧与小模型、推理成本经济学、能耗约束 |
| 现状判断 | 推理算力需求已超过训练,成为主要消耗;国产替代与端侧部署是两条重要主线 |
| 读完能回答 | 自部署划不划算?为什么要关心芯片?端侧 AI 能做什么? |
| 相关板块 | 01 基础模型 | 05 工程化 | 11 趋势 |
一、为什么算力是 AI 的地基
大模型的每一层能力都建立在算力之上:
算力规模 → 可训练的参数量 → 模型能力上限
算力成本 → 推理单价 → 应用能否规模化
算力供给 → 谁能做 AI、做多快 → 产业格局这不只是一个技术话题:算力的可获得性直接影响国家与企业的 AI 能力,是产业竞争与地缘博弈的焦点。
二、训练算力 vs 推理算力
这是理解当前算力格局的关键区分。
| 维度 | 训练 | 推理 |
|---|---|---|
| 做什么 | 从数据中学习参数 | 用已有模型生成输出 |
| 计算特征 | 一次性、超大规模、可中断重来 | 持续性、与用户量成正比、要求低延迟 |
| 硬件要求 | 极致算力 + 大显存 + 高速互联 | 更看重性价比、能效、延迟 |
| 数量级 | 少数机构需要 | 所有应用都需要 |
| 当前占比 | 较小且集中 | 已占主要部分(随应用普及持续增长) |
为什么这个转变重要
早期算力的焦点是训练(比谁的模型大)。随着模型进入应用阶段:
- 推理算力需求随用户量线性增长,而训练是一次性的
- 推理场景多样化(云端高并发、边缘低延迟、端侧离线),单一芯片难以通吃
- 推理的成本敏感度远高于训练——每分钱都直接影响商业模型
结果:推理专用芯片、推理优化技术(量化、投机解码、KV Cache 优化)成为竞争焦点。
三、芯片格局
[易变] 芯片产业变化快且受政策影响大,以下为结构性描述。
主要玩家
| 类别 | 代表 | 特点 |
|---|---|---|
| 通用 GPU 主导者 | NVIDIA | 算力强劲,CUDA 生态壁垒极高,是当前训练与推理的主流选择 |
| 传统巨头 | AMD、Intel | 硬件有竞争力,软件生态仍在追赶 |
| 云厂自研 | Google TPU、AWS、各家自研芯片 | 针对自身负载优化,不外售或有限外售 |
| 国产厂商 | 华为昇腾、寒武纪等 | 受外部管制推动,快速迭代,生态建设是主要挑战 |
| 推理专用 | 各类推理加速卡、SRAM 方案 | 针对推理场景优化能效与成本 |
| 端侧芯片 | 手机/PC 的 NPU、各类边缘芯片 | 低功耗,支撑端侧小模型 |
三条技术路线
| 路线 | 思路 | 优势 | 挑战 |
|---|---|---|---|
| 通用 GPU + 成熟生态 | 沿用 CUDA 生态 | 兼容性与开发效率最高 | 成本高、能效未必最优 |
| 全栈自研 | 自研芯片 + 自研软件栈 | 自主可控、可深度优化 | 生态建设周期长 |
| 推理专用 | 针对推理做架构创新(如大容量 SRAM) | 推理能效比高 | 通用性差,场景受限 |
生态比芯片本身更重要
关键判断:NVIDIA 的真正壁垒不是芯片性能,而是 CUDA 软件生态——十几年的算子库、工具链、开发者习惯。
这解释了为什么:
- 国产芯片的性能参数追上后,落地仍需时间(生态适配)
- 各家都在重投入软件栈(算子库、编译器、迁移工具)
- "兼容 CUDA"成为很多替代方案的现实选择
四、国产替代
[待核实] 以下内容涉及快速变化的政策与产业动态,具体数据请以权威来源为准。
驱动力
| 因素 | 说明 |
|---|---|
| 外部出口管制 | 高端芯片获取受限 |
| 供应链安全 | 降低对单一来源的依赖 |
| 政策支持 | 算力基础设施相关行动计划 |
| 市场需求 | 国内 AI 应用规模巨大 |
现状
- 国产芯片在推理场景已可提供可用方案,部分产品在特定推理指标上有竞争力
- 训练场景仍是短板,尤其在超大规模集群的互联与生态上
- 软件生态是最大瓶颈:模型适配、算子覆盖、开发工具链成熟度
- 算力中心建设快速推进,但实际利用率是需要关注的问题
务实建议
| 场景 | 建议 |
|---|---|
| 推理服务、对成本敏感 | 可评估国产方案,需实测适配效果 |
| 大规模训练 | 短期内仍依赖通用 GPU,需提前规划供给 |
| 涉密/自主可控要求 | 国产方案是必选项,需为适配留出时间 |
| 混合部署 | 常见做法:核心训练与推理分层,关键链路保留备选 |
五、端侧 AI 与小模型
为什么端侧在兴起
| 驱动 | 说明 |
|---|---|
| 隐私 | 数据不离开设备 |
| 延迟 | 无需网络往返 |
| 成本 | 无 API 费用,边际成本趋近零 |
| 离线可用 | 不依赖网络 |
| 模型能力 | 小模型能力足够好(蒸馏、量化技术进步) |
端侧能做什么
| 场景 | 说明 |
|---|---|
| 手机端 | 输入法、相册搜索、通话摘要、实时翻译、系统级助手 |
| PC 端 | 本地知识库、代码补全、文档处理 |
| 车机 | 语音助手、座舱交互 |
| IoT / 摄像头 | 本地视觉识别、异常检测 |
| 工业设备 | 离线质检、预测性维护 |
小模型(SLM)的定位
不是"差一点的大模型",而是不同的成本结构。
| 维度 | 大模型 | 小模型 |
|---|---|---|
| 能力 | 强,通用 | 弱,但特定任务可接近 |
| 部署 | 云端 | 端侧 / 边缘 |
| 成本 | 按量付费 | 一次性硬件成本 |
| 隐私 | 数据出网 | 数据本地 |
| 延迟 | 有网络开销 | 极低 |
常见架构:端云协同
端侧小模型:处理高频、简单、隐私敏感的请求
↓ 复杂请求
云端大模型:处理困难任务这种分层能同时优化成本、延迟与隐私。
六、推理成本经济学
成本为何持续下降
| 因素 | 说明 |
|---|---|
| 硬件迭代 | 每代芯片能效提升 |
| 架构优化 | MoE 只激活部分参数、注意力变体降低计算量 |
| 软件优化 | 推理框架、算子融合、量化、投机解码 |
| 模型优化 | 蒸馏、剪枝 |
| 市场竞争 | 厂商价格战 |
趋势判断:单位智能的成本长期下降,这是 AI 应用能够规模化普及的前提。
自部署 vs 调 API 的经济账
需要计算的真实成本:
| 成本项 | 自部署 | 调 API |
|---|---|---|
| 硬件采购/租赁 | 高(GPU 昂贵) | 无 |
| 电力与机房 | 中高 | 无 |
| 运维人力 | 高(需要专职) | 低 |
| 利用率损失 | 真实存在(业务有波峰波谷) | 无(按量付费) |
| 模型升级 | 需要自己跟进 | 供应商负责 |
| 边际成本 | 低(量越大越划算) | 恒定 |
关键判断:
- API 价格下降速度往往快于自部署成本的下降速度,这使盈亏平衡点不断右移
- 自部署的真实理由通常是:数据不能出网、需要深度定制、规模极大且稳定、合规要求
- 单纯为了省钱而自部署,常常算不过账
决策时应定期重算,因为价格在变,你的业务量也在变。
七、能耗与环境约束
这是常被忽视但日益重要的约束。
| 问题 | 说明 |
|---|---|
| 电力需求 | 大规模数据中心的电力消耗快速增长 |
| 选址约束 | 需要电力充足、电价低、冷却条件好的地点 |
| 散热 | 高密度算力带来散热挑战,液冷成为趋势 |
| 水资源 | 部分冷却方案耗水 |
| 碳排放 | 企业 ESG 目标下的压力 |
产业影响:
- 算力建设开始受电力供应制约
- 能效比成为芯片竞争的关键指标
- 推动了对更高效的模型架构与推理方案的需求
八、算力对应用开发者的实际影响
你可能不直接买芯片,但算力格局会通过以下方式影响你:
| 传导路径 | 表现 |
|---|---|
| 模型价格 | 算力成本决定 API 定价 |
| 模型能力 | 训练算力规模影响前沿模型能力 |
| 可用性 | 算力紧张时可能出现限流、排队 |
| 上下文长度 | 长上下文的显存开销限制了可用长度 |
| 部署选择 | 决定了哪些规模的自部署可行 |
| 国产化要求 | 特定行业可能要求使用国产算力 |
实践建议
| 建议 | 说明 |
|---|---|
| 不要过度绑定特定硬件 | 保持架构可移植 |
| 关注单位成本趋势 | 定期重算自部署的经济性 |
| 设计时考虑算力波动 | 有降级与排队方案 |
| 端侧场景提前规划 | 若业务有端侧需求,模型选择需考虑端侧可部署性 |
| 涉密/合规场景早评估 | 国产化适配需要时间,不能临时抱佛脚 |
九、常见误区
| 误区 | 事实 |
|---|---|
| "算力就是 GPU 数量" | 互联带宽、显存、软件栈同样关键,集群效率才是真指标 |
| "国产芯片参数追上就能用" | 生态适配(算子、框架、工具链)才是落地瓶颈 |
| "自部署一定省钱" | 需计入利用率、运维、电力、升级成本,且 API 价格在快速下降 |
| "端侧模型一定很弱" | 特定任务上小模型经优化后可接近大模型,且成本与隐私优势明显 |
| "算力会一直紧缺" | 各细分领域供需不同,推理算力正在快速扩张 |
| "能耗不重要" | 已成为算力扩张的实质约束之一 |
十、延伸方向
- 模型能力与成本的关系 → 01-基础模型层
- 自部署的工程复杂度 → 05-工程化与LLMOps
- 落地成本结构 → 08-应用形态与行业落地
- 未来算力演进 → 11-趋势与前沿展望