Skip to content

07 算力与硬件底座

速览卡

内容
一句话定位整个 AI 产业的物理约束层,决定了能力上限、成本下限与地缘风险
核心内容训练 vs 推理的算力分化、芯片格局、端侧与小模型、推理成本经济学、能耗约束
现状判断推理算力需求已超过训练,成为主要消耗;国产替代与端侧部署是两条重要主线
读完能回答自部署划不划算?为什么要关心芯片?端侧 AI 能做什么?
相关板块01 基础模型05 工程化11 趋势

一、为什么算力是 AI 的地基

大模型的每一层能力都建立在算力之上:

算力规模 → 可训练的参数量 → 模型能力上限
算力成本 → 推理单价 → 应用能否规模化
算力供给 → 谁能做 AI、做多快 → 产业格局

这不只是一个技术话题:算力的可获得性直接影响国家与企业的 AI 能力,是产业竞争与地缘博弈的焦点。


二、训练算力 vs 推理算力

这是理解当前算力格局的关键区分。

维度训练推理
做什么从数据中学习参数用已有模型生成输出
计算特征一次性、超大规模、可中断重来持续性、与用户量成正比、要求低延迟
硬件要求极致算力 + 大显存 + 高速互联更看重性价比、能效、延迟
数量级少数机构需要所有应用都需要
当前占比较小且集中已占主要部分(随应用普及持续增长)

为什么这个转变重要

早期算力的焦点是训练(比谁的模型大)。随着模型进入应用阶段:

  • 推理算力需求随用户量线性增长,而训练是一次性的
  • 推理场景多样化(云端高并发、边缘低延迟、端侧离线),单一芯片难以通吃
  • 推理的成本敏感度远高于训练——每分钱都直接影响商业模型

结果:推理专用芯片、推理优化技术(量化、投机解码、KV Cache 优化)成为竞争焦点。


三、芯片格局

[易变] 芯片产业变化快且受政策影响大,以下为结构性描述。

主要玩家

类别代表特点
通用 GPU 主导者NVIDIA算力强劲,CUDA 生态壁垒极高,是当前训练与推理的主流选择
传统巨头AMD、Intel硬件有竞争力,软件生态仍在追赶
云厂自研Google TPU、AWS、各家自研芯片针对自身负载优化,不外售或有限外售
国产厂商华为昇腾、寒武纪等受外部管制推动,快速迭代,生态建设是主要挑战
推理专用各类推理加速卡、SRAM 方案针对推理场景优化能效与成本
端侧芯片手机/PC 的 NPU、各类边缘芯片低功耗,支撑端侧小模型

三条技术路线

路线思路优势挑战
通用 GPU + 成熟生态沿用 CUDA 生态兼容性与开发效率最高成本高、能效未必最优
全栈自研自研芯片 + 自研软件栈自主可控、可深度优化生态建设周期长
推理专用针对推理做架构创新(如大容量 SRAM)推理能效比高通用性差,场景受限

生态比芯片本身更重要

关键判断:NVIDIA 的真正壁垒不是芯片性能,而是 CUDA 软件生态——十几年的算子库、工具链、开发者习惯。

这解释了为什么:

  • 国产芯片的性能参数追上后,落地仍需时间(生态适配)
  • 各家都在重投入软件栈(算子库、编译器、迁移工具)
  • "兼容 CUDA"成为很多替代方案的现实选择

四、国产替代

[待核实] 以下内容涉及快速变化的政策与产业动态,具体数据请以权威来源为准。

驱动力

因素说明
外部出口管制高端芯片获取受限
供应链安全降低对单一来源的依赖
政策支持算力基础设施相关行动计划
市场需求国内 AI 应用规模巨大

现状

  • 国产芯片在推理场景已可提供可用方案,部分产品在特定推理指标上有竞争力
  • 训练场景仍是短板,尤其在超大规模集群的互联与生态上
  • 软件生态是最大瓶颈:模型适配、算子覆盖、开发工具链成熟度
  • 算力中心建设快速推进,但实际利用率是需要关注的问题

务实建议

场景建议
推理服务、对成本敏感可评估国产方案,需实测适配效果
大规模训练短期内仍依赖通用 GPU,需提前规划供给
涉密/自主可控要求国产方案是必选项,需为适配留出时间
混合部署常见做法:核心训练与推理分层,关键链路保留备选

五、端侧 AI 与小模型

为什么端侧在兴起

驱动说明
隐私数据不离开设备
延迟无需网络往返
成本无 API 费用,边际成本趋近零
离线可用不依赖网络
模型能力小模型能力足够好(蒸馏、量化技术进步)

端侧能做什么

场景说明
手机端输入法、相册搜索、通话摘要、实时翻译、系统级助手
PC 端本地知识库、代码补全、文档处理
车机语音助手、座舱交互
IoT / 摄像头本地视觉识别、异常检测
工业设备离线质检、预测性维护

小模型(SLM)的定位

不是"差一点的大模型",而是不同的成本结构。

维度大模型小模型
能力强,通用弱,但特定任务可接近
部署云端端侧 / 边缘
成本按量付费一次性硬件成本
隐私数据出网数据本地
延迟有网络开销极低

常见架构:端云协同

端侧小模型:处理高频、简单、隐私敏感的请求
       ↓ 复杂请求
云端大模型:处理困难任务

这种分层能同时优化成本、延迟与隐私。


六、推理成本经济学

成本为何持续下降

因素说明
硬件迭代每代芯片能效提升
架构优化MoE 只激活部分参数、注意力变体降低计算量
软件优化推理框架、算子融合、量化、投机解码
模型优化蒸馏、剪枝
市场竞争厂商价格战

趋势判断:单位智能的成本长期下降,这是 AI 应用能够规模化普及的前提。

自部署 vs 调 API 的经济账

需要计算的真实成本:

成本项自部署调 API
硬件采购/租赁高(GPU 昂贵)
电力与机房中高
运维人力高(需要专职)
利用率损失真实存在(业务有波峰波谷)无(按量付费)
模型升级需要自己跟进供应商负责
边际成本低(量越大越划算)恒定

关键判断

  • API 价格下降速度往往快于自部署成本的下降速度,这使盈亏平衡点不断右移
  • 自部署的真实理由通常是:数据不能出网、需要深度定制、规模极大且稳定、合规要求
  • 单纯为了省钱而自部署,常常算不过账

决策时应定期重算,因为价格在变,你的业务量也在变。


七、能耗与环境约束

这是常被忽视但日益重要的约束。

问题说明
电力需求大规模数据中心的电力消耗快速增长
选址约束需要电力充足、电价低、冷却条件好的地点
散热高密度算力带来散热挑战,液冷成为趋势
水资源部分冷却方案耗水
碳排放企业 ESG 目标下的压力

产业影响

  • 算力建设开始受电力供应制约
  • 能效比成为芯片竞争的关键指标
  • 推动了对更高效的模型架构与推理方案的需求

八、算力对应用开发者的实际影响

你可能不直接买芯片,但算力格局会通过以下方式影响你:

传导路径表现
模型价格算力成本决定 API 定价
模型能力训练算力规模影响前沿模型能力
可用性算力紧张时可能出现限流、排队
上下文长度长上下文的显存开销限制了可用长度
部署选择决定了哪些规模的自部署可行
国产化要求特定行业可能要求使用国产算力

实践建议

建议说明
不要过度绑定特定硬件保持架构可移植
关注单位成本趋势定期重算自部署的经济性
设计时考虑算力波动有降级与排队方案
端侧场景提前规划若业务有端侧需求,模型选择需考虑端侧可部署性
涉密/合规场景早评估国产化适配需要时间,不能临时抱佛脚

九、常见误区

误区事实
"算力就是 GPU 数量"互联带宽、显存、软件栈同样关键,集群效率才是真指标
"国产芯片参数追上就能用"生态适配(算子、框架、工具链)才是落地瓶颈
"自部署一定省钱"需计入利用率、运维、电力、升级成本,且 API 价格在快速下降
"端侧模型一定很弱"特定任务上小模型经优化后可接近大模型,且成本与隐私优势明显
"算力会一直紧缺"各细分领域供需不同,推理算力正在快速扩张
"能耗不重要"已成为算力扩张的实质约束之一

十、延伸方向