Skip to content

01 基础模型层(Foundation Models)

速览卡

内容
一句话定位所有 AI 应用的通用能力来源,相当于"CPU"——你需要知道有哪些可选、各自的脾气、怎么选
核心内容海外/国产厂商格局、闭源 vs 开源、能力维度拆解、选型方法论、模型路由
现状判断竞争已从"全能冠军"转向"场景专精",没有单一模型在所有维度领先
读完能回答该用哪个模型?自部署还是调 API?要不要跟着频繁换模型?
相关板块02 增强技术05 工程化07 算力

一、什么是基础模型

在海量数据上预训练、能通过微调或提示适配到大量下游任务的大模型。

关键特征:能力是"涌现"出来的,而不是为每个任务单独设计的。同一个模型可以写代码、做翻译、分析财报、生成图片描述——这些能力没有被显式编程过。

为什么重要:它把 AI 应用开发从"每个场景训练一个模型"变成了"一个模型适配多个场景",这是近几年 AI 应用爆发的根本原因。


二、厂商格局

[易变] 以下均为动态事实,具体型号与能力对比请查阅 附录

海外阵营

厂商系列一般认知中的特点
OpenAIGPT 系列生态最成熟,工具链与第三方集成最丰富,多模态能力强
AnthropicClaude 系列长文档处理与代码能力突出,安全性与指令遵循口碑好
GoogleGemini 系列原生多模态,与 Google 生态深度整合,长上下文与性价比有优势
MetaLlama 系列开源权重的代表,自部署生态的基础
xAIGrok 系列与 X 平台数据结合,实时信息有特色

国产阵营

厂商系列一般认知中的特点
DeepSeekDeepSeek 系列以推理能力与高性价比著称,MoE 架构、开源生态活跃,对全球开源社区影响大
阿里通义千问 Qwen开源覆盖全尺寸,多模态与 Agent 方向投入大
智谱GLM 系列代码与 Agent 能力,国产生态适配好
月之暗面Kimi长上下文与 Agent 方向
字节Seed / 豆包多模态、视频生成,C 端产品量大
百度文心 ERNIE中文场景与行业解决方案,政企合规优势

国内还有 MiniMax、阶跃星辰等厂商,格局仍在快速变化。

格局判断

  1. 没有全能王:不同模型在推理、代码、长上下文、多模态、成本上各有胜负,领先位置频繁易主。
  2. 开源与闭源的差距在收敛:开源模型在多数常规任务上已能接近闭源前沿,差距主要体现在最难的推理任务与稳定性上。
  3. 价格持续下降:单位 Token 成本快速下降,竞争的焦点从"谁更强"部分转向"谁更便宜"。
  4. 国产模型在中文场景与合规落地上有天然优势:数据出境、内容合规、本地化支持是实打实的选型因素。

三、闭源 vs 开源:决策框架

这是选型的第一道分岔,不只是钱的问题。

维度闭源 API(如 GPT / Claude / Gemini)开源权重(如 Llama / Qwen / DeepSeek)
入门成本极低,注册即可调用高,需要 GPU 与运维能力
能力上限通常代表当前最优略滞后于最前沿,但差距在缩小
数据隐私数据出网,需信任供应商的数据政策数据完全在内网,可物理隔离
定制能力受限(多为提示工程 + 有限微调)完全可控,可深度微调与架构改造
成本结构按量付费,波动可预测,量大后昂贵固定硬件投入,量大后边际成本低
稳定性责任供应商负责 SLA自己负责
供应商锁定强,切换有改造成本弱,但自部署本身有绑定
合规审计依赖供应商资质自主可控,便于过审

决策建议

数据能否出网?
├── 不能(涉密、医疗、政务、金融核心)
│   └── 开源自部署,或选择有本地化部署方案的供应商
└── 能
    ├── 日调用量小 / 处于验证阶段
    │   └── 闭源 API,快速验证,别过早优化成本
    ├── 日调用量大且稳定
    │   └── 核算临界点:量大到一定程度后自部署更划算
    │       临界点随价格下降不断右移,需定期重算
    └── 需要深度定制 / 领域专有能力
        └── 开源微调

常见误判:过早为成本自部署。模型 API 价格下降速度往往快于你优化自部署的速度,且自部署把"别人的问题"变成了"你的问题"(扩容、故障、版本升级)。


四、能力维度:不要只看总分

选型时把"模型强不强"拆成可度量的维度,逐项对照你的场景:

维度关注点典型场景
通用推理多步逻辑、数学、因果判断分析、决策支持、复杂问答
代码能力生成、补全、重构、调试、仓库级理解研发提效(见 04 篇
长上下文有效窗口大小、中段信息保持率长文档分析、整库理解、长对话
指令遵循是否严格按格式与约束输出结构化输出、流程自动化
多模态图像/音频/视频理解能力文档扫描、截图理解、质检
中文能力成语、方言、本土常识、公文体国内业务场景
延迟首 Token 延迟、生成速度实时交互(客服、语音)
成本输入/输出单价、缓存折扣全场景
稳定性版本行为一致性、服务可用性生产系统

关键提醒

  • 标称上下文 ≠ 有效上下文。很多模型在长输入中段表现下降,实际使用前要用你的真实数据测。
  • 输出格式稳定性在生产中常常比"聪明程度"更重要。一个偶尔不按 JSON 输出的模型会让你的系统崩溃。
  • 同一厂商不同版本行为可能变化,生产环境务必锁定具体版本,不要跟随 latest

五、模型路由(Model Routing)

既然没有全能王,工程上的自然解法:按任务难度与类型分发到不同模型

常见路由策略

简单任务(分类、抽取、格式转换)
    → 小模型 / 便宜模型(成本可降一个数量级)

中等任务(常规问答、摘要、改写)
    → 中档模型

复杂任务(多步推理、代码生成、长文档综合)
    → 旗舰模型

失败重试(置信度低 / 输出不合规)
    → 升级到更强的模型重试一次

实现方式

方式说明适用
规则路由按任务类型、输入长度硬编码分发任务类型明确,最简单可控
分类路由先用一个小模型判断任务难度,再分发任务混杂,需要自适应
级联路由便宜模型先做,输出不满足质量阈值再升级成本敏感,且质量可自动判定
LLM 网关用统一网关层做分发、限流、缓存、容灾多模型并存的生产系统

收益:在多数真实业务中,合理的路由能把成本降低 50% 以上,而不显著损失质量——因为大部分请求根本不需要旗舰模型。


六、选型实操建议

1. 先建评测集,再选模型

不要靠"感觉哪个强"。用你的真实业务数据做 50~200 条评测样本,人工标注期望输出,然后批量跑分。这一步不能省,通用榜单与你的场景可能相关性很低。

2. 关注"够用"而非"最强"

在满足业务阈值的模型里选最便宜、延迟最低的。追求 SOTA 往往付出数倍成本换取用户感知不到的提升。

3. 设计成可替换的

  • 把模型调用封装在统一抽象层后面
  • 提示词与业务代码分离,便于按模型调整
  • 关键链路保留降级方案(主模型不可用时切备用)

为什么重要:模型迭代极快,半年后你大概率会换模型。把替换成本控制住,比今天选对模型更有价值。

4. 别忽略非技术因素

因素为什么重要
服务可用性记录供应商故障会直接传导到你的业务
数据处理与留存政策合规审计必查项
价格稳定性与可预测性用于成本预算
供应商存续风险小厂商可能关停或涨价
国内合规资质生成式 AI 备案等要求

5. 锁定版本 + 建立回归基线

生产环境:

  • 锁定具体模型版本号
  • 建立自动化回归评测,模型升级前先跑基线
  • 保留灰度能力:新版本先小流量验证

七、常见误区

误区事实
"选一个最强模型一直用"没有全能王,且成本浪费严重。路由是更优解
"开源免费"硬件、运维、人力都是成本。开源省的是许可费与数据出网风险
"榜单第一名就是最适合我的"通用榜单与具体业务相关性有限,必须自建评测集
"上下文窗口够大就能塞下所有资料"塞得下不等于用得好,检索(RAG)常常更准更省
"模型越新越好,要及时跟进"生产系统追求稳定。除非新版本解决了你的真实痛点,否则不要频繁换
"微调一定比提示词好"02 篇 的三者决策树

八、延伸方向