01 基础模型层(Foundation Models)
速览卡
| 项 | 内容 |
|---|---|
| 一句话定位 | 所有 AI 应用的通用能力来源,相当于"CPU"——你需要知道有哪些可选、各自的脾气、怎么选 |
| 核心内容 | 海外/国产厂商格局、闭源 vs 开源、能力维度拆解、选型方法论、模型路由 |
| 现状判断 | 竞争已从"全能冠军"转向"场景专精",没有单一模型在所有维度领先 |
| 读完能回答 | 该用哪个模型?自部署还是调 API?要不要跟着频繁换模型? |
| 相关板块 | 02 增强技术 | 05 工程化 | 07 算力 |
一、什么是基础模型
在海量数据上预训练、能通过微调或提示适配到大量下游任务的大模型。
关键特征:能力是"涌现"出来的,而不是为每个任务单独设计的。同一个模型可以写代码、做翻译、分析财报、生成图片描述——这些能力没有被显式编程过。
为什么重要:它把 AI 应用开发从"每个场景训练一个模型"变成了"一个模型适配多个场景",这是近几年 AI 应用爆发的根本原因。
二、厂商格局
[易变] 以下均为动态事实,具体型号与能力对比请查阅 附录。
海外阵营
| 厂商 | 系列 | 一般认知中的特点 |
|---|---|---|
| OpenAI | GPT 系列 | 生态最成熟,工具链与第三方集成最丰富,多模态能力强 |
| Anthropic | Claude 系列 | 长文档处理与代码能力突出,安全性与指令遵循口碑好 |
| Gemini 系列 | 原生多模态,与 Google 生态深度整合,长上下文与性价比有优势 | |
| Meta | Llama 系列 | 开源权重的代表,自部署生态的基础 |
| xAI | Grok 系列 | 与 X 平台数据结合,实时信息有特色 |
国产阵营
| 厂商 | 系列 | 一般认知中的特点 |
|---|---|---|
| DeepSeek | DeepSeek 系列 | 以推理能力与高性价比著称,MoE 架构、开源生态活跃,对全球开源社区影响大 |
| 阿里 | 通义千问 Qwen | 开源覆盖全尺寸,多模态与 Agent 方向投入大 |
| 智谱 | GLM 系列 | 代码与 Agent 能力,国产生态适配好 |
| 月之暗面 | Kimi | 长上下文与 Agent 方向 |
| 字节 | Seed / 豆包 | 多模态、视频生成,C 端产品量大 |
| 百度 | 文心 ERNIE | 中文场景与行业解决方案,政企合规优势 |
国内还有 MiniMax、阶跃星辰等厂商,格局仍在快速变化。
格局判断
- 没有全能王:不同模型在推理、代码、长上下文、多模态、成本上各有胜负,领先位置频繁易主。
- 开源与闭源的差距在收敛:开源模型在多数常规任务上已能接近闭源前沿,差距主要体现在最难的推理任务与稳定性上。
- 价格持续下降:单位 Token 成本快速下降,竞争的焦点从"谁更强"部分转向"谁更便宜"。
- 国产模型在中文场景与合规落地上有天然优势:数据出境、内容合规、本地化支持是实打实的选型因素。
三、闭源 vs 开源:决策框架
这是选型的第一道分岔,不只是钱的问题。
| 维度 | 闭源 API(如 GPT / Claude / Gemini) | 开源权重(如 Llama / Qwen / DeepSeek) |
|---|---|---|
| 入门成本 | 极低,注册即可调用 | 高,需要 GPU 与运维能力 |
| 能力上限 | 通常代表当前最优 | 略滞后于最前沿,但差距在缩小 |
| 数据隐私 | 数据出网,需信任供应商的数据政策 | 数据完全在内网,可物理隔离 |
| 定制能力 | 受限(多为提示工程 + 有限微调) | 完全可控,可深度微调与架构改造 |
| 成本结构 | 按量付费,波动可预测,量大后昂贵 | 固定硬件投入,量大后边际成本低 |
| 稳定性责任 | 供应商负责 SLA | 自己负责 |
| 供应商锁定 | 强,切换有改造成本 | 弱,但自部署本身有绑定 |
| 合规审计 | 依赖供应商资质 | 自主可控,便于过审 |
决策建议
数据能否出网?
├── 不能(涉密、医疗、政务、金融核心)
│ └── 开源自部署,或选择有本地化部署方案的供应商
└── 能
├── 日调用量小 / 处于验证阶段
│ └── 闭源 API,快速验证,别过早优化成本
├── 日调用量大且稳定
│ └── 核算临界点:量大到一定程度后自部署更划算
│ 临界点随价格下降不断右移,需定期重算
└── 需要深度定制 / 领域专有能力
└── 开源微调常见误判:过早为成本自部署。模型 API 价格下降速度往往快于你优化自部署的速度,且自部署把"别人的问题"变成了"你的问题"(扩容、故障、版本升级)。
四、能力维度:不要只看总分
选型时把"模型强不强"拆成可度量的维度,逐项对照你的场景:
| 维度 | 关注点 | 典型场景 |
|---|---|---|
| 通用推理 | 多步逻辑、数学、因果判断 | 分析、决策支持、复杂问答 |
| 代码能力 | 生成、补全、重构、调试、仓库级理解 | 研发提效(见 04 篇) |
| 长上下文 | 有效窗口大小、中段信息保持率 | 长文档分析、整库理解、长对话 |
| 指令遵循 | 是否严格按格式与约束输出 | 结构化输出、流程自动化 |
| 多模态 | 图像/音频/视频理解能力 | 文档扫描、截图理解、质检 |
| 中文能力 | 成语、方言、本土常识、公文体 | 国内业务场景 |
| 延迟 | 首 Token 延迟、生成速度 | 实时交互(客服、语音) |
| 成本 | 输入/输出单价、缓存折扣 | 全场景 |
| 稳定性 | 版本行为一致性、服务可用性 | 生产系统 |
关键提醒:
- 标称上下文 ≠ 有效上下文。很多模型在长输入中段表现下降,实际使用前要用你的真实数据测。
- 输出格式稳定性在生产中常常比"聪明程度"更重要。一个偶尔不按 JSON 输出的模型会让你的系统崩溃。
- 同一厂商不同版本行为可能变化,生产环境务必锁定具体版本,不要跟随
latest。
五、模型路由(Model Routing)
既然没有全能王,工程上的自然解法:按任务难度与类型分发到不同模型。
常见路由策略
简单任务(分类、抽取、格式转换)
→ 小模型 / 便宜模型(成本可降一个数量级)
中等任务(常规问答、摘要、改写)
→ 中档模型
复杂任务(多步推理、代码生成、长文档综合)
→ 旗舰模型
失败重试(置信度低 / 输出不合规)
→ 升级到更强的模型重试一次实现方式
| 方式 | 说明 | 适用 |
|---|---|---|
| 规则路由 | 按任务类型、输入长度硬编码分发 | 任务类型明确,最简单可控 |
| 分类路由 | 先用一个小模型判断任务难度,再分发 | 任务混杂,需要自适应 |
| 级联路由 | 便宜模型先做,输出不满足质量阈值再升级 | 成本敏感,且质量可自动判定 |
| LLM 网关 | 用统一网关层做分发、限流、缓存、容灾 | 多模型并存的生产系统 |
收益:在多数真实业务中,合理的路由能把成本降低 50% 以上,而不显著损失质量——因为大部分请求根本不需要旗舰模型。
六、选型实操建议
1. 先建评测集,再选模型
不要靠"感觉哪个强"。用你的真实业务数据做 50~200 条评测样本,人工标注期望输出,然后批量跑分。这一步不能省,通用榜单与你的场景可能相关性很低。
2. 关注"够用"而非"最强"
在满足业务阈值的模型里选最便宜、延迟最低的。追求 SOTA 往往付出数倍成本换取用户感知不到的提升。
3. 设计成可替换的
- 把模型调用封装在统一抽象层后面
- 提示词与业务代码分离,便于按模型调整
- 关键链路保留降级方案(主模型不可用时切备用)
为什么重要:模型迭代极快,半年后你大概率会换模型。把替换成本控制住,比今天选对模型更有价值。
4. 别忽略非技术因素
| 因素 | 为什么重要 |
|---|---|
| 服务可用性记录 | 供应商故障会直接传导到你的业务 |
| 数据处理与留存政策 | 合规审计必查项 |
| 价格稳定性与可预测性 | 用于成本预算 |
| 供应商存续风险 | 小厂商可能关停或涨价 |
| 国内合规资质 | 生成式 AI 备案等要求 |
5. 锁定版本 + 建立回归基线
生产环境:
- 锁定具体模型版本号
- 建立自动化回归评测,模型升级前先跑基线
- 保留灰度能力:新版本先小流量验证
七、常见误区
| 误区 | 事实 |
|---|---|
| "选一个最强模型一直用" | 没有全能王,且成本浪费严重。路由是更优解 |
| "开源免费" | 硬件、运维、人力都是成本。开源省的是许可费与数据出网风险 |
| "榜单第一名就是最适合我的" | 通用榜单与具体业务相关性有限,必须自建评测集 |
| "上下文窗口够大就能塞下所有资料" | 塞得下不等于用得好,检索(RAG)常常更准更省 |
| "模型越新越好,要及时跟进" | 生产系统追求稳定。除非新版本解决了你的真实痛点,否则不要频繁换 |
| "微调一定比提示词好" | 见 02 篇 的三者决策树 |
八、延伸方向
- 怎么让模型适配具体场景 → 02-模型能力增强技术
- 模型要自主调用工具 → 03-Agent智能体与协议生态
- 生产环境怎么管 → 05-工程化与LLMOps
- 部署成本与硬件 → 07-算力与硬件底座
- 具体型号与价格 → 附录-版本与产品速查表