00 基础概念与术语谱系
速览卡
| 项 | 内容 |
|---|---|
| 一句话定位 | 建立术语坐标系,让后面 11 篇的所有讨论有共同的语义基础 |
| 核心内容 | AI/ML/DL/LLM 的包含关系、Transformer 与 Token、涌现与 Scaling Law、幻觉、AGI 定义争议 |
| 现状判断 | 概念体系已基本稳定,争议集中在 AGI 的定义与判定标准上 |
| 读完能回答 | "大模型"到底大在哪?它为什么会胡说?它和传统程序有什么本质区别? |
| 相关板块 | 全部。这一篇是其他篇的前置 |
一、概念层级:从 AI 到 LLM
很多讨论的混乱来自概念混用。先把包含关系钉死:
人工智能 AI
├── 机器学习 ML (让机器从数据中总结规律,而非手写规则)
│ ├── 深度学习 DL (用多层神经网络做机器学习)
│ │ ├── CNN (卷积神经网络,图像时代的主力)
│ │ ├── RNN / LSTM (循环网络,序列建模,已基本被 Transformer 取代)
│ │ └── Transformer (注意力机制,当前所有主流大模型的骨架)
│ └── 传统 ML (决策树、SVM、线性回归等,小数据场景仍有价值)
└── 非学习方法 (专家系统、规则引擎、搜索算法)大语言模型 LLM 不是独立的一层,而是"用 Transformer 架构 + 海量文本预训练出来的深度学习模型,且参数量足够大"。
关键区分
| 概念 | 本质 | 常见误解 |
|---|---|---|
| AI | 目标:让机器表现出智能 | 常被等同于"大模型",实际范畴大得多 |
| 机器学习 | 方法:从数据中学规律 | 不等于"自动",数据质量决定上限 |
| 深度学习 | 技术:多层神经网络 | 不是万能的,小数据场景往往不如传统方法 |
| 大模型 LLM | 产品形态:大规模预训练的语言模型 | "大"指参数与数据规模,不是"能力全面" |
二、Transformer:现代 AI 的地基
2017 年论文 Attention Is All You Need 提出的架构,是当前几乎所有主流模型的共同底座。
它解决了什么问题
在它之前,RNN/LSTM 处理序列必须逐词串行,既慢又难以捕捉长距离依赖。Transformer 的核心是自注意力(Self-Attention):让序列中每个位置直接与其他所有位置计算相关性,从而:
- 可以并行训练(这是规模化的前提)
- 能捕捉长距离依赖("这句话开头的主语"能被句尾的谓语正确关联)
三个必须知道的概念
1. Token(词元)
模型不直接处理字符,而是把文本切成 Token。中文大致 1 个汉字 ≈ 1~2 个 Token,英文 1 个单词 ≈ 1~3 个 Token。
为什么重要:
- 计费按 Token 计
- 上下文窗口按 Token 计
- 中文、代码、非拉丁语系的 Token 效率通常低于英文,成本更高
2. 上下文窗口(Context Window)
单次能"看到"的 Token 上限,包含输入 + 输出。它决定了:
- 一次能塞多少文档进去
- 长对话会不会"忘记"前面的内容
[易变] 窗口大小从几千 Token 增长到百万级只用了两三年,且"标称窗口"与"实际有效窗口"往往有差距——很多模型在长输入的中段表现明显下降("Lost in the Middle"现象)。
3. 注意力机制
简单理解:处理每个 Token 时,动态决定"应该重点关注输入中的哪些部分"。这是模型能理解指代、长句、逻辑关系的关键。
代价:注意力的计算量随序列长度平方级增长,这是长上下文成本高昂的根本原因。
三、模型是怎么"变聪明"的:训练三阶段
| 阶段 | 做什么 | 产出 | 类比 |
|---|---|---|---|
| 预训练 | 在海量无标注文本上做"预测下一个 Token" | 基础模型(Base Model):知识渊博但不会听话 | 读完整个图书馆 |
| 后训练 / 微调 | 用指令数据与人类偏好数据调整行为 | 指令模型(Instruct/Chat):能对话、守规矩 | 学会与人协作的礼仪 |
| 推理 | 部署上线,根据用户输入生成输出 | 实际服务 | 上岗工作 |
关键术语
| 术语 | 含义 |
|---|---|
| SFT(监督微调) | 用"问题-标准答案"配对数据训练,教模型按格式回答 |
| RLHF(人类反馈强化学习) | 人类对多个答案排序,训练奖励模型,再用强化学习优化,让输出更符合人类偏好 |
| DPO | RLHF 的简化替代,直接从偏好对中学习,省去奖励模型,成本更低 |
| 蒸馏 | 用大模型教会小模型,牺牲部分能力换取体积与成本 |
| 量化 | 降低参数数值精度(如 FP16 → INT8/INT4),换取内存与速度,有轻微能力损失 |
| LoRA | 只训练少量低秩参数来适配任务,大幅降低微调成本 |
四、理解模型行为的五个关键概念
1. 涌现能力(Emergent Abilities)
某些能力(如多步推理、代码调试)在模型规模较小时几乎不存在,超过某个规模阈值后突然出现。
[有争议] 部分研究认为,所谓"涌现"部分是评测指标不连续造成的度量假象——换用平滑的指标后,能力提升是渐进的而非突变。无论争议如何,实践中"规模上去后某些能力确实可用了"是成立的。
2. Scaling Law(规模定律)
模型性能与参数量、数据量、计算量之间存在可预测的幂律关系。它过去几年是行业投入的核心依据。
近年出现的重要补充:
- 数据瓶颈:高质量公开文本接近耗尽,单纯堆数据收益递减
- 推理时扩展:不只是训练时堆算力,推理时让模型"多想一会儿"(生成更长的思维链)也能提升效果,且这条路径当前收益显著
3. 幻觉(Hallucination)
模型生成听起来合理但与事实不符的内容。
为什么会幻觉(这是机制性的,不是 bug):
- 模型的目标是"预测最可能的下一个 Token",而不是"陈述事实"
- 训练数据中的错误、偏见会被继承
- 对自身知识边界缺乏可靠感知,不会主动说"我不知道"
应对思路(详见 02-模型能力增强技术):
- RAG:给模型提供可核查的事实依据
- 引用溯源:要求输出标注来源
- 工具调用:让模型查数据库/计算器,而不是凭记忆编
- 关键场景保留人工复核
不要指望彻底消除。工程目标是"把幻觉率降到业务可接受,并让错误可检测、可追溯"。
4. 温度(Temperature)与采样
控制生成的随机性:
- 低温度 → 输出更确定、更保守,适合代码、事实问答、格式化输出
- 高温度 → 输出更多样,适合创意写作、头脑风暴
5. 思维链(Chain of Thought, CoT)
让模型"把推理过程写出来再给答案",能显著提升复杂推理的准确率。这已成为推理类模型的标准工作方式,也是"推理时扩展"的实现基础。
五、AGI:定义分歧远大于技术分歧
| 概念 | 常见定义 | 状态 |
|---|---|---|
| ANI(狭义 AI) | 在单一任务上达到或超过人类 | 已实现(下棋、图像识别、语音识别等) |
| AGI(通用人工智能) | 在大多数经济价值任务上达到人类水平 | [有争议] 定义本身无共识,何时达成更是分歧巨大 |
| ASI(超级智能) | 在所有领域远超人类 | 纯理论推演 |
分歧在哪
- 能力派:用任务覆盖率与 benchmark 分数衡量
- 自主派:强调能否在无人监督下完成长周期任务
- 经济派:看是否实质替代了某类劳动
[有争议] 业内对"AGI 是否已初步具备"的判断从"已经到了"到"还差数十年"跨度极大。建议读者对任何确定性的 AGI 时间表保持警惕——无论乐观还是悲观。
六、与传统软件的本质区别
理解这一点,才能理解为什么 AI 系统的工程实践(测试、监控、迭代)与传统软件完全不同:
| 维度 | 传统软件 | 大模型系统 |
|---|---|---|
| 行为依据 | 明确的逻辑规则 | 统计概率分布 |
| 相同输入 | 必然得到相同输出 | 可能得到不同输出(除非固定随机种子且参数不变) |
| 正确性 | 可以证明 | 只能评估(采样 + 人工/模型评判) |
| 失败模式 | 崩溃、异常、报错 | 看似正常地输出错误内容(最危险) |
| 修改方式 | 改代码、重新部署 | 改提示词 / 换数据 / 换模型 / 微调 |
| 测试 | 单元测试、断言 | 需要评测集、打分器、回归基线 |
实践含义:AI 系统必须假设"它一定会出错",工程重心从"保证正确"转向"让错误可发现、可控制、影响可控"。这是 05-工程化与LLMOps 整篇的出发点。
七、常见误区速查
| 误区 | 事实 |
|---|---|
| "AI 在思考/理解" | 它是基于统计模式生成最可能的输出,与人类认知机制不同。是否构成"理解"是哲学问题,工程上不必依赖这个判断 |
| "参数越大越好" | 同等成本下,小模型 + 好数据 + 好工程,常常优于裸调大模型 |
| "AI 会记住我的对话" | 取决于产品设计。多数 API 服务不会用你的数据训练,但会话上下文与产品方的留存策略要分别确认 |
| "上下文越长越好" | 长窗口成本高、中段易丢失信息,且不等于模型能有效利用全部内容 |
| "跑通 Demo 就快上线了" | Demo 到生产有巨大鸿沟,见 05 篇 与 08 篇 |
| "RAG 能解决幻觉" | 显著降低,但不消除。检索错、理解错、拼接错都可能引入新问题 |
八、术语速查表
| 缩写/术语 | 全称 / 含义 |
|---|---|
| LLM | Large Language Model,大语言模型 |
| Token | 模型处理文本的最小单位,计费与上下文计量的基础 |
| Embedding | 把文本/图像映射成稠密向量,使"语义相似"可计算 |
| Prompt | 输入给模型的指令文本 |
| Context | 上下文,模型单次可见的全部输入 |
| Fine-tuning | 微调,用特定数据进一步训练模型 |
| RAG | Retrieval-Augmented Generation,检索增强生成 |
| Agent | 能自主规划、调用工具、多步执行的 AI 系统 |
| Hallucination | 幻觉,生成看似合理但虚假的内容 |
| Grounding | 让模型输出有事实依据(通常通过检索或工具) |
| Guardrail | 护栏,输入输出的安全过滤与约束机制 |
| Benchmark | 评测基准,用于量化比较模型能力 |
| Multimodal | 多模态,能同时处理文本、图像、音频、视频等 |
| SLM | Small Language Model,小语言模型,通常可端侧部署 |
| MoE | Mixture of Experts,混合专家架构,推理时只激活部分参数以降成本 |
延伸方向
- 想了解有哪些具体模型 → 01-基础模型层
- 想了解怎么让模型适配你的场景 → 02-模型能力增强技术
- 想了解怎么系统学习 → 10-学习路径与资源索引