Skip to content

00 基础概念与术语谱系

速览卡

内容
一句话定位建立术语坐标系,让后面 11 篇的所有讨论有共同的语义基础
核心内容AI/ML/DL/LLM 的包含关系、Transformer 与 Token、涌现与 Scaling Law、幻觉、AGI 定义争议
现状判断概念体系已基本稳定,争议集中在 AGI 的定义与判定标准上
读完能回答"大模型"到底大在哪?它为什么会胡说?它和传统程序有什么本质区别?
相关板块全部。这一篇是其他篇的前置

一、概念层级:从 AI 到 LLM

很多讨论的混乱来自概念混用。先把包含关系钉死:

人工智能 AI
├── 机器学习 ML          (让机器从数据中总结规律,而非手写规则)
│   ├── 深度学习 DL      (用多层神经网络做机器学习)
│   │   ├── CNN          (卷积神经网络,图像时代的主力)
│   │   ├── RNN / LSTM   (循环网络,序列建模,已基本被 Transformer 取代)
│   │   └── Transformer  (注意力机制,当前所有主流大模型的骨架)
│   └── 传统 ML          (决策树、SVM、线性回归等,小数据场景仍有价值)
└── 非学习方法            (专家系统、规则引擎、搜索算法)

大语言模型 LLM 不是独立的一层,而是"用 Transformer 架构 + 海量文本预训练出来的深度学习模型,且参数量足够大"。

关键区分

概念本质常见误解
AI目标:让机器表现出智能常被等同于"大模型",实际范畴大得多
机器学习方法:从数据中学规律不等于"自动",数据质量决定上限
深度学习技术:多层神经网络不是万能的,小数据场景往往不如传统方法
大模型 LLM产品形态:大规模预训练的语言模型"大"指参数与数据规模,不是"能力全面"

二、Transformer:现代 AI 的地基

2017 年论文 Attention Is All You Need 提出的架构,是当前几乎所有主流模型的共同底座。

它解决了什么问题

在它之前,RNN/LSTM 处理序列必须逐词串行,既慢又难以捕捉长距离依赖。Transformer 的核心是自注意力(Self-Attention):让序列中每个位置直接与其他所有位置计算相关性,从而:

  • 可以并行训练(这是规模化的前提)
  • 能捕捉长距离依赖("这句话开头的主语"能被句尾的谓语正确关联)

三个必须知道的概念

1. Token(词元)

模型不直接处理字符,而是把文本切成 Token。中文大致 1 个汉字 ≈ 1~2 个 Token,英文 1 个单词 ≈ 1~3 个 Token。

为什么重要:

  • 计费按 Token 计
  • 上下文窗口按 Token 计
  • 中文、代码、非拉丁语系的 Token 效率通常低于英文,成本更高

2. 上下文窗口(Context Window)

单次能"看到"的 Token 上限,包含输入 + 输出。它决定了:

  • 一次能塞多少文档进去
  • 长对话会不会"忘记"前面的内容

[易变] 窗口大小从几千 Token 增长到百万级只用了两三年,且"标称窗口"与"实际有效窗口"往往有差距——很多模型在长输入的中段表现明显下降("Lost in the Middle"现象)。

3. 注意力机制

简单理解:处理每个 Token 时,动态决定"应该重点关注输入中的哪些部分"。这是模型能理解指代、长句、逻辑关系的关键。

代价:注意力的计算量随序列长度平方级增长,这是长上下文成本高昂的根本原因。


三、模型是怎么"变聪明"的:训练三阶段

阶段做什么产出类比
预训练在海量无标注文本上做"预测下一个 Token"基础模型(Base Model):知识渊博但不会听话读完整个图书馆
后训练 / 微调用指令数据与人类偏好数据调整行为指令模型(Instruct/Chat):能对话、守规矩学会与人协作的礼仪
推理部署上线,根据用户输入生成输出实际服务上岗工作

关键术语

术语含义
SFT(监督微调)用"问题-标准答案"配对数据训练,教模型按格式回答
RLHF(人类反馈强化学习)人类对多个答案排序,训练奖励模型,再用强化学习优化,让输出更符合人类偏好
DPORLHF 的简化替代,直接从偏好对中学习,省去奖励模型,成本更低
蒸馏用大模型教会小模型,牺牲部分能力换取体积与成本
量化降低参数数值精度(如 FP16 → INT8/INT4),换取内存与速度,有轻微能力损失
LoRA只训练少量低秩参数来适配任务,大幅降低微调成本

四、理解模型行为的五个关键概念

1. 涌现能力(Emergent Abilities)

某些能力(如多步推理、代码调试)在模型规模较小时几乎不存在,超过某个规模阈值后突然出现

[有争议] 部分研究认为,所谓"涌现"部分是评测指标不连续造成的度量假象——换用平滑的指标后,能力提升是渐进的而非突变。无论争议如何,实践中"规模上去后某些能力确实可用了"是成立的。

2. Scaling Law(规模定律)

模型性能与参数量、数据量、计算量之间存在可预测的幂律关系。它过去几年是行业投入的核心依据。

近年出现的重要补充:

  • 数据瓶颈:高质量公开文本接近耗尽,单纯堆数据收益递减
  • 推理时扩展:不只是训练时堆算力,推理时让模型"多想一会儿"(生成更长的思维链)也能提升效果,且这条路径当前收益显著

3. 幻觉(Hallucination)

模型生成听起来合理但与事实不符的内容。

为什么会幻觉(这是机制性的,不是 bug):

  • 模型的目标是"预测最可能的下一个 Token",而不是"陈述事实"
  • 训练数据中的错误、偏见会被继承
  • 对自身知识边界缺乏可靠感知,不会主动说"我不知道"

应对思路(详见 02-模型能力增强技术):

  • RAG:给模型提供可核查的事实依据
  • 引用溯源:要求输出标注来源
  • 工具调用:让模型查数据库/计算器,而不是凭记忆编
  • 关键场景保留人工复核

不要指望彻底消除。工程目标是"把幻觉率降到业务可接受,并让错误可检测、可追溯"。

4. 温度(Temperature)与采样

控制生成的随机性:

  • 低温度 → 输出更确定、更保守,适合代码、事实问答、格式化输出
  • 高温度 → 输出更多样,适合创意写作、头脑风暴

5. 思维链(Chain of Thought, CoT)

让模型"把推理过程写出来再给答案",能显著提升复杂推理的准确率。这已成为推理类模型的标准工作方式,也是"推理时扩展"的实现基础。


五、AGI:定义分歧远大于技术分歧

概念常见定义状态
ANI(狭义 AI)在单一任务上达到或超过人类已实现(下棋、图像识别、语音识别等)
AGI(通用人工智能)大多数经济价值任务上达到人类水平[有争议] 定义本身无共识,何时达成更是分歧巨大
ASI(超级智能)在所有领域远超人类纯理论推演

分歧在哪

  • 能力派:用任务覆盖率与 benchmark 分数衡量
  • 自主派:强调能否在无人监督下完成长周期任务
  • 经济派:看是否实质替代了某类劳动

[有争议] 业内对"AGI 是否已初步具备"的判断从"已经到了"到"还差数十年"跨度极大。建议读者对任何确定性的 AGI 时间表保持警惕——无论乐观还是悲观。


六、与传统软件的本质区别

理解这一点,才能理解为什么 AI 系统的工程实践(测试、监控、迭代)与传统软件完全不同:

维度传统软件大模型系统
行为依据明确的逻辑规则统计概率分布
相同输入必然得到相同输出可能得到不同输出(除非固定随机种子且参数不变)
正确性可以证明只能评估(采样 + 人工/模型评判)
失败模式崩溃、异常、报错看似正常地输出错误内容(最危险)
修改方式改代码、重新部署改提示词 / 换数据 / 换模型 / 微调
测试单元测试、断言需要评测集、打分器、回归基线

实践含义:AI 系统必须假设"它一定会出错",工程重心从"保证正确"转向"让错误可发现、可控制、影响可控"。这是 05-工程化与LLMOps 整篇的出发点。


七、常见误区速查

误区事实
"AI 在思考/理解"它是基于统计模式生成最可能的输出,与人类认知机制不同。是否构成"理解"是哲学问题,工程上不必依赖这个判断
"参数越大越好"同等成本下,小模型 + 好数据 + 好工程,常常优于裸调大模型
"AI 会记住我的对话"取决于产品设计。多数 API 服务不会用你的数据训练,但会话上下文产品方的留存策略要分别确认
"上下文越长越好"长窗口成本高、中段易丢失信息,且不等于模型能有效利用全部内容
"跑通 Demo 就快上线了"Demo 到生产有巨大鸿沟,见 05 篇08 篇
"RAG 能解决幻觉"显著降低,但不消除。检索错、理解错、拼接错都可能引入新问题

八、术语速查表

缩写/术语全称 / 含义
LLMLarge Language Model,大语言模型
Token模型处理文本的最小单位,计费与上下文计量的基础
Embedding把文本/图像映射成稠密向量,使"语义相似"可计算
Prompt输入给模型的指令文本
Context上下文,模型单次可见的全部输入
Fine-tuning微调,用特定数据进一步训练模型
RAGRetrieval-Augmented Generation,检索增强生成
Agent能自主规划、调用工具、多步执行的 AI 系统
Hallucination幻觉,生成看似合理但虚假的内容
Grounding让模型输出有事实依据(通常通过检索或工具)
Guardrail护栏,输入输出的安全过滤与约束机制
Benchmark评测基准,用于量化比较模型能力
Multimodal多模态,能同时处理文本、图像、音频、视频等
SLMSmall Language Model,小语言模型,通常可端侧部署
MoEMixture of Experts,混合专家架构,推理时只激活部分参数以降成本

延伸方向