06 多模态与 AIGC
速览卡
| 项 | 内容 |
|---|---|
| 一句话定位 | AI 从"处理文字"走向"生成内容",消费端感知最强、商业化最活跃的一层 |
| 核心内容 | 文生图、文生视频、音频与语音、数字人、3D,以及它们如何嵌入创作工作流 |
| 现状判断 | 视频生成从"能生成"走向"可控可用";多模态输入成为标配;竞争焦点从画质转向可控性与工作流整合 |
| 读完能回答 | 各模态现在能用到什么程度?能不能用于生产?有哪些法律与标识风险? |
| 相关板块 | 01 基础模型 | 08 行业落地 | 09 合规 |
一、什么是多模态
模型能同时理解或生成多种类型的数据:文本、图像、音频、视频、代码、结构化数据。
两个方向
| 方向 | 说明 | 例子 |
|---|---|---|
| 多模态理解 | 输入多种模态,输出文本或判断 | 看懂截图、分析图表、理解视频内容、语音转文字 |
| 多模态生成 | 输入文字或其他模态,生成图片/视频/音频 | 文生图、文生视频、语音合成 |
当前成熟度:理解方向已相当可靠,可广泛用于生产;生成方向在可控性上仍有明显局限。
二、文生图
成熟度
已完全可用于生产,是 AIGC 中商业化最成熟的模态。
主要能力
| 能力 | 说明 | 成熟度 |
|---|---|---|
| 文生图 | 文字描述生成图片 | 成熟 |
| 图生图 | 基于参考图变换 | 成熟 |
| 局部重绘(Inpainting) | 修改图中局部区域 | 成熟,实用价值高 |
| 扩图(Outpainting) | 向外扩展画面 | 成熟 |
| 风格迁移 | 套用特定风格 | 成熟 |
| 角色/物体一致性 | 同一角色在多图中保持一致 | 中等,仍是不稳定点 |
| 图像内文字 | 生成带正确文字的图片 | 曾长期薄弱,近年明显改善 |
| 精确构图控制 | 控制布局、姿态、空间关系 | 中等,靠 ControlNet 类手段改善 |
典型应用
| 场景 | 价值 | 注意 |
|---|---|---|
| 电商商品图 | 大幅降低拍摄成本 | 实物一致性需谨慎,避免误导消费者 |
| 营销素材 | 快速产出多版本 | 品牌一致性需要风格约束 |
| 游戏/影视概念稿 | 加速前期探索 | 作为参考而非终稿 |
| 设计灵感 | 快速发散 | 需人工深化 |
| UI 配图/插画 | 低成本获得视觉素材 | 注意版权与风格雷同 |
关键局限
- 可控性仍是痛点:想要"精确长成我脑中的样子"依然困难,通常需要多轮生成 + 人工修改
- 一致性与细节:手部、文字、复杂结构仍易出错
- 风格同质化:不加约束时产出趋同
三、文生视频
成熟度
可用于部分生产场景,但可控性仍是主要瓶颈。
[易变] 该领域迭代极快,以下为能力层面的描述,具体产品能力请以官方为准。
发展主线
| 阶段 | 特征 |
|---|---|
| 早期 | 几秒、画面不稳定、易变形 |
| 中期 | 时长增加、运动更连贯、支持图生视频 |
| 当前 | 原生多模态输入(图/视频/音频/文本混合)、音画同生、分钟级时长、更高分辨率、智能分镜 |
主要厂商与路线差异
| 路线 | 代表 | 侧重 |
|---|---|---|
| 画质与叙事控制 | 可灵等 | 电影感、高分辨率、分镜控制 |
| 多模态输入与一站式 | 即梦(Seedance/Seedream)等 | 多参考文件、音画同生、与剪辑工具整合 |
| 海外前沿探索 | Sora、Veo 等 | 物理规律模拟、长时长 |
| 开源自建 | 各类开源视频模型 | 可控、可私有化 |
核心能力维度
| 维度 | 说明 |
|---|---|
| 时长 | 从几秒到分钟级 |
| 分辨率 | 已出现原生高分辨率输出 |
| 一致性 | 角色、场景在镜头间保持一致(关键难点) |
| 可控性 | 运镜、分镜、动作控制 |
| 音频 | 音画同步生成成为趋势 |
| 多模态输入 | 同时参考图片、视频、音频、文本 |
真实的生产定位
当前视频生成的实际用法不是"一键出片",而是"嵌入工作流":
脚本/分镜构思
↓
关键帧生成(文生图,可控性更高)
↓
图生视频(生成镜头片段)
↓
人工筛选与剪辑
↓
配音、配乐、字幕
↓
成片"文生图 + 图生视频"的组合,可控性显著优于直接文生视频——这是当前业内的普遍实践。
局限
| 局限 | 说明 |
|---|---|
| 可控性不足 | 难以精确控制动作、镜头、时序 |
| 长视频一致性 | 角色与场景在长时间跨度下易崩坏 |
| 物理合理性 | 复杂物理交互仍会出错 |
| 成本 | 视频生成成本高,反复试错代价大 |
| 商用细节 | 品牌元素、文字、人物的精确呈现不稳定 |
四、音频与语音
语音识别(ASR)
成熟度最高、应用最广的 AI 技术之一。
| 能力 | 状态 |
|---|---|
| 语音转文字 | 成熟,中文多方言支持良好 |
| 实时转写 | 成熟,会议记录、字幕生成常见 |
| 说话人分离 | 成熟 |
| 多语言与翻译 | 成熟 |
应用:会议纪要、字幕、客服质检、语音输入法、无障碍。
语音合成(TTS)
已达到"难以分辨"的水平。
| 能力 | 状态 |
|---|---|
| 自然度 | 极高,接近真人 |
| 情感与语调控制 | 可用 |
| 声音克隆 | 可用,但风险极高(见合规章节) |
音乐与音效生成
可用但版权与质量稳定性仍在演进,适合作为素材辅助而非终稿。
语音交互
端到端语音对话(语音进、语音出,不转文字)在降低延迟、保留语气情感上有优势,是实时语音助手的发展方向。
五、数字人
类型
| 类型 | 说明 | 应用 |
|---|---|---|
| 形象类 | 生成的虚拟形象 | 品牌代言、虚拟 IP |
| 真人复刻类 | 基于真人形象与声音克隆 | 直播、口播视频、企业培训 |
| 驱动方式 | 音频驱动口型、文本驱动、动作捕捉 | — |
应用与风险
| 应用 | 价值 | 风险 |
|---|---|---|
| 口播视频批量生成 | 大幅降低录制成本 | 需明确标识为 AI 生成 |
| 数字人直播 | 可长时间在线 | 多地对虚拟主播有监管要求 |
| 企业培训/客服 | 标准化内容输出 | 用户知情权 |
| 多语言内容 | 一套内容多语种输出 | 口型与文化适配 |
合规红线:声音与形象克隆涉及肖像权、声音权、人格权,未经授权的克隆在多数司法辖区存在明确法律风险。
六、3D 与空间生成
| 能力 | 状态 | 应用 |
|---|---|---|
| 文/图生 3D 模型 | 可用,质量参差 | 游戏资产、电商展示、原型 |
| 场景生成 | 研究中 | 虚拟现实、仿真 |
| 材质与贴图生成 | 可用 | 3D 制作流程提效 |
[易变] 相比图像与视频,3D 生成成熟度较低,但发展迅速,与游戏、具身智能、虚拟现实有较强关联(见 11 篇)。
七、多模态理解的应用
相比生成,理解方向的生产价值目前更明确:
| 场景 | 说明 | 成熟度 |
|---|---|---|
| 文档理解 | 扫描件、表格、票据、证照的结构化提取 | 高,已广泛替代传统 OCR |
| 截图/界面理解 | AI 看懂界面并操作(Computer Use) | 中,Agent 的重要能力 |
| 图表分析 | 读取图表并回答 | 高 |
| 质检 | 工业视觉检测 | 高(结合传统视觉方案) |
| 视频内容理解 | 检索、摘要、合规审查 | 中高 |
| 医疗影像 | 辅助读片 | 高,但受严格监管 |
工程提示:文档理解(尤其是复杂表格、多栏排版、扫描件)的效果高度依赖前处理质量。这一环常被低估,实际是决定成败的关键。
八、创作工作流的整合
真正改变生产力的不是单次生成,而是把 AI 嵌入完整工作流。
| 领域 | AI 扮演的角色 |
|---|---|
| 设计 | 灵感发散、素材生成、批量改尺寸、初稿产出 |
| 视频 | 分镜构思、关键帧、片段生成、字幕、配音、剪辑辅助 |
| 运营 | 多版本文案、本地化、素材适配 |
| 电商 | 商品图、详情图、多场景展示 |
| 游戏 | 概念设计、资产生成、NPC 对话 |
人机分工的当前合理状态:
AI 负责:发散、批量、重复、草稿
人负责:判断、把关、审美、决策、最终质量九、法律与伦理风险
| 风险 | 说明 | 应对 |
|---|---|---|
| 训练数据版权 | 生成内容是否侵犯训练素材的版权 | [有争议] 各国法律尚在演进,商用需关注 |
| 生成内容权属 | AI 生成物能否享有著作权 | [有争议] 各地规定不一,多数要求有实质性人类创作 |
| 肖像与声音权 | 克隆他人形象与声音 | 必须取得明确授权 |
| 深度伪造 | 用于欺诈、诽谤、伪造证据 | 多地已立法限制,切勿触碰 |
| 标识义务 | AI 生成内容需显式标识 | 多地法规已明确要求,见 09 篇 |
| 误导消费者 | 电商用 AI 图代替实物 | 可能构成虚假宣传 |
| 品牌一致性 | AI 产出偏离品牌调性 | 建立风格约束与人工审核 |
实务建议
| 场景 | 建议 |
|---|---|
| 内部使用、灵感参考 | 风险最低 |
| 公开发布的营销内容 | 需审核 + 按法规标识 |
| 商用素材(尤其是人物形象) | 谨慎,优先使用有授权保障的素材或商用许可明确的服务 |
| 涉及真人形象/声音 | 必须取得书面授权 |
| 新闻、医疗、金融等敏感领域 | 严格限制,避免生成可能被误认为事实的内容 |
十、常见误区
| 误区 | 事实 |
|---|---|
| "AI 能一键生成完整视频" | 实际是工作流中的一环,需要关键帧、筛选、剪辑、配音配合 |
| "生成的图片可以随便商用" | 版权与训练数据合法性尚存争议,形象/声音克隆有明确法律风险 |
| "AI 会取代设计师" | 改变的是工作方式:从"执行"转向"判断与把关" |
| "分辨率越高越好" | 可控性与一致性往往比分辨率更影响可用性 |
| "多模态模型一定比单模态好" | 专用模型在特定任务上常常更优更省 |
| "AI 生成的内容不需要标识" | 多地法规已明确要求标识,不标识存在合规风险 |
十一、延伸方向
- 底层模型能力 → 01-基础模型层
- 商业化与行业应用 → 08-应用形态与行业落地
- 标识义务与法规 → 09-安全治理与合规
- 具体产品与定价 → 附录-版本与产品速查表