Skip to content

06 多模态与 AIGC

速览卡

内容
一句话定位AI 从"处理文字"走向"生成内容",消费端感知最强、商业化最活跃的一层
核心内容文生图、文生视频、音频与语音、数字人、3D,以及它们如何嵌入创作工作流
现状判断视频生成从"能生成"走向"可控可用";多模态输入成为标配;竞争焦点从画质转向可控性与工作流整合
读完能回答各模态现在能用到什么程度?能不能用于生产?有哪些法律与标识风险?
相关板块01 基础模型08 行业落地09 合规

一、什么是多模态

模型能同时理解或生成多种类型的数据:文本、图像、音频、视频、代码、结构化数据。

两个方向

方向说明例子
多模态理解输入多种模态,输出文本或判断看懂截图、分析图表、理解视频内容、语音转文字
多模态生成输入文字或其他模态,生成图片/视频/音频文生图、文生视频、语音合成

当前成熟度:理解方向已相当可靠,可广泛用于生产;生成方向在可控性上仍有明显局限。


二、文生图

成熟度

已完全可用于生产,是 AIGC 中商业化最成熟的模态。

主要能力

能力说明成熟度
文生图文字描述生成图片成熟
图生图基于参考图变换成熟
局部重绘(Inpainting)修改图中局部区域成熟,实用价值高
扩图(Outpainting)向外扩展画面成熟
风格迁移套用特定风格成熟
角色/物体一致性同一角色在多图中保持一致中等,仍是不稳定点
图像内文字生成带正确文字的图片曾长期薄弱,近年明显改善
精确构图控制控制布局、姿态、空间关系中等,靠 ControlNet 类手段改善

典型应用

场景价值注意
电商商品图大幅降低拍摄成本实物一致性需谨慎,避免误导消费者
营销素材快速产出多版本品牌一致性需要风格约束
游戏/影视概念稿加速前期探索作为参考而非终稿
设计灵感快速发散需人工深化
UI 配图/插画低成本获得视觉素材注意版权与风格雷同

关键局限

  • 可控性仍是痛点:想要"精确长成我脑中的样子"依然困难,通常需要多轮生成 + 人工修改
  • 一致性与细节:手部、文字、复杂结构仍易出错
  • 风格同质化:不加约束时产出趋同

三、文生视频

成熟度

可用于部分生产场景,但可控性仍是主要瓶颈。

[易变] 该领域迭代极快,以下为能力层面的描述,具体产品能力请以官方为准。

发展主线

阶段特征
早期几秒、画面不稳定、易变形
中期时长增加、运动更连贯、支持图生视频
当前原生多模态输入(图/视频/音频/文本混合)、音画同生、分钟级时长、更高分辨率、智能分镜

主要厂商与路线差异

路线代表侧重
画质与叙事控制可灵等电影感、高分辨率、分镜控制
多模态输入与一站式即梦(Seedance/Seedream)等多参考文件、音画同生、与剪辑工具整合
海外前沿探索Sora、Veo 等物理规律模拟、长时长
开源自建各类开源视频模型可控、可私有化

核心能力维度

维度说明
时长从几秒到分钟级
分辨率已出现原生高分辨率输出
一致性角色、场景在镜头间保持一致(关键难点)
可控性运镜、分镜、动作控制
音频音画同步生成成为趋势
多模态输入同时参考图片、视频、音频、文本

真实的生产定位

当前视频生成的实际用法不是"一键出片",而是"嵌入工作流"

脚本/分镜构思

关键帧生成(文生图,可控性更高)

图生视频(生成镜头片段)

人工筛选与剪辑

配音、配乐、字幕

成片

"文生图 + 图生视频"的组合,可控性显著优于直接文生视频——这是当前业内的普遍实践。

局限

局限说明
可控性不足难以精确控制动作、镜头、时序
长视频一致性角色与场景在长时间跨度下易崩坏
物理合理性复杂物理交互仍会出错
成本视频生成成本高,反复试错代价大
商用细节品牌元素、文字、人物的精确呈现不稳定

四、音频与语音

语音识别(ASR)

成熟度最高、应用最广的 AI 技术之一。

能力状态
语音转文字成熟,中文多方言支持良好
实时转写成熟,会议记录、字幕生成常见
说话人分离成熟
多语言与翻译成熟

应用:会议纪要、字幕、客服质检、语音输入法、无障碍。

语音合成(TTS)

已达到"难以分辨"的水平。

能力状态
自然度极高,接近真人
情感与语调控制可用
声音克隆可用,但风险极高(见合规章节)

音乐与音效生成

可用但版权与质量稳定性仍在演进,适合作为素材辅助而非终稿。

语音交互

端到端语音对话(语音进、语音出,不转文字)在降低延迟、保留语气情感上有优势,是实时语音助手的发展方向。


五、数字人

类型

类型说明应用
形象类生成的虚拟形象品牌代言、虚拟 IP
真人复刻类基于真人形象与声音克隆直播、口播视频、企业培训
驱动方式音频驱动口型、文本驱动、动作捕捉

应用与风险

应用价值风险
口播视频批量生成大幅降低录制成本需明确标识为 AI 生成
数字人直播可长时间在线多地对虚拟主播有监管要求
企业培训/客服标准化内容输出用户知情权
多语言内容一套内容多语种输出口型与文化适配

合规红线:声音与形象克隆涉及肖像权、声音权、人格权,未经授权的克隆在多数司法辖区存在明确法律风险。


六、3D 与空间生成

能力状态应用
文/图生 3D 模型可用,质量参差游戏资产、电商展示、原型
场景生成研究中虚拟现实、仿真
材质与贴图生成可用3D 制作流程提效

[易变] 相比图像与视频,3D 生成成熟度较低,但发展迅速,与游戏、具身智能、虚拟现实有较强关联(见 11 篇)。


七、多模态理解的应用

相比生成,理解方向的生产价值目前更明确

场景说明成熟度
文档理解扫描件、表格、票据、证照的结构化提取高,已广泛替代传统 OCR
截图/界面理解AI 看懂界面并操作(Computer Use)中,Agent 的重要能力
图表分析读取图表并回答
质检工业视觉检测高(结合传统视觉方案)
视频内容理解检索、摘要、合规审查中高
医疗影像辅助读片高,但受严格监管

工程提示:文档理解(尤其是复杂表格、多栏排版、扫描件)的效果高度依赖前处理质量。这一环常被低估,实际是决定成败的关键。


八、创作工作流的整合

真正改变生产力的不是单次生成,而是把 AI 嵌入完整工作流

领域AI 扮演的角色
设计灵感发散、素材生成、批量改尺寸、初稿产出
视频分镜构思、关键帧、片段生成、字幕、配音、剪辑辅助
运营多版本文案、本地化、素材适配
电商商品图、详情图、多场景展示
游戏概念设计、资产生成、NPC 对话

人机分工的当前合理状态

AI 负责:发散、批量、重复、草稿
人负责:判断、把关、审美、决策、最终质量

九、法律与伦理风险

风险说明应对
训练数据版权生成内容是否侵犯训练素材的版权[有争议] 各国法律尚在演进,商用需关注
生成内容权属AI 生成物能否享有著作权[有争议] 各地规定不一,多数要求有实质性人类创作
肖像与声音权克隆他人形象与声音必须取得明确授权
深度伪造用于欺诈、诽谤、伪造证据多地已立法限制,切勿触碰
标识义务AI 生成内容需显式标识多地法规已明确要求,见 09 篇
误导消费者电商用 AI 图代替实物可能构成虚假宣传
品牌一致性AI 产出偏离品牌调性建立风格约束与人工审核

实务建议

场景建议
内部使用、灵感参考风险最低
公开发布的营销内容需审核 + 按法规标识
商用素材(尤其是人物形象)谨慎,优先使用有授权保障的素材或商用许可明确的服务
涉及真人形象/声音必须取得书面授权
新闻、医疗、金融等敏感领域严格限制,避免生成可能被误认为事实的内容

十、常见误区

误区事实
"AI 能一键生成完整视频"实际是工作流中的一环,需要关键帧、筛选、剪辑、配音配合
"生成的图片可以随便商用"版权与训练数据合法性尚存争议,形象/声音克隆有明确法律风险
"AI 会取代设计师"改变的是工作方式:从"执行"转向"判断与把关"
"分辨率越高越好"可控性与一致性往往比分辨率更影响可用性
"多模态模型一定比单模态好"专用模型在特定任务上常常更优更省
"AI 生成的内容不需要标识"多地法规已明确要求标识,不标识存在合规风险

十一、延伸方向