2026 年的 AI 视频模型,生成一条 8 秒的漂亮短片已经不成问题;真正把成片挡在门外的是两件更朴素的事:同一角色跨镜头要长一个样,以及画面里的世界要讲物理。这两道坎决定了 AI 视频是「抽奖素材」还是「生产线」。这篇文章把各家的方案和还欠着的债各盘一遍。
坎一:角色一致性——模型记不住你的主角
技术上的根因不难理解:DiT 类模型(架构见本专题《一篇读懂 DiT》)学的是「这段描述对应怎样的一族画面」,而不是「这个具体的人」。提示词里写「红裙子的短发女孩」,模型脑海里有一万个红裙子短发女孩——这次采样到 A,下次采样到 B,发型、脸型、配饰处处漂移。短片无所谓,连续剧立刻穿帮。
主流方案:把「人」喂给模型
第一类也是目前商用主流的方案是参考生视频(reference-to-video):上传角色的图片甚至视频片段,模型以参考素材为锚生成新画面。这条线上各家卷得非常凶:生数 Vidu 的「参考生」支持最多 7 个主体同场;快手可灵 4.0 宣布单任务最多融合 10 张图片、5 段视频与 7 个主体;字节 Seedance 2.5 把参考上限放宽到 30 张图、10 段视频、10 段音频,并支持白模参考与运动参考;Google Veo 3.1 的「Ingredients to Video」用参考图锁定角色、产品与场景。第三方横评(OpenCreator,基于十数万次商用生成)认为 Veo 与 Vidu 在产品/角色的多镜头一致性上占优,可灵的强项则在人像表情与肤质的稳定。
第二类是身份微调:用目标角色的少量素材训练 LoRA 等低秩适配器,把「这个人」烧进模型权重。效果扎实,代价是每个角色都要单独训练、上线慢,适合头部 IP 而不适合流水线。
第三类绕开了「像不像」:Sora 2 的 Cameo 让真人录一段影像并授权,直接把自己的形象投进生成视频——一致性由真人兜底,但它只适用于「本人出镜」这一种场景。
第四类承认模型的局限,用工程补丁兜住:参考链(把上一次生成的定妆照作为下一次的输入)、角色资产库(所有镜头共用同一套参考素材与描述)、乃至多智能体「剧组」——开源项目 VideoClaw 的做法是维护一个类似场记的状态库,分阶段管理剧情、角色与道具的上下文。第三方工具盘点已把「角色一致性」单列为一条产品赛道(Soul ID、Runway 的角色参考等都被列入此类)。
还欠什么
多人的长篇叙事仍是重灾区:两个以上角色持续互动、服饰道具跨集不变、正反打镜头间视线与位置自洽,参考生视频也只能缓解不能根治。一致性的终局方案可能不在生成侧——把角色变成可复用的「资产」而非每次重新采样,这一思路与游戏引擎的资产管线殊途同归。
坎二:物理合理性——画面越真,穿帮越刺眼
如果说一致性是「身份记忆」问题,物理合理性就是「世界理解」问题。视频模型从海量真实视频里学到了「画面通常长什么样」,但「看起来对」和「物理上对」是两回事。
这不是猜测,而是有基准测试背书的结论。发表于 CVPR 2024 的 VideoPhy 基准用「球浮在水上」这类固液交互提示词测试文生视频模型,发现现有模型严重缺乏符合物理常识的生成能力。Google DeepMind 2025 年 2 月发布的 Physics-IQ 更系统:给模型真实视频的前几帧让它补完,再与真实后续逐帧比对,覆盖碰撞、旋转、流体、重力、动量等场景,结论被论文标题直接点破——视觉真实性不蕴含物理理解(visual realism does not imply physical understanding);视觉上最难与真实区分的 Sora,物理补全得分并不与它的逼真度相称。这一基准后来还迭代出修正标注质量的 Physics-IQ Verified,另有 T2VPhysBench(牛顿力学、光学、流体第一性原理测试)与用物理引擎当裁判的 GAUGE 等后续工作——评测界正在把「好看」换成「可算」。
各家的补法
模型的补法大致三条。数据侧:堆更高质量的物理相关视频数据,让统计规律里多含一点力学。架构侧:把推理放进生成——NVIDIA Cosmos 3 采用「推理优先于生成」的设计,官方称由此带来领先的物理精度;它本身就是给机器人与自动驾驶做闭环仿真用的。路线侧:换目标,从「生成像素」转向「可交互的世界模型」,Genie 3、Cosmos 这些玩家赌的就是这条路(见本专题《什么是世界模型》)。
模型厂自己也交底:字节在 Seedance 2.5 的官方公告里明确承认,复杂运动的物理合理性与极多主体交互的稳定性仍是待提升项。即便是被 OpenCreator 横评价为「物理逻辑第一梯队」的 Sora 2,社区实测里翻车合集也从未断更。
还欠什么
长时程漂移是共同软肋:几秒钟内守得住,几十秒后杯子里的水、桌上的书就开始偏离初始状态。可控性同样欠缺——你没法用参数精确指定「这个球以每秒 3 米弹出」,物理量在提示词里只是形容词。这也是为什么物理引擎 + 生成模型的混合管线(引擎给约束、模型给质感)在专业场景里越来越常见。
两道坎,一个尽头
把两道坎放在一起看,会发现它们指向同一个缺失:模型没有「状态」。一致性需要记住角色的状态,物理需要维护世界的状态——而这恰恰是当前以逐帧去噪为核心的目标函数所不要求的。这也解释了为什么 2026 年「世界模型」会从论文词汇变成头部公司押注的方向:让模型维护一个可交互、可预测的状态,两道坎可能是同一道坎。
在那之前,务实的答案依然是工程组合拳:参考生视频锁人、资产库锁道具、物理引擎锁规则、人工审片兜底。AI 视频的「能用」,从来不是模型单点赢来的。
相关阅读
- 一篇读懂 DiT:视频生成模型为什么都换上了 Transformer 主干
- 什么是世界模型:从「生成视频」到「可交互的模拟器」
- VTR-Bench:视频生成文字渲染的系统性评测基准
- 可灵4.0首发实测,国产AI视频再次掀桌?
读者留言
COMMENTS 暂无还没有留言,来说第一句?