把 2025 年 8 月到 2026 年 9 月的资金数字排成一行,就能看出风向:LeCun 的 AMI Labs 种子轮 10.3 亿美元(欧洲史上最大),李飞飞的 World Labs 新一轮 10 亿美元,随后整个公司被 AMD 以报道口径 82 亿美元收入囊中;中间还夹着 NVIDIA 开源 Cosmos 3、DeepMind 把 Genie 3 开进 Google 订阅渠道。本站 10 月 7 日的概念篇讲清了世界模型「是什么、和视频生成差在哪」;本文讲格局——谁在做、钱从哪来、路线怎么分、以及怀疑者为什么还不敢信。
一张时间线:从论文词汇到资本主战场
timeline
title 世界模型大事记 2024 - 2026
section 2024
2 月 Sora 引发「世界模拟器」之争,Genie 1 论文发布
12 月 Genie 2 单图生成可玩 3D 世界
section 2025
1 月 NVIDIA Cosmos 开源发布,LeCun 预言 LLM 范式寿命
6 月 Meta V-JEPA 2 零样本操作机械臂
8 月 Genie 3 实时交互世界
11 月 LeCun 宣布离开 Meta,Marble 全面开放
section 2026
1 月 Project Genie 面向订阅者开放
2 月 Waymo 世界模型曝光,World Labs 融资 10 亿美元
3 月 AMI Labs 完成 10.3 亿美元种子轮
5 月 Cosmos 3 与 Gemini Omni 相继亮相
9 月 World Labs 并入 AMD
这条时间线有两层背景。远的一层是概念史:2018 年 Ha 与 Schmidhuber 的《World Models》让智能体在自己「梦」出的环境里学策略;2023 年 DeepMind 的 Dreamer v3 在无人干预下从零集齐 Minecraft 钻石;2024 年 Genie 论文用 20 万小时游戏视频训练出 11B 参数的基础世界模型。近的一层是范式之争:LeCun 从 2023 年起反复把 LLM 比作「通往人类级 AI 高速路上的匝道」,2025 年 1 月达沃斯上他给出时间表——现范式寿命「大概三到五年」,下个十年属于机器人(TechCrunch 报道)。世界模型从不是新点子,2025 年之后变的是工程可用性与钱。
四大阵营:同一个名词,四种押注
2026 年的世界模型不再是单一技术,而是四条路线共用的招牌。
DeepMind:把世界开进订阅
Genie 3 是交互式世界生成的标杆:2025 年 8 月 5 日发布,文本生成可实时导航的世界,720p、24fps,视觉记忆约一分钟,一致性维持数分钟——而且不需要 NeRF、高斯泼溅这类显式 3D 表征,一致性是逐帧生成的涌现能力。它还支持「可提示世界事件」:一句话改天气、凭空加一头大象,为智能体提供反事实训练场景。DeepMind 在官方博客里写得很直白:「世界模型是通往 AGI 路上的关键垫脚石」。局限也同样直白:动作空间有限、多智能体交互不可靠、真实地点无地理配准、清晰文字渲染不出来、连续交互只有几分钟(官方博客)。
此后的动作是一条商业化曲线:2025 年 11 月 SIMA 2 智能体用 Genie 3 生成的陌生世界做泛化考场与自我改进闭环;2026 年 1 月 29 日 Project Genie 向美国 Google AI Ultra 订阅者开放(单次世界限 60 秒,研究总监 Fruchter 解释是「为了让更多用户用上」);5 月 I/O 大会上 Street View 接入,真实街道可交互改天气。同一场发布会上 Pichai 给 Gemini Omni 定调:「有了世界模型,AI 正从预测文本走向模拟现实」(TechCrunch 报道)——世界模型不再另立山头,而是被并进 Gemini 主线。落地侧,据 PCMag、Ars Technica 等多家媒体 2026 年 2 月报道,Waymo 基于 Genie 3 自建世界模型模拟龙卷风、大象闯路等极端场景,号称激光雷达仿真提速四倍、支撑了 11 个美国城市的扩张;两家官方没有联合公告,细节以媒体交叉报道为准。
NVIDIA:Cosmos,物理 AI 的开放底座
NVIDIA 的路线自成一派:不做「能逛的世界」,做「能造机器人的世界模型基础设施」。Cosmos 1 在 2025 年 1 月 CES 发布,4B 到 14B 参数、Nano/Super/Ultra 三档,用 2000 万小时视频训练出 90 万亿 token,开放权重,首批伙伴是 Waabi、Wayve、Foretellix、Uber 四家自动驾驶公司;配套论文的立场是一句口号:「物理 AI 需要先在数字世界训练」。之后一年快速迭代:8 月 GTC 发推理模型 Cosmos Reason 与加速合成数据的 Transfer-2;10 月 Predict 2.5 统一文本/图像/视频到世界的生成,配 2 亿精选片段。
2026 年 5 月 31 日 GTC 台北发布的 Cosmos 3 把牌面拉满:自称「全球首个全开放 omnimodel」,原生理解并生成文本、图像、视频、环境声、动作五种模态,双塔 mixture-of-transformers 架构(推理塔配专家生成塔),Super 与 Nano 两档开放权重、Edge 待发,模型卡标注 OpenMDW 许可可商用。黄仁勋的台词是「物理 AI 的大爆炸就在眼前」。生态比模型本身更值得关注:Cosmos Coalition 创始成员包括 Black Forest Labs、Runway、Skild AI 等六家,下游点名用户有三星、LG、斗山机器人和理想汽车。NVIDIA 卖的从来不是模型,是让所有机器人公司都从它的底座上起建。
World Labs:空间智能三年,止于并入 AMD
李飞飞的 World Labs 走「空间智能」路线,产品最像传统软件:2025 年 11 月 12 日全面开放的 Marble 从单图、文本、多图甚至粗 3D 布局生成持久、可编辑、可下载的 3D 世界,导出高斯泼溅、网格与视频,订阅 $20 到 $95 每月,兼容 Vision Pro 与 Quest 3——和 Genie 的「直播流」不同,Marble 交付的是资产。公司 2024 年 9 月出 stealth 即融资 2.3 亿美元,2026 年 2 月再融 10 亿美元(AMD、Autodesk、NVIDIA、Sea 等入场,估值未披露),7 月收购机器人仿真公司 SceniX,9 月初发布空间智能模型 Atlas。
然后是这条线上最戏剧性的一幕:2026 年 9 月 28 日,World Labs 官宣签署最终协议并入 AMD——官方未披露金额,TechCrunch 报道为 82 亿美元。李飞飞出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报;联创 Justin Johnson 与 Ben Mildenhall 继续带队,交易预计年底前交割。动机她自己在 Substack 里说得坦白:空间智能要规模化,「必须更靠近硬件」。GPU 厂商买下世界模型团队,等于把世界模型的算力账单直接写进了芯片路线图(本站此前有过报道)。
JEPA 阵营:LeCun 的出走与 AMI Labs
最贵的一枪来自最坚定的批评者。2025 年 11 月 11 日 FT 曝光 LeCun 离职,八天后本人发文确认,给新公司的使命画了四件事:理解物理世界、持久记忆、推理、规划复杂动作序列;并称 Meta 将成为新公司伙伴。2026 年 3 月 9 日,AMI Labs 宣布完成 10.3 亿美元种子轮,投前估值 35 亿美元:Cathay Innovation、Greycroft、Hiro Capital、HV Capital 与贝索斯家族基金 Bezos Expeditions 联合领投,NVIDIA、三星、淡马锡、丰田创投做战略方,个人股东里有 Berners-Lee、Eric Schmidt 和 Mark Cuban。公司总部巴黎,CEO 是医疗 AI 公司 Nabla 联创 LeBrun,首席科学家谢赛宁(Saining Xie),首席研究官冯雁(Pascale Fung)——首个合作伙伴正是 Nabla:LeBrun 做医疗 AI 时体会到,LLM 幻觉在诊室里可能要人命。「真正的智能不始于语言,而始于世界」是这家公司的信条。截至 2026 年 7 月它仍无产品、无时间表,LeBrun 明确拒绝 AGI 标签,也拒绝「取代 LLM」的说法——世界模型与 LLM「互补,而非替代」。
JEPA 路线的技术底座已有实证:Meta 在 2025 年 6 月发布的 V-JEPA 2 用 12 亿参数、100 万小时视频预训练,只靠 62 小时机器人交互数据就完成动作条件化,零样本操作真实 Franka 机械臂,在未见环境抓放成功率 65%–80%,权重开源;2026 年 3 月的 V-JEPA 2.1 把真实机器人抓取成功率再提 20 个百分点。LeCun 走后 Meta 官方未表态这条路线是否延续,但论文还在出。
四大阵营对比如下(截至 2026-10-09):
| 阵营 | 代表 | 技术路线 | 主战场 | 开放程度 | 商业状态 |
|---|---|---|---|---|---|
| Google DeepMind | Genie 3 | 自回归视频生成,实时交互 | 智能体训练环境、消费体验 | 封闭,订阅渠道 | Project Genie 订阅开放 |
| NVIDIA | Cosmos 3 | 全模态世界基础模型 | 机器人、自动驾驶合成数据与仿真 | 权重开放可商用 | 平台生态加联盟 |
| World Labs(并入 AMD) | Marble、Atlas | 3D 表征,可导出资产 | 游戏、影视、VR、仿真 | 产品付费 | 被收购,年底交割 |
| AMI Labs | 暂无产品 | JEPA 潜空间表征预测 | 医疗、工业、机器人 | 承诺开源论文与代码 | 种子轮,pre-product |
| Meta FAIR | V-JEPA 2.1 | 潜空间预测 | 视频理解、机器人规划 | 权重与代码开源 | 研究线,提出者已出走 |
为什么是现在:三股推力
第一是视频生成的技术溢出。Sora 证明了长视频生成的可行性,Genie 3 证明自回归出帧能做到实时交互——生成引擎的进步直接抬高了世界模拟的上限,Parker-Holder 的自我评估是生成质量「落后纯视频六到十二个月」,差距在收敛。
第二是具身智能的数据饥渴。真机数据又贵又慢,机器人行业撞上了当年自动驾驶的墙,而世界模型是唯一能无限量产「带动作标签的物理交互数据」的机器。Cosmos 的口号「物理 AI 先在数字世界训练」和 V-JEPA 2 用 62 小时机器人数据完成动作对齐,是同一件事的两个证明。本站《世界模型上车》拆过自动驾驶这条垂直线,逻辑完全同构。
第三是LLM 范式的集体焦虑与资本新叙事。关于 Scaling 撞墙的讨论持续了两年,头部实验室需要一个「下一幕」。LeCun 给出了最锋利的版本,资本用真金白银投票:一笔种子轮加一轮融资加一桩收购,十四个月里流向世界模型的明确资金超过 100 亿美元。热度甚至渗回了中国——就在本文发稿前一天,彭博社还在报道前字节实习生田柯宇的世界模型创业公司拿到 2 亿美元估值(本站昨日新闻)。
冷水:范式,还是下一个 buzzword?
最响的警报来自阵营内部。AMI Labs 的 CEO LeBrun 在融资官宣当天就说:「我的预测是,世界模型会成为下一个 buzzword。六个月后,每家公司都会自称世界模型去融资。」概念外溢已经发生:渲染器、仿真器、规划器都往同一个标签里装。
概念史本身也削弱原创叙事。Gary Marcus 在 LeCun 离职后发表的《对 LeCun 的错误神化》里系统地质疑:世界模型思想可追溯到 1950 年代的 Herb Simon,Schmidhuber 从 1990 年代就在做,LeCun 的贡献是布道而非首创。这类人身色彩较强的批评不必全收,但方向提醒是对的:这条线的护城河如果是「理念」,那它非常浅。
工程现实同样冷静。Genie 3 的官方局限清单(动作空间、多智能体、地理精度、文字、数分钟时长)一条没解决;Sora 时代的物理失败——被咬的饼干没有咬痕——在今天的生成世界里仍是常态。分析机构 Futurum 提醒得对:别把融资额当技术可信度的代理指标,一家 35 亿美元估值、约 12 名员工、没有产品的公司,赌的是多年路线图;而如果头部 LLM 实验室加速吸收世界模型能力,AMI Labs 架构独特性的窗口会明显收窄。事实上 Google 把世界模型并进 Gemini、LeBrun 自己说「互补而非替代」,都指向同一个结论:这不是一场取代 LLM 的革命,而是一次向 LLM 主线的并入。
写在最后:三个值得盯的信号
一是 Gemini Omni 与世界模型的合流速度——如果「预测文本」和「模拟现实」真的长进同一个模型,独立世界模型公司的生存空间会被压缩。二是 AMD 交割之后,世界模型第一次有了「为它设计芯片」的硬件主线,算力成本曲线值得跟踪。三是 AMI Labs 的交付节点:10.3 亿美元花出去之后,第一篇重磅论文或第一个产品何时出现,将决定 JEPA 路线是范式还是情怀。以上三条是本文作者的观察推测,不是事实断言——毕竟这条赛道上连「世界模型」四个字本身,都还没有公认的定义。
参考资料
- Genie 3: A new frontier for world models(DeepMind 官方博客,2025-08-05):720p/24fps 规格、视觉记忆与五条官方局限的出处。
- NVIDIA Launches Cosmos 3(NVIDIA 新闻稿,2026-05-31):全开放 omnimodel、Coalition 成员与下游用户名单。
- World Labs is Joining AMD(World Labs 官方博客,2026-09-28):并入交易、李飞飞新职务与动机原话;金额 82 亿美元见 TechCrunch 同日报道。
- AMI Labs raises $1.03B(TechCrunch,2026-03-09):融资额、投资方、团队与 LeBrun 的 buzzword 预言。
- Introducing V-JEPA 2(Meta AI 博客,2025-06-11):12 亿参数、62 小时机器人数据与零样本操作的实证。
- Meta's Yann LeCun predicts a new paradigm of AI architectures within 5 years(TechCrunch,2025-01-23):达沃斯言论,「范式寿命三到五年」出处。
- The False Glorification of Yann LeCun(Gary Marcus,2025-11-18):最系统的反方观点。
- World Models(Ha & Schmidhuber,2018):概念史起点。
读者留言
COMMENTS 暂无还没有留言,来说第一句?