一、先建立一个正确的直觉世界模型这个词在2026年被用得极其混乱。一个生成火焰视频的模型、一个能凭空生成可玩游戏的模型、一个精确模拟燃烧过程的物理引擎都被叫作世界模型但它们实际在做三件完全不同的事。要理解这个领域必须先抓住一个最底层的直觉大语言模型学的是文本的统计规律而世界模型学的是时空的统计规律——光怎么照在物体上、东西受力后怎么运动、一个动作会导致什么后果。普通的大语言模型像一个博学的旁观者它知道很多事但无法预测你做一个动作后会发生什么。世界模型的目标是让AI成为一个参与者——在行动之前先在脑子里把各种可能性过一遍。李飞飞在2026年6月的长文中给出了一个精确的技术定义。智能体采取行动行动改变世界的状态智能体只能观测到状态的一部分然后根据观测产生新的行动。这个主体→行动→状态→观察→返回的循环赋予了世界模型以技术意义。现在被称为世界模型的各种事物实际上是同一个循环的不同投射。二、李飞飞的功能分类理解这个领域的钥匙李飞飞从强化学习中的部分可观测马尔可夫决策过程出发将当前被冠以世界模型之名的技术划分为三大功能范式。渲染器把世界画出来渲染器的任务是把信息转成人眼能看的像素唯一标准是视觉上够不够逼真。谷歌的Genie 3、World Labs的RTFM都属于渲染器。这也是目前商业化跑得最快的方向。但它只管看起来像不管实际上对不对。AI生成的航拍镜头中建筑物从空中俯瞰完美无瑕但如果开车穿过街道建筑物结构就会暴露出各种错误瞬间崩塌。因为这类模型根本不掌握三维空间结构只还原观看者会看到的画面而非事物本身的真实构造。这种输出再精美也没法拿来做建筑设计或者训练一个需要在真实环境里精准操作的工业机器人。模拟器让世界真的对模拟器输出的是精确的物理数据——几何数据、材质参数、碰撞网格。它追求的不是看起来像而是结构上的正确。几何要经得起测量运动要遵守牛顿定律动力学行为要符合物理法则。模拟器同时服务两类用户建筑师、设计师、影视开发者需要超越视觉效果的精确数据强化学习智能体、机器人控制器、自动驾驶算法需要一个安全的环境来大规模训练复现那些现实中太危险、太贵或者根本没法实测的场景。李飞飞认为模拟器获得关注最少但最关键是连接渲染和规划的桥。如果说语言是对世界的抽象像素是对世界的投影那么几何、物理和动力学就是世界本身。模拟器正是视觉外观和动作后果得以生成的结构骨架。英伟达的Omniverse仿真平台瞄准的工厂、仓库、数字孪生、供应链等市场潜在规模就超过万亿美元。World Labs的Marble是这个方向的第一步产品接受文字、图片或草图输入生成可以自由漫游的3D环境同时输出用于视觉呈现的高斯泼溅数据和用于物理计算的碰撞网格。规划器决定下一步做什么规划器输入观察和目标输出下一步动作。VLA模型和新一代世界动作模型都属于规划器这些系统决定了机器人在非结构化世界中应该做什么。规划器最吸引人也最具发展潜力。具身智能就与此紧密相关。但李飞飞指出近年来很多令人印象深刻的机器人演示都局限于高度受限的实验室环境目标对象范围狭窄任务周期短无法在真实世界部署所需的复杂性、可变性和持续时间下进行验证。三、技术路线三种截然不同的哲学理解了三大功能之后还需要理解实现这些功能的技术路线。2026年世界模型形成了三条清晰的路线它们的核心分歧在于如何理解世界。联合嵌入预测架构JEPA在抽象空间预测这是Yann LeCun力推的路线。他在ECCV 2026的演讲中明确表示只靠语言和tokenAI永远跨不过物理世界这道门槛。JEPA的核心思路是理解世界不必重构像素而是预测高层语义特征。 给模型一段视频它预测后续事件的抽象表示但不是生成人类可懂的像素级画面。优势是极大地节省算力且避免了生成式模型容易产生的幻觉其实更接近人类观察世界的方式。LeCun认为预测像素是伪命题。他的论证很直接很多信息比如镜头外的人在当前帧里根本不存在强行预测像素是浪费。JEPA放弃像素重建只在语义嵌入空间做预测。Meta在2025年发布的V-JEPA2被明确定位为迈向AGI的世界模型组件给定动作序列在语义空间预测未来的视觉表示。但JEPA也面临严肃挑战。LeCun自己在演讲中花了大量篇幅讨论表征坍塌问题——模型可能学会把所有输入映射到同一个表示从而在预测任务上作弊。他的解法从VICReg发展到SIGReg通过让变量不相关、呈独立高斯分布来防止坍塌。纯JEPA路线仍面临训练坍缩、可解释性不足和缺少中间产品等工程问题因此产业侧目前更偏向生成式或混合式路线。视频生成路线像素级的物理模拟器代表模型是Sora和Genie。核心思路是通过像素级预测理解世界。如果模型能生成未来每一帧图像就隐式理解了物理规律。Sora通过大规模视频训练学习重力、流体、物体遮挡等规律。视觉逼真但可能违反物理。Genie则是可交互生成器不仅生成视频还能通过动作干预——比如通过键盘控制生成的视频内容。这条路线商业化最快但物理一致性是硬伤。Majumdar指出当前机器人领域的世界模型几乎等同于视频生成模型在商业推动力方面拥有不容低估的短期优势但长时域生成是重大挑战——当前视频模型很难在超过某个时间尺度后保持一致性。空间智能路线3D物理的架构师这是李飞飞World Labs走的路。核心思路是相比Sora的2D像素补丁强调对三维空间结构的精确理解。Marble模型接受文字、图片或草图输入生成可以自由漫游的3D环境同时输出两套数据用于视觉呈现的高斯泼溅数据和用于物理计算的碰撞网格。这条路线工程化落地效率较高适配游戏开发等B端场景但生成可编辑的3D资产需要精确的几何标注数据而这类数据比训练渲染器用的互联网视频稀缺好几个数量级。四、经典架构Dreamer与潜空间里的白日梦在理解了三路线之后需要回到一个经典架构Dreamer。它是世界模型在强化学习领域的基石由Google的Danijar Hafner提出。Dreamer的核心思路是将图像压缩到潜空间在潜空间中进行梦境推演从而训练策略。它的前身是World ModelsHa Schmidhuber, 2018后者将变分自编码器与混合密度网络循环神经网络耦合从像素中学习生成式的内部模型并证明了一个完全在模型的梦境中训练的简单控制器可以迁移回真实环境。Dreamer的关键贡献是证明了只靠内部想象就能学会复杂技能不需要真实环境交互。这大幅降低了成本尤其是极其难收集的机器人真实数据。Dreamer在Minecraft中学会了复杂行为证明了在潜空间中做长时程规划是可行的。它的核心机制是编码器把观测压缩成潜在状态动力学模型预测状态如何随动作变化奖励预测器估计当前状态的价值策略在想象中学习如何最大化奖励。Dreamer和JEPA的区别在于Dreamer优化的是像素级或状态级的预测精度JEPA优化的是嵌入空间中的预测一致性——不建模像素级似然或显式动力学。五、前沿代表工作NeoVerse-ABot破解动作幻觉中科院自动化所联合高德CV Lab的NeoVerse-ABot在ICRA 2026的AGIBOT World Challenge世界模型赛道中从全球27个国家和地区的526支队伍中夺冠得分0.829。这项工作的核心突破是破解了动作幻觉难题——模型不再只是机械执行指令而是在行动前能想一想动作的物理后果。该赛道创新性地加入了物品掉落等任务要求模型能够预测夹得太松杯子会不会在半路滑落这类问题。它构建了基于扩散模型的高保真动作条件视频生成框架通过时序对齐算法与多维度条件增强机制实现复杂操作任务下物理演变过程的精准模拟。InternW0原生物理世界模型2026年9月23日发布的InternW0定位为基础物理世界模型围绕全模态接口、异步多频率处理、部分观测和外部影响下的局部物理建模构建。它直接面向真实世界的交互效率问题。DexWorldModel因果潜世界模型DexWorldModel提出了因果潜世界模型使用DINOv3特征作为生成目标将交互语义从视觉噪声中解耦产生高度鲁棒的领域泛化能力。它引入了双状态测试时训练记忆保证长时程任务中严格的常数级内存占用。Code World Model代码作为世界大脑西湖大学AGI Lab与南洋理工大学提出的范式把世界如何演化和世界如何被看见拆成两个互补问题。Coding Agent作为世界大脑通过持续编写、调用和修改代码维护可执行的world state。规则以代码的形式存在可以被组合、扩展和改写。视频模型负责视觉呈现通过proxy representation将可执行状态编译为proxy video再条件化视频模型渲染高保真视觉观察。Meta也开源了320亿参数的代码世界模型CWM用世界模拟的方式处理代码。Kairos从被动生成器到操作基础设施大晓机器人的开悟世界模型3.1Kairos 3.1是融合生成智能、物理智能与认知智能的行动一体化世界模型。它以原生统一架构打通理解、生成、预测技术壁垒构建理解—推演—执行—反思全链路自进化智能闭环。8B模型平均推理延迟为125毫秒已面向全行业开源。这意味着世界模型不再是一个训练时工具而是实时参与决策的操作组件。六、关键挑战长时程一致性这是最根本的瓶颈。当前机器人领域的视频模型很难在超过某个时间尺度后保持一致性。GigaWorld-1的系统研究揭示长时程推演一致性和机器人专用可控性对于可靠的策略评估比短期视觉真实感更为重要。问题出在复合误差上。自回归视频生成中复合误差本质上是不可约的。模型在每一步都可能有微小偏差这些偏差会随时间累积最终导致预测完全偏离真实轨迹。泛化边界Agentic-JEPA的实验给出了一个尖锐的边界。在分布内环境中它达到了100%成功率和接近最优的规划效率。但在分布外环境中完全失败——0%成功率无论动态类型如何。这揭示了一个关键问题自监督世界模型在文本环境中的泛化能力仍然非常有限。物理状态稳定性当前世界模型在未观察到状态时无法保持一致的世界状态。这说明需要进行设计变更将物理状态稳定性置于外观保真度之上。外观可以暂时错误但物理状态的内核必须稳定。潜空间紧凑性与视觉保真度的张力这是一个根本性的权衡。高保真重建往往与物理可交互的场景重建脱节导致开环预测误差累积。紧密的动作耦合和分层规划可以缓解长时程任务中的复合误差但会引入计算瓶颈挑战实时反射控制的要求。七、全局视野这个领域正在走向哪里把以上所有信息放在一起一个清晰的图景浮现出来。第一世界模型正在从任务特定的动力学预测器演变为机器人学习的预测基础设施。 多篇2026年的综述都指出了这个趋势。世界模型不再只是一个辅助模块而是正在成为机器人学习管线的核心组件。第二四类建模范式正在收敛。 中科院联合MBZ、NTU、Oxford的综述将现有方法归纳为四大分支观测层生成式世界模型、潜空间世界模型、强化学习驱动的世界模型、对象中心世界模型。综述同时指出思维链推理与世界模型想象正在出现收敛趋势未来方向是统一的多模态世界模型和基础规模的交互式模拟器。第三产业侧已经给出了明确的信号。 2026年国内以世界模型为核心概念的33家创业公司累计融资规模已超过260亿元人民币其中7家跻身独角兽。前华为云大模型CTO创办的息壤开物连续完成数亿元种子轮及天使轮融资估值达5亿美元。浙大00后博士生创办的4D世界模型企业魔芯科技估值跃升至近100亿元。第四真正的分歧不在于技术路线而在于时间尺度。 Majumdar的判断值得认真对待视频生成模型在短期商业推动力方面拥有不容低估的优势但LeCun倡导的潜在世界模型在长时域规划上更具前景可能在五年左右的时间尺度上成为关键组件。这意味着两件事同时是真的渲染器路线会在未来两三年内产生最大的商业回报因为它的技术链路最成熟、数据最充足、用户最愿意买单。但模拟器和规划器路线才是让AI真正理解物理世界的基础它们需要更长的周期来积累数据和弥合虚实鸿沟。第五世界模型与Harness的关系不是替代是层次跃迁。 Harness工程解决的是把AI放进一个受控的工程环境里让它能调用工具、遵守规则、接受验证。世界模型工程解决的是让AI拥有一套对物理环境的可计算理解能预测行动后果能在真实执行前做模拟和推演。Harness的原理天花板是它只能管理已经发生的事。世界模型管理的是可能发生的事。但Agent越强Harness越重要——因为一个行动力很强但没有流程、权限、测试和审计的Agent短期看起来很猛长期一定出事。世界模型的终点是让Agent的试错成本趋近于零。Harness工程的全部复杂性——重试策略、验证器、回滚机制、子Agent调度——本质上都是在用外部工程手段补偿模型不知道行动后果这个缺陷。世界模型直接消除这个缺陷本身。当Agent能在内部可靠地预演足够长的行动序列时外部脚手架的存在理由会被逐个消解。不是被内化而是不再需要。
企业数字化 ERP 产品动态
相关推荐
网站建设丿金手指谷哥12实战案例:解决域名服务器难题 网站建设丿金手指谷哥12实战案例:解决域名服务器难题 域名服务器配置是建站第一道坎,很多新手在此卡壳。结合上海创业团队实战案例,我们拆解网站建设丿金手指谷哥12的核心步骤。从需求痛点到技术选型,再到实操部署,全程直击“域名服务器搞不懂”的痛… · 2026/9/27 2:47:22
Jev与结构化决策模型 不生成文本的 AI,怎么给 Agent 当裁判?认识 Jev 与结构化决策模型
判断一段 Agent 轨迹是否泄露隐私、有没有正确使用工具、用户是不是已经很生气,我们通常有两种办法:写规则,或者再调用一个大语言模型当裁判。
规则… · 2026/9/27 2:47:16
3步搞定国家化妆品备案网官网搭建完整流程 3步搞定国家化妆品备案网官网搭建完整流程 网站被黑挂马不知道怎么办?别慌,这通常是基础安全没做好。很多甲方对接人找上门,第一句话都是“我的备案网站怎么变成博彩广告了”,第二句就是“能不能救”。救是可以救,但预防才是根本。今天咱们不聊虚的,直… · 2026/9/27 2:47:16
5个网站系统开发毕业设计对比评测:告别模板丑站,报价透明 5个网站系统开发毕业设计对比评测:告别模板丑站,报价透明 模板网站真的丑到让人想删库?别急,先看看这份网站系统开发毕业设计的真实对比评测。很多学生党找外包做毕设,或者企业老板找团队做官网,一上来就被“模板化”坑得明明白白:千篇一律的轮播图、… · 2026/9/27 5:29:08
继电器触点灭弧实战指南:RC吸收电路设计与参数选型 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 5:29:02
PageHelper分页插件深度解析:原理、实战与性能优化 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 5:28:56
Linux下COMSOL安装的四大系统级兼容性校验 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 5:28:50
职教集团网站建设方案与建站报价避坑指南 职教集团网站建设方案与建站报价避坑指南 网站做好了没人访问,这是很多职教集团信息化负责人最头疼的事。花了大几万甚至十几万做的官网,上线后日均访客可能只有个位数,搜索引擎里搜集团名字都排不到前三页。问题往往不在服务器配置高低,而在… · 2026/9/27 5:28:31
河北外贸网站建设避坑指南:图解步骤与技术选型全解析 河北外贸网站建设避坑指南:图解步骤与技术选型全解析 网站做好了没人访问,这是很多河北外贸老板最头疼的事。钱花了,站建了,结果后台数据一片空白,询盘更是寥寥无几。问题出在哪?往往不是内容不好,而是技术选型错了,或者SEO基础没打牢。… · 2026/9/27 5:28:31
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01