← 返回 AI新闻列表
📈 行业动态

π0引用的中国团队,又出手了:世界仿真器新作发布

来源:量子位 · 发布于 2026-08-18 17:57:40
π0引用的中国团队,又出手了:世界仿真器新作发布 思邈 2026-08-18 17:57:40 来源:量子位 给机器人造一个更接近真实的“第二世界” 允中 发自 凹非寺 量子位 | 公众号 QbitAI 机器人撬开啤酒瓶盖,白色泡沫顺着瓶口涌出来。 紧接着,它倾斜酒瓶,酒液划过画面右下角,被稳稳注入杯中。 一整套动作行…

π0引用的中国团队,又出手了:世界仿真器新作发布

思邈 2026-08-18 17:57:40 来源:量子位

给机器人造一个更接近真实的“第二世界”

允中 发自 凹非寺

量子位 | 公众号 QbitAI

机器人撬开啤酒瓶盖,白色泡沫顺着瓶口涌出来。

紧接着,它倾斜酒瓶,酒液划过画面右下角,被稳稳注入杯中。

一整套动作行云流水,乍看和真机实拍没有任何区别,平平无奇。

但真相是——从瓶盖弹开的瞬间、泡沫与酒液的流体变化,到后续的所有物理反馈,整段画面全是由AI实时推演生成的!

这就是Current Robotics团队刚刚交出的硬核新作:

CurrentWorld-0,一套交互式世界仿真器(Interactive World Simulator)。

它首次把跨本体、多视角、力-触觉预测塞进同一个系统,也是该团队继人形全身精细操作模型Curr-0之后的又一次出手。

而这家低调团队的技术底色与操盘手,同样来头不小——

创始人祝毅晨曾任美的集团具身智能部部长,已发表40余篇顶会论文,学术引用超过5,200次。

作为国内最早发布VLA及世界模型的研究者,他曾带领团队提出扩散模型和VLM端到端的VLA范式(TinyVLA),拓展VLA+CoT策略(DiffusionVLA & DexVLA,发表至ICML和CoRL),并较早提出世界模型用于具身策略评估(dWorldEval,发表至ICML高亮论文)。

值得一提的是,Physical Intelligence在其里程碑论文π0中,就引用了祝毅晨团队完成的TinyVLA与ScaleDP工作。

△图源:π0论文References

从早期的VLA大模型、人类示教数据,逐步延伸至全身机器人学习,这些前沿探索最终沉淀为Current Robotics的技术基石。

而对于刚刚亮相的这套交互式世界仿真器,团队的核心目标很明确:

机器人的身体和观察方式可以千差万别,但在走进真实世界前,它们演练的必须是同一个世界

评测机器人,首先需要一个不会替策略纠错的世界

机器人世界模型有一个很自然的起点:视频生成模型。

经过大规模预训练之后,模型已经记住了不少视觉和运动规律:物体被遮挡后不会凭空消失,形状不会突然改变,运动在时间上也通常是连续的。

一次常见的抓取会怎么发生,模型其实已经“看过”很多遍,这对视频生成当然是好事。

但机器人训练数据里大量的成功范例,让模型见惯了“伸手—抓住—拿起”这样的轨迹。当一个还没训练好的策略把手伸偏,视频先验有时反而会把后面的结果继续往“成功”上补。

机械臂实际没有抓稳,生成画面里的物体却还是跟着手走了。真实执行已经失败,世界模型给出的未来却仍然顺利完成了任务。

放到机器人评测里,这样的“纠错”会直接让结果失真。

Current Robotics此前在dWorldEval中研究的,正是世界模型的动作可控性(action controllability):动作发生变化,后面的世界也必须跟着变。

机器人往左偏了一点,物体不能还沿着原来的轨迹走;动作已经失败,模型也不能替它把后面的结果补回成功。

对于CurrentWorld来说,这是一条最基本的要求:

机器人怎么做,世界就怎么变化;即使做错了,模型也不能替它把结果纠正回来。

CurrentWorld-0:评测机器人,为什么需要跨本体、多视角和力-触觉?

假设现在要评测一个最简单的动作:让机器人把桌上的杯子往前推一点。

如果执行者是一台固定双臂机器人,动作可能只涉及机械臂;换成移动升降双臂,底盘和升降机构也可能参与进来;再换成人形机器人,整个动作又会落到另一套全身控制上。

同样一句“把杯子往前推”,到了不同机器人身上,真正输入给模型的动作已经完全不同。

CurrentWorld-0因此没有先规定一种所有机器人都必须使用的动作格式,而是保留不同本体自己的Action Subspace

模型需要做的,是把这些不同形式的动作继续往后推演:杯子受到了什么影响,位置发生了多少变化,后面的场景又该怎么接下去。

这也是跨本体建模真正困难的地方。

机器人可以换,动作接口可以换,但杯子不会因为执行者换了,就突然变得更轻、更重,或者开始遵循另一套运动规律。

可仅仅知道杯子动了,还不足以完成一次动作。

机器人执行任务时,往往同时依赖多个摄像头。

第三视角看到整个桌面,头部相机随着机器人运动,腕部相机几乎贴在机械手旁边。一个动作发生以后,杯子会同时出现在几路完全不同的画面里。

这时候,问题就从“这一帧生成得像不像”变成了“几路画面能不能对得上”。

比如第三视角已经看到杯子向前移动了十几厘米,腕部相机里的杯子却还停在原处;又或者物体被机械臂挡住几秒,再出现时位置突然发生跳变。

任何一路出现这种漂移情况,这次评测的物理过程都会断开。

CurrentWorld-0要维持的,是多个相机对同一次事件的共同记录

当前Demo中,模型可以同步生成多路视角,并让机器人、物体和场景状态随着操作持续向前变化。

如果把任务从“推杯子”换成夹薯片或者削黄瓜,复杂度又增加一层。

机器人已经把夹爪放到盘中,视觉上看起来位置完全正确,可它究竟有没有捏住薯片,仅靠画面并不好判断。

削皮刀也是如此。刀刃已经贴住黄瓜,并不意味着这一刀真的削下去了。受力太轻,可能只是从表面划过;接触不稳,也可能下一秒就发生滑移。

CurrentWorld-0因而把力觉和触觉也放进未来预测里。

工具什么时候真正受力,接触有没有实际发生,抓取是否稳定,这些原本藏在像素之外的状态,也会随着机器人的动作一起变化。

如此,一次完整的机器人评测需要锚定的,其实是一整段连续过程:

  • 机器人按照自己的方式发出动作,物体随之变化;
  • 多个摄像头从不同位置记录这个结果;
  • 真正发生接触以后,力和触觉再补上画面里难以直接看到的部分。

CurrentWorld-0把跨本体、多视角和力-触觉统一放进模型,最终要还原的,是一次动作从输入开始,到环境响应、接触发生,再到物理反馈出现的完整过程。

人类接管:在世界模型里重新选择下一步

真机执行任务时,一个中间状态往往很难被原样复现。

动作继续往前,物体位置、机器人姿态和接触关系都会随之变化;如果想从同一个位置重新尝试,通常需要重新复位场景,再把前面的过程跑一遍,费时费力。

而在CurrentWorld-0里,这个过程可以被中止。

策略自主执行后,当机器人进入潜在失败状态,操作员可以通过遥操作直接接管,从当前位置继续完成后续动作。

当前状态也可以被保存和回滚,一次尝试结束后,再回到同一个节点,换一种方式继续推进。

于是,同一个状态之后,可以接上不同的动作,也会得到不同的结果。

这延续了Current Robotics团队此前Hi-WM(Human-in-the-World-Model)工作的思路。

到了CurrentWorld-0,每一次接管都会把后续交互重新展开:画面会继续变化、新的接触带来对应的力与触觉反馈、操作员的纠正动作也会被完整记录下来。

这些信息共同组成新的交互轨迹,可进一步用于policy post-training。

一个原本只会经过一次的状态,也因此可以被重新调用,从不同的动作选择里继续探索。

△CurrentWorld多模态纠错轨迹用于post-training后的结果

殊途同归:机器人最终面对的仍是同一个世界

机器人的形态未来会越来越多,本体、数据、模型、控制方式,每一样都在继续分岔。

但无论采用哪一种路线,机器人的能力最后都要回到真实世界里接受检验

《周易·系辞》里那句“天下同归而殊涂,一致而百虑”,说的正是这件事——路有百条,归处只有一个。

这条归路上,CurrentWorld-0想扮演的是终点前的最后一道关:让那些还没被现实检验过的动作,先在这里跑一遍、错一遍、改一遍。

它们可以有一千种走法,但走到最后,面对的仍是同一个世界。

*本文系量子位获授权刊载,观点仅为原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。 Current Robotics 世界仿真器 祝毅晨 思邈 扫码分享至朋友圈

热门文章

一家新能源大厂,如何撑起全球最大AI算力超级单体?

2026-08-11

深度体验DeepSeek Harness,我原谅它涨价了

2026-08-14

4.8亿美元砸向端侧算力!Agent芯片新贵冲出重围

2026-08-13

马斯克Grok 4.6重回一梯队!更低价格反超Fable 5,这Cursor是真没白收购

2026-08-13

刚刚,Qwen3.8-27B 开源了!家用显卡也能跑

2026-08-14