机器人的GPT-3时刻真·来了!卡卡西上身,看3秒就学会新动作
机器人的GPT-3时刻真·来了!卡卡西上身,看3秒就学会新动作
梦瑶
2026-08-21
15:17:58
来源:量子位
机器人看3秒演示就能学会
梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
救啊我说……机器人界的GPT-3时刻,好像真来了!?
GPT-3当年看几个例子就能学会一项新任务的本事,现在直接在机器人身上上演了——
哪怕是从没学过的新活,只要给机器人看一段3-12秒的动作示范,人家下一秒直接大干特干!!!

甚至它还会举一反三。
你先教机器人拿刷子扫东西,转头把刷子换成一根香蕉,它居然顺手拿香蕉继续扫——

还嫌不够?那咱再给它塞个簸箕~
瞧嘛,这回连完整动作都没教,人家自己琢磨出了一只手扫、一只手接的双手配合,神了:

这,就是Generalist AI刚刚发布的机器人基础模型——GEN-1.5。
一个主打One-shot Learning的机器人模型,通过大规模物理数据预训练,能让机器人只看几秒示范,就快速学会新任务。
此外,这模型还能把两段不同的教学演示拼起来学,模拟器里看一遍,转头到了真实世界,也能直接上手。
整个训练过程甚至可以做到0梯度更新、0微调。
甚至吧,这些能力根本没人手把手教过,而是在大规模Physical Data预训练过程中模型自己「悟」出来的。。。

这下好了,模型刚一发,网友直接梦回六年前:
机器人届的GPT-3时刻,可能真的来了。

物理版Prompt Engineering来了:机器人看3秒演示就能学会!
不知道大家还记不记得。
GPT-3当年真正把人《看愣》的能力之一,就是In-Context Learning。
给模型一个或者几个例子,它不用重新训练,光看上下文,就能临时get到一个新任务要怎么做。
而Generalist这次做的事情,则是直接把这套玩法一脚踹进了「物理世界」——
GEN-1.5是团队连续预训练8个多月搞出来的新一代机器人基础模型。
底子还是那套底子,继续猛吃真实世界里的物理交互数据,但这回一个很关键的新本事冒出来了:
刚刚发生过的动作,也可以进入Context!!!



就拿下面这个《杯盖堆堆乐》来说。
人类先演示3-12秒,整个过程中没有梯度更新,也没有任何微调,GEN-1.5看完这段Physical Prompt,转头自己就能上手。
主打一个你前脚刚演示完,后脚小机器人:得嘞,您瞧好了哈~
甚至我浅浅粗略算了一下,从学习技能到完成任务,大概也就花费「半分钟」的时间???
而且吧,GEN-1.5最神的一点还在于,在GEN-1.5的世界观里,不同演示教学甚至还能「拼起来用」。。。
比如先给它看一段A动作,再看一段B动作,模型可以自己把两项技能串成一个连续任务。
中间那些没人演示过的衔接动作,它也得自己搞定。
重新定位、调整抓法、切换姿势,甚至中途出了错之后怎么继续往下做,都可能由模型自己补出来:
甚至,给它当「老师」的可能都不一定是真人。
因为虚拟世界里的Demo,这模型也照吃不误。。。(孩子是真不挑.jpg)
脚本策略跑出来的动作、强化学习Agent做出的演示、人类在模拟器里遥控机器人完成的操作,都能被塞进它的上下文里,当成Physical Prompt。
下面这个例子就很直观,GEN-1.5先看左边模拟器里的虚拟演示,随后直接去右边真实世界1:1复现。
更关键的是,这项任务它此前既没有在模拟器里专门训练过,也没有在真实世界里练过。
这波属实是——云学艺,线下直接上岗了。
怎么样,很有体感了是不是。
不知道大家有没有一样的感觉,就GEN-1.5这东西,真的很像现在我们用大模型的方式。
今天我们想让Claude学一种新的文章格式,通常不会重新训练一个Claude,而是直接把例子扔进Context,让模型自己悟。
只不过到了GEN-1.5这里,完成任务的逻辑从文字接龙,一路卷到了机械臂。(doge)
Generalist把这种能力生动形容为「物理版Prompt Engineering」——
也就是Prompt从一句话,变成了一段真实世界里的动作。
你先给它演示怎么拉拉链、怎么叠杯盖、怎么从钱包里拿东西,这些动作会直接进入机器人的Context,成为它理解当前任务的「提示」~
当然,几秒学会这件事,目前还远谈不上「百发百中」。
Generalist在10种任务上做了测试——
只给一次Physical Prompt、0次梯度更新的情况下,GEN-1.5平均成功率为59%,如果每个任务再给5分钟数据,并进行10步梯度更新,成功率可以进一步提升到83%。
而且现阶段测试任务,大多还是短程、相对原子化的操作。
团队自己也提到,通过In-Context方式临时学到的技能,目前稳定性还赶不上真正Fine-tune之后的模型。
但真正让研究圈兴奋的点,恰恰在这里——
59%没那么吓人,0次训练却能做到59%,才吓人好吧!!!
没人专门教它One-shot,这能力是自己「长」出来的
说到这里,关于GEN-1.5这模型魔幻精彩的地方还远没有结束。
因为更有GPT-3内味儿的一点来了——
据Generalist透露,他们压根没专门教GEN-1.5怎么One-shot Learning!!
没有为In-Context Learning特制模型架构,没有专门设计Meta Learning循环,也没有额外加一个目标函数逼它学会即兴发挥。
至于这些能力咋来的,其实是在大规模Physical Data预训练过程中,自己冒出来的。。。(老天爷.jpg)
当时在GEN-1.5预训练的时候,Generalist最开始只是不断发现,新任务需要的数据越来越少。
几百步微调,后来变成几十步,几十步又变成10步。
最后甚至只用1分钟数据、1个梯度Step,机器人也开始能学会新东西。
于是团队顺手问了一个更疯的问题:那0步捏?结果真能跑。。。
这也解释了为什么很多人第一时间想到了GPT-3。
因为当年的大语言模型,也出现过类似的转折——
模型规模和预训练一路往上堆,堆着堆着,Few-shot、In-Context Learning这些能力突然变得足够明显。
在Generalist看来,机器人数据里也许存在类似规律,而关键就埋在GEN-1.5长期吃进去的连续真实物理数据里。
因为真实世界里的动作,本来就很少是孤零零发生的。
拧完第一颗螺丝,往往还有第二颗,整理完一个物体,接下来通常还有另一个,一次抓取失败,人也会下意识重新抓住,再把动作继续完成。
换句话说,整理、装配、搬运这些数据里,天然就塞满了重复、延续和失败恢复。
当模型长期在这样的连续轨迹上预训练,前面刚刚发生过的动作和结果,本身就会不断给后面的动作提供上下文。
久而久之,它也就有机会学会一件很关键的事:先看看刚才发生了什么,再决定下一步该怎么做。
这其实,已经很接近In-Context Learning的雏形了。。。
我说真的。
咱思路再打开一点。
如果GEN-1.5这条路真能继续Scale,那以后机器人出厂时最重要的技能,可能真就四个字:
看!着!学!啊!(doge)
参考链接:
[1]https://generalistai.com/blog/gen-1.5#one-shot-in-context
[2]https://x.com/GeneralistAI/status/2090161945307664621
[3]https://x.com/_joe_harris_/status/2090332664746352872
版权所有,未经授权不得以任何形式转载及使用,违者必究。 具身智能
梦瑶
- Jeff Dean离职后首次公开访谈火力有点猛。。。2026-08-21
- MiniMax核心工程负责人阿岛离职2026-08-19
- 阿里杀进Agent上下文战场:钉钉聊天、企业文档、工作数据终于要被Agent吃进去了2026-08-18
- 菲尔兹奖得主:AI现在主要靠「抬杠」突破重大数学猜想2026-08-17
相关阅读
人形机器人主持发布会发布自己!追觅科技孵化,下月将参加全球首届人形机器人马拉松
衡宇2025-03-27 人形机器人 具身智能 追觅 魔法原子
上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下
可实现多模态大模型(MLLM)对物理实体的直接操控,使机器人能像人类一样“看到-思考-行动”
不圆2025-06-05 上海AI Lab 具身智能 多模态大模型
5.28亿融资砸向杭州具身智能公司,清华叉院机器人天才坐镇
具身智能赛道赢麻了
衡宇2025-03-31 具身智能 创业公司 清华
离开马斯克后,他把人形机器人做成了这样
集齐特斯拉/英伟达/OpenAI班底,最新产品曝光
邓思邈2026-01-10 人形机器人 具身智能 特斯拉 矩阵超智
具身智能机器人隐藏冠军上新:领狗进家门,多模态AI那种
波士顿动力的抠脑壳难题,被这家中国公司解决了
衡宇2024-09-26 具身智能 国产机器人
再融20亿!星海图把具身智能头部门槛抬到了200亿
200亿估值成具身智能“季后赛”入场券
听雨2026-04-02 AI 具身智能 星海图热门文章
刚刚,Qwen3.8-27B 开源了!家用显卡也能跑
2026-08-14
刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了
2026-08-14
DeepSeek Harness插件一夜燃爆GitHub:长期记忆、电子宠物、4399小游戏全来了
2026-08-15
源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude
2026-08-15
Aitishiku.com