今日:2026年08月30日 星期日 首页要闻
权 威 · 及 时 · 准 确

古城文脉里的科技微光,李飞飞的世界模型照进机器人训练赛道

来源:今日报道 分类:科技
古城文脉里的科技微光,李飞飞的世界模型照进机器人训练赛道

henry 发自 凹非寺

量子位 | 公众号 QbitAI

李飞飞执掌的 World Labs,终于补齐了那块至关重要的拼图。

就在刚才,依托新近收购的机器人公司 SceniX 的技术底座,World Labs 正式推出了一套全新的机器人策略训练与评估引擎——Real-to-sim-to-real(简称 R2S2R)。

这一举措标志着 World Labs 在空间智能领域的布局,从单纯生成可交互的虚拟世界,进一步延伸至真实机器人的训练、评估及部署环节,并首次实现了从仿真训练到真实运行全链路的闭环打通。

拆解 R2S2R 的结构,它主要由 Real-to-Sim 和 Sim-to-Real 两大模块构成。

Real-to-Sim 的核心任务,是将现实中的机器人本体、传感器数据、物体属性以及具体的交互过程,精准映射进仿真环境,构建出与真实任务高度对齐的虚拟场景。

Sim-to-Real 则在此基础上,让机器人在这些虚拟环境中完成策略训练与性能评估,随后将优化后的策略直接部署至真实硬件上运行。

李飞飞在 X 平台分享称,基于该方法训练出的策略,即便从未接触过真实世界的数据,也能实现连续 1 小时的自主运行,全程无需人工介入。

不仅如此,R2S2R 还显著降低了机器人策略评估的规模化门槛。

通过将仿真与现实中的运行过程进行对齐,真实世界中发生的成功、失败案例及其触发条件,都能在虚拟空间中被完整复现与深入分析。

可以说,R2S2R 不仅打通了世界模型从“生成世界”到“训练、评估、部署真实机器人”的全流程闭环,也推动了李飞飞此前提出的世界模型三分法中最为关键的一环——仿真器——落地。

在她经典的理论框架中,世界模型主要承担三种职能:渲染器负责生成视觉观察,仿真器负责模拟世界状态变化,而规划器则负责输出具体行动指令。

R2S2R 所做的工作,正是推动 World Labs 生成的世界从“视觉上的逼真”,进化为机器人真正能够进入、交互并进行深度学习的训练场。

想要扩展具身智能的规模,必须先扩展机器人学习所依赖的世界环境,且必须借助仿真之力。

World Labs 在其博客中指出:

当前机器人技术发展的核心瓶颈,已不再局限于模型架构本身,而是缺乏能够大规模获取的经验数据与有效的评估体系。

一方面,现实世界中的物体位置、光照条件、物理属性以及交互动态时刻处于变化之中。

为了让机器人真正走出实验室环境,就必须提前覆盖足够丰富的场景变量,并反复测试其在何种条件下能成功,又在何处会遭遇失败。

另一方面,不同于大模型训练所依赖的海量互联网数据,机器人的每一条经验都必须通过真实发生来获取。

每一轮实验都需要占用实体硬件,涉及人工重置物体、处理故障恢复以及系统维护等工作。即便拥有海量的人类操作视频,也难以系统化地覆盖不同环境、物体属性、机器人状态及各类失败条件。

因此,仿真的最大价值并非仅仅是“节省数据采集成本”,而在于能够主动制造那些在现实中昂贵、危险或难以重复的情境,迫使机器人反复经历成功与失败的循环。

但以往的仿真技术存在明显短板。

它不仅需要为每一项真实任务单独搭建环境,导致成本高企且效率低下,而且仿真与现实之间往往在视觉呈现、几何结构及物理动态上存在显著差异。

更棘手的是,机器人在仿真中学会的策略,迁移到真实世界时未必依然有效;仿真中的测试结果,也未必能准确反映其真实表现。

基于上述背景,World Labs 推出了这套从现实到仿真再回到现实的 R2S2R 仿真引擎,旨在解决机器人策略的训练与评估难题。

其中,Real-to-Sim 负责将现实中的机器人、传感器、物体及交互过程,重建为与任务严格对齐的虚拟世界。这不仅要求还原世界的外观表象,更要尽可能保留机器人与物体交互时的运动轨迹与物理反馈。

Sim-to-Real 则利用这些高保真世界完成策略训练与评估,精准定位模型容易失效的状态,并判断仿真中的表现能否有效迁移至真实硬件。

两者紧密连接,形成了一套完整的闭环体系:

从现实中提取任务样本,在仿真中规模化生成经验、训练模型并挖掘失败案例,再将策略部署回现实;现实中新产生的结果,又会反过来修正世界模型、优化训练数据并迭代机器人策略。

换言之,R2S2R 并非简单地用仿真数据替代真实数据,而是将一个真实的单一任务,扩展为大量可控、可复用的学习世界,使机器人能够以更低的成本进行反复训练、评估与迭代。

具体而言,这套方法始于 Real-to-Sim 阶段。

团队首先采集机器人本体、传感器参数、环境信息、物体特性及任务演示数据,随后通过生成式世界建模系统,将其重建为一个可交互的虚拟空间。

这个虚拟世界不仅要还原外观细节与几何结构,还要尽可能复现物体的物理特性与动力学规律。

例如,在双机械臂装箱任务的演示中,仿真环境与现实环境执行完全相同的动作序列,从而产生高度一致的视觉观测结果、物体运动轨迹及最终效果。

这里的难点在于,真实环境并不会提供一套精确的参数设定。

物体的重量、摩擦系数可能难以精确测量,机器人本体与摄像头也可能与标称规格存在偏差,而电缆、包装材料等柔性物体的形变更是难以用简单模型描述。

因此,R2S2R 会根据不同任务的具体需求,灵活组合使用多种表示方法与建模技术。

完成重建后,团队会让机器人在现实与仿真中执行相同的动作,通过直接比较视觉观测、物体反应及最终结果,来验证两个环境是否真正对齐。

进入 Sim-to-Real 阶段后,经过对齐的仿真世界进一步演变为可扩展的训练与评估引擎。

具体流程是:机器人先在仿真中学习新策略,评估系统随即主动寻找其易失败的状态,并围绕这些薄弱环节生成新的交互经验,形成“发现问题—补充数据—改进策略”的闭环,最后再将成熟策略部署至真实硬件。

此外,相较于现实数据采集,仿真可以系统地调整物体位置、机器人状态、视角、外观、物理属性及任务难度,让策略反复经历那些在现实中成本高、难复现甚至不安全的情境,并获得诸如物体状态、接触力、受力分布等在硬件上难以采集的监督信号。

而且,一个精心重建的任务场景并不只服务于某个特定模型或某款机器人。同一套仿真环境可以继续适配不同的策略算法、传感器配置及机器人平台,从而将一次性实验转化为可复用的训练基础设施。

报告数据显示,在没有真实世界数据参与、仅在仿真环境中训练的策略,可以直接迁移至 ALOHA、RB-Y1、YAM、Flexiv 和 xArm 等多种机器人平台,完成装箱、绕线、试管转移以及在杂乱环境中抓取单件物品等任务。

其中,电源线绕行、线缆插拔、试管转移,以及马克笔和铅笔抓取等任务,均实现了连续 1 小时的自主运行,期间未出现失败,也未有人工接管干预。

这表明,经过高精度对齐的仿真,未来可能不再仅仅是现实数据的补充,而将成为机器人训练经验的重要来源。

最后在评估环节。

由于机器人受限于物理世界的运行速度,每测试一个检查点(checkpoint),都需要重新布置场景、运行机器人并处理潜在故障,成本高昂且覆盖范围有限。

相比之下,R2S2R 可以先在数千种受控条件下主动寻找失败案例,提前筛选掉表现不佳的检查点,仅将最有潜力的策略留给真实硬件进行测试。

这里的关键,并非要求仿真与现实的成功率完全一致,而是双方能够得出相同的判断结论:

哪些策略更优?它们在何处成功或失败?训练过程中的提升能否真正迁移至硬件?

在 ALOHA 双臂方块交接任务中,团队测试了 GR00T N1.6 和 π₀.₅ 两种策略架构,以及不同的训练配置、ID 和 OOD(分布外)场景。每个检查点分别进行了 2000 次仿真试验和 100 次真机试验。

结果显示,在仿真中表现更好的检查点,在真机上通常也表现更佳。仿真不仅保持了不同策略之间的相对排名,也呈现出与现实相似的成功与失败分布特征。

更重要的是,这种对齐不仅仅是让仿真画面看起来像现实。

团队会让机器人在仿真和现实中执行完全相同的动作,然后仔细比对两边看到的画面、物体的反应以及最终结果是否一致。

即使是在线缆、关节物体等极难模拟的任务中,也要尽可能复现真实的物理变化过程。

以方块交接为例,当方块放置在机器人不太熟悉的位置时,机械臂会抓得更靠近边缘,险些失手。这种“险些失败”的过程,不仅出现在真机上,也在仿真中被精准复现了出来。

也就是说,仿真还原的不仅是机器人最终是成功还是失败,还能还原它走向成功或失败的原因与过程。

这意味着,R2S2R 可以成为机器人开发中的高通量评估层,用于筛选检查点、发现性能退化,并决定下一轮应补充何种数据。

World Labs 收购 SceniX

事实上,在正式发布 R2S2R 的前一周,World Labs 就已宣布收购 SceniX。

SceniX 是一家专注于机器人仿真、训练与评估的初创公司,其技术方向聚焦于将真实机器人任务搬入数字世界,让原本昂贵、缓慢甚至危险的数据采集和模型评估,得以在仿真环境中规模化完成。

SceniX 联合创始人李昀烛目前是哥伦比亚大学助理教授,他曾在 MIT 获得博士学位,随后在斯坦福跟随李飞飞从事博士后研究。

有趣的是,这两家公司的合作并非始于这段师生关系。

最早,SceniX 只是 World Labs 生成式世界模型 Marble 的客户。直到李飞飞发现该公司由李昀烛创办,双方才进一步意识到彼此技术在互补性上的契合,并由此展开了收购计划。

World Labs 擅长生成模型、计算机视觉和 3D 重建,能够从稀疏输入中快速生成具有空间一致性的世界;

SceniX 则更熟悉机器人技术、仿真环境、学习算法及硬件系统,深知如何让这些世界真正应用于策略训练、评估与部署。

换句话说,前者解决“世界如何生成”的问题,后者解决“机器人如何在其中学习”的问题。

在 a16z 的访谈中,李昀烛表示,此次收购并不意味着 World Labs 要亲自涉足机器人制造。

他们真正想建设的,是一套与机器人形态和模型架构解耦的基础设施:

无论客户使用的是单臂、双臂还是移动机器人,采用 VLA 还是 World Action Model,都可以进入同一个数字世界进行训练和测试。

在未来,双方将围绕仿真技术、基础模型及动作条件模型逐步整合,并希望先在仓库、实验室和电子装配等半结构化场景中,与客户共同完成真实部署验证。

参考链接

[1]https://www.worldlabs.ai/blog/real-to-sim-to-real

[2]https://www.worldlabs.ai/blog/taxonomy-of-world-models?utm_source=chatgpt.com

[3]https://x.com/drfeifei/status/2082137342824075357

相关推荐