以真实人类操作为基石的具身世界动作模型 Noe-0 发布
理想的具身智能应当通用、能理解现实世界、具备自主决策与执行,并能与人和环境持续自然交互。这样的一类模型,被称为世界动作模型(World Action Model),其核心在于把对世界状态的预测和如何采取动作联系起来。最近,穹彻智能推出了预训练的具身智能模型 Noe-0,标志着朝这一方向的重要进展。
Noe-0 的最大特点是全链路采用“无本体”采集数据:所有训练数据来自人在真实家庭、门店等日常环境中直接完成操作的录像与状态记录,覆盖超过50个城市、数十万小时、成千上万类任务场景。与传统集中式、标准化的遥操作数据不同,这类在野外采集的数据包含更多样的视角、光照、物体摆放、操作习惯以及大量难以预设的长尾情形,更贴近机器人未来真正会遇到的世界。
团队为实现高效且自然的数据采集,设计了名为 RoboPocket 的采集设备,强调采集端与机器人末端在形态与感知上的同构,同时兼顾人的操作舒适度和采集效率。这样既能保证数据更接近机器人执行时的动作表达,又避免了以遥操作常见的缓慢、机械化动作作为样本的弊端。 龙8头号玩家
在训练流程上,Noe-0 从预训练到后训练始终沿用无本体数据,避免了如果两阶段使用不同数据范式而产生的分布断层。预训练阶段通过大规模多样化的无本体视频与状态序列让模型学习跨任务的视觉变化、状态转移与动作规律,建立面向真实世界的基础能力;后训练则用更聚焦的无本体数据进行任务适配和能力强化,保证连续性和一致性。
方法上,Noe-0 采用以视频预测为核心的世界动作模型架构:模型接收连续历史帧与相关状态信息,预测未来视觉状态并推断实现目标的动作策略。这一方向被视为对传统以视觉-语言-动作为主的方法的升级,因为丰富的真实世界交互对视频级别的世界建模和连续动作理解提出了更高要求。
实验证明,基于这种端到端、在野外采集数据训练的策略,机械手能在真实环境中稳健完成相对复杂和精细的操作任务。Noe-0 的发布展示了通过大规模真实人类操作数据来驱动具身智能训练的可行性,为将来规模化、面向现实世界的机器人能力提升提供了新的路径。 龙8头号玩家
斯图加特队长人选生变:翁达夫或接棒
足球不仅是激情与速度,更是智慧与策略的较量!...
曼城首创球迷AI设计并票选第三球衣
足球不仅是激情与速度,更是智慧与策略的较量!...