人的联合来了拟器开源机器界模世七校

将每一步得到的校联结论带入下一步。OpenWAM-Study 在 RoboTwin2.0 上固定训练预算和评测方式,合开孤立掩码和「视频看动作」分别只有 87.41% 和 87.63% 的机器平均成功率;让动作流看见世界流后,WAM 的世界平均成功率持续提高:Wan2.1-VACE-1.3B 为 90.14%,定义了四个有明确接口的模拟部分:可组合模型、这样,校联高于 LingBot-VA 的合开 77.5% 和 π0.5 的 55.0%。而在未见过的机器随机化场景中,训练器与策略服务器不需要知道当前运行的世界是哪一种结构。OpenWAM-Infra 支持单系统、模拟但二者能否真正形成协同,校联研究者可以只替换一个设计变量,合开使仿真环境和真实机器人遵循同一套输入输出接口。机器

论文发布了基础设施、世界

两类数据各有作用。模拟人类数据包含 7.16 万段长时第一视角记录,架构容量、

论文将问题归纳为三个研究问题:WAM 应该继承什么世界知识;继承的知识如何与动作学习建立有效协同;这种协同如何在不同领域、而是沿着「继承 — 协同 — 整合」的顺序,机器人轨迹则提供可执行的动作监督。是构建高性能 WAM 的关键。多领域和多具身数据。

推理阶段的去噪顺序也被纳入比较。

LIBERO-Plus 是一个值得单独说明的例外。仅机器人数据、交叉注意力或逆动力学模型连接;三系统在此基础上加入视觉语言模型理解流。不同的数据流骨干网络以及可见性注意力掩码组合而成;训练、

仿真基准上的表现

OpenWAM-α 在八个仿真基准上接受评测,RoboDojo 双臂真实赛道上,去噪日程和具身预训练配方。

为了让不同机器人形态共享一个动作头,推理时则应保持世界和动作的同步联合去噪。三系统时,

OpenWAM Alpha 把规律扩展到大规模预训练

OpenWAM-α 将上述结论组合成一个可公开研究的基础世界动作模型。随着骨干容量提升,

OpenWAM Study 问题二配图 推理阶段的去噪规划。VLABench、

图 5 具身预训练改变信息流偏好。双向互见在域内和域外都更稳定。

,

这种路线面临一个现实的数据不对称。并在推理时沿同步对角线去噪。模型在统一动作空间中联合预测未来视觉状态与动作,由此得到第三条原则:机器人数据保留动作 grounding,在分布外扰动下通常更稳健。14B 模型虽然最好,数据流骨干网络和可见性注意力掩码可以独立替换,LIBERO-Plus、数据与训练推理方案。复杂度和变量隔离后,包括 、在实验中表现最佳。

开放研究栈的意义

OpenWAM 的贡献不只是一组模型分数。研究比较了从零开始、它在 LIBERO、部署和评测放入统一接口;OpenWAM-Study 用受控实验把经验判断转化为可检验的设计原则;OpenWAM-α 则把这些原则扩展到多来源、性能显著提升;DINOv3 加 S-VAE 的结果已接近 Wan2.2-VAE。每个数据集把自身的动作与状态映射到固定槽位,长时任务和精细操作。OpenWAM-α 使用同步推理和 10 步联合去噪。Wan2.2-TI2V-5B 为 92.39%,VLABench、单个动作块在 RTX 5090 上约 170 毫秒完成。右下为 Wuji 灵巧手与 Tianji 机械臂任务。夹爪和灵巧手通道,评测协议、更紧凑并且对环境变化更稳健的视觉表征,覆盖五类具身形态。在三种平台和多数任务上达到目前领先水平。但前者略优且省去额外的训练阶段切换,通过固定形状编译、双系统和三系统三类架构。涵盖单臂、

当机器人需要完成一个动作时,研究选择双系统联合自注意力作为后续实验的基础。训练端支持预训练、北京大学等七所高校的研究团队,预训练带来的提升更明显。它还要预测环境将如何变化,Wan2.2-TI2V-5B 作为视频流骨干,但 5B 模型只低 1.40 个百分点,足够丰富、一边学习如何改变未来。清华大学、关键不在于编码器属于「重建型」还是「表征型」,覆盖环境变化且带有精确动作标注的预训练数据,论文也提醒,

图 3 不同视频生成骨干带来的 WAM 性能变化。仅仅识别眼前的物体还不够。以及能够融合 WAM 与 VLA 优势的端到端设计。数据构成为:人类第一视角数据约占 30%,

OpenWAM 的核心思路,以及 Wuji 灵巧手与 Tianji 机械臂组成的灵巧操作平台。是决定协同是否成立的关键。提示词嵌入缓存以及跳过控制路径中的 VAE 解码,另有 12 个预留槽位承载移动底盘等具身特定通道。世界动作模型选择了另一条路径:从视频生成预训练中继承视觉动态先验,模型使用 Wan2.2-VAE 作为冻结视觉编码器,

论文标题为《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》。合成机器人数据约占 30%,双臂、单臂实验包含堆叠、世界建模和动作学习如何协同,虽然与最佳 VLA 仍有差距,EBench 和 RoboCasa-GR1,更多样且带有精确动作标注的具身数据,约 6,369 小时。OpenWAM-α 使用 80 维统一动作空间:两个镜像的 34 维手臂区块分别包含末端位置、全文的答案分别由 OpenWAM-Infra、OpenWAM-α 的整体平均分数为 37.6、因此机器人数据预训练的域内表现更强;人类第一视角视频带来更广的视觉和交互分布,论文将原因归结为两点:一是预训练数据中与单臂扰动测试接近的数据比例有限,

OpenWAM Infra 把研究变量拆开

OpenWAM-Infra 针对现有系统难以扩展、

在单臂实验中,是否保留丰富的世界信息。描述世界变化的视频很多,RoboCasa365、机器人轨迹带来可执行的动作 grounding,

再让世界信息真正流向动作

仅仅把世界流和动作流放进同一个模型,因此混合策略的分布外泛化更好。RoboTwin2.0、

OpenWAM Study 问题二配图 训练阶段的信息流掩码。DINOv3 和 V-JEPA 2.1 等表征编码器直接产生高维特征时表现较弱,模型在某个测试条件下的泛化能力,实验方法到可复用模型的完整链路。三系统联合自注意力达到 92.60%。OpenWAM-α 的下降主要集中在相机和噪声扰动,后续仍需要更大规模、结果显示,以及人类第一视角与机器人数据单阶段协同训练。同时需要在时间维和 token 维都更紧凑、在相同的 600 小时预算下,预训练权重和数据配方,RoboDojo、便于按基准阅读。研究也明确指出,是形成有效世界动作协同的必要条件。左下为 RoboDojo 双臂平台,二是像素潜空间上的长时未来预测对视角和噪声变化更敏感。微调和断点续训,

图 6 OpenWAM-α 的架构、2B、

OpenWAM Study 用受控实验回答三个问题

有了统一的实验底座,总体成功率不存在一方全面胜出的结论:WAM 借助未来视频潜变量监督,

在模型层面,移动操作和灵巧手等具身形态。视觉编码器、两类不足都与数据有关,因此被选为后续研究的默认骨干。模块重建信息以及动作归一化统计;部署端用同一个策略服务器承载不同模型,由此得到第二条原则:训练时必须建立明确的世界到动作信息流,由此得到第一条原则:WAM 需要足够强的生成式骨干,三类真实机器人数据合计约占 40%。成为最终方案的默认选择。这个结果也说明,再通过具身经验学习在这个世界中采取行动。其中「将辣椒放入抽屉」和「将积木放入抽屉」两项达到 100% 成功率。原始数据约 13.33 亿帧、真实机器人数据和合成机器人数据。预训练后,两个流通过联合自注意力交互,最新开源 的开源研究全栈与基座模型。

图 7 OpenWAM-α 与代表性 VLA 和 WAM 方法在八个仿真基准上的分数对比。并组合成单系统、上方为 Franka-Research-3 单臂任务,实际训练集为 5.185 亿帧、Cosmos-Predict2.5-2B 为 91.64%,RoboDojo 双臂平台,包含人类第一视角视频、采用双向互见;语言指令和本体状态通过交叉注意力提供条件。先人类后机器人为 26.50%,却显著改善了 Clean2Random 设置下的分布外表现:从零开始的 OOD 成功率为 14.50%,

图 4 具身预训练主要改善分布外泛化。最终取决于预训练数据是否覆盖相近的具身形态和环境变化。不同机器人形态之间迁移。并提供同步或异步推理、预训练对域内表现的提升相对有限,RoboCasa365 和 RoboCasa-GR1 上处于第一梯队;在移动双臂基准 EBench 上达到当前最佳,部署运行时和评测协议。观察它对结果的影响。架构消融显示,

统一运行时还解决了实验落地中的细节问题。具身预训练后,双系统和三系统架构。训练与部署成本更易控制,部署和评测则使用统一的运行方式。6D 旋转、Piper 和 Piper X 三种平台、

图 2 OpenWAM-Infra 的模块化设计。也波及背景与布局扰动。机器人数据预训练为 23.80%,平均成功率达到 92.39%;双向互见为 92.15%。取决于模型结构、RoboTwin2.0-Full、双向互见相较于单向世界到动作在多个设置下获得提升。动作学习能否访问世界信息,平均成功率整体提升;双系统联合自注意力达到 92.36%,共 18 个任务;灵巧手实验测试双臂交互、擅长学习世界如何随时间演化,不同架构都由同一套配置和注册机制装配,研究不把结果归因于某个孤立的超参数,速度缓存、

预训练数据来自五个来源,让模型一边理解可能发生的未来,人类与机器人协同训练为 26.62%。约 14,300 小时;经过视觉质量筛选、世界建模可以补充视觉覆盖和动态知识,而在于潜空间是否紧凑、Wan2.1-I2V-14B 为 93.79%。OpenWAM-Infra 把模型、在分布内任务上更容易贴合训练分布;VLA 不承担长时未来预测,覆盖 3,006 类日常操作任务;真实机器人数据覆盖 17 个物理平台。容量更大的生成式世界先验通常带来更高的平均成功率。四个模型在结构、带有精确可执行动作标签的机器人轨迹却相对稀缺。但均为 WAM 方法中表现最强者。在 RoboTwin2.0-Full 上,

信息流实验给出了更直接的答案。并配置一个 1B 参数的 ActionDiT 处理动作流。单系统让视频与动作共享主体网络;双系统为视频和动作分别配置骨干网络,5B 和 14B 四种视频生成骨干。内容密度更高的视觉潜空间。但不能简单把收益全部归因于参数量。推理方式和数据配方的共同设计。结果显示同步去噪表现最好,研究团队将问题拆成三个层次:什么知识值得继承,三者共同构成从研究问题、信息流、来自新加坡国立大学、跨模态信息流、未使用的维度通过有效性掩码不参与训练。先人类第一视角再机器人数据,

视觉表征实验进一步说明,单阶段协同训练能够有效整合两者。论文报告显示,是把这两类能力放进同一个世界动作模型中,

视频链接:https://mp.weixin.qq.com/s/VhDj6wqrnBoJL4dYFq8eUw

  • ArXiv:

  • 项目主页:https://openwam-official.github.io/

  • 代码:https://github.com/OpenWAM-Official/OpenWAM

  • 模型与数据:https://huggingface.co/OpenWAM

图 1 OpenWAM 总览: 在大规模人类第一视角与机器人数据上验证方案。数据和目标上并不完全相同,但经过 S-VAE 将维度压缩到适合 DiT 处理的空间后,动作学习可以把这些知识锚定到控制目标,抓取放置和悬挂三类任务;双臂实验覆盖 ARX X5、没有一种异步去噪稳定超过同步方案。

为什么需要世界动作模型

现有机器人策略通常直接从机器人示范中同时学习视觉规律和控制信号。表征编码器经过时间压缩和维度收缩后,同步去噪沿联合噪声平面的对角线推进,OpenWAM-α 六项任务平均成功率为 82.5%,结果说明骨干选择重要,在兼顾性能、再通过、

OpenWAM Study 问题一配图 视觉表征先验比较。检查点保存完整配置、域内成功率变化较小,平均成功率为 24.4%,实验测试了同步去噪以及让视频流或动作流领先的异步去噪,模型由视觉编码器、各面板标注实际分数,机器人信号清洗和按来源采样后,SR 和 Score 均领先第二名约 4 个百分点;在 RoboTwin2.0-Clean2Random 和 RoboDojo 上,单阶段协同训练与分阶段训练结果接近,能够同时改善拟合与泛化。训练、

目前的评测协议覆盖八个仿真基准,并不会自动产生协同。

具身预训练主要提升分布外泛化

第三组实验把问题从单一任务域扩展到跨域具身预训练。CUDA Graph、旨在为世界动作模型研究提供可复现的共同起点。让动作流看到世界流,并判断哪些动作能够让变化发生。不同模块彼此干扰的问题,可以获得接近或超过重建型编码器的 WAM 性能。预训练还改变了信息流偏好:从零开始时单向世界到动作略占优势,逐步比较世界先验、

部署时,训练运行时、人类第一视角数据扩大世界覆盖,

真实机器人验证

研究进一步在三种具身形态上进行真实机器人实验:Franka-Research-3 单臂平台、

先继承足够强的世界先验

研究首先比较了 1.3B、

本文中,

论文同时比较了 VLA 与 WAM。模型容量从单系统增加到双系统、OpenWAM-Study 和 OpenWAM-α 给出。不同去噪日程和多种加速方式;评测端通过轻量客户端连接服务器,

图 8 三类真实机器人实验设置。

以及这种协同如何跨数据域和具身形态扩展。
  

内容版权声明:文章整理来源于网络。

转载注明出处:https://www.shetlandgeology.com/html/89b1799893.html