CodexQA

Industry & PracticeResearch & Benchmarks

见过任务平均 92.0,空间泛化仍低于 π0.5:京东怎么测机器人操作

CodexQA 团队4 min read

真机见过任务平均分 92.0,对照 π0.5 是 74.0。没见过平均 75.5,但空间和拓扑这一维对照略高,分数没写。桌面子集和视频加量的分数不能和 92.0 排成一条曲线。

In this piece

见过任务平均 92.0,空间泛化仍低于 π0.5:京东怎么测机器人操作

京东的论文 JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment。页面版本是 arXiv 2608.05674v1,水印日期 2026 年 8 月 6 日。许可证是 arXiv.org 的永久非独占许可。作者单位写的是 Joy Future Academy, JD。通讯作者邮箱是 jd.com。

JoyAI-RA 0.5 是一个视觉–语言–世界–动作模型,用来把人的第一视角视频、仿真和真机轨迹放进同一套操作策略。评测看四件事:真机上见过和没见过的任务分、对齐消融、世界模型消融,以及人的视频加量之后机器人分数怎么变。任务分是 100 分制,按子任务完成率平均,不是二值成功率。

每项任务见过测 20 次,没见过测 10 次

第 5.1 节的真机基准分三档见过任务。简单抓放包括鼠标、订书机,以及把橡皮、充电器放进收纳盒。困难抓放包括耳机、笔、修正液,以及扔杯子。长程任务包括收拾食物、烤可颂、打包药品。没见过的泛化分三维:空间和拓扑,大改物体初始位置和相对关系;物体类别和属性,换相近类别或颜色、尺寸、外观;背景和光照,换桌布和光线。每一项任务,见过做 20 次,没见过做 10 次。

见过平均高 18 分,有一维仍然更低

图 7 用同一套协议对 π0.5。见过任务的平均分,JoyAI-RA 0.5 是 92.0,π0.5 是 74.0。论文写优势从抓放拉到精细操作和长程时变大,但没有给出这三档各自的分数。没见过的设置里,完整模型平均 75.5,论文写总体和多数维度高于 π0.5,背景与光照这一维差距最大,新物体和新属性上也更高。唯一的例外是空间和拓扑:π0.5 略高。这一维的两个分数都没有写进正文。

对齐消融仍在全基准上。两种对齐都去掉,没见过的平均掉到 29.8。只去掉隐式对齐,没见过是 46.8,见过仍然比较高,但见过的分数没写。只去掉显式对齐,见过掉到 85.7,论文写掉得最明显的是困难抓放;没见过相对还高,数字没写。92.0 和 75.5 是完整模型。29.8、46.8、85.7 是拆掉对齐之后的平均,不是 π0.5 的分。

桌面子集的 51.5,不能拿去和 92.0 比

表 2 是另一套对照:现成视觉语言模型可训练,世界模型若加上则冻结,数据相同。评的是桌面场景里固定的简单和困难抓放子集。没有世界模型:见过 59.3,没见过 37.5,平均 48.4。加上世界模型:62.3、40.6、51.5。没见过绝对高 3.1 分。这三列和全基准的 92.0 不是同一次评测。

表 3 再换一个问题:世界模型结构相同,只有一边在预训练时吃潜动作;下游策略两边都不吃潜动作。见过任务分从 87.3 到 92.1,高 4.8 分。表里没有没见过的列。87.3 已经高于表 2 的 62.3,所以两张表的桌面分也不能横比。

强化学习只写了一句数。鼠标抓放、位置分布不偏移时,成功率在少量训练回合里到 100%,回合数没写。正文主要讨论的是位置比微调时更开的设置。图 8 比较原策略、只内环、只外环和内外环,写内外环最好,四个成功率都没有写进正文。外环权重同步频率低;论文写同步再勤会不稳,没有给出不稳时的成功率。

两套小时数,两套满分

EgoLive 在第 5.4.1 节和附录里是 2 万小时以上、约 89.8 万条、2360 万个子任务、600 个以上细类场景。厨房整理占时长 9.1%。标成其他的 555 类合计占 30.1%。

图 10 只改 EgoLive 预训练比例,10%、25%、50%、100% 嵌套。世界模型冻结。见过任务分从 47.8 到 85.6,没见过从 37.6 到 60.2。中间两档的任务分没有写。10% 的验证损失先降后升,50% 和 100% 一直降。论文把这套叫更难的纯第一视角设置,发生在物理动作对齐之前。

第 5.4.3 节是另一个库:人类视频大约 5.3 万小时,机器人轨迹固定,只改人类视频比例,再冻住 LAC-WM 做同一套下游训练。大约 10% 到 25%:见过从 83.1 到 89.4,高 6.3 分;没见过从 56.9 到 67.7,高 10.8 分。全量再到见过 97.5、没见过 72.4。50% 这一档没有数字。97.5 不是图 7 的 92.0,5.3 万小时也不是 EgoLive 的 2 万小时。

这些数不能被读成什么

92.0 是见过任务的平均分,对照是 74.0。它不是成功率,也不是每一档的分。空间和拓扑这一维,论文写 π0.5 略高,所以「没见过全面更高」不成立。每项只有 20 次和 10 次。

75.5、29.8、46.8、85.7 是对齐消融的平均。缺的格子不能补。

51.5、92.1、85.6、97.5 来自四套不同协议。不能排成一条从 51.5 练到 97.5 的曲线。

100% 只属于没有位置偏移的鼠标抓放。图 8 的困难设置没有数。2 万小时和 5.3 万小时不要加成一个数据集。

出处:京东,Joy Future Academy, JD,JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment,2026-08-06,https://arxiv.org/abs/2608.05674v1

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction