研究与基准测试/2026-08-06/6 分钟见过任务平均 92.0,空间泛化仍低于 π0.5:京东怎么测机器人操作真机见过任务平均分 92.0,对照 π0.5 是 74.0。没见过平均 75.5,但空间和拓扑这一维对照略高,分数没写。桌面子集和视频加量的分数不能和 92.0 排成一条曲线。
研究与基准测试/2026-08-02/9 分钟打断回应率 0.88,并行工具调用没超过纯文本:京东 JoyAI-Talker 的全双工评测打断场景 C_RESPOND 0.88,附和时误触发 0.01。语音工具调用只有 ACEBench 单工具到 98.56,并行项 44.32,低于纯文本的 61.36。没有线上成交。