研究与基准测试/2026-09-09/9 分钟跨设备依赖一断就归零:百度参与的 JarvisGUI 用终态评 GUI150 道组合题,最好的整题成功是 HOLO2 的 12/150(8.0%)。多设备有依赖的整题成功率最高 2.0%,六行里四行是 0。换规划器到 Kimi K2.6,这一格仍是 2.0。
研究与基准测试/2026-08-27/11 分钟整题只有 2.8%:蚂蚁 UI-Venus-2 用关键点把 GUI 轨迹和单步分开评27B 在 OSWorld 2.0 的 108 题、150 步上整题只有 2.8%,部分分 13.2。MobileWorld 50 步 76.1,低于 Qwen-UI-Agent 的 82.1。WebVoyager 刷新子集 93.4。OSBlind 的攻击成功率仍是 47.9。
研究与基准测试/2026-08-16/11 分钟进度 76.86,整题只有 41.00:腾讯 UI-Mate 用检查点评办公 GUIOSWorkerBench 100 题、上限 200 步。27B 进度 76.86,整题成功 41.00,只比 Kimi-K2.6 的 40.67 高 0.33。OSWorld-Verified 77.0,低于 GPT-5.5 的 78.7。自演示的 30 题是按「没演示就失败」挑的。
研究与基准测试/2026-07-31/9 分钟平均只比老师高 0.4:蚂蚁 MAGA 用动作结构蒸馏评跨端 GUI8B 平均成功率 51.2,比三个域老师的平均 50.9 高 0.4,TNS 99.9。MobileWorld 仍低 3.4。2B 的 TNS 只有 77.1。WebVoyager 只用 140 题。