38 项 里 19 项 第一: 腾 讯 Hy - Embodied 按 感知— 动作 环 评 具 身 Agent
可比规模里总平均 65.6,比 Qwen3.6-A3B 高 4.4,比上一代 MoT-2B 高 8.4。A30B 不进排名。Where2Place 只有 65.0,PartAfford 63.7 低于 Embodied-R1.5 的 82.6。导航 OS 排第二。

本文目录
38 项里 19 项第一:腾讯 Hy-Embodied 按感知—动作环评具身 Agent
腾讯 Robotics X、混元视觉团队、福田实验室 2026 年 7 月 14 日的技术报告 Hy-Embodied-VLM-1.0: Efficient Physical-World Agents(arXiv:2607.12894)。项目负责人 Yongming Rao,核心贡献者 Ziyi Wang、Xumin Yu、Yonggen Ling,监督是 Han Hu、Zhengyou Zhang。代码在 https://github.com/Tencent-Hunyuan/HY-Embodied 。Hy-Embodied-VLM-1.0 是面向物理世界的具身基础模型,激活参数大约 3B。这篇评测不把它当成一堆互不相关的视觉问答,而是按感知—动作环的三段来排 38 个诊断基准,再放到两条闭环导航里看能不能接成持续行为。
排名只在相近激活规模里算,思考模式并不统一
主排名只比激活参数相近的模型:Hy-Embodied-0.5 MoT-2B、Qwen3.6-A3B、Embodied-R1.5(8B,只有 Instruct,没有单独的思考模式)、Cosmos3-Nano(视觉语言部分也是 8B)。Hy-Embodied-0.5 A30B 只作更大规模的参照,不参与最好、次好的排名和高亮。
Qwen3.6-A3B、Embodied-R1.5、Cosmos3-Nano 是这篇用同一条评测流水线重跑的,所以分数可以和原论文不一样。Cosmos3-Nano 打开思考后明显变差,表里报的是不思考。Qwen3.6-A3B 和全部 Hy-Embodied 变体,包括 VLM-1.0 A3B,用思考模式。每个基准沿用官方协议,指标方向调成越高越好,分数写成百分比。类别平均在该能力类内部计算。总平均覆盖全部 38 项,是按基准数加权,不是三类平均再平均:68.6×23、64.1×8、57.4×7 再除以 38,得到 65.6。
38 项里,VLM-1.0 第一 19 项、第二 11 项,前二共 30 项。总平均 65.6,比同规模里最强的 Qwen3.6-A3B 高 4.4(61.2),比上一代 MoT-2B 高 8.4(57.2)。A30B 不进这个排名。
下面四列表的列顺序相同:MoT-2B(思考)、A30B†(思考,不排名)、Qwen3.6-A3B(思考)、Embodied-R1.5(Instruct)、Cosmos3-Nano(不思考)、VLM-1.0 A3B(思考)。
状态理解 23 项:类平均 68.6,不是每项都第一
这一段看当前物理状态:物体和属性、几何和视角、以及能拿来动作的空间表征。23 项分三组。物理和语义:BLINK、CV-Bench、PixMo-Points、PointBench。空间:内部基准 Depth-InHouse,以及 3DSRBench、All-Angles-Bench、DA-2K、ERQA、EmbSpatial-Bench、MMSI-Bench、MindCube、SAT、SIBench-mini、SITE-Bench-Image、ViewSpatial-Bench。机器人向:OpenEQA、PartAfford、RoboAfford、RoboRefIt、RefSpatial-Bench、RoboSpatial-Home、Where2Place。
| 基准 | MoT-2B | A30B† | Qwen | R1.5 | Cosmos | VLM-1.0 |
|---|---|---|---|---|---|---|
| BLINK | 82.7 | 87.1 | 87.9 | 77.8 | 82.4 | 87.3 |
| CV-Bench | 89.2 | 88.8 | 88.6 | 86.8 | 88.0 | 89.7 |
| PixMo-Points | 51.4 | 62.6 | 57.5 | 57.1 | 59.8 | 64.6 |
| PointBench | 69.0 | 74.8 | 35.1 | 59.1 | 39.2 | 71.7 |
| Depth-InHouse | 45.7 | 57.6 | 63.0 | 52.0 | 47.0 | 67.6 |
| 3DSRBench | 57.0 | 56.6 | 49.9 | 42.6 | 31.9 | 52.6 |
| All-Angles-Bench | 55.1 | 71.8 | 64.0 | 48.4 | 51.9 | 63.4 |
| DA-2K | 92.3 | 90.2 | 81.4 | 80.5 | 82.8 | 83.2 |
| ERQA | 54.5 | 62.3 | 57.5 | 37.3 | 45.0 | 60.8 |
| EmbSpatial-Bench | 82.8 | 84.1 | 83.2 | 76.0 | 80.0 | 82.7 |
| MMSI-Bench | 33.2 | 39.2 | 41.9 | 29.8 | 34.0 | 41.8 |
| MindCube | 66.3 | 69.2 | 55.0 | 27.9 | 32.8 | 70.0 |
| SAT | 76.7 | 87.3 | 80.7 | 60.7 | 54.0 | 78.0 |
| SIBench-mini | 58.2 | 67.3 | 60.9 | 51.9 | 52.5 | 64.5 |
| SITE-Bench-Image | 62.7 | 74.7 | 71.7 | 60.3 | 59.6 | 72.3 |
| ViewSpatial-Bench | 53.1 | 59.8 | 49.0 | 43.7 | 52.0 | 53.3 |
| OpenEQA | 54.4 | 73.2 | 73.2 | 53.9 | 53.8 | 63.1 |
| PartAfford | 30.1 | 65.2 | 25.5 | 82.6 | 32.2 | 63.7 |
| RoboAfford | 73.5 | 75.4 | 66.7 | 60.6 | 76.2 | 71.5 |
| RoboRefIt | 82.8 | 85.2 | 78.5 | 77.2 | 55.4 | 88.2 |
| RefSpatial-Bench | 45.8 | 57.2 | 53.1 | 52.4 | 44.4 | 53.4 |
| RoboSpatial-Home | 55.7 | 76.6 | 70.9 | 69.1 | 58.3 | 69.4 |
| Where2Place | 68.0 | 70.0 | 70.0 | 73.0 | 71.0 | 65.0 |
| 类平均 | 62.6 | 71.1 | 63.7 | 59.2 | 55.8 | 68.6 |
可比模型里类平均 68.6,高于 Qwen 的 63.7,差 4.9。23 项里第一 11 项、第二 9 项,前二共 20 项。A30B 的类平均 71.1 更高,但不进排名。输给可比模型的格子包括:BLINK 87.3 低于 Qwen 87.9;3DSRBench 52.6 低于 MoT-2B 57.0;All-Angles 63.4 低于 Qwen 64.0;DA-2K 83.2 低于 MoT-2B 92.3;EmbSpatial 82.7 低于 Qwen 83.2;MMSI 41.8 低于 Qwen 41.9;SAT 78.0 低于 Qwen 80.7;OpenEQA 63.1 低于 Qwen 73.2;PartAfford 63.7 低于 Embodied-R1.5 的 82.6;RoboAfford 71.5 低于 Cosmos 76.2;RoboSpatial-Home 69.4 低于 Qwen 70.9;Where2Place 65.0 是这一组可比模型里的最低,低于 R1.5 的 73.0。Depth-InHouse 是内部基准。
动作迁移 8 项:类平均 64.1,轨迹视觉这一项输给 R1.5
这一段看交互意图、当前配置下选哪个动作、把动作落到物体或方向、以及这个动作立刻会怎样。交互:FineBench、CrossHOI-Bench。决策和落地:PIO、VABench-Point、VABench-Visual-Trace、ShareRobot-Bench 的可供性和轨迹两条。局部机器人推理:RoboBench-MCQ。
| 基准 | MoT-2B | A30B† | Qwen | R1.5 | Cosmos | VLM-1.0 |
|---|---|---|---|---|---|---|
| FineBench | 56.9 | 61.4 | 76.9 | 67.1 | 63.5 | 80.3 |
| CrossHOI-Bench | 40.7 | 52.7 | 58.0 | 55.1 | 51.0 | 63.2 |
| PIO | 54.6 | 65.3 | 47.9 | 61.6 | 54.4 | 65.3 |
| VABench-Point | 26.0 | 57.8 | 50.5 | 61.4 | 45.2 | 59.7 |
| VABench-Visual-Trace | 75.0 | 72.0 | 80.3 | 89.8 | 81.6 | 79.7 |
| ShareRobot 可供性 | 26.8 | 28.6 | 28.2 | 25.2 | 23.0 | 26.7 |
| ShareRobot 轨迹 | 73.3 | 76.9 | 68.9 | 69.2 | 65.5 | 76.7 |
| RoboBench-MCQ | 49.2 | 62.8 | 59.1 | 41.1 | 43.5 | 61.2 |
| 类平均 | 50.3 | 59.7 | 58.7 | 58.8 | 53.5 | 64.1 |
类平均 64.1,比这一类最强可比基线 Embodied-R1.5 的 58.8 高 5.3。第一的是 FineBench、CrossHOI、PIO、ShareRobot 轨迹、RoboBench-MCQ。VABench-Point 59.7 低于 R1.5 的 61.4。VABench-Visual-Trace 79.7 低于 R1.5 的 89.8,也低于 Qwen 80.3 和 Cosmos 81.6。ShareRobot 可供性 26.7 低于 Qwen 28.2 和 MoT-2B 26.8。
序列与自适应 7 项:类平均只高 1.4,反思不是全面第一
这一段看历史和进度、长程规划、失败后的反思和修复。历史和进度:SITE-Bench-Video、VSIBench、EgoPlan2、Cosmos。长程:VLABench、RoboBench-Planning。反思修复:RoboFAC。
| 基准 | MoT-2B | A30B† | Qwen | R1.5 | Cosmos | VLM-1.0 |
|---|---|---|---|---|---|---|
| SITE-Bench-Video | 63.5 | 72.5 | 71.1 | 59.1 | 57.6 | 69.2 |
| VSIBench | 60.5 | 68.3 | 57.5 | 59.2 | 50.4 | 58.9 |
| EgoPlan2 | 45.5 | 51.4 | 49.9 | 61.0 | 42.6 | 49.6 |
| Cosmos | 54.3 | 65.5 | 67.8 | 68.6 | 67.1 | 66.9 |
| VLABench | 16.2 | 51.0 | 49.9 | 39.4 | 48.9 | 51.1 |
| RoboBench-Planning | 54.2 | 59.3 | 53.9 | 39.4 | 41.5 | 54.9 |
| RoboFAC | 35.6 | 42.8 | 41.4 | 43.9 | 34.4 | 51.0 |
| 类平均 | 47.1 | 58.7 | 55.9 | 52.9 | 48.9 | 57.4 |
类平均 57.4,比 Qwen 55.9 高 1.4,比 A30B 的 58.7 低,A30B 仍不进排名。第一是 VLABench、RoboBench-Planning、RoboFAC。SITE-Bench-Video 69.2 低于 Qwen 71.1。VSIBench 58.9 低于 MoT-2B 60.5 和 R1.5 59.2。EgoPlan2 49.6 低于 R1.5 的 61.0。Cosmos 这一项 66.9 低于 R1.5 68.6、Qwen 67.8 和 Cosmos3-Nano 67.1。
闭环导航:指令跟随和找物体是两套协议
诊断分之外,模型被放进两条闭环导航,每一步环境变了之后,观测历史和导航状态再喂回去。
R2R-CE 是连续 Matterport3D 里的 Room-to-Room,环境是 Habitat,评测切分 val-unseen,环境与训练不重叠。每步只看路线指令和累积的第一人称 RGB,不用地图。同一套参数、不同角色提示,同时做动作预测和是否停止。输出是停止,或一段有限的低层导航动作。执行后把新观测接进历史再问。成功半径是标准的 3 米。指标:成功率 SR、Oracle Success OS、按路径长度加权的成功 SPL、导航误差 NE(米,越低越好)。
| 模型 | SR | OS | SPL | NE |
|---|---|---|---|---|
| Uni-NaVid | 47.0 | 53.3 | 42.7 | 5.5 |
| InternVLA-N1 | 55.4 | 60.6 | 52.1 | 4.8 |
| Vesta | 55.5 | 61.4 | 50.8 | 5.1 |
| Qwen-VLA-Base | 53.8 | 61.7 | 49.4 | 5.2 |
| Qwen-VLA-Instruct | 57.5 | 69.0 | 51.2 | 5.1 |
| Hy-Embodied-VLM-1.0 A3B | 57.9 | 66.4 | 54.2 | 4.5 |
SR、SPL、NE 最好:57.9、54.2、4.5。相对各指标上最强基线,SR +0.4,SPL +2.1,NE 少 0.3 米。OS 66.4 低于 Qwen-VLA-Instruct 的 69.0,排第二。SR 更高且 NE 更低,论文把它读成接近终点时对终止状态的判断更稳,不是 OS 更高。
MP3D 物体目标导航没有路线说明,只给目标类别和 RGB-D,要在没见过的环境里找到实例并在成功区域停下。框架用深度产生可通行候选,并跨观测维持显式空间表征。模型负责方向打分、子目标选择、目标落地和动作选择。所有模型用同一套几何处理和空间记忆,没有针对 ObjectNav 的参数适配。这是零样本。
| 模型 | SR | SPL |
|---|---|---|
| Qwen3.5-35B-A3B | 35.8 | 9.7 |
| Qwen3.6-35B-A3B | 36.1 | 9.8 |
| Hy-Embodied-VLM-1.0 A3B | 38.3 | 11.2 |
SR 比 Qwen3.6-35B-A3B 高 2.2,SPL 高 1.4。对照模型名是 35B-A3B,和前面诊断表里的 Qwen3.6-A3B 不是同一行。
这些数不能被读成什么
思考模式不统一:R1.5 只有 Instruct,Cosmos 打开思考后变差所以报不思考,Qwen 和 Hy 用思考。A30B 多处类平均更高,被排除出排名。重跑分可以和原论文不一致。Depth-InHouse 是内部基准。总平均按 38 个基准平均,不是三类平均的平均。诊断表是静态基准;导航才是闭环,而且 R2R 只要 RGB、无地图,ObjectNav 用 RGB-D 加共享的几何和空间记忆,两边输入不一样。OS 更高不等于 SR 或路径效率更高。没有单独的限制节把统计显著性和重复次数写出来,表内是单次协议下的百分比。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测协议和表内数字。
出处:腾讯 Robotics X、混元视觉团队、福田实验室,Yongming Rao、Ziyi Wang、Xumin Yu、Yonggen Ling 等,Hy-Embodied-VLM-1.0: Efficient Physical-World Agents,2026-07-14,https://arxiv.org/abs/2607.12894
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。