CodexQA

行业与实践研究与基准测试

38 项里 19 项第一:腾讯 Hy-Embodied 按感知—动作环评具身 Agent

CodexQA 团队阅读约 6 分钟

可比规模里总平均 65.6,比 Qwen3.6-A3B 高 4.4,比上一代 MoT-2B 高 8.4。A30B 不进排名。Where2Place 只有 65.0,PartAfford 63.7 低于 Embodied-R1.5 的 82.6。导航 OS 排第二。

本文目录

38 项里 19 项第一:腾讯 Hy-Embodied 按感知—动作环评具身 Agent

腾讯 Robotics X、混元视觉团队、福田实验室 2026 年 7 月 14 日的技术报告 Hy-Embodied-VLM-1.0: Efficient Physical-World Agents(arXiv:2607.12894)。项目负责人 Yongming Rao,核心贡献者 Ziyi Wang、Xumin Yu、Yonggen Ling,监督是 Han Hu、Zhengyou Zhang。代码在 https://github.com/Tencent-Hunyuan/HY-Embodied 。Hy-Embodied-VLM-1.0 是面向物理世界的具身基础模型,激活参数大约 3B。这篇评测不把它当成一堆互不相关的视觉问答,而是按感知—动作环的三段来排 38 个诊断基准,再放到两条闭环导航里看能不能接成持续行为。

排名只在相近激活规模里算,思考模式并不统一

主排名只比激活参数相近的模型:Hy-Embodied-0.5 MoT-2B、Qwen3.6-A3B、Embodied-R1.5(8B,只有 Instruct,没有单独的思考模式)、Cosmos3-Nano(视觉语言部分也是 8B)。Hy-Embodied-0.5 A30B 只作更大规模的参照,不参与最好、次好的排名和高亮。

Qwen3.6-A3B、Embodied-R1.5、Cosmos3-Nano 是这篇用同一条评测流水线重跑的,所以分数可以和原论文不一样。Cosmos3-Nano 打开思考后明显变差,表里报的是不思考。Qwen3.6-A3B 和全部 Hy-Embodied 变体,包括 VLM-1.0 A3B,用思考模式。每个基准沿用官方协议,指标方向调成越高越好,分数写成百分比。类别平均在该能力类内部计算。总平均覆盖全部 38 项,是按基准数加权,不是三类平均再平均:68.6×23、64.1×8、57.4×7 再除以 38,得到 65.6。

38 项里,VLM-1.0 第一 19 项、第二 11 项,前二共 30 项。总平均 65.6,比同规模里最强的 Qwen3.6-A3B 高 4.4(61.2),比上一代 MoT-2B 高 8.4(57.2)。A30B 不进这个排名。

下面四列表的列顺序相同:MoT-2B(思考)、A30B†(思考,不排名)、Qwen3.6-A3B(思考)、Embodied-R1.5(Instruct)、Cosmos3-Nano(不思考)、VLM-1.0 A3B(思考)。

状态理解 23 项:类平均 68.6,不是每项都第一

这一段看当前物理状态:物体和属性、几何和视角、以及能拿来动作的空间表征。23 项分三组。物理和语义:BLINK、CV-Bench、PixMo-Points、PointBench。空间:内部基准 Depth-InHouse,以及 3DSRBench、All-Angles-Bench、DA-2K、ERQA、EmbSpatial-Bench、MMSI-Bench、MindCube、SAT、SIBench-mini、SITE-Bench-Image、ViewSpatial-Bench。机器人向:OpenEQA、PartAfford、RoboAfford、RoboRefIt、RefSpatial-Bench、RoboSpatial-Home、Where2Place。

基准MoT-2BA30B†QwenR1.5CosmosVLM-1.0
BLINK82.787.187.977.882.487.3
CV-Bench89.288.888.686.888.089.7
PixMo-Points51.462.657.557.159.864.6
PointBench69.074.835.159.139.271.7
Depth-InHouse45.757.663.052.047.067.6
3DSRBench57.056.649.942.631.952.6
All-Angles-Bench55.171.864.048.451.963.4
DA-2K92.390.281.480.582.883.2
ERQA54.562.357.537.345.060.8
EmbSpatial-Bench82.884.183.276.080.082.7
MMSI-Bench33.239.241.929.834.041.8
MindCube66.369.255.027.932.870.0
SAT76.787.380.760.754.078.0
SIBench-mini58.267.360.951.952.564.5
SITE-Bench-Image62.774.771.760.359.672.3
ViewSpatial-Bench53.159.849.043.752.053.3
OpenEQA54.473.273.253.953.863.1
PartAfford30.165.225.582.632.263.7
RoboAfford73.575.466.760.676.271.5
RoboRefIt82.885.278.577.255.488.2
RefSpatial-Bench45.857.253.152.444.453.4
RoboSpatial-Home55.776.670.969.158.369.4
Where2Place68.070.070.073.071.065.0
类平均62.671.163.759.255.868.6

可比模型里类平均 68.6,高于 Qwen 的 63.7,差 4.9。23 项里第一 11 项、第二 9 项,前二共 20 项。A30B 的类平均 71.1 更高,但不进排名。输给可比模型的格子包括:BLINK 87.3 低于 Qwen 87.9;3DSRBench 52.6 低于 MoT-2B 57.0;All-Angles 63.4 低于 Qwen 64.0;DA-2K 83.2 低于 MoT-2B 92.3;EmbSpatial 82.7 低于 Qwen 83.2;MMSI 41.8 低于 Qwen 41.9;SAT 78.0 低于 Qwen 80.7;OpenEQA 63.1 低于 Qwen 73.2;PartAfford 63.7 低于 Embodied-R1.5 的 82.6;RoboAfford 71.5 低于 Cosmos 76.2;RoboSpatial-Home 69.4 低于 Qwen 70.9;Where2Place 65.0 是这一组可比模型里的最低,低于 R1.5 的 73.0。Depth-InHouse 是内部基准。

动作迁移 8 项:类平均 64.1,轨迹视觉这一项输给 R1.5

这一段看交互意图、当前配置下选哪个动作、把动作落到物体或方向、以及这个动作立刻会怎样。交互:FineBench、CrossHOI-Bench。决策和落地:PIO、VABench-Point、VABench-Visual-Trace、ShareRobot-Bench 的可供性和轨迹两条。局部机器人推理:RoboBench-MCQ。

基准MoT-2BA30B†QwenR1.5CosmosVLM-1.0
FineBench56.961.476.967.163.580.3
CrossHOI-Bench40.752.758.055.151.063.2
PIO54.665.347.961.654.465.3
VABench-Point26.057.850.561.445.259.7
VABench-Visual-Trace75.072.080.389.881.679.7
ShareRobot 可供性26.828.628.225.223.026.7
ShareRobot 轨迹73.376.968.969.265.576.7
RoboBench-MCQ49.262.859.141.143.561.2
类平均50.359.758.758.853.564.1

类平均 64.1,比这一类最强可比基线 Embodied-R1.5 的 58.8 高 5.3。第一的是 FineBench、CrossHOI、PIO、ShareRobot 轨迹、RoboBench-MCQ。VABench-Point 59.7 低于 R1.5 的 61.4。VABench-Visual-Trace 79.7 低于 R1.5 的 89.8,也低于 Qwen 80.3 和 Cosmos 81.6。ShareRobot 可供性 26.7 低于 Qwen 28.2 和 MoT-2B 26.8。

序列与自适应 7 项:类平均只高 1.4,反思不是全面第一

这一段看历史和进度、长程规划、失败后的反思和修复。历史和进度:SITE-Bench-Video、VSIBench、EgoPlan2、Cosmos。长程:VLABench、RoboBench-Planning。反思修复:RoboFAC。

基准MoT-2BA30B†QwenR1.5CosmosVLM-1.0
SITE-Bench-Video63.572.571.159.157.669.2
VSIBench60.568.357.559.250.458.9
EgoPlan245.551.449.961.042.649.6
Cosmos54.365.567.868.667.166.9
VLABench16.251.049.939.448.951.1
RoboBench-Planning54.259.353.939.441.554.9
RoboFAC35.642.841.443.934.451.0
类平均47.158.755.952.948.957.4

类平均 57.4,比 Qwen 55.9 高 1.4,比 A30B 的 58.7 低,A30B 仍不进排名。第一是 VLABench、RoboBench-Planning、RoboFAC。SITE-Bench-Video 69.2 低于 Qwen 71.1。VSIBench 58.9 低于 MoT-2B 60.5 和 R1.5 59.2。EgoPlan2 49.6 低于 R1.5 的 61.0。Cosmos 这一项 66.9 低于 R1.5 68.6、Qwen 67.8 和 Cosmos3-Nano 67.1。

闭环导航:指令跟随和找物体是两套协议

诊断分之外,模型被放进两条闭环导航,每一步环境变了之后,观测历史和导航状态再喂回去。

R2R-CE 是连续 Matterport3D 里的 Room-to-Room,环境是 Habitat,评测切分 val-unseen,环境与训练不重叠。每步只看路线指令和累积的第一人称 RGB,不用地图。同一套参数、不同角色提示,同时做动作预测和是否停止。输出是停止,或一段有限的低层导航动作。执行后把新观测接进历史再问。成功半径是标准的 3 米。指标:成功率 SR、Oracle Success OS、按路径长度加权的成功 SPL、导航误差 NE(米,越低越好)。

模型SROSSPLNE
Uni-NaVid47.053.342.75.5
InternVLA-N155.460.652.14.8
Vesta55.561.450.85.1
Qwen-VLA-Base53.861.749.45.2
Qwen-VLA-Instruct57.569.051.25.1
Hy-Embodied-VLM-1.0 A3B57.966.454.24.5

SR、SPL、NE 最好:57.9、54.2、4.5。相对各指标上最强基线,SR +0.4,SPL +2.1,NE 少 0.3 米。OS 66.4 低于 Qwen-VLA-Instruct 的 69.0,排第二。SR 更高且 NE 更低,论文把它读成接近终点时对终止状态的判断更稳,不是 OS 更高。

MP3D 物体目标导航没有路线说明,只给目标类别和 RGB-D,要在没见过的环境里找到实例并在成功区域停下。框架用深度产生可通行候选,并跨观测维持显式空间表征。模型负责方向打分、子目标选择、目标落地和动作选择。所有模型用同一套几何处理和空间记忆,没有针对 ObjectNav 的参数适配。这是零样本。

模型SRSPL
Qwen3.5-35B-A3B35.89.7
Qwen3.6-35B-A3B36.19.8
Hy-Embodied-VLM-1.0 A3B38.311.2

SR 比 Qwen3.6-35B-A3B 高 2.2,SPL 高 1.4。对照模型名是 35B-A3B,和前面诊断表里的 Qwen3.6-A3B 不是同一行。

这些数不能被读成什么

思考模式不统一:R1.5 只有 Instruct,Cosmos 打开思考后变差所以报不思考,Qwen 和 Hy 用思考。A30B 多处类平均更高,被排除出排名。重跑分可以和原论文不一致。Depth-InHouse 是内部基准。总平均按 38 个基准平均,不是三类平均的平均。诊断表是静态基准;导航才是闭环,而且 R2R 只要 RGB、无地图,ObjectNav 用 RGB-D 加共享的几何和空间记忆,两边输入不一样。OS 更高不等于 SR 或路径效率更高。没有单独的限制节把统计显著性和重复次数写出来,表内是单次协议下的百分比。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测协议和表内数字。

出处:腾讯 Robotics X、混元视觉团队、福田实验室,Yongming Rao、Ziyi Wang、Xumin Yu、Yonggen Ling 等,Hy-Embodied-VLM-1.0: Efficient Physical-World Agents,2026-07-14,https://arxiv.org/abs/2607.12894

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误