Industry & PracticeResearch & Benchmarks
BabelArena: 面向 大 语言 模型 智能 体 的 大规模 多 语言 基准
大语言模型(LLM)智能体越来越多地通过工具使用以及与用户和环境的交互来执行多步骤工作流。然而,现有智能体评测大体以英语为中心,限制了我们对智能体在多语言场景下能力的理解。我们提出 BabelFlow,一套与具体基准无关的智能体化工作流:它
In this piece
BabelArena:面向大语言模型智能体的大规模多语言基准(中文全译)
翻译说明:本文是 arXiv 论文 BabelArena: A Large-Scale Multilingual Benchmark for LLM Agents(arXiv:2609.23490)的中文全译,由智测团队翻译。原作者:Kuang Peng、Yuchun Fan、Jiangnan Li、Minghao Wu、Jialong Tang、Haoran Wei、Weixuan Wang、Jianhong Tu、Baosong Yang、Tong Xiao。原文以 CC BY 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。
arXiv:2609.23490v1 [cs.CL] 2026 年 9 月 20 日
作者与单位
Kuang Peng(同等贡献;实习工作完成于阿里巴巴集团 Alibaba Token Hub) 单位:阿里巴巴集团 Alibaba Token Hub;伊利诺伊大学厄巴纳-香槟分校(University of Illinois Urbana-Champaign)
Yuchun Fan(同等贡献;实习工作完成于阿里巴巴集团 Alibaba Token Hub) 单位:阿里巴巴集团 Alibaba Token Hub;东北大学(Northeastern University)
Jiangnan Li(实习工作完成于阿里巴巴集团 Alibaba Token Hub) 单位:阿里巴巴集团 Alibaba Token Hub;莫纳什大学(Monash University)
Minghao Wu(通讯作者:minghao.wu@alibaba-inc.com) 单位:阿里巴巴集团 Alibaba Token Hub
Jialong Tang 单位:阿里巴巴集团 Alibaba Token Hub
Haoran Wei 单位:阿里巴巴集团 Alibaba Token Hub
Weixuan Wang 单位:蚂蚁国际(Ant International)
Jianhong Tu 单位:阿里巴巴集团 Alibaba Token Hub
Baosong Yang 单位:阿里巴巴集团 Alibaba Token Hub
Tong Xiao 单位:阿里巴巴集团 Alibaba Token Hub
摘要
大语言模型(LLM)智能体越来越多地通过工具使用以及与用户和环境的交互来执行多步骤工作流。然而,现有智能体评测大体以英语为中心,限制了我们对智能体在多语言场景下能力的理解。我们提出 BabelFlow,一套与具体基准无关的智能体化工作流:它通过分析运行时依赖、协调保结构翻译,并把多层校验与人工审阅结合起来,从而在把已有智能体基准适配到新语言时保留任务与评测语义。借助 BabelFlow,我们构建了 BabelArena,一个大规模多语言基准,包含 16,146 个实例,源自四个基准家族、13 个领域、23 种语言中的 702 个规范任务。对五个前沿模型的实验表明,没有任何单一模型在所有基准家族上占优,而且跨语言差距远不止任务是否成功。资源更低的语言呈现出不同的失败模式:工具使用与控制流错误所占比例更大,而不仅仅是答案质量错误,这说明在这些语言的不同资源水平上,可靠完成任务仍存在缺口。在相同任务上,低资源语言中的智能体消耗的词元也显著多于英语(输入最多约为英语的两倍),交互长度却没有成比例增加;在需要结构化输出的任务上,语言一致性进一步下降,切换方向压倒性地指向英语。我们认为 BabelArena 为推进可靠且高效的多语言智能体研究提供了基础。
1 引言
大语言模型(LLM)正越来越多地被用作智能体:它们不再只是回答问题,而是通过工具使用以及与用户和环境的交互来执行多步骤工作流(Kuang 等,2026)。要服务不同语言的用户,智能体所要做的必须多于生成流畅回复(Liu 等,2024;Zhou 等,2024;Patil 等,2025)。它们必须正确理解请求、根据工具反馈采取行动,并在整个工作流中维持任务约束(Luo 等,2026;Nguyen 等,2026)。因此,评测必须考察智能体能否跨语言可靠地完成这些工作流,而不是只判断回复是否流畅。
然而,现有智能体基准对这种多语言端到端评测的支持有限,因为大多数仍集中在英语或中文(Hofman 等,2026;Kim 等,2026;Caciolai 等,2026)。近期的多语言基准试图填补这一空白,但多数只改写源基准的部分组件,覆盖的语言与领域也有限(Hofman 等,2026;Kim 等,2026;Caciolai 等,2026;Luo 等,2026;Nguyen 等,2026;Li 等,2026)(表 1)。扩大这一覆盖尤其困难,因为智能体基准并不是自包含的输入—输出数据集,而是由多个相互作用组件构成的可执行环境(Zhou 等,2024;Yao 等,2024;Patil 等,2025)。在这些组件之间,任务指令、工具、数据库、模拟用户和评测器通过共享实体与约束相连,必须保持一致。若独立翻译这些组件,就可能破坏跨组件一致性,即使智能体行为正确,也会导致执行失败或评分失败(Kim 等,2026;Luo 等,2026;Nguyen 等,2026)。因此,可靠的跨语言比较需要协同适配:在保持任务与评测语义跨语言对齐的同时,保留这些依赖关系。
为应对这些挑战,我们提出 BabelFlow,一套与具体基准无关的智能体化工作流,用于把已有智能体基准适配到新语言,同时保留任务与评测语义。编码智能体首先分析运行时依赖,识别承载语言的字段,并把可翻译内容与对执行至关重要的取值区分开。在这些依赖的引导下,翻译智能体跨组件一致地翻译字段,并对共享实体复用规范译文,同时由工作流把译后字段按原结构重建。随后,相互独立的校验智能体检查结构完整性、跨组件一致性、语义保真和行为等价,人工审阅者裁定其发现并指导修订,之后才接受该语言变体。
我们将 BabelFlow 应用于 VitaBench(He 等,2025)、DeepPlanning(Zhang 等,2026)、τ³-Bench(Yao 等,2024;Barrès 等,2025;Shi 等,2026)和 ClawEval(Ye 等,2026),构建了 BabelArena。它覆盖交互式服务、长程规划、基于知识的工具使用,以及异构自主任务。BabelArena 在 13 个领域、23 种语言上包含 702 个互不相同的任务,任务数多于大多数先前基准,语言与领域覆盖最广,实例总数 16,146 也是表 1 所比较基准中最大的。任务身份与源评测标准在各语言间保持固定,从而能够对智能体表现做受控比较。
表 1:多语言智能体基准比较。 ✓/✗ 表示已适配/未适配的组件:系统、模拟器与评测提示(Prompt)、任务输入(Task)、工具描述(Tool)以及环境内容(Env.)。Tasks 统计互不相同的任务数;Dom. 为领域数;Lang. 为语言数;Inst. 为跨语言的实例总数。BabelArena 以粗体标出。
| 基准 | Prompt | Task | Tool | Env. | Tasks | Dom. | Lang. | Inst. |
|---|---|---|---|---|---|---|---|---|
| MAPS(2026) | ✗ | ✓ | ✗ | ✗ | 805 | 4 | 12 | 9,660 |
| GAIA-v2-LILT(2026) | ✓ | ✓ | ✗ | ✗ | 165 | 1 | 6 | 990 |
| OmnilingualGAIA2(2026) | ✓ | ✓ | ✗ | ✓ | 640 | 1 | 11 | 7,040 |
| MLCL(2026) | ✗ | ✓ | ✗ | ✗ | 200 | 1 | 4 | 800 |
| SEATauBench(2026) | ✓ | ✓ | ✓ | ✓ | 278 | 3 | 6 | 1,668 |
| PolyWorkBench(2026) | ✓ | ✓ | ✗ | ✓ | 67 | 5 | 10 | 67 |
| BabelArena | ✓ | ✓ | ✓ | ✓ | 702 | 13 | 23 | 16,146 |
我们首先在 40 个适配为中文的任务上,通过受控消融验证 BabelFlow,发现断裂引用与行为不匹配都少于独立字段翻译(第 4.1 节)。随后我们在 BabelArena 上评测五个前沿模型,发现没有任何单一模型在全部四个基准家族上领先;五个模型在低资源组的平均任务成功率和语言一致性都低于高资源组(第 4.2 节)。在抽样的 VitaBench 失败中,泰语和泰米尔语的工具使用与控制流错误占比大于英语和中文,说明跨语言差距超出了答案质量,延伸到执行可靠性(第 5 节)。在相同的 VitaBench 任务上,低资源轨迹消耗的总输入词元是英语对应轨迹的 1.69–2.06 倍,对话轮数却相近;DeepPlanning 中的购物任务还会带来更多轮次和工具调用。在被标注为语言不一致的 DeepPlanning 与 ClawEval 抽样轨迹中,英语占已标注切换的 91.2%;不一致分别集中在助手回复,以及工具调用之前的文本前缀。
我们的贡献有三方面:
- 我们提出并验证了 BabelFlow,一套与具体基准无关的智能体化工作流,用于跨语言适配智能体基准并保留语义(第 3.2 节与第 4.1 节)。
- 我们构建了 BabelArena,一个多语言智能体基准,任务与评测标准在各语言间对齐(第 3.3 节)。
- 我们评测了五个前沿模型,揭示了任务成功、语言一致性、失败模式和执行成本上依赖于语言的差异(第 4.2 节与第 5 节)。
2 相关工作
智能体评测
智能体基准越来越衡量可执行环境中的闭环行为,而不是孤立的最终答案(Liu 等,2024;Zhou 等,2024;Patil 等,2025)。我们的四个源基准覆盖交互式服务、带约束的规划、基于知识的工具使用,以及自主任务(He 等,2025;Zhang 等,2026;Yao 等,2024;Barrès 等,2025;Shi 等,2026;Ye 等,2026)。
多语言评测
传统多语言基准使用自包含的输入—输出对(Bandarkar 等,2024;Kulkarni 等,2025)。智能体基准还会通过提示、工具、环境和评测器暴露语言。MAPS 与 MLCL 主要翻译任务输入(Hofman 等,2026;Luo 等,2026),GAIA-v2-LILT 还适配了评测(Kim 等,2026)。PolyWorkBench 与 OmnilingualGAIA2 还进一步本地化了环境与评测器,后者对其多语言校验器做了校准(Li 等,2026;Caciolai 等,2026)。SEATauBench 适配了全部组件,但覆盖的领域和语言少于 BabelArena(Nguyen 等,2026)。
软件本地化
软件本地化把可翻译资源与程序逻辑分开(Pirrone 与 D’Ulizia,2024;Xia 等,2013;Wang 等,2013)。其实践进一步把验证看得重于流畅性检查:国际化测试考察软件在特定语言和地区是否正常工作(Couto 等,2025;Felipe 等,2024)。
本文工作
BabelFlow 适配相互依赖的基准组件,同时保留执行与评测语义。应用于四个基准家族后,它产出 BabelArena;在表 1 的基准中,其语言与领域覆盖最广,实例数也最多。
3 把智能体基准从英语适配到多语言
我们首先概述跨语言适配智能体基准的挑战(第 3.1 节)。然后介绍 BabelFlow,一套把结构化翻译与多层校验、人工审阅结合起来的智能体化工作流(第 3.2 节)。最后,我们应用 BabelFlow 构建 BabelArena(第 3.3 节)。
3.1 新时代,新挑战
多语言对话基准通常通过翻译自包含的输入—输出对来降低编写成本。然而,智能体基准把对执行至关重要的文本串联在任务、工具、数据库、模拟用户和评分器之间。适配这些可执行环境会带来若干新挑战:
- (C1)可执行性保持: 与软件本地化一样,智能体基准适配必须保持可执行性。因此,我们必须检查其代码、数据和评测器,以确定哪些内容可以安全翻译。
- (C2)翻译一致性: 共享实体与取值,例如商品名称和工具名称,必须在数据库、工具响应和标准答案之间保持一致。否则执行可能失败,或者正确的智能体行为可能被判为不正确。
- (C3)评测有效性: 为英语设计的输出解析器,在其他语言使用不同词形或词序时可能失效。翻译给大语言模型模拟用户的指令会改变其行为,而大语言模型评判器在不同语言上的准确性和严格程度也不同。
- (C4)评测效率: 多轮展开、工具执行、环境模拟和基于模型的评判使每次评测都很昂贵。把这一成本乘以语言数,可能使穷尽评测不可行,因此需要一种基准构成,使每种语言的评测仍然负担得起。
C1–C3 促使适配框架(第 3 节)保持每种语言变体的保真度;C4 指导基准构成(第 3.3 节),以控制多语言评测成本。
图 1:BabelFlow 概览。 运行时数据流分析识别文本字段及其依赖,以便按类型翻译并按原结构重建。多层校验检查适配质量。人工审阅指导对分析与翻译的修订。
3.2 BabelFlow:把基准适配到英语之外的智能体化工作流
给定源语言 \(\ell_s\) 中的源基准 \(\mathcal{B}^{s}\) 和目标语言 \(\ell_t\),BabelFlow 构建一个可独立执行的 \(\ell_t\) 变体 \(\mathcal{B}^{t}\)。如图 1 所示,分析器 \(\mathcal{A}\)(Claude-Opus-4.8)识别文本字段与跨产物依赖,并指派翻译类型(步骤 1 和 2);翻译器 \(\mathcal{T}\)(Qwen-3.7-Plus)翻译这些字段,以便按原结构重建(步骤 3)。校验器 \(\mathcal{V}\) 由三个异构智能体组成(GPT-5.6-Sol、Qwen-3.7-Max 与 Claude-Opus-4.8),它们独立地跨多层检查该变体,并汇总发现(步骤 4)。人工审阅者分拣这些发现,并指导 \(\mathcal{A}\) 与 \(\mathcal{T}\) 修订(步骤 5)。变体 \(\mathcal{B}^{t}\) 只有在每一层都通过且审阅者签字后才被接受。步骤 1–3 在构造上确立 C1 与 C2,步骤 4 和 5 则通过执行把它们与 C3 一起重新检验。
#### 步骤 1:运行时数据流分析
分析器 \(\mathcal{A}\) 是一个编码智能体。它阅读并运行源基准,追踪其评测数据流,并清点运行时访问的每一个文本字段,无论这些字段位于数据文件还是代码中:任务规格、策略与系统提示、模拟用户指令、工具文档与模式、数据库与夹具、工具观测、输出解析器、评分细则、评判提示,以及评分器常量。然后,它把必须跨产物一致的字段连接起来,例如请求、数据库行、工具响应和标准答案所共享的商品名称,或任务正文与评测器词法匹配器所共享的类别标签。这些依赖决定哪些字段可以安全翻译。分析产生一个带类型的中间表示 \(\mathcal{I}^{s}=\mathcal{A}(\mathcal{B}^{s})=\{e^{s}_{i}\}_{i=1}^{N}\),其中每个元素 \(e^{s}_{i}\) 表示一个源语言文本字段,并记录其源字符串、产物位置,以及它必须与之保持一致的字段。
#### 步骤 2:翻译类型指派
分析器 \(\mathcal{A}\) 为每个元素 \(e^{s}_{i}\in\mathcal{I}^{s}\) 指派翻译类型 \(t_i\),以在构建目标变体时指导翻译器 \(\mathcal{T}\):
- 保留(Preserve): 保持字节级相同,并声明原因。原因要么是可执行项,涵盖工具与参数名称、模式键、标识符、枚举代码、日期和评测器控制词元;要么是源资产,涵盖参考文档、图像、音频、视频以及其他定义任务的源媒介。
- 自由翻译(Translate-Free): 在局部语境中翻译,涵盖指令、策略、人设、描述和评分细则正文。
- 规范翻译(Translate-Canonical): 翻译一次并复用,涵盖城市、商品、显示标签、星期,以及评测器要匹配的术语。
保留原因把对执行至关重要的取值——基准要能运行就必须保持不变——与一旦翻译就会改变任务的源资产区分开。记录原因使豁免可审计,并把保留的资产与未完成的翻译区分开。只有源资产计入某一变体的本地化覆盖。这些类型在步骤 3 中指导 \(\mathcal{T}\):翻译普通正文,跨产物复用规范译文,并保留对执行至关重要的取值以及已声明的源资产。
#### 步骤 3:保结构的字段抽取与重建
为保护产物结构以及 JSON 键和代码等范围外内容,BabelFlow 只把抽取出的字段交给翻译器 \(\mathcal{T}\)。它复制源产物,抽取标记为待翻译的字段,并用占位符保护标识符、模板、标记以及精确格式示例。翻译器把自由正文渲染为 \(\ell_t\),并从规范翻译映射 \(\mathcal{C}\) 中复用共享实体的译文。结果被写回复制结构中的原位置,从而保留键、嵌套和可执行取值。按类型 \(t_i\) 翻译每个元素 \(e^{s}_{i}\),得到其目标语言对应项 \(e^{t}_{i}\) 以及表示 \(\mathcal{I}^{t}=\mathcal{T}(\mathcal{I}^{s},\ell_{t})=\{e^{t}_{i}\}_{i=1}^{N}\)。遵循跨产物依赖的重建产生一个在 \(\ell_t\) 中执行的适配基准 \(\mathcal{B}^{t}\)。
#### 步骤 4:多层校验
翻译流畅本身并不能确立基准有效性。由 GPT-5.6-Sol、Qwen-3.7-Max 和 Claude-Opus-4.8 支撑的三个智能体组成校验器 \(\mathcal{V}\):每一个都独立地并排执行 \(\mathcal{B}^{s}\) 与 \(\mathcal{B}^{t}\),并检查四层:
- 完整性与结构。 所需产物存在、能正确解析,并保留源键、类型、嵌套和占位符。
- 跨产物一致性。 受保护的取值保持不变,共享实体使用一致译文,引用在任务、工具、数据库、解析器和评分器之间能够解析。
- 语义保真。 译文保留意图、约束和信息,并特别关注影响任务难度或评分的字段。
- 行为等价。 校验器在两种环境中、在相同的受控动作下,比较工具结果、状态变化、终止状态、解析器输出和评分器决定。
这些智能体看不到彼此的报告。它们的发现被合并为一个失败集 \(\mathcal{F}=\mathcal{V}(\mathcal{B}^{s},\mathcal{B}^{t})\),保留任一智能体标出的每一个问题。每条记录包含出问题的字段、校验层、推理,以及并排证据。前两层在已构建的变体上复查 C1 与 C2,因为类型标错的字段仍可能能够解析且读起来流畅。后两层针对 C3。
#### 步骤 5:人工审阅
逐行审阅 \(\mathcal{B}^{t}\) 不可行,因为其相互依赖的文本字段横跨任务、提示、工具、数据库和评测器,而且许多缺陷只在运行时才显现。校验器组识别候选缺陷并提供推理。人工审阅者在修订前确认发现,因为校验器可能误判。审阅者检查 \(\mathcal{F}\) 中的每一个失败,丢弃误报,并把已确认的缺陷追溯到其来源阶段,以产生修订指导 \(\mathcal{R}\):类型标错或缺失的元素返回分析器 \(\mathcal{A}\)(步骤 1 和 2);保真或规范一致性错误则返回翻译器 \(\mathcal{T}\),并更新规范翻译映射 \(\mathcal{C}\)(步骤 3)。分析、翻译、校验和审阅重复进行,直到 \(\mathcal{F}=\emptyset\);此后审阅者对随机抽样的任务做端到端抽查,并在该变体上签字。
3.3 BabelArena:面向多语言智能体的智能体基准
#### 基准概览
我们在四个源基准上实例化 BabelFlow。它们具有互补的交互结构与目标能力:VitaBench 面向外卖、到店消费和在线旅行中的多用途交互任务;DeepPlanning 面向长程旅行与购物规划;τ³-Bench 的文本组件面向模拟用户交互、工具调用、知识检索和领域策略遵从;ClawEval 面向服务编排、多模态感知与生成,以及专业对话。由此得到的 BabelArena 发布版覆盖 702 个规范任务身份和 16,146 个实例(表 1),每个基准都跨越相同的 23 种语言(表 2)。我们选取的语言覆盖 15 种文字,以及高、中、低三种资源水平,从而捕捉书写方向、词分隔符和字形塑形上的差异。
表 2:BabelArena 中的 23 种语言,按大语言模型资源水平分组。 代码由 ISO 639-3 语言标签与 ISO 15924 文字标签组成。
| 高资源(7) | 代码 | 中资源(8) | 代码 | 低资源(8) | 代码 |
|---|---|---|---|---|---|
| 英语 | eng_Latn | 韩语 | kor_Hang | 白俄罗斯语 | bel_Cyrl |
| 中文 | zho_Hans | 印度尼西亚语 | ind_Latn | 东部旁遮普语 | pan_Guru |
| 日语 | jpn_Jpan | 印地语 | hin_Deva | 哈萨克语 | kaz_Cyrl |
| 法语 | fra_Latn | 泰语 | tha_Thai | 高棉语 | khm_Khmr |
| 俄语 | rus_Cyrl | 希伯来语 | heb_Hebr | 缅甸语 | mya_Mymr |
| 阿拉伯语 | arb_Arab | 土耳其语 | tur_Latn | 老挝语 | lao_Laoo |
| 西班牙语 | spa_Latn | 越南语 | vie_Latn | 泰米尔语 | tam_Taml |
| 马来语 | zsm_Latn | 泰卢固语 | tel_Telu |
#### 评测
我们保留每个源基准的评分程序,按需要翻译评测提示,并对每个任务运行三次独立试验。根据任务完成奖励,我们报告 Pass^1,即单次试验成功率的平均,以及 Pass^3,即三次试验中被解出的任务所占比例。对每条轨迹 \(\tau\),若智能体面向用户可见的文本一致地使用目标语言 \(\ell_t\),则 Gemini-3.7-Flash 令 \(\mathrm{LC}(\tau,\ell_{t})=1\),否则为 0。这一检查覆盖助手回复、工具调用之前的文本前缀,以及交付物中的自然语言内容(附录 A)。我们对各次试验的 LC 取平均,并分别报告全部三项指标。
#### 质量保证
我们通过每种语言随机抽取 200 条可翻译文本来评估翻译质量,在 23 种语言上得到 4,600 条记录。每条译文按 1 到 5 分评分:七种高资源语言由人类语言专家评分,十六种中、低资源语言由 GPT-5.6-Sol 评分。高、中、低资源语言的平均分分别为 4.28、4.02 和 3.91。更多细节见附录 B。
4 实验
我们首先通过测量适配缺陷和构建词元成本来验证 BabelFlow(第 4.1 节)。然后在 BabelArena 上评测五个前沿模型,比较各基准家族和语言资源组上的任务表现与语言一致性(第 4.2 节)。
4.1 验证 BabelFlow
表 3:在 40 个适配为中文的任务上对 BabelFlow 做消融。 Br. ref. 与 Be. mis. 报告出现断裂引用和行为不匹配的任务百分比;词元成本相对于独立翻译。越低越好。
| 方法 | Br. ref. | Be. mis. | 成本(词元) |
|---|---|---|---|
| 独立翻译 | 20.0 | 5.0 | 1.00 |
| + 规范翻译 | 7.5 | 2.5 | 1.78 |
| BabelFlow | 2.5 | 0.0 | 3.35 |
#### 设置
我们把 40 个规范任务(每个基准家族 10 个)适配为中文,比较独立字段翻译、复用 \(\mathcal{C}\) 的规范翻译,以及 BabelFlow——后者增加了多层校验和人工指导的修订。我们报告受每种缺陷类型影响的任务百分比:断裂引用(实体不一致或引用无法解析),以及行为不匹配(在各语言间、语义等价的受控动作下,工具、状态、解析或评分结果不一致)。
#### 结果
表 3 突出了 BabelFlow 的有效性:与独立翻译相比,它把断裂引用率从 20.0%(八个失败任务)降到 2.5%(一个失败任务),在 40 个任务中未观察到行为不匹配。仅做规范翻译仍留下更高的缺陷率(断裂引用 7.5%,行为不匹配 2.5%),支持了校验与人工指导修订的价值。这些收益的代价是更高的构建成本,为基线词元用量的 3.35 倍。剩余的引用错误凸显了在多语言适配过程中保持基准组件间一致性的挑战。
4.2 评测多语言智能体
#### 设置
我们在 BabelArena 上评测五个前沿模型:Claude-Opus-4.8、GPT-5.6-Terra、Gemini-3.1-Pro、Qwen-3.7-Max 和 Qwen-3.8-Max。五个模型都使用中等推理力度以控制成本。我们在全部四个基准上使用 Gemini-3.5-Flash 作为模拟用户智能体,并把它作为 DeepPlanning 的转换智能体,把自由形式的计划映射到所需的结构化格式。GPT-5.6-Sol 担任 VitaBench、τ³-Bench 和 ClawEval 的大语言模型评判器,而 DeepPlanning 使用确定性规则,没有大语言模型评判器。所有辅助智能体都关闭思考,所有模型温度均为 0。
#### 按基准家族的模型表现
表 4 报告 BabelArena 上按家族划分的结果。Qwen-3.8-Max 总体上在各基准家族中取得最好的综合表现,在两项推理负担较重的任务——VitaBench 与 DeepPlanning——的准确率上领先,但没有任何单一模型在所有基准上获胜,这说明我们的基准具有多样性。然而,Qwen-3.8-Max 虽在准确率上领先,语言一致性却落后。我们还观察到,DeepPlanning 上的语言一致性显著差于其他基准,我们将在第 5 节深入分析这一点。
表 4:BabelArena 上按基准家族划分的模型表现。 我们以百分比报告 Pass^1、Pass^3 和语言一致性(LC)。越高越好。最佳结果以粗体标出。
| 模型 | VitaBench Pass^1 | VitaBench Pass^3 | VitaBench LC | DeepPlanning Pass^1 | DeepPlanning Pass^3 | DeepPlanning LC | τ³-Bench Pass^1 | τ³-Bench Pass^3 | τ³-Bench LC | ClawEval Pass^1 | ClawEval Pass^3 | ClawEval LC |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude-Opus-4.8 | 36.9 | 20.1 | 98.5 | 36.2 | 17.2 | 61.8 | 62.6 | 49.5 | 95.0 | 55.8 | 43.0 | 96.3 |
| GPT-5.6-Terra | 29.6 | 15.1 | 99.1 | 22.5 | 10.7 | 90.0 | 69.2 | 38.5 | 82.5 | 46.1 | 33.5 | 98.7 |
| Gemini-3.1-Pro | 34.3 | 17.7 | 99.9 | 18.6 | 5.6 | 74.3 | 71.4 | 46.9 | 86.2 | 41.5 | 29.3 | 98.8 |
| Qwen-3.7-Max | 36.1 | 18.9 | 98.6 | 41.6 | 23.8 | 57.5 | 59.0 | 49.1 | 92.8 | 32.4 | 24.6 | 98.5 |
| Qwen-3.8-Max | 42.3 | 25.0 | 94.7 | 46.0 | 26.5 | 75.8 | 62.0 | 50.0 | 87.8 | 40.8 | 27.1 | 88.7 |
#### 按语言组的模型表现
表 5 显示,智能体表现总体上随语言资源水平下降而下降。从高资源语言到低资源语言,五个模型的 Pass^1 与 Pass^3 都大幅下降。每个模型的语言一致性也下降,LC 下降 3.8–14.8 个百分点。Qwen-3.8-Max 在全部三个组的两项任务完成指标上都领先,而 GPT-5.6-Terra 取得最高 LC,说明强任务表现并不必然意味着一致使用目标语言。这些结果揭示了资源组之间在任务完成和语言遵从上的差距,促使我们为在较低资源语言中运行的智能体提供更强支持。
表 5:BabelArena 上按语言资源组划分的模型表现。 我们以百分比报告 Pass^1、Pass^3 和语言一致性(LC)。越高越好。最佳结果以粗体标出。
| 模型 | 高资源 Pass^1 | 高资源 Pass^3 | 高资源 LC | 中资源 Pass^1 | 中资源 Pass^3 | 中资源 LC | 低资源 Pass^1 | 低资源 Pass^3 | 低资源 LC |
|---|---|---|---|---|---|---|---|---|---|
| Claude-Opus-4.8 | 51.3 | 34.3 | 90.4 | 48.1 | 33.9 | 87.2 | 44.8 | 29.6 | 86.7 |
| GPT-5.6-Terra | 45.3 | 26.3 | 98.8 | 43.9 | 25.1 | 90.9 | 36.8 | 21.9 | 89.6 |
| Gemini-3.1-Pro | 45.9 | 27.4 | 98.6 | 42.4 | 25.8 | 87.5 | 36.4 | 21.0 | 83.8 |
| Qwen-3.7-Max | 45.8 | 32.4 | 89.0 | 42.9 | 29.5 | 86.9 | 40.1 | 27.6 | 84.9 |
| Qwen-3.8-Max | 49.8 | 33.8 | 89.9 | 46.4 | 32.3 | 86.2 | 43.7 | 28.1 | 84.1 |
5 分析
为更好理解多语言表现差距,我们分析失败模式、资源使用和语言一致性。我们考察错误如何随语言和模型变化,执行成本如何依赖于语言和任务类型,以及智能体在何处偏离目标语言。更多分析见附录 D。
表 6:VitaBench 上按模型与语言资源组划分的资源使用,相对于相同任务上的英语。 轮次统计智能体回复。常量(Const.)输入统计已翻译固定文本中的词元:系统指令、工具定义和初始用户消息。总输入与总输出统计每条轨迹的累计词元。颜色越深表示偏离英语(1.00 倍)越大:红色表示用量更高,蓝色表示更低。高资源组不含英语。
| 模型 | 高资源轮次 | 高资源常量输入 | 高资源总输入 | 高资源总输出 | 中资源轮次 | 中资源常量输入 | 中资源总输入 | 中资源总输出 | 低资源轮次 | 低资源常量输入 | 低资源总输入 | 低资源总输出 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-5.6-Terra | 0.98 | 1.31 | 1.20 | 1.13 | 0.97 | 1.41 | 1.26 | 1.21 | 0.97 | 2.51 | 1.92 | 1.60 |
| Gemini-3.1-Pro | 1.05 | 1.25 | 1.23 | 1.09 | 1.08 | 1.34 | 1.41 | 1.09 | 1.16 | 1.89 | 1.90 | 1.15 |
| Claude-Opus-4.8 | 1.03 | 1.24 | 1.21 | 1.07 | 1.03 | 1.53 | 1.45 | 1.27 | 1.05 | 2.20 | 2.06 | 1.66 |
| Qwen-3.7-Max | 0.86 | 1.15 | 0.78 | 0.94 | 0.95 | 1.23 | 0.96 | 1.05 | 1.03 | 2.10 | 1.69 | 1.65 |
| Qwen-3.8-Max | 0.98 | 1.14 | 1.10 | 1.15 | 0.99 | 1.23 | 1.20 | 1.26 | 1.01 | 2.09 | 1.80 | 1.54 |
低资源语言在对话轮数相近时产生更高的词元成本
在相同的 VitaBench 任务上(表 6),每个模型的常量输入、总输入和总输出比值都在低资源组最高。常量输入从高资源组相对英语的 1.14–1.31 倍,升至低资源组的 1.89–2.51 倍。此外,低资源的总输入和总输出分别达到英语的 1.69–2.06 倍和 1.15–1.66 倍,而轮次保持在 0.97–1.16 倍。这些结果与失败分析一起,促使我们为低资源语言构建更高效也更有效的多语言智能体。
表 7:VitaBench 与 DP-Shop(DeepPlanning 购物)上的低资源对话成本,为相同任务上英语用量的倍数。 轮次统计智能体回复,调用次数统计工具调用。
| 模型 | VitaBench 轮次 | VitaBench 调用 | DP-Shop 轮次 | DP-Shop 调用 |
|---|---|---|---|---|
| GPT-5.6-Terra | 0.97 | 0.93 | 1.14 | 1.31 |
| Gemini-3.1-Pro | 1.16 | 1.13 | 1.71 | 1.59 |
| Claude-Opus-4.8 | 1.05 | 1.03 | 1.49 | 1.66 |
| Qwen-3.7-Max | 1.03 | 1.09 | 1.67 | 1.80 |
| Qwen-3.8-Max | 1.01 | 1.00 | 1.68 | 1.79 |
低资源对话开销因基准和任务类型而异
在 VitaBench 上,轮次比值保持在英语的 0.97–1.16 倍,工具调用比值保持在 0.93–1.13 倍,说明对话长度和工具使用量的变化相对较小。相比之下,在 DP-Shop 上,低资源轨迹的轮次是英语轨迹的 1.14–1.71 倍,工具调用是 1.31–1.80 倍。我们推测,这一对比部分反映了任务类型:DP-Shop 要求智能体搜索商品目录,对语言敏感的查询匹配可能导致反复搜索和查询改写。这一搜索要求可能放大低资源对话开销,使多语言资源差距超出词元成本,延伸到更长的对话序列和更多的工具使用。
图 2:1,600 条失败的 VitaBench 轨迹的主要错误分布,按语言(上,每个面板 400 条)和模型(下,每个面板 320 条)划分。内环为宽泛类别;外环为常见子类型,并把每个类别中更少见的子类型合并。每条轨迹贡献一个主要错误。两环中的百分比都在每个面板的全部失败上计算,并四舍五入为整数。更多结果见附录 D。
资源更低的语言中,工具使用与控制流失败所占份额更大
使用 Gemini-3.7-Flash 以及附录 C 中的层次化分类体系,我们标注了 1,600 条失败的 VitaBench 轨迹,在四种语言、五个模型和四个领域上保持平衡。结果错误在所有语言中都占主导,其次是推理错误和工具使用错误(图 2,上)。英语和中文的分布相似,而泰语和泰米尔语的结果错误份额更小,工具使用与控制流错误份额更大,尤其是无成效循环。泰米尔语中明确与语言相关的错误份额最大,主要由工具误用驱动,例如参数使用了错误的语言。
结果错误在各模型中占主导,但推理与工具使用揭示出不同的失败画像
结果错误在所有模型中占主导(46–58%;图 2,下)。GPT-5.6-Terra 的工具使用错误份额最大(27%);缺失必要调用是其最常见的错误子类型(占失败的 22%),高于错误答案。Gemini-3.1-Pro 的推理错误份额最大(30%),主要是忽略上下文和错误推断;Claude-Opus-4.8 的推理错误与工具使用错误份额相近(各约五分之一)。与 Qwen-3.7-Max 相比,Qwen-3.8-Max 的推理错误份额更小(19% 对 25%),控制流错误份额也更小(3% 对 6%),但结果错误份额更大(58% 对 52%)。明确与语言相关的错误在各模型中占失败的 3–5%,主要涉及由语言引起的工具误用。
图 3:2,000 条随机抽取的 DeepPlanning 与 ClawEval 轨迹中、面向用户可见的语言不一致。 (a)各语言组的切换方向。(b)按基准划分的切换组件。
语言不一致以切换到英语为主,但受影响的组件因基准而异
五个模型在 DeepPlanning 上的语言一致性都低于 VitaBench 或 ClawEval(表 4)。我们在 2,000 条被标为语言不一致的、随机抽样的 DeepPlanning 与 ClawEval 轨迹中,标注切换目的地和受影响组件(图 3)。英语占已标注切换的 91.2%;中、低资源语言很少成为切换目的地。不一致主要发生在 ClawEval 的工具调用前文本前缀,以及 DeepPlanning 的助手回复中。人工检查每个基准 20 条轨迹后,我们发现 ClawEval 智能体常在工具调用前加上英语开场,例如 “Let me check the weather now”。类似地,20 条被检查的 DeepPlanning 回复中有 13 条在所需的 <plan> … </plan> 块之前加上英语文本,例如 “Let me compile a travel plan now”。我们推测这些开场来自训练数据,并把进一步研究留给未来工作。
6 结论
我们提出 BabelFlow,一套与具体基准无关的智能体化工作流,用于把已有智能体基准适配到新语言。把 BabelFlow 应用于四个互补基准,得到覆盖广泛语言与领域的 BabelArena。我们验证了 BabelFlow 的有效性,并在 BabelArena 上评测了五个前沿大语言模型智能体,发现没有任何模型在各基准家族和各语言上占优。对资源更低的语言,失败从答案质量转向工具使用与控制流错误,同时即使在成功任务上词元消耗也大幅增加。我们还观察到,语言不一致在工具调用之前的文本前缀中最为明显。这些发现表明,需要把任务完成与可靠性、效率放在一起评测。BabelArena 提供了一个广泛、受控的试验台,用以推进能够以用户自己的语言可靠且高效地服务用户的智能体。
人工智能使用声明
在准备本稿时,我们仅使用人工智能工具(Codex)来润色语言并提高表述清晰度。其使用限于纠正语法、改写作者撰写的句子,以及改善可读性与用词一致性。本研究的研究问题、核心思想、方法论、实验设计、分析以及科学结论均由人类作者形成,这些工具没有生成任何主张、结果或参考文献。每一处人工智能辅助的编辑都至少由两位人类作者审查正确性。我们对本文的最终内容负全部责任。
关于源文范围
所给源文在「人工智能使用声明」处结束。目录中列出的参考文献以及附录 A(语言一致性检查)、附录 B(质量保证)、附录 C(错误分类体系与标注,含抽样与标注、标注提示)和附录 D(关于失败类型与资源成本的更多分析,含 D.1 失败类型细分、D.2 资源核算与配对比较、D.3 低资源语言中重复检索增加交互成本)的正文未包含在源文件中。参考文献按翻译要求从略;附录正文未出现在源文中,故不编造。
署名与许可
- 原文:BabelArena: A Large-Scale Multilingual Benchmark for LLM Agents,arXiv:2609.23490
- 原作者:Kuang Peng、Yuchun Fan、Jiangnan Li、Minghao Wu、Jialong Tang、Haoran Wei、Weixuan Wang、Jianhong Tu、Baosong Yang、Tong Xiao
- 许可:原文以 CC BY 4.0 发布
- 译者:智测团队
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.