Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “智能体评测”
Research & Benchmarks//44 min
随着大语言模型(LLM)智能体越来越多地通过 MCP 等标准化协议与外部工具交互,工具接口设计成为一个关键却研究不足的因素。功能如何被分解为工具,会影响智能体能否选对工具并构造出合法参数。这一选择在边缘侧尤其关键:资源约束限制了哪些模型可以
Research & Benchmarks//39 min
大语言模型(LLM)智能体越来越多地通过工具使用以及与用户和环境的交互来执行多步骤工作流。然而,现有智能体评测大体以英语为中心,限制了我们对智能体在多语言场景下能力的理解。我们提出 BabelFlow,一套与具体基准无关的智能体化工作流:它
Research & Benchmarks//33 min
生产环境中的大语言模型智能体在持续演进中会被反复评测,但完整的智能体基准每次重跑代价很高。我们研究一种服务于每月数万活跃用户的生产分析智能体的高效重复评测,并报告一手部署经验。我们使用该生产基准的 574 次历史运行,按时间顺序划分为标定期
Research & Benchmarks//55 min
前沿模型在浅层文档/图表阅读任务上得分很高。在一次受控的数据室审计中,把证据移入埋没条件后,准确率下降,强制声明增加,工具调用增加,每个正确答案的成本也增加。置信度与基准校准并不能完全抓住错误答案;一起有记录的生产事故表明,捏造的结构性主张
Research & Benchmarks//21 min
智能体基准评测政策遵从,却假定每一条政策都能确定唯一正确的动作。自然语言政策会因沉默、歧义或自相矛盾而违背这一假定,从而允许多种站得住脚的解读,而单一金标准轨迹无法覆盖这些解读。我们对 τ²-bench 的两个领域做了审计,建立了此类政策漏
Research & Benchmarks//53 min
智能体评测在数值上可以是正确的,同时所度量的构念却不同于其标签所暗示的构念。我们对选定的 Praxa AI 实现文件、历史评测产物与运行记录做了一项回顾性度量审计。一份含 139 个用例的离线路由报告有 112 次通过、27 次失败,尽管门
Research & Benchmarks//32 min
生成式人工智能智能体的持续部署,所要求的不止是孤立任务上的成功。智能体必须在反复交互、条件变化,以及对共享工作流中人员的依赖之下仍然有用,尤其是当技术、人员与运营方面的扰动随时间累积时。我们提出**运行韧性**(operational re
Research & Benchmarks//38 min
现有基准并不检验语言智能体与人类用户的交互,也不检验其遵循特定领域规则的能力,而这两者对于把它们部署到真实世界应用都至关重要。我们提出 τ-bench,这一基准模拟用户(由语言模型模拟)与语言智能体之间的动态对话;该智能体配备领域专用的 A
Research & Benchmarks//31 min
尽管人工智能基准测试进步迅速,基准成绩在现实世界中究竟意味着什么,仍然不清楚。为了用人类能力来量化人工智能系统的能力,我们提出一项新指标:50% 任务完成时间视界(50%-task-completion time horizon),即人工智
Research & Benchmarks//36 min
BenchShield 讨论如何用形式化模型支撑的插桩,检查智能体评测里的奖励是否被篡改。
Research & Benchmarks//28 min
BenchShield 讨论如何用形式化模型支撑的插桩,检查智能体评测里的奖励是否被篡改。