PinchBench: 百度 AI 搜索 如何 公开 一套 端 到 端 Agent 评 测 流程
百度 AI 搜索团队公开的 PinchBench-Evaluation 仓库,展示了 Orion-Mission-Mode 在真实工作任务上的评测流程:原始输入直接注入系统,Agent 自主调度工具并交付文件或报告,再由脚本检查与 LLM 评审共同打分。

PinchBench:百度 AI 搜索如何公开一套端到端 Agent 评测流程
百度 AI 搜索团队公开的 PinchBench-Evaluation 仓库,展示了 Orion-Mission-Mode 在真实工作任务上的评测流程:原始输入直接注入系统,Agent 自主调度工具并交付文件或报告,再由脚本检查与 LLM 评审共同打分。
一、从问题到可验证交付物
PinchBench 的任务不是单轮问答,而是要求 Agent 处理 CSV、日志、PDF 合同、会议记录和代码环境等输入,完成研究、分析、写作、开发或办公自动化,并留下可验证产物。
百度团队在仓库中公开了 147 个任务的输入、输出、任务说明和评分明细,使外部读者能够追踪一个具体 Case 如何被理解、执行和判分。
二、标准化评测流水线
1. 原始注入
按照任务定义,把初始文件、上下文和高层指令直接注入 Orion-Mission-Mode,而不是为某个模型额外改写问题。
2. 智能执行
系统通过“指挥官—规划师—执行者”的多智能体协作方式,在本地沙箱中完成多步推理和工具调度,输出代码、报告或其他交付物。
3. 双轨判分
可量化部分由自动脚本检查文件存在性、格式、数值和有效性;开放式质量由 Claude LLM Judge 按预设标准评审。两者共同写入 evaluation_score.json,兼顾确定性与语义质量。
三、公开结果与解读边界
仓库记录显示,2026 年 7 月 17 日百度 AI 搜索任务化模式在 PinchBench 榜单取得 94.6% 综合成功率和 94.4% 平均得分。147 个任务覆盖内容创作、日志分析、会议文档、数据分析、代码运维、安全排查等场景。
其中,公开汇总给出了内容创作、日志分析、会议分析等切片成绩。阅读这些结果时,应区分“该系统在其适配后的公开任务上表现突出”和“所有企业 Agent 都能达到同样水平”这两个命题。榜单结果不能替代在自有文件、权限和工具环境中的复测。
四、这套流程值得借鉴的地方
- 输入不做过度简化:保留真实文件和噪声,避免评测只剩模板题;
- 产物优先:检查文件、代码、图表和数值,而不是只看聊天文本;
- 客观与主观分轨:脚本负责确定性检查,模型裁判负责开放质量;
- 结果可回放:保存任务快照和评分理由,便于定位失败根因;
- 适配要透明:如果改变路径、格式容差或评分规则,必须公开说明。
PinchBench 的重要价值,是让“Agent 做得好”变成一套可以复现、检查和讨论的执行记录。企业落地时,应进一步加入权限越界、敏感数据处理和人工确认门槛。
出处:百度 AI 搜索团队,PinchBench-Evaluation,2026-07-17,https://github.com/Baidu-AI-Search/PinchBench-Evaluation
出处:百度,百度 AI 搜索团队,PinchBench-Evaluation,2026-07-17,https://github.com/Baidu-AI-Search/PinchBench-Evaluation。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。