CodexQA

行业与实践研究与基准测试

EdgeBench:Agent 如何从真实环境中学习

CodexQA 团队阅读约 2 分钟

字节 Seed 用 134 个日级任务和约 3.8 万小时交互,评测 Agent 在真实反馈中随时间改善的能力;总体表现呈对数 S 形,学习速度约每三个月翻倍。

EdgeBench:Agent 如何从真实环境中学习

字节跳动 Seed 团队于 2026 年 7 月 7 日发布 EdgeBench,关注 Agent 在真实环境、持续反馈和长时间运行中能否不断学习并改善表现。

从“会什么”转向“能学什么”

多数基准测量模型已经掌握的知识与能力。EdgeBench 则把 Agent 放进接近真实工作的环境,观察它如何通过尝试、观察反馈、吸收经验和改进方案完成任务。

基准包含 134 个任务,覆盖科学与机器学习、系统与软件工程、组合优化、专业知识工作、形式化数学与定理证明、交互式游戏与模拟器六类领域。每个任务支持至少 12 小时连续运行,部分扩展实验超过 72 小时;已公开 51 个任务和完整评测框架。

环境学习的规模规律

官方介绍基于约 3.8 万小时环境交互数据,发现整体 Agent 表现随交互时间呈现稳定的 log-sigmoid 曲线,平均拟合优度 R² 达到 0.998。单个任务可能出现长时间平台期和突然跃升,但将 134 个任务的轨迹按交互时间汇总后,群体趋势更加清晰。

在一个 12 小时引力波任务示例中,GPT-5.5 的得分从 42.8 提升到 67.0,经历 247 次评分尝试。提升并非简单重复调参,而是 Agent 根据反馈重新定义问题、拆解失败、定位瓶颈,并保留有效部分后继续修正。

官方还比较了 2025 年 9 月至 2026 年 5 月发布的连续模型代际,在初始表现相近的 18 个任务上进行两小时评测。结果显示,前沿模型的环境学习速度接近每三个月翻倍;这一结论描述的是官方实验窗口内的观察趋势,不应外推为长期保证。

对企业 Agent 评测的启示

EdgeBench 将评测重点从一次性提交推进到持续交互:

  1. 任务应提供可验证的中间反馈,而非只给最终成败;
  2. 评测应保留完整学习曲线,报告不同时间预算下的表现;
  3. 运行环境、评分器和权限边界应分离,降低奖励劫持风险;
  4. 应记录检查点、失败原因和策略变化,便于分析 Agent 是否真正从环境中学习。

EdgeBench 的边界也很明确:完整基准并未全部公开,长时运行成本较高,模型、Harness 与基础设施差异都会影响结果;总体曲线不能替代单任务失败分析。

来源:ByteDance Seed 官方介绍《EdgeBench: Measuring Real-World Environment Learning and Discovering a New Scaling Law》,2026-07-07。

官方项目:https://seed.bytedance.com/edgebench 官方页面:https://seed.bytedance.com/en/blog/edgebench-measuring-real-world-environment-learning-and-discovering-a-new-scaling-law 论文:https://edge-bench.org/paper.pdf 代码:https://github.com/ByteDance-Seed/EdgeBench 数据:https://huggingface.co/datasets/ByteDance-Seed/EdgeBench

出处:字节,字节跳动 Seed 团队,EdgeBench: Measuring Real-World Environment Learning and Discovering a New Scaling Law,2026-07-07,https://seed.bytedance.com/en/blog/edgebench-measuring-real-world-environment-learning-and-discovering-a-new-scaling-law。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误