研究与基准测试/2026-09-30/6 分钟OpenAI Cookbook:用轨迹、评测和 Codex 把 Agent 改进转起来Wesley Pasfield 在 2026 年 5 月的笔记本里搭了一条闭环:真实轨迹、人工和模型反馈、Promptfoo 评测、HALO 排序,再交给 Codex 改支架。评论先过,再考虑自动合并。
研究与基准测试/2026-09-30/6 分钟榜首模型不一定该上线:公开基准之外怎么评测整套系统deepsense.ai 认为 2026 年的公开基准更接近真实工作,但仍然只够做能力筛选。上线要评模型、支架、工具、成本和业务结果,而不是只看榜单。