研究与基准测试/2026-10-05/12 分钟失败透明的智能体:工具失败之后,模型还会不会谎报成功FTA 把失败轨迹事先固定,只评测最终报告是否被证据支持。六个模型、3600 条人工标注里,基线虚假成功 22.8%,透明指令 9.3%,结构化证据契约 0.8%,有用回答不降反升。