CodexQA

Industry & PracticeResearch & Benchmarks

固定微调把 IFEval 打掉 7.7 分:淘宝直播用四套尺子看模型能不能跟着 Harness 改

CodexQA 团队8 min read

978 条真实直播间上,HAT 平均分 94.8,基座 80.3。固定 Harness 微调把 IFE-P 从 81.5 打到 73.8。线上七天 GMV 人均 +5.54%,没有置信区间。

In this piece

固定微调把 IFEval 打掉 7.7 分:淘宝直播用四套尺子看模型能不能跟着 Harness 改

阿里淘宝直播 TaoLive AIGC LLM Team 的技术报告 Training Agents to Evolve with Their Harness。页面版本是 arXiv 2608.15763v1,水印日期 2026 年 8 月 16 日。许可证是 CC BY 4.0。单位标识是淘宝直播和阿里。

Harness 在这里指模型权重之外、可以单独改的那一层:Skills、Hooks、提示词和工具。HAT(Harness-Aware Training)是他们的训练法:训练时故意换这些配置,让小模型读当前这份 Harness,而不是背住某一版。对照的基座是 Qwen3.6-35B-A3B。Qwen3.6-35B-A3B 是通义的混合专家模型,总参数 35B,推理时激活约 3B。IFEval 是公开的指令遵循基准,用官方评测器打分。

离线四套,外加 100 条部署回放

第 4 节把评测源写成一张表。直播问答和 Harness 变体都来自真实直播间,各 978 条。工具与提示鲁棒性是用真实场景种子扩出来的合成集,2023 条。IFEval 用公开集,541 条。另有 482 条人工标注的真实直播间样本,只用来校准裁判、兼作 Harness 改动的开发集,不拿来给策略打分。部署回放 110 条,其中 10 条热身,指标算在剩下的 100 条上。

直播问答和 Harness 变体用带 Harness 的 Agent 当裁判。Accuracy 是二分:事实错误、没有依据的商品说法、虚假承诺、能力说过头,都算错。Effectiveness 看有没有接住观众意图,分值只有 0、0.5、1。AVG 是单条样本上这两项的算术平均,先平均再取整之前就算好。

工具鲁棒性看三件事:ADR 是不是回应了核心问题,RC 是不是用上了工具返回的必要信息,TC 是不是叫了该叫的工具。提示鲁棒性把 RC、TC 换成 LLM 和 TCO:LLM 看回答是否满足当前指令约束,TCO 看工具调用顺序对不对。

IFEval 报两个数。IFE-P 是整段提示里的指令全部满足才算过。IFE-I 是按单条指令算。

部署回放的墙钟延迟是从收到问题到拿到最终回答。TTFT 是到第一个 token 的时间。执行成功只表示这次 Agent 请求跑完,不表示回答对。15 秒达标率的分母是全部被测请求。每条请求走完整 Agent,同一份 Harness 提交,真实 MCP 服务,最多四轮,工具超时 5 秒。生成温度 1.0,top-p 0.95。基座和任务模型都是 BF16,单卡 H20,张量并行和流水并行都是 1。投机解码开 3 步、4 个草稿 token。对照的大模型走百炼 API,不在这张卡上。

直播问答平均 94.8,固定微调把通用指令打下去

表 3 的直播问答 AVG:基座 80.3,固定 Harness 的普通微调 89.5,HAT 94.8。HAT 的 Accuracy 95.8,Effectiveness 93.8。同一张业务集上,文中点名的最强通用模型平均分是 GLM-5.2 的 93.0。Qwen3.7-Max 的 Accuracy 是 93.8,平均分 92.5,没有超过 HAT 的 94.8。

Harness 变体上,基座平均只有 75.4,其中 Effectiveness 62.1。普通微调 88.2。HAT 94.6。

IFEval 上基座 IFE-P 81.5、IFE-I 87.7。普通微调掉到 73.8 和 82.4,相对基座是 −7.7 和 −5.3。HAT 是 83.5 和 88.7,相对基座 +2.0 和 +1.0。提示鲁棒性平均分,普通微调比基座低 4.6(68.2 对 72.8),HAT 是 77.6。

工具鲁棒性上 HAT 的 ADR 99.1、TC 94.7,但 RC 只有 70.1,平均 84.0。提示鲁棒性的 TCO 是 65.3。工具叫对了,不等于把工具结果用进回答,顺序约束也还没过线。

文中的读法是:只在一版 Harness 上做监督微调,业务分会升,提示鲁棒性和 IFEval 会掉,像是在背这一版配置。

消融是单次运行,增益主要来自微调阶段的扰动

表 4 每一行都是在上一行检查点上再加一阶段。箭头是描述性差值,不含重训方差。

不扰动的路径:监督微调把直播问答从 80.3 拉到 89.5,同时把提示鲁棒性打到 68.2、IFE-P 打到 73.8。接着做通用域的 on-policy 蒸馏,IFE-P 回到 82.3。再在原 Harness 上做强化学习,直播问答到 95.1,提示鲁棒性又掉回 66.7。

扰动路径:扰动微调后 IFE-P 仍是 81.7,几乎没掉。加上通用蒸馏是 81.9。在原环境做强化学习,直播问答 94.1,提示鲁棒性 78.7。再把强化学习也放到扰动环境里,直播问答 94.8,Harness 变体 94.6,IFE-P 83.5,提示鲁棒性 77.6。最后这一步业务分只加 0.7,提示鲁棒性还降了 1.1。

表 5 把强化学习和蒸馏放在同一起点上比。原环境下,强化学习比蒸馏高 0.1(直播问答)、0.2(IFE-P)、4.8(提示鲁棒性)。扰动环境下对应差距是 0.9、1.8、2.1。作者把带星号的 HAT 检查点写成工程上的工作点,不是统计显著的方法结论。这些都是单次运行。

表 6 拿掉通用蒸馏,单独看扰动加在哪一阶段。相对标准微调加标准强化学习(IFE-P 71.3),只扰动强化学习是 +1.0(72.3),只扰动微调是 +9.4(80.7),两阶段都扰动是 +10.0(81.3),但直播问答平均掉到 93.3。正文据此说,IFEval 上的主要收益在微调阶段。

延迟只在 1 到 2 路并发里过线

表 7 每行都是同一批 100 条完整 Agent 请求。任务模型开投机解码、并发 1 时,墙钟 P50 3.407 秒,P95 8.114 秒,15 秒达标率 100%,执行成功 100%。并发 2 时 P95 9.047 秒,达标率仍是 100%。同一检查点关掉投机解码,并发 1 的解码吞吐从 160.30 token/s 升到 271.40,约 1.69 倍;并发 2 从 129.22 升到 196.15,约 1.52 倍。

作者写明:跨检查点的解码速度不能当成核函数谁更快,因为轨迹长度不同。加速证据只用同一检查点的开关对比。离线质量表用的是关掉投机解码的结果。同一裁判、同一直播问答集上,打开后 Accuracy 96.22、Effectiveness 94.22,关掉是 95.8 和 93.8,这一次没有看到汇总质量下降。

API 路线在并发 1 时 P95 超过 21 秒。DeepSeek-V4-Flash 是 21.191 秒,15 秒达标率 71%。DeepSeek-V4-Pro 是 28.882 秒,达标率 61%。硬件、批大小和服务负载都看不见,只当作端到端运行参照,不是同机对比。

并发 4 到 8 被标成压力测试:投机解码的吞吐收益降到 1.27 倍和 1.19 倍,而且不再改善 P95。线上策略按每副本 1 到 2 路并发来配,不够就加副本,不把投机解码当成高并发的通用加速。

改完 Harness 再测留出的 1000 条

另抽 1500 条真实线上流量:500 条开发、1000 条留出。开发集只用来看坏例子并改系统提示和 Skills,权重不动。同一套改动同时套到普通微调和 HAT 上。表 8 计的是检出错误条数,越低越好。普通微调从 149 降到 122,相对下降 18.1%。HAT 从 238 降到 115,相对下降 51.7%。改完之后 HAT 的错误数更低,但改之前 HAT 的错误数比普通微调多 89 条。

盲测 100 条里 64 条打平

100 条按全量池的场景比例分层抽取,随机种子固定。同一输入两边各跑一遍,标注时打乱成 A/B,不展示系统名。选项是 Harness 更好、ReAct 更好、或打平。ReAct 指边推理边调工具的常见循环。非打平必须写短理由。100 条事后都做了一致性复查。

结果是 Harness 更好 35 条,打平 64 条,ReAct 更好 1 条。有明确偏好的 36 条里 Harness 占 35 条,非打平胜率 97.2%。相对「两边一样好」的双侧二项检验,p < 0.001。唯一一条 ReAct 更好的,是一条含糊短评:Harness 对上了一条不相关的常见问题答复,ReAct 给了更稳的过渡。作者把它当成单条兜底失败,不是反复出现的劣势。

35 条胜出的归因是事后按理由归类:输入理解更准 12 条(34.3%),输出更可靠 8 条(22.9%),场景行为更合适 8 条(22.9%),回答质量更高 5 条(14.3%),工具使用更合适 2 条(5.7%)。前三类合计 80.0%。

线上七天:桶不对称,没有区间

淘宝直播数字人生产环境里,按用户分桶,对照是已有的 ReAct 系统。七天快照时,对照桶 678,598 人,实验桶 75,754 人,大约是 89.96% 和 10.04%。比的是完整生产版本,不是只换一个检查点。

人均 GMV 是多日累计确认收货金额除以桶内用户数。人均订单是完成订单数除以同一分母。表 11 只给相对对照的变化:确认收货 GMV 人均 +5.54%,完成订单人均 +0.80%。正文写明实验仍在进行,这是前七天未调整的点估计,没有置信区间,也没有显著性检验,桶大小不相等,原始总量不能直接比。

发布门槛在第 6 节写成三道:15 秒延迟、业务回归、通用能力。策略版本和 Harness 版本分开开关。高严重错误被点了三类:没有依据的店铺或商品说法、谎称有真人在驱动数字人、工具反复失败或漏参数。商品、价格、库存、促销必须落在对应工具结果上。兜底是首调用超时 3 秒、后续 2 秒、整条轨迹预算 10 秒,仍失败就保守回复或干脆不在公屏说话。

这些数不能被读成什么

94.8 是 978 条真实直播间上、Accuracy 和 Effectiveness 的样本内平均,裁判是他们自己的 Harness Agent。482 条人工标注集被写明用来校准裁判,第 4 到第 6 节没有给出一致率。没有这一个数,94.8 和人评之间差多少不知道。

94.8 对 93.0 只在这套业务集、这一份 Harness 上成立。大模型走 API,小模型在单卡 H20 上,质量表和延迟表不是同一套服务条件。

−7.7 是普通微调相对基座的 IFE-P 差,不是 HAT 的差。HAT 的 IFE-P 只比基座高 2.0,到 83.5,仍低于表里 DeepSeek-V4-Flash 的 90.0 和 Qwen3.7-Max 的 90.4。

表 4、表 5、表 6 都是单次运行,箭头不含重训方差。扰动强化学习那一步把提示鲁棒性从 78.7 降到 77.6。表 6 里两阶段都扰动时,直播问答平均是 93.3,低于只做标准强化学习的 95.1。

表 8 的 51.7% 是错误条数的相对下降。改之前 HAT 有 238 条错误,普通微调只有 149 条。留出集测的是「同一套人工改动谁降得多」,不是改之前谁的直播话术更干净。

盲测的 97.2% 分母是 36 条非打平,不是 100。100 条里 64 条打平。p 值针对的是这 36 条里两边是否一样经常赢。

线上 +5.54% 和 +0.80% 是七天、10% 流量、没有区间的点估计,实验当时还没结束。不能写成已经显著的成交提升。P95 8.114 秒只在并发 1、打开投机解码、单卡 H20 的回放里成立。并发再高,文中写投机解码不再改善 P95。

出处:阿里淘宝直播,TaoLive AIGC LLM Team,Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report,2026-08-16,https://arxiv.org/abs/2608.15763v1

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction