Industry & PracticeResearch & Benchmarks
AIME24 到了 23.75 %, 业务 上 的 12 % 没 写 指标 名: 美 团 GeoRA
美团 GeoRA 把低秩适配对齐到 RLVR 的更新几何。Qwen3-8B 的 AIME24 为 23.75%。招聘场景相对 LoRA 约提升 12%,原文没有写出这个 12% 的指标名。

In this piece
AIME24 到了 23.75%,业务上的 12% 没写指标名:美团 GeoRA
美团技术团队在 2026 年 8 月 27 日解析了履约技术团队与北京大学的 GeoRA(Geometry-Aware Low-Rank Adaptation)。它是给 RLVR 用的低秩适配,不是把 SFT 上的 LoRA 先验原样搬过来。这篇同时给了论文实验和 AI 骑手招聘场景的落地数字,两边的分母不一样。
先承认两种错位
RLVR(用可验证奖励做强化学习)的有效更新分散在稀疏子空间里,并且倾向于避开预训练权重的主方向。LoRA 用高斯和全零初始化,不看预训练权重。PiSSA 把可训练预算分给主奇异方向。MiLoRA 取尾部奇异方向。这些先验主要在 SFT 上设计和验证。PiSSA 把更新推向主成分,和 RLVR 偏好的子空间冲突,原文说实验里它更容易崩溃。
另一边是工程错位。直接对那个稀疏子空间做稀疏微调,更新模式更接近 RLVR,但 GPU 对非结构化稀疏并不划算。效率实验里,SparseFT 把训练参数降低 68.0%,训练耗时却增加 10.8%。GeoRA 要的是:先定位契合 RLVR 的稀疏子空间,再用低秩稠密的方式训练它。
两个掩码几乎不重叠
构造只在训练开始前做一次。训练阶段的计算图和标准 LoRA 一样。
两个掩码共用稀疏率 ρ。谱先验先对权重做秩为 r 的低秩近似,再选出其中幅值最小的 ρ 比例位置,避开主成分里的高幅值、高曲率区域。欧氏先验直接在原始权重上选出幅值最小的 ρ 比例位置。几何约束矩阵取两者的并集。
在 Qwen3-8B 上取 ρ = 0.2,两个掩码各选中 20.0% 的参数,交集只有 4.55%,Jaccard 相似度只有 0.128。消融说去掉任何一个先验都会掉点。原文没有给出这个消融的绝对分。
接着对几何子空间做 SVD,取前 r 个奇异分量初始化低秩矩阵。取的是这个子空间的 top-r,不是原始权重的 top-r。残差权重冻结。初始化时两项加起来等于原权重乘输入,模型输出不会突变。原文把这一点和 RLVR 绑在一起:初期输出扰动会污染 rollout 的采样分布。
论文实验给了少数绝对分
主实验在 DeepMath-103K 上用 GRPO,对 Qwen3-8B 和 Llama-3.1-8B 做数学 RLVR。对照是 LoRA、PiSSA、MiLoRA、SparseFT 和全参微调。另外在 4B 和 1.5B 上用 GSM8K 做规模验证。原文没有写出 GSM8K 的分数。
分布内数学基准上,两个骨干都是 GeoRA 整体最强。竞赛难度上对低秩基线的领先更一致:Qwen3-8B 的 AIME24 达到 23.75%,略高于全参微调。没有写出全参微调的 AIME24 分数,也没有写出其余数学基准的绝对分。
分布外:全参微调在 IFEval、TruthfulQA 上明显回退,GeoRA 基本无损。HumanEval 从 76.83 提升到 82.93。原文没有给 IFEval 和 TruthfulQA 的回退幅度,也没有写明 HumanEval 是哪个骨干、什么协议。
医学和代码的扩展实验只写了结论:稳定优于低秩基线,并与全参微调相当。没有绝对分。训练动态说 GeoRA 全程领先,到达高位更早;学习率区间更宽,大学习率下其他方法明显下滑。这些没有配步数或奖励数值。
相对全参微调,可训练参数降低 99.5%,单步耗时降低 19.9%,显存占用降低 28.5%。谱分析用来解释为什么只训练 0.5% 的参数就能和全参效果相当:全参 RLVR 的实际更新 ΔW 本身就是重尾、可压缩的。模型范围写成 1.5B 到 32B 的 Qwen 与 Llama。0.5% 和前面的 99.5% 是同一件事的两种说法,不是另一组实验。
招聘场景的 12% 和论文分不是同一张表
业务场景是 AI 骑手招聘。Agent 多轮跟进候选人,目标可验证,包括约面、入职和 ROI。基模要大、单条轨迹上下文要长,所以强化学习开销高;垂直域要补的能力规模不大,低秩容量够用。业务训练里的体感是:LoRA、PiSSA、MiLoRA 效果差得明显,学习率调大就不稳甚至崩溃。
正在落地的 Agentic RL 实验写成两句。效果与全参训练相当,相比 LoRA 提升约 12%。效率与 LoRA 相当,显存相比全参训练降低 54%,配合 QLoRA 等量化还可以再降。没有写出 12% 的指标名、样本量、流量和实验窗口,不能把它当成 AIME24 或 HumanEval 的延续。
落地还有两条工程说明,不是效果分。随机 SVD 只算前 r 个奇异分量,72B 模型的这次预处理不到 1 分钟。参考策略不必再存一份完整权重:原始权重等于残差权重加初始适配器,在 actor 里多留一份冻结的初始适配器就能算出参考策略。
读的时候只保留原文给得出的边界:23.75% 只是 Qwen3-8B 的 AIME24;76.83 到 82.93 只写了 HumanEval,没有协议;68.0% 和 10.8% 是 SparseFT 的参数和耗时,方向相反;99.5%、19.9%、28.5% 是相对全参微调的训练成本;约 12% 和 54% 是招聘场景,12% 没有指标名。
出处:美团,美团技术团队,GeoRA: 为RLVR设计的LoRA——ACL 2026杰出论文解析,2026-08-27,https://tech.meituan.com/2026/08/27/ACL-Outstanding-Paper-GeoRA.html
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.