CodexQA

行业与实践研究与基准测试

问答最高 86.46%,改图代码只有 0.51–2.98:百度用 TikZ 测科学图

CodexQA 团队阅读约 5 分钟

百度 Diagram-MMU 用 3.7k 张科学图、18.3k 道题测十二个模型。问答最高 86.46%,被改部分的 CrystalBLEU 只有 0.51 到 2.98。Agent 小集上多数模型改图上升、问答下降,三件事都涨的只有 Claude-4.6 Opus。

本文目录

问答最高 86.46%,改图代码只有 0.51–2.98:百度用 TikZ 测科学图

百度与南京理工大学等的 Diagram-MMU(用 LaTeX 的 TikZ 代码看多模态模型能不能把科学图解析成可编译代码、按指令改图、再回答图上的问题),论文日期 2026-08-13,arXiv v1 戳记 2026-08-12(2608.12262)。项目负责人 Jingdong Wang(百度)。项目页 https://vi-ocean.github.io/projects/diagram-mmu 。许可证是 CC BY 4.0。

图集有 3.7k 张筛选过的科学图、18.3k 道人工核过的问题,六个域:图表、平面几何、三维、图结构、化学式、电路。十二个模型。闭源六个:Gemini-3.1 Pro、Gemini-3.0 Pro、Gemini-3.0 Flash、GPT-5.2、Claude-4.6 Opus、Seed-2.0 Pro。开源五个通用模型:Qwen3.5-397B-A17B、Qwen3-VL-235B-A22B、Kimi-K2.5、Qwen3-VL-8B、InternVL3-38B。另有 TikZero+10B,只在 456K 组图和 TikZ 代码上微调,没练过改图和问答,所以只测解析。

三件事。D2C-P 是图转代码,下面称解析。D2C-E 是按指令改代码,下面称改图。DQA 是看图问答。主表是 pass@1,六个域平均。对象级用 F1avg,也就是平均对象 F1。代码级用 CrystalBLEU,比的是代码结构,不是编译过没过。图像级 SC 是 SSIM 和 CLIP 的平均,越高越像。All 是 F1avg、CrystalBLEU 和 SC 的平均。问答用准确率。

Agent 设置另切小集,不能和主表混。小集 300 张图,每域 50 张,1500 条:解析 300、改图 600、问答 600。只跑六个模型。论文写明这不是完整的 Agent 能力谱,限制在附录 H。

基础能力:能答,写不对位置

表 5,pass@1。改图一格拆成留存和被改两部分。

模型解析 All对象 F1CrystalBLEU图像 SC改图对象 F1(留/改)改图 CrystalBLEU(留/改)问答
Gemini-3.1 Pro48.3849.9432.8862.3360.60/40.8442.02/2.9886.29
Gemini-3.0 Pro53.2854.6432.7672.4465.12/40.2444.77/2.3486.46
Gemini-3.0 Flash50.9751.1930.6771.0459.29/37.2442.21/2.1784.07
GPT-5.251.8851.3528.8175.4855.59/31.1538.75/1.1581.67
Claude-4.6 Opus52.4152.2331.2773.7362.56/31.9543.59/1.4268.75
Seed-2.0 Pro50.8947.5732.5672.5453.03/30.1437.49/1.4175.90
Qwen3.5-397B-A17B52.7251.3832.9273.8462.75/36.3543.66/1.9183.42
Qwen3-VL-235B-A22B55.9855.1137.9274.9063.79/33.3843.05/1.8563.60
Kimi-K2.556.9757.4836.1377.3163.12/36.5242.11/2.0279.74
Qwen3-VL-8B48.2644.6633.3166.8121.26/9.9516.29/0.5147.12
InternVL3-38B41.1331.4730.9161.0244.72/22.6933.13/1.2956.39
TikZero+10B25.3015.4317.1943.29不测不测不测

图像 SC:闭源 62.33 到 75.48,开源通用模型 61.02 到 77.31,差距小。CrystalBLEU:闭源 28.81 到 32.88,开源 30.91 到 37.92,也小。对象 F1:闭源挤在 47.57 到 54.64,开源从 31.47 拉到 57.48。TikZero+10B 的对象 F1 只有 15.43。图可以看起来像,对象可以认错。

改图里被改的那一部分,CrystalBLEU 只有 0.51 到 2.98,对象 F1 相对更高。模型能按指令生出对象,但位置或格式对不上标准代码。

问答最高是 Gemini-3.0 Pro 的 86.46%,Gemini-3.1 Pro 是 86.29%。Claude-4.6 Opus 问答只有 68.75%,解析 All 仍有 52.41。开源问答最高是 Qwen3.5-397B-A17B 的 83.42%。Kimi-K2.5 的解析对象 F1 是 57.48,开源最高,问答 79.74%。Qwen3-VL-235B-A22B 解析 All 55.98,问答掉到 63.60%。作者写 Gemini-3.0 Pro 最均衡。

pass@k 见文中图 5:k 变大时分数上升,从 pass@1 到 pass@2 涨最多,k 超过 4 以后饱和。图里没有逐点列表,这里不补数字。解析失败的图上,改图和问答也更低(图 7)。文中没有把这条拆成全模型的一张总表。

小集上的 Agent:改图涨,问答掉

图 4 是从小集的基础设定到 Agent 设定的差值。模型顺序是 Seed-2.0 Pro、Claude-4.6 Opus、GPT-5.2、Gemini-3.0 Pro、Gemini-3.1 Pro、Qwen3-VL-8B。解析对象 F1:+0.7、+2.1、−0.1、−1.0、−1.8、−2.6。改图只看被改对象的 F1:+1.4、+2.7、+3.0、+0.6、−0.3、+1.3。问答:−2.2、+0.4、−4.7、−1.0、−1.3、−1.0。三件事都涨的只有 Claude-4.6 Opus。GPT-5.2 解析 −0.1,改图 +3.0。除 Claude-4.6 Opus 外,问答都掉。

这张图的分母是小集,不是表 5。表 6 直接解析(S1)上,Seed-2.0 Pro 的对象 F1 是 44.4,和表 5 的 47.57 不是同一批图。

表 6 的直接设定:S1 是解析,S12 是问答。

模型S1 对象 F1S1 CrystalBLEUS12 准确率
Seed-2.0 Pro44.431.686.0
Claude-4.6 Opus48.530.680.7
GPT-5.248.927.987.7
Gemini-3.0 Pro50.930.888.3
Gemini-3.1 Pro47.131.690.2
Qwen3-VL-8B40.734.150.7

把图里的对象当上下文交给模型,相对直接设定:改图上留存对象 F1 增加 4.1 到 10.6 个百分点,被改对象增加 3.3 到 7.1 个百分点(表 7。Gemini-3.0 Pro 留存 +4.1、被改 +3.3;GPT-5.2 留存 +10.6;Seed-2.0 Pro 被改 +7.1)。解析上四个涨、两个掉:Gemini-3.0 Pro −2.0,Qwen3-VL-8B −6.1。代码级只有 Claude-4.6 Opus +0.3、Gemini-3.1 Pro +1.4。问答上多数受益,GPT-5.2 −7.3。

工具是一个 TikZ 检索服务,按 MCP 接上,模型自己决定查什么。Gemini-3.1 Pro 在解析上对象 F1 −4.3。轨迹里它反复查、没有停止条件,上下文被撑到长度上限截断。Qwen3-VL-8B 的查询不对题。Claude-4.6 Opus 解析对象 F1 +2.2,改图留存/被改 +4.4/+2.2。

状态是先写出 TikZ,再在这份代码上改或答。改图的留存对象 F1 多数下降。例外是 Claude-4.6 Opus +2.5/+2.6、GPT-5.2 +2.5/+3.5,两个数分别是留存和被改。问答只有 Claude-4.6 Opus +3.8、Seed-2.0 Pro +0.8,其余是 −1.3 到 −3.2。

规划要模型把几项拼在一起。问答里允许先写代码再答,六个模型都下降。再加上工具,Seed-2.0 Pro 在 S16 是 −8.8,GPT-5.2 是 −5.7。解析的 S5:Claude-4.6 Opus +5.1/+2.8,Seed-2.0 Pro +2.6/+1.5,两个数是对象 F1 和 CrystalBLEU。表 6 同一列上 GPT-5.2 是 −1.6/−4.1,Gemini-3.1 Pro −5.0/−4.5,Qwen3-VL-8B −5.6/−6.4。Gemini-3.0 Pro 这一列是对象 F1 +0.1、CrystalBLEU −0.5,不是全面下降。作者把规划写成最弱的一项:从解析加到问答,没有模型能稳定把几项能力拼起来。

表 7 直接改图 S6 的对象 F1(留/改):Seed-2.0 Pro 50.6/28.0,Claude-4.6 Opus 55.9/28.3,GPT-5.2 54.9/29.3,Gemini-3.0 Pro 58.8/36.1,Gemini-3.1 Pro 57.6/38.1,Qwen3-VL-8B 47.0/22.2。对应 CrystalBLEU(留/改):34.3/1.5、39.3/1.3、38.6/1.2、40.9/1.9、38.0/2.5、34.2/0.8。被改部分的代码分仍在 1 上下。

限制

附录 H 写了三件事。评测不覆盖写作里的起草、引文和排版,也不覆盖长程拆任务、多工具编排、用执行结果自我修正、以及和人来回改。代码只认 TikZ,不含 Matplotlib、Seaborn、SVG,也不含 pstricks、xy-pic。问答还不是专家级,也没有把论文里的图注接进来。

13 名标注者交叉核对超过 2000 张图,其中 3 人是合作者。这不等于 3.7k 张都在致谢名单里逐张点过。Agent 数字来自 300 张的小集。图 5 只描述 pass@k 的形状,没有逐点列表。没有线上写作产品的采纳率。

百度、南京理工大学等,Weihao Bo、Shan Zhang、Yanpeng Sun、Jie Liu、Yongke Yao、Jinhao Du、Wei He、Kai Zou、Zechao Li、Jingdong Wang,Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams,2026-08-13,https://arxiv.org/abs/2608.12262

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误