CodexQA

Industry & PracticeResearch & Benchmarks

公开榜 9B 总分 80.6,线上 14 次实验没有幅度:微信视觉把嵌入模型拆开测

CodexQA 团队5 min read

MMEB-v2 上 9B 总分 80.6,视频总分 74.3 仍低于对照。内部 26 项平均 72.0,只比了一个 2B。线上 14 次 A/B 没有给出涨幅。

In this piece

公开榜 9B 总分 80.6,线上 14 次实验没有幅度:微信视觉把嵌入模型拆开测

腾讯微信视觉团队的技术报告 WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report。页面版本是 arXiv 2608.24053v1,水印日期 2026 年 8 月 25 日,正文也写了 August 25, 2026。许可证是 arXiv.org 的永久非独占许可。单位是 WeChat Vision, Tencent Inc.。

WeMM-Embedding 是一组多模态嵌入模型。嵌入在这里指把图、视频、文档或一段字压成同一空间里的向量,后面用距离做检索或匹配。报告给了 2B、4B、9B 三档。评测分成公开的 MMEB、12 个跨模态检索集、微信内部 26 项,以及已经上线的推荐和搜索。MMEB 是多模态嵌入基准,v2 覆盖图、视频和视觉文档,v3 再加文本、智能体、音频。

不支持的音频记 0 分,再算进总分

第 4.1 节按基准自己的指标来。图像、视频、音频和智能体任务用 Hit@1,也就是正确条目排在第一位的比例。文本和视觉文档用 NDCG@5,相关条目越靠前分越高。

MMEB-v2 有 78 个数据集。表 1 的对照成绩取自官方榜。带剑号的是闭源提交,没有公开权重,也没有公开接口。带星号的是参数量没写明的商业模型。榜上 2B 这一档,WeMM-Embedding 总分 77.9。Qwen3-VL-Embedding-2B 是 73.2,差 4.7。DME-Small 是 74.8,差 3.1。4B 总分 79.2,高于表里 Qwen3-VL-Embedding-8B 的 77.8。9B 总分 80.6,高于 DME-Large 的 80.2 和 Octen-VL-Large 的 80.1。

总分第一不是每一列第一。9B 的视频总分 74.3,低于 Octen-VL-Large 的 76.0。图像问答 82.2,低于 Octen 的 84.5。视觉文档 83.3,低于 DME-Large 的 83.4。图像定位 95.6,低于 QQMM-embed-v4 的 96.1。2B 的图像定位 94.0,也低于同尺寸 DME-Small 的 94.3。

MMEB-v3 把任务数加到 190:原来的 78,加上文本 53、智能体 47、音频 11、MCMR 1。智能体 47 项里,工具检索 35、界面检索 8、记忆检索 4。文本 53 项再拆成推理检索、指令遵循、长上下文、多条件、一般检索。模型不支持的任务记 0。当前这组模型不吃音频,所以 11 项音频都是 0。对照里有的模型有音频分,例如 E5-Omni-7B 的音频是 43.0。零分记进 V3-All,是把 WeMM 的总分往下拉,不是把它垫高。新增任务的对照来自 MMEB-v3 论文或榜单提交,榜单截止 2026 年 8 月 24 日。有四家的 V3-All 是作者用它们原来的 v2 分数,加上 v3 新任务重算的。

表 2:2B 的 V3-All 56.0,文本 45.3,智能体 45.1。同表 Qwen3-VL-Embedding-2B 是 50.9、39.2、39.3。4B 是 58.2、47.9、49.0。9B 是 59.5、48.8、51.0,音频仍是 0。9B 的智能体细分:工具 53.0,界面 43.3,记忆 48.9。文本细分不是全高。9B 的多条件检索 58.3,低于 Tianmu-Emb-Uni-8B 的 63.4,也低于 Qwen3-VL-Embedding-8B 的 61.2。9B 的一般检索 61.1,低于 GME-8B 的 62.5。

12 个公开检索里,9B 有两项低于自己的 4B

第 4.2 节是 12 个公开集,分四组。文到图、图到文用 Recall@1。文到视频、文档检索用 NDCG@10。Gemini Embedding 2、Amazon Nova MME、Voyage Multimodal 3.5 三家的数,引自 Gemini Embedding 2 的技术报告,不是微信这次重跑的。Qwen3-VL-Embedding 和 WeMM 是作者在公开集上自己测的。

12 项平均:Gemini Embedding 2 为 79.5,Qwen3-VL-Embedding-8B 为 76.7,WeMM 的 2B、4B、9B 为 79.8、80.8、81.7。文到图的四项均值,9B 是 83.6,Gemini 是 83.8,9B 没有超过这列。图到文均值 4B 是 91.4,9B 是 90.3,放大尺寸在这组均值上是降的。单看 Flickr30k 的图到文,4B 96.6,9B 94.4,Gemini 97.4。TextCaps 的文到图,4B 85.8,9B 85.2。文档检索 ViDoRe V2:2B 61.4,低于 Gemini 的 64.9 和 Voyage 的 65.5;9B 升到 66.3,这列才到表里最高。

内部 26 项只比了一个开源 2B,线上没有幅度

第 4.3 节是微信内部 26 项,五类:分类 4、搜索 7、跨域内容匹配 4、文章相关 4、视频相关 7。表 4 只放了 Qwen3-VL-Embedding-2B。平均 60.9 对 72.0。分类 60.1 对 72.6,搜索 51.9 对 65.5,跨域匹配 55.5 对 73.7,文章相关 75.5 对 86.4,视频相关 64.9 对 68.8。表头没有写这五类用的是 Hit@1、NDCG 还是别的业务分,也没有样本量。

同一节写模型已经用在公众号、视频号和电商内容的推荐里,也用在微信搜索,覆盖视频号、公众号文章和朋友圈。表示会进候选召回、排序特征、用户序列和跨域理解。截至成文,14 次在线 A/B 都有提升,并已推到生产。正文没有给出任何一次的相对涨幅、实验时长或流量比例。结论里复述了「14 次在线 A/B」和「26 项内部基准」,仍然没有数。

小规模消融的 71.9,不能拿去和主表的 77.9 比

第 4.4.2 节是另一套小规模实验,2B,同样报 MMEB-v2。完整配置总分 71.9,图像 76.1,视频 59.1,视觉文档 75.3。这和表 1 的 2B 总分 77.9 不是同一次训练。去掉任务指令降到 71.1,视觉文档掉得最多,75.3 到 73.8。去掉任务一致的组批,降到 68.5,是这三项里掉最多的,3.4 分。组批指一个 batch 里尽量来自同一任务,负样本才可比。去掉重复目标屏蔽,降到 71.4。

第 4.4.3 节才和主表的 2B 接得上。从阶段一检查点 75.7 开始,一项一项加上去:精选数据 76.6,再加重排器监督 76.7,再加嵌入教师蒸馏 77.6,再加大视觉输入预算到最终 77.9。合计涨 2.2。精选数据这一步,图像 77.7 到 78.9,视频 67.5 到 69.2,视觉文档 78.9 到 78.5,是降的。重排器监督把视觉文档从 78.5 拉到 79.1,图像从 78.9 微降到 78.8。蒸馏三列都升。加大视觉预算后,视频从 70.0 到 70.8,是这步里最明显的一列。这些行是累加,不是各自从同一个起点单拆。

图 3 讲套娃式降维,从 64 维到 2048 维还剩多少比例。正文没有列出每一档的保留比例。

这些数不能被读成什么

80.6 是 MMEB-v2 的 78 项总分。视频、图像问答、视觉文档、图像定位都有更高的对照列。4B 的 79.2 高于表里的 8B Qwen,比的是榜上成绩,不是同一套服务条件。

59.5 的 V3-All 把 11 项音频记成 0。能处理音频的模型在这 11 项上不是 0。即使得分仍高,也不能写成「音频检索也领先」。多条件检索和一般检索,9B 不是表里最高。

12 项平均的 81.7 盖不住图到文均值上 9B 低于 4B,也盖不住 2B 的 ViDoRe 低于 Voyage。三家商业模型的数来自另一份报告。

内部 72.0 只相对一个 2B 开源对照,指标名和样本量都没写。14 次线上实验没有区间、没有相对涨幅。不能写成已经量化的推荐提升。

表 5 的 71.9 是小规模消融。表 6 的 77.9 才和主表 2B 对齐。精选数据把视觉文档打低 0.4,累加表里后来又涨回去。

出处:腾讯,WeChat Vision,WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report,2026-08-25,https://arxiv.org/abs/2608.24053v1

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction