微信视觉团队在9月初通过官方平台宣布,把微信线上每天调用量达十亿量级的通用多模态嵌入模型WeMM-Embedding正式开源,一次放出2B、4B、9B三个版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。在权威多模态嵌入评测MMEB-v2上,9B版本以80.6分登顶榜首,2B版本也拿到77.9分,反超此前领先的8B级开源模型。腾讯方面表示,模型权重、推理代码与评测工具已全部开放,希望帮助更多研究者和开发者构建多模态检索、推荐与智能体应用,这也是国内大厂首次把经受十亿级线上流量检验的检索底座完整交到社区手里。
嵌入模型解决的是让机器"找得到"的问题,把文字、图片、视频映射到同一套向量空间,推荐系统靠它召回候选内容,搜索引擎靠它衡量相关性,智能体靠它从知识库里定位答案。MMEB-v2榜单把跨模态检索能力拆成细颗粒度任务逐一打分,WeMM-Embedding-9B拿下80.6分登顶,2B版本77.9分的成绩也超过了此前领先的8B级开源模型,12项跨模态检索任务中,2B版本与Gemini Embedding 2打成平手,小模型的表现足以支撑高并发线上场景。
值得注意的是,微信公开的成绩不止榜单数字。在内部26项任务基准上,2B版本相比同规模基线从60.9分提升到72.0分,分类、搜索、跨域匹配、文章相关与视频相关五类任务全部上涨,且这套模型经历了14次线上A/B测试并全部正向,才最终全量上线。换句话说,榜单验证的是能力上限,真实流量验证的才是稳定性,两者都达标,才敢把十亿量级的日调用压在一个开源模型上,这也是这份开源清单比分数本身更有分量的原因。
在技术路线上,WeMM-Embedding没有走"每个模态单独训练再拼接"的老路,而是选用开源多模态架构作为统一骨干,让图像、视频和文字从一开始就在同一个模型中共同处理,交互对齐的成本被大幅压缩。训练采用两阶段方案,第一阶段用InfoNCE对比损失配合任务一致批次与去重感知负例掩码,把内容区分能力做扎实;第二阶段引入排序模型监督信号,并用冻结的9B版本当教师做嵌入蒸馏,双向相似度分布对齐后,小模型的效果得到显著提升,蒸馏也被官方认定为小模型提分的主因。
数据工程同样是这份工作的重头戏。团队把数亿训练对统一整理成指令、源、目标、难负例、分级相关度五元组,把分类和问答都改写成检索形式,再用语义ID做密度重采样压高频保长尾,用多模态大模型清洗修正图片替代文本,用自身检查点挖掘难负例,从中精选出约十分之一的子集参与第二阶段训练。部署层面,模型支持套娃式向量截断,从64维到4096维可按需取用,2B版本在256维下仍保留98.7%的图像视频检索性能,兼顾了海量候选的粗召回与精细排序两档需求,为不同成本预算的接入方留足了选择空间。
模型并非实验室里的"纸上模型",而是已经在微信生态里跑了许久的线上老兵。官方信息显示,WeMM-Embedding如今大规模部署在视频号、直播、公众号、电商与朋友圈的推荐与搜索系统中,日调用量稳定在十亿量级,生成的多模态表示被用于候选检索、排序特征构建、用户序列建模与跨域内容理解等环节。一个用户在看短视频时刷到公众号文章,在看朋友圈时被推荐电商商品,背后都有这套向量表示在跨内容形态之间做桥接,把图文、视频、商品统一到可比较的语义空间里。
从产业视角看,这次开源最大的信号在于大厂愿意把"流量验证过的基建"拿出来共享。过去多模态检索能力大多封装在云厂商的API里,企业想自建一套既懂图又懂视频的检索底座,要么付费调用,要么从零训练,成本与门槛都不低。微信把经过十亿级日调用检验的模型权重直接放出,配合MIT式的开放协议与完整评测工具,等于把一套可复用的多模态检索参考实现交到社区手里,对RAG应用、企业知识库与智能体开发者来说,多了一个性能可靠且可本地化的国产选项,也让多模态检索这一层基础设施的竞争,从比参数规模转向比工程沉淀与生态开放度。
如果说2026年上半年开源竞赛的主角是对话大模型,那么下半年,嵌入与检索正在成为新的焦点。智能体要执行任务,就必须在文档、网页、图片与视频片段之间快速定位信息,检索质量直接决定任务完成度,而多模态嵌入恰恰是这条链路的起点。微信此次把2B、4B、9B三个规格全部放出,覆盖了从端侧轻量部署到云端高性能推理的完整梯度,开发者可以按设备与场景自由裁剪,论文、代码仓库与模型集合同步公开,复现与二次开发都有据可依。
可以预见,开源多模态嵌入模型的增多,会进一步压低智能体应用的信息检索成本,也会让"多模态RAG"从大厂的专属能力变成普通团队也能搭建的标配组件。对微信而言,开源既是生态策略,也是对自己技术路线的一次公开检验,榜单分数与线上数据都摆在那里,社区随时可以用真实场景复核。对行业而言,一个被十亿级流量验证过的开源底座,意味着多模态应用的地基又结实了一层,接下来更值得期待的是,谁能在这套地基之上,长出真正好用的检索应用与智能体产品。