← 返回每日热点
BiFish original · 2026-09-08

微信悄悄开源了个多模态模型,日调用10亿次,朋友圈搜索都在用

上周我还被一个AI视频检索工具气到摔键盘,搜个"夕阳下奔跑的狗",它给我返回一堆猫。但微信刚开源的WeMM-Embedding,号称能让文字、图片、视频在同一个语义空间里比较,朋友圈搜索、视频号推荐都

上周我还被一个AI视频检索工具气到摔键盘,搜个"夕阳下奔跑的狗",它给我返回一堆猫。但微信刚开源的WeMM-Embedding,号称能让文字、图片、视频在同一个语义空间里比较,朋友圈搜索、视频号推荐都在用,日调用量10亿次。同一个任务,它跑得怎么样?我还没测,但数据摆在那,MMEB-v2榜单第一,超过所有开源闭源模型。

这模型到底强在哪

WeMM-Embedding有三个版本:2B、4B、9B。简单说,它把文本、图像、视频、文档这些不同模态的东西,都映射到一个向量空间里。这样你搜"去年夏天海边度假",它不光能匹配文字描述,还能直接命中你朋友圈里那张模糊的日落照片,或者视频号里那段海浪拍岸的短视频。

微信AI官方说,这个模型已经大规模应用了:朋友圈搜索、视频号推荐、公众号推荐、微信电商都在用。每天调用量10亿次,这个数字在国产多模态模型里相当少见。作为对比,一些头部AI搜索产品,日调用量可能也就几千万次。10亿次意味着它已经经过了真实业务的极限压力测试,不是实验室里的花架子。

从数据来看,微信不是拿用户当小白鼠,而是真刀真枪地用了很久,才敢开源。

MMEB-v2榜单上拿了第一,超过之前所有提交的开源和闭源模型。这个榜单测试的是多模态嵌入的检索能力,包括跨模态检索、零样本分类等。微信视觉团队在技术报告里说,他们在训练数据、模型结构、损失函数上都做了优化,比如用了一种叫"多模态对比学习"的方法,让模型学会对齐不同模态的语义。

谁最需要它

先说说谁最需要这个模型。做多模态搜索的开发者,比如想给电商App加个"拍照搜同款"功能,或者做视频素材库的智能检索,WeMM-Embedding可以直接拿来用,省去从零训练的成本。做推荐系统的团队,比如视频号、抖音这类内容平台,需要理解用户上传的图文视频,这个模型能帮他们更精准地匹配用户兴趣。学术研究者,多模态嵌入是个热门方向,有了开源模型做baseline,能更快验证自己的新想法。

微信悄悄开源了个多模态模型,日调用10亿次,朋友圈搜索都在用(WeMM-Embedding)

但谁不需要?纯文本业务为主的小团队,比如做个文本客服机器人,用不到这么重的多模态模型,BERT或者GPT系列就够用了。没有GPU资源的人,9B模型推理需要不少显存,如果只是偶尔用用,API调用可能更划算。对延迟要求极高的场景,比如实时语音交互,嵌入模型不是为这个设计的,用错了地方反而添乱。

为什么这么分?因为多模态嵌入模型解决的核心问题是"跨模态检索",如果你的业务不需要跨模态,那它就是杀鸡用牛刀。而且模型越大,部署成本越高,2B版本可能勉强能跑在移动端,9B就得靠服务器了。微信有强大的基础设施才能撑起10亿次调用,普通团队得掂量掂量自己的服务器账单。

行业要变天

这个开源动作,对行业的影响不小。第一个冲击波是给闭源多模态模型敲了警钟。之前很多公司把多模态嵌入当核心卖点,比如Google的Gemini、OpenAI的CLIP,虽然不完全一样,但应用场景重叠。现在微信把同等水平的模型开源,还免费商用(Apache 2.0协议),那些靠卖API赚钱的小公司日子难过了。

第二个冲击波是给国内AI圈打了个样。腾讯在开源方面一向比较保守,这次直接放出了9B模型,说明他们对自己的技术有信心,也说明国内大厂在AI竞争上开始转向"开源+生态"策略。阿里有通义,百度有文心,腾讯有混元,现在又多了一个WeMM-Embedding,以后开发者选型时,国产模型的分量会越来越重。

我判断,未来一年内,国内至少还有两家大厂会跟进开源自家的多模态嵌入模型,不然开发者都去用微信的了。

第三个影响是给搜索和推荐领域带来新变量。传统的搜索是关键词匹配,多模态嵌入让搜索能跨模态理解意图。比如你搜"那种很治愈的风景",它可能返回一段阳光穿过树叶的视频,而不是一堆文字链接。微信已经在朋友圈搜索里用了,效果据说不错。其他平台如果不跟进,用户体验差距会越来越大。

微信悄悄开源了个多模态模型,日调用10亿次,朋友圈搜索都在用(WeMM-Embedding) 配图2

跟你有什么关系

普通用户可能感觉不到变化,但你的使用习惯已经在被改变。比如你在视频号里刷到一条做菜视频,点赞后,首页推荐里出现了更多类似视频,这背后就有WeMM-Embedding的功劳。它理解了你喜欢的不仅是"做菜"这个标签,还包括视频里的画面色彩、声音节奏,甚至字幕风格。朋友圈搜索也越来越聪明了,你搜"去年生日",能直接翻出当时的照片和视频,不用再翻几百条动态。

作为从业者,如果你是产品经理,可以想想怎么利用这个模型做跨模态搜索功能;如果你是独立开发者,可以试试接它的API,给用户的图片库做智能分类。但得提醒一句,别指望开箱即用,嵌入模型需要针对你的业务数据做微调,才能达到最佳效果。

我被各种AI工具坑过无数次,但这次微信敢开源,肯定是在内部打磨了很久,不然10亿次调用早把问题暴露光了。

半年见分晓

从技术到产品,微信这次走得很稳。但开源只是第一步,后续的社区运营、文档完善、工具链支持,才是决定它能否被广泛采用的关键。目前模型在HuggingFace上可以下,代码也挂在GitHub上,论文也公开了,看起来是认真的。

我赌半年内至少有两家大厂会跟进做同样的事,要么开源类似的多模态嵌入模型,要么推出更强的闭源版本。到时候,多模态检索会像今天的文本搜索一样普及。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. 微信WeMM-Embedding多模态模型已大规模应用:覆盖朋友圈搜索等,日调用量达10亿次