开源项目

微信开源多模态模型日调用十亿次

Heooo 09月08日13时34分 44 阅读

「微信AI团队开源通用多模态嵌入模型WeMM-Embedding,提供2B、4B、9B三个版本,支持文本、图像、视频及交错输入。该模型已在朋友圈搜索、视频号推荐等场景大规模应用,每日调用量达10亿次,并在MMEB-v2榜单中位居第一。」

微信AI团队近日宣布将通用多模态嵌入模型WeMM-Embedding正式开源,这一举动引发了开发者社区的广泛关注。该模型包含2B、4B、9B三个参数版本,能够支持文本、图像、视频、视觉文档以及任意交错的多模态输入,为构建跨模态语义理解提供了统一解决方案。

据微信内部员工透露,WeMM-Embedding并非停留在实验阶段的演示项目,而是已经在微信生态中承担起关键的基础检索角色。目前,该模型已被大规模应用于朋友圈搜索、视频号推荐、公众号推荐以及微信电商等核心业务场景,每日调用量高达10亿次。这意味着,用户在微信中每一次搜索图片、滑动推荐流,背后都可能由这一多模态模型驱动,实现更精准的内容匹配与语义理解。

从技术层面来看,WeMM-Embedding的核心价值在于将不同模态的数据映射到同一个语义空间,使得系统能够直接对文字、图片和视频进行统一的比较与检索。这种设计突破了传统单一模态嵌入的局限,让跨模态检索变得更加自然和高效。例如,用户可以用一段文字描述某个生活场景,系统便能从海量视频或图片中找出视觉内容与之匹配的结果,甚至在电商购物时通过图片理解商品属性并关联到合适的推荐文本。

该模型的性能同样经得起检验。在国际权威评测榜单MMEB-v2上,WeMM-Embedding取得了第一名的成绩,超越了此前所有已提交的开源与闭源模型。这一结果不仅验证了微信视觉团队在多模态理解领域的深厚积累,也为开源社区提供了一个极具竞争力的基线模型。

微信团队选择将如此大规模应用的核心模型开源,无疑会推动多模态检索技术的普及与创新。开发者可以基于不同大小的版本,在资源受限的边缘设备或高性能服务器上灵活部署,构建自己的跨模态搜索、推荐或内容理解系统。同时,开源也意味着可复现性和社区协作的可能性更大,后续版本有望在更多场景中释放潜力。随着微信生态对多模态能力的需求持续增长,WeMM-Embedding的开源或将加速行业在多模态AI应用上的探索步伐。

# 多模态模型 # 微信 # 开源

来源:Heooo AI工具导航