微信开源多模态嵌入模型全面领跑国际榜单
「微信AI正式开源通用多模态嵌入模型WeMM-Embedding,推出2B、4B及9B三个参数版本,全面支持文本、图像、视频等多种模态输入。该模型在国际权威评测榜单MMEB-v2上综合表现位列第一,超越此前所有开源及闭源商业模型,并已在微信生态核心业务中大规模落地应用,日均调用量突破10亿次。」
微信AI官方近日宣布,将通用多模态嵌入模型WeMM-Embedding向全球开发者正式开源,并同步推出了2B、4B以及9B三个不同参数规模的版本。这一举措不仅降低了多模态模型的使用门槛,也为全球研究与工程社区提供了强大的基础工具。该模型展现出极强的多模态兼容能力,不仅全面支持文本、图像与视频输入,还能原生处理视觉文档以及任意交错的混合多模态内容,显著拓展了传统嵌入模型的应用边界。
据微信视觉团队透露,WeMM-Embedding的核心技术逻辑,在于让系统能够同时深度理解文字、图片与视频,并将其映射并统一在同一个语义空间中进行高效比较与精准检索。这种多模态同构的设计方式,使模型能够跨越不同信息形态之间的语义鸿沟,从而在复杂检索、内容理解与推荐排序等任务中表现出色。尤其是在多模态检索领域,模型需要同时处理来自不同来源和类型的非结构化数据,这一设计为构建更加接近人类感知方式的人工智能系统提供了可行路径。
在国际权威多模态检索与评估榜单MMEB-v2上,WeMM-Embedding凭借出色的综合表现,在同类方案中斩获第一名,成功超越了此前所有已提交的开源及闭源商业模型。这一成绩充分验证了该模型在多模态表示学习与跨模态匹配方面的领先水平,也显示出微信AI团队在视觉与语言融合方向上的深厚积累。
作为一款经历了高强度内部打磨的技术成果,WeMM-Embedding并非停留在实验室阶段。目前,该模型已经在微信生态的多项核心业务中实现大规模落地应用,实际覆盖场景包括朋友圈搜索、视频号推荐、公众号推荐以及微信电商等核心板块,日均调用量已经突破10亿次。如此大规模的业务实践不仅印证了模型的高效性与稳定性,也为后续持续优化积累了宝贵的真实数据反馈。
为了进一步推动技术社区的繁荣与前沿创新,微信团队此次同步公开了完整的技术生态资源。开发者和研究人员既可以通过相关代码仓库对模型实现进行深入研究,也能在模型托管平台上获取对应的模型集合。这一开源动作预计将吸引更多研究者与工程师参与多模态嵌入技术的探索与改进,推动整个行业在多模态理解、检索与生成方向继续加速前行。
来源:Heooo AI工具导航