开源项目

微信开源多模态嵌入模型WeMM-Embedding

Heooo 09月04日22时02分 3 阅读

「微信AI宣布开源通用多模态嵌入模型WeMM-Embedding,提供2B、4B、9B三个版本,支持文本、图像、视频等任意交错输入。该模型已在微信推荐与搜索系统每日十亿量级调用,9B版在MMEB-v2榜单以80.6分位列第一。」

微信AI官方于今日宣布,将大规模部署于微信生态的通用多模态嵌入模型WeMM-Embedding正式开源。这一模型包含2B、4B、9B三个参数版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入,能够为各类上层应用提供统一而强大的多模态语义表示能力。作为微信线上核心业务的重要基础设施,WeMM-Embedding的日均调用量已达十亿量级。

在技术架构上,WeMM-Embedding选择基于Qwen3.5多模态架构作为统一骨干模型。这一设计意味着图像、视频与文本从输入之初便在同一模型中进行联合处理,而非采用常见的独立编码器后期融合方案。官方表示,这种从底层统一建模的方式有助于不同模态之间的深层语义对齐,使生成的嵌入表示更好地捕捉跨模态的细粒度关系。

在权威多模态嵌入基准榜单MMEB-v2上,WeMM-Embedding-9B以80.6分的成绩位列第一。更值得注意的是,轻量级的2B版本也取得了77.9分,超过了此前领先的8B开源模型,展现出极高的效率优势。这一结果验证了统一骨干架构与大规模业务数据训练的有效性。

目前,WeMM-Embedding已经深度融入微信的推荐与搜索系统,覆盖视频号、直播、公众号、电商与朋友圈等多个核心场景。模型产出的多模态表示被广泛应用于候选检索、排序特征构建、用户序列建模以及跨域内容理解等关键环节。在26项内部任务基准上,WeMM-Embedding-2B相比同规模基线模型,综合得分从60.9提升至72.0,在分类、搜索、跨域匹配、文章相关和视频相关五类任务上均实现了显著提升。

此次开源不仅面向学术界与工业界研究者开放了高性能多模态嵌入模型,也为推荐、搜索、多模态理解等领域的开发者提供了直接可用的基座。未来,随着更多团队基于WeMM-Embedding进行二次开发与场景适配,通用多模态表示技术的应用边界有望进一步拓展。

# 微信开源 # 多模态嵌入 # WeMM-Embedding

来源:Heooo AI工具导航