技术进展

微信开源多模态嵌入模型并大规模应用

Heooo 09月08日22时34分 52 阅读

「微信开源通用多模态嵌入模型WeMM-Embedding,提供2B、4B、9B三个版本,支持文本、图像、视频等输入。目前该模型已在朋友圈搜索、视频号推荐、公众号推荐、微信电商等场景大规模落地,日调用量达十亿次,并登顶权威评测榜单MMEB-v2。论文、代码和模型均已开放。」

微信AI团队近日宣布正式开源通用多模态嵌入模型WeMM-Embedding,包含2B、4B、9B三个参数版本。该模型的核心能力在于能够同时理解文本、图像、视频、视觉文档以及任意交错的多模态输入,并将这些不同模态的信息映射到同一个语义空间中进行统一比较与检索。简单来说,它让系统具备跨媒介的内容理解与匹配能力。

据微信员工“客村小蒋”透露,WeMM-Embedding已在微信生态内大规模使用,覆盖朋友圈搜索、视频号推荐、公众号推荐以及微信电商等核心场景,每天调用量高达10亿次。这意味着用户在微信中浏览搜索、观看视频或挑选商品时,背后都可能由这一多模态模型对内容进行语义级理解与匹配。

在技术评测方面,该模型在国际权威的多模态嵌入测试集MMEB-v2上取得了第一名,超过了此前所有已提交的开源与闭源模型,展现出领先的跨模态表示能力。

为了让开发者和研究者共同参与,微信团队已将相关资源全面开放:论文已发布在arXiv;代码仓库托管于GitHub的Tencent/WeMM-Embedding项目;模型集合也同步上线Hugging Face平台。这些举措将有助于推动多模态检索、推荐系统和企业级AI应用的发展。

# 多模态嵌入 # 开源模型 # 微信AI

来源:Heooo AI工具导航