开源项目

微信视觉团队开源通用多模态嵌入模型

Heooo 09月07日17时00分 43 阅读

「腾讯微信视觉团队正式开源通用多模态嵌入模型WeMM-Embedding,支持文本、图像等多模态输入,推出2B、4B和9B三个版本。该模型采用统一架构设计,结合两阶段训练与知识蒸馏,已大规模部署于微信推荐与搜索系统,日调用量达十亿量级,将有力赋能AI应用开发。」

近日,腾讯微信视觉团队正式宣布开源通用多模态嵌入模型WeMM-Embedding。该模型全面支持文本、图像等多模态输入,旨在通过先进的技术架构与训练策略,为AI应用开发者提供坚实的技术支撑,并进一步推动人工智能技术在更多垂直领域的创新应用。

在版本布局上,WeMM-Embedding推出了2B、4B和9B三个不同体量的版本,以适应多样化的部署需求。无论是资源受限的边缘场景,还是对性能要求较高的云端服务,开发者都能根据实际需求选择合适的模型规模。这种灵活的版本设计,显著降低了多模态模型的应用门槛。

从技术架构来看,该模型采用了统一架构设计,将文本与图像等多种模态的编码与嵌入任务整合到同一框架中,避免了传统多模态模型常见的复杂拼接与适配问题。同时,结合两阶段训练和知识蒸馏等核心技术,WeMM-Embedding在大幅提升多模态理解能力的同时,也有效兼顾了实际落地中的部署效率。通过知识蒸馏,较大的9B模型可以将其能力迁移至较小的2B和4B版本,使得轻量级模型也能具备接近大模型的表现,从而在性能与资源消耗之间实现良好平衡。

作为一项经过严苛业务检验的技术成果,WeMM-Embedding目前已大规模部署在微信的推荐与搜索系统中,线上日调用量高达十亿量级。这一真实应用场景充分验证了模型在处理海量真实数据时的稳定性、准确性与低延迟特性。推荐与搜索任务通常要求模型快速理解用户输入并匹配相关内容,多模态嵌入模型的引入让系统能够同时将文本与图像信息映射到统一语义空间,从而提升召回与排序效果,改善用户体验。

此次全面开源,不仅标志着微信在多模态AI技术生态建设上的进一步开放,也将为行业内的AI应用开发带来强有力的技术赋能。开发者可以基于WeMM-Embedding构建图像搜索、跨模态检索、内容理解、智能推荐等应用,节省从零训练模型所需的算力与数据成本。同时,开源生态的建设也将吸引更多研究者和工程师参与模型迭代,推动多模态嵌入技术的持续进步。

# 多模态 # 开源 # 嵌入模型

来源:Heooo AI工具导航