开源项目

DeepSeek V4多模态模型开源发布

Heooo 09月01日01时34分 2 阅读

「DeepSeek V4系列首款多模态模型V4-Flash-Vision-Exp在Hugging Face上线,采用MIT License开源。模型支持图片输入,多模态Agent能力接近Opus-4.8,核心模块全面公开,为开发者提供完整推理实现。」

深度求索今日正式在Hugging Face平台开源DeepSeek V4系列首个多模态模型——DeepSeek-V4-Flash-Vision-Exp。该模型采用MIT License许可,开发者可自由使用、修改和商用,进一步降低了多模态AI技术的应用门槛。

本次开源内容相当完整,不仅包含模型文件与Tokenizer,还提供了Prompt Encoding参考实现,以及基于PyTorch的最小化推理实现。这些资源覆盖了视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块,为研究者和工程师深入理解模型架构、进行二次开发提供了扎实基础。

作为DeepSeek V4系列首款原生支持图片输入的视觉模型,V4-Flash-Vision-Exp明确标注为实验版本,并于2026年8月21日上线DeepSeek API平台。模型在文本之外支持图片输入,能够完成图片描述、截图文字识别、图表分析等多种视觉理解任务,目前兼容JPEG、PNG、GIF、WebP四种常见图片格式。

深度求索官方表示,V4-Flash-Vision-Exp在各类Agent框架内展现出较好的多模态适配能力,能够有效支持开发者借助多样化Agent工具解锁更多实用工作场景。在Agent、推理、世界知识等纯文本任务上,该模型与V4-Flash正式版表现持平,原有优势完整保留;而在需要视觉理解的Agent基准测试中,其相比V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。

此次开源不仅验证了DeepSeek在多模态技术路线上的快速迭代能力,也为开源社区提供了一个高性能的多模态基座选择。开发者可直接基于官方提供的推理实现快速部署,或将其集成到现有的Agent工作流中,探索视觉交互与自动化任务结合的更多可能性。

# DeepSeek # 多模态模型 # 开源

来源:Heooo AI工具导航