DeepSeek开源多模态模型 专供Agent干活 封面图
技术进展

DeepSeek开源多模态模型 专供Agent干活

Heooo 09月01日18时34分 4 阅读

「DeepSeek发布V4家族首个开源多模态模型DeepSeek-V4-Flash-Vision-Exp,参数量305B,采用MIT许可。该模型不主打看图说话,而是强化多模态Agent能力,可读取界面截图与图表。性能上多模态Agent分数接近Claude Opus 4.8,开源内容完整,社区已快速推出多个量化版本。」

DeepSeek在Hugging Face上线了DeepSeek-V4-Flash-Vision-Exp,这是V4家族首款实验性多模态模型。模型参数量达305B,基于V4-Flash-0731底座,在原有语言模型基础上接入视觉编码器和Aligner,经过持续训练获得图像理解能力。采用MIT License开源,意味着开发者可以自由使用、修改和商用。

DeepSeek开源多模态模型 专供Agent干活

与传统多模态模型主打视觉问答不同,DeepSeek为这个Vision版本划定了全新赛道:官方重点强调多模态Agent能力,让Agent直接读取网页截图、软件界面、图表等视觉信息,再结合工具调用继续执行任务。换言之,这双“眼睛”不是给人看的,而是给Agent用的。这一设计思路明显区别于市面上常见的视觉大模型,聚焦于自动化操作与执行场景。

此次开源内容相当完整,包括模型权重、Tokenizer、Prompt Encoding参考实现以及一份最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections等核心模块。社区跟进迅速,Hugging Face页面上已出现7个面向llama.cpp、LM Studio、Ollama的量化版本,本地部署门槛大幅降低。

DeepSeek开源多模态模型 专供Agent干活

时间线上也有值得注意的细节:8月21日该模型先上线DeepSeek API,当时只能调用、不给权重,开发者可通过API同时输入文字和图片,图片按Token计费;十天后权重才正式开放,本地部署和二次开发由此成为可能。这种“先卖API再开源”的节奏,也透露出DeepSeek对其以API服务为主的定位。

从跑分来看,加入视觉能力后纯文本Agent能力基本不受影响:Terminal Bench 2.1从82.7涨到83.9,DeepSWE从54.4涨到59.3,反而超过Opus 4.8的58.0。多模态Agent提升更明显:ApexBench Pass@1达到36.5,Agents' Last Exam以27.3超过Opus 4.8的25.7,ZeroBench Pass@5也以35.0压过对手的34.0。不过DeepSeek并未宣称“全面超越”:NL2Repo项目上其得分57.7,与Opus 4.8的69.7差距不小。官方表述也保持克制,仅称“多模态Agent能力接近Claude Opus 4.8”。

把近期更新串起来看,DeepSeek正在拼装一套完整的Agent技术栈:模型负责推理和工具调用,Harness负责持续执行任务,Vision则让Agent能直接读取电脑里的视觉信息,此次开源正是这块拼图的关键落子。对于开发者而言,这套开源方案为构建可操作图形界面的智能体提供了新的选择。

# DeepSeek # 多模态模型 # 开源 # Agent

来源:Heooo AI工具导航