技术进展
DeepSeek Flash新增视觉模型支持多模态
Heooo 08月21日18时35分 30 阅读
「DeepSeek近日升级其工具链至0.1.1-rc.1版本,推出V4Flash Vision-Exp视觉模型体验版,实现图文混合输入能力。该更新将多模态功能深度整合进开发工具链,开发者可通过npm命令快速体验这一兼具速度与准确度的新特性。」
近日,国产大模型厂商DeepSeek对其核心工具链DeepSeek Harness进行了重要迭代,正式发布0.1.1-rc.1版本。此次更新的最大亮点在于引入了全新的视觉模型体验版——V4Flash Vision-Exp,标志着其在多模态AI能力上的关键突破。
就在前一日发布的v0.1.0-rc.8版本中,DeepSeek已初步打通多模态处理的核心路径,允许用户通过原生图片请求方式,在/goal、/plan等关键指令中直接嵌入图像内容。这意味着开发者或终端用户现在可以将工作截图与文字需求一并提交给AI智能体(Agent),实现“看图干活”的高效交互模式,极大简化了操作流程和开发复杂度。
尽管DeepSeek此前已在网页端提供较为成熟的识图功能,但此次将视觉能力深度集成至开发工具链,是其多模态战略落地的关键一步。V4Flash Vision-Exp不仅继承了V4Flash系列模型的高速推理优势,还在图像理解与图文融合任务上展现出更高准确率。
对于广大开发者而言,体验这一新功能极为便捷:只需执行指定的npm命令完成工具链升级,即可立即调用V4Flash Vision-Exp的视觉处理能力。此举不仅降低了多模态AI应用的接入门槛,也为后续构建更复杂的智能体系统奠定了坚实基础。
# DeepSeek # 多模态模型 # 视觉模型
来源:Heooo AI工具导航