豆包大模型2.1 Pro重磅升级,多模态与Agent能力全面进化 封面图
技术进展

豆包大模型2.1 Pro重磅升级,多模态与Agent能力全面进化

Heooo 09月16日20时00分 46 阅读

「火山引擎发布豆包大模型2.1 Pro 0915版本,强化Agent任务交付稳定性、多模态编程辅助及视频图像理解能力,并显著优化Token效率,降低企业应用成本。」

近日,火山引擎正式推出豆包大模型2.1 Pro(Doubao-Seed-2.1-pro)的0915新版,该版本已在火山方舟平台全量上线API,并同步更新至豆包工作客户端和TRAE开发环境。用户只需升级客户端并选择“豆包2.1Pro(0915新版)”,即可体验这一面向企业级生产场景深度优化的AI模型。


在核心的Agent能力方面,新版本显著提升了任务交付的可靠性。通过增强证据溯源、权威信源检索、时效判断与数据核验机制,模型大幅减少了幻觉问题,在执行工具调用时更忠于事实。尤其在金融投研、办公自动化等需处理长篇报告的场景中,模型展现出分析师级别的分析框架——能自主拆解研究需求、查询高质量数据源,并输出结构严谨、结论可追溯的专家级建模底稿。


豆包大模型2.1 Pro重磅升级,多模态与Agent能力全面进化

多模态Coding能力也迎来全面进化。面对复杂的跨文件、长程编程任务,新模型能清晰理解项目整体架构与模块间关系,精准定位根因并完成端到端修复。更值得一提的是,其视觉语言模型(VLM)可直接解析设计稿、工程图纸乃至操作录屏,将视觉信息转化为前端代码或游戏逻辑,显著提升Web3D与游戏开发效率。


在多模态理解层面,视频推理能力尤为突出:不仅能跨帧整合信息、精准定位证据,还可对照SOP识别操作流程并解释原理,适用于视频标注、内容质检、教学演示等专业场景。图像理解方面,对3D物体(如CAD工件、AR空间)及密集图文(如财报表格、工程图纸公差符号、PDF跨页脚注)的识别精度均有明显提升。


此外,新版本在Token效率上实现突破,图像与视频推理的Token消耗降低超30%,有效减少推理轮次和工具调用次数,为高频应用场景如图像质检、视频审核等带来显著成本优化。

# 豆包大模型 # 多模态AI # Agent智能体 # 火山引擎 # AI编程辅助

来源:Heooo AI工具导航