技术进展

豆包大模型2.1 Pro更新:多模态Coding进化

Heooo 09月16日18时34分 36 阅读

「火山引擎宣布豆包大模型2.1 Pro更新至0915版本,API全量上线火山方舟,TRAE与Doubao-Seed-Evolving同步接入。升级围绕企业生产级需求,强化Agent证据溯源与数据核验,多模态Coding与视频图像理解能力提升,图像及视频推理Token消耗较上一代降低30%以上。」

火山引擎宣布,豆包大模型2.1 Pro已更新至0915版本,API在火山方舟全量上线。豆包应用已完成同步升级,用户下载或升级至最新版后,选取“豆包2.1 Pro(0915新版)”模型即可体验。本次升级围绕企业生产级需求展开,覆盖Agent任务交付、多模态Coding、多模态理解与Token效率优化四大方向。

Agent任务交付:让结论有据可查
在Agent能力上,模型强化了证据溯源、权威信源检索、时效判断和数据核验能力,官方称幻觉显著减少,更忠于工具调用事实。在金融投研、办公自动化等长报告任务中,结论有据可查,推进过程更加稳定。以金融投研为例,模型具备分析师级别的分析框架,能够自主拆解研究需求、查询高质量数据源并建模分析,产出专家级建模底稿。

多模态Coding:从设计稿到可运行代码
多模态Coding能力同步强化,模型更懂复杂代码仓库,面对跨文件、长程问题能够理清项目结构与模块关系,定位根因并完成修复,覆盖从理解需求到运行验证的端到端流程。借助VLM能力,模型可以直接读懂设计稿、图纸和操作录屏,将视觉信息转化为前端代码与游戏逻辑,Web 3D开发和游戏场景呈现效果均有提升。

多模态理解:视频与图像推理双向增强
视频推理能力增强后,模型可在视频中定位证据、跨帧整合后作答,也能对照SOP辨认操作并解释原理。物理教学、工程、实验操作、医疗等专业内容理解有所提高,视频标注、内容质检、长视频剪辑与定位摘要等场景随之受益。图像理解则在3D物体与密集图文方向增强:可识别CAD工件、游戏引擎3D元素及AR空间;工程图纸尺寸标注与公差符号、PDF图注脚注与表头层级、财报研报表格提取和跨页脚注引用等处理精度提升。

Token效率:高频场景成本更低
Token效率同步优化,推理轮次和工具调用次数降低。图像推理和视频推理的Token消耗比上一代减少30%以上,看图解题、图像质检、视频审核等高频场景的使用成本进一步下降。

生态接入无需改动节点
除豆包外,TRAE已同步接入0915版本。今年6月推出的Doubao-Seed-Evolving也更新至同一版本,企业无需更换API接入节点即可获得新能力。从整体升级方向看,这一版本把重点放在了“可核查的事实”与“可交付的结果”上:一方面通过证据溯源、数据核验降低长链路任务中的幻觉风险,另一方面用多模态Coding与视频图像理解拓宽模型的输入形态,再配合Token效率优化压低落地成本,形成面向生产环境的完整升级路径。

# 豆包大模型 # 火山引擎 # 多模态Coding # Agent

来源:Heooo AI工具导航