DeepSeek V4 Pro编程测评夺亚,性价比惊艳
「在SuperCLUE-Terminal中文编程测评中,DeepSeek-V4-Pro-0813以51.52分位列第二,仅略低于Kimi K3,但单题调用成本仅为1.42元,约为对手的十四分之一,展现出极强的性价比优势。」
近日,CLUE团队发布了最新一期SuperCLUE-Terminal中文智能体终端编程测评榜单,聚焦国内开发者真实编程场景,全面评估大模型在理解中文需求、任务规划、工具调用及代码调试等方面的综合能力。在此次评测中,深度求索(DeepSeek)推出的DeepSeek-V4-Pro-0813模型以51.52分的成绩稳居第二,仅次于登顶的Kimi K3(60.61分),同时显著领先于GLM-5.2(48.48分)和旧版DeepSeek-V4-Flash(46.46分),成功跻身第一梯队。
该评测的独特之处在于其高度贴近实际开发流程:每道题目要求模型完成50至110轮交互,单题运行时间长达30分钟至90分钟,完整复现了复杂软件开发中的迭代与调试过程。所有测试均基于Claude Code统一框架执行,确保了结果的公平性与可比性。
尤为引人注目的是DeepSeek-V4-Pro-0813的成本控制能力。其单题调用成本仅约1.42元,约为Kimi K3的十四分之一、GLM-5.2的十六分之一。在头部模型分数差距普遍微小的背景下,如此显著的成本优势,为预算有限的中小企业和独立开发者提供了接近顶级性能的可行选择。
实测显示,该模型能高效完成前端页面构建、3D小游戏开发及工程脚本修改等多样化任务,游戏逻辑中的碰撞检测、计分系统与结算流程均运行流畅,界面设计也摆脱了常见的模板化风格。尽管在部分创意绘图类题目中偶有结构瑕疵,但整体完成度仍处于行业领先水平。
DeepSeek-V4-Pro-0813以“第二名的分数、十四分之一的价格”,重新定义了AI编程模型的性价比基准,标志着高性能AI编程能力正加速走向普惠化。
来源:Heooo AI工具导航