行业资讯

DeepSeek V4 Flash编程搭档横评

Heooo 08月07日17时02分 33 阅读

「Composio用30项真实任务测试Oh My Pi、Claude Code、Codex、OpenCode四个AI编程智能体框架,统一调用DeepSeek V4 Flash。结果显示Oh My Pi成功率最高(17/30)但耗时最长;OpenCode成本最低,Claude Code速度最快但成本最高。」

Composio近期在X平台公布了一项有趣的测试:它使用30项任务,对比了四个AI编程智能体框架在DeepSeek V4 Flash正式版上的表现。这四个框架分别是Oh My Pi、Claude Code、Codex和OpenCode。测试目的很明确——看看谁能更好地发挥DeepSeek V4 Flash的性能,成为开发者的最佳编程搭档。

Composio是一家成立于2023年的开源AI智能体工具集成平台,总部位于旧金山。它的核心能力是打通大语言模型与各类外部应用的连接,帮助开发者快速搭建可落地的生产级AI智能体。本次测试使用了Gmail、GitHub、Slack和Notion等真实工具来执行30个AI智能体任务,所有任务统一调用DeepSeek V4 Flash正式版模型,因此在相同的模型底座下,结果能够直接反映框架本身的调度与编排水平。

从成功率来看,Oh My Pi以17/30的成绩位居第一,Claude Code和Codex并列第二(16/30),OpenCode则以14/30暂时落后。但成绩并非唯一衡量标准。速度方面,Claude Code表现最为亮眼,平均每个任务仅需122秒;而Oh My Pi虽然成功率最高,却也是最慢的,每个任务平均耗时272秒。成本方面,OpenCode展现出明显优势,每个成功任务仅需0.073美元;Claude Code则成本最高,达到0.195美元,尽管它使用的工具调用次数最少,生成的输出词元也最少。

这一结果反映出不同智能体框架在设计哲学上的差异。Oh My Pi可能在任务规划和工具调用上更加谨慎,以更多时间换取更高成功率;Claude Code则更注重效率,在极快的执行速度下依然能保持较高的任务完成度,但成本也相应上升。OpenCode则以极低的花费完成了接近前者的成绩,适合对预算敏感的开发者。值得注意的是,Claude Code虽然调用的工具和生成的词元最少,成本却最高,说明各框架在模型调度、上下文管理以及API使用策略上存在明显不同的成本结构。

对于开发者而言,没有绝对的“最佳搭档”,只有最适合作业场景的选择。如果追求最高成功率且不介意时间成本,Oh My Pi值得尝试;如果希望在快速迭代中保持响应速度,Claude Code是高效之选;若预算有限,OpenCode的性价比显然更有吸引力。Composio的这次测试,为DeepSeek V4 Flash生态下的工具选型提供了真实且直观的参考。

# AI编程 # 智能体 # DeepSeek

来源:Heooo AI工具导航