行业资讯

Grok 4.6发布即登顶性价比榜

Heooo 08月13日19时35分 24 阅读

「xAI发布Grok 4.6,智能指数61分追平GPT-5.6 Sol,仅次于Claude Opus 5和Claude Fable 5。代理基准全面飙升,定价比OpenAI和Anthropic旗舰低60%以上,长任务资源消耗仅为四分之一,高性价比引发行业关注。」

xAI正式发布新一代大模型Grok 4.6,凭借出色的智能表现和极具竞争力的定价,一经推出便登顶性价比榜单。在AI智能指数评测中,Grok 4.6获得61分,追平GPT-5.6 Sol(Max),仅次于Claude Opus 5的63分和Claude Fable 5的62分,成功跻身全球前沿模型第一梯队,与OpenAI、Anthropic的旗舰产品展开正面较量。

模型在Grok 4.5基础上进行了扩展训练,核心改进包括使用模型生成的精选数据进行推理和高级技术概念训练,同时结合高质量工程数据和改进的优化器。训练方法上最关键的变化在于数据闭环:Grok 4.5被用于重新生成监督微调轨迹,覆盖推理、代理工具使用以及STEM、软件工程和知识工作等领域。此外,模型还在广泛的代理强化学习任务上接受训练,涵盖知识工作、通用编码、内核优化、网页开发和计算机辅助设计,这一策略明显瞄准了智能体时代的核心工作负载。

在智能体类基准测试中,Grok 4.6表现尤为亮眼。GDPval-AA v2达到1753 Elo,仅次于Claude Opus 5;DeepSWE v1.1提升至65.9%,较Grok 4.5的54%大幅跃升;APEX-Agents从47.1%飙升至57.5%;Terminal-Bench v3.0也从15.7%涨到26%。在CursorBench v3.2上获得69.9%,在FrontierCode v1.1上获得61.3%,编码与代理能力均实现显著突破。

更值得关注的是成本效率优势。Grok 4.6定价维持在每百万输入token 2美元、每百万输出token 6美元,比Claude Opus 5(5美元/25美元)和GPT-5.6 Sol(5美元/30美元)低60%以上。在AA-Briefcase长周期知识工作基准中,Grok 4.6平均仅用53个回合和约5亿输入token完成任务,而Claude Opus 5需要约103个回合和约20亿token——用不到四分之一的资源完成同等任务,性价比差距一目了然。

目前,Grok 4.6已通过Cursor、Grok Build、API及OpenRouter、Vercel、Cloudflare等渠道提供,首周在Grok Build和Cursor中还有2倍用量优惠,上下文窗口维持在50万token。一场围绕同等智能、更低价格的性价比大战已经打响。

# Grok 4.6 # xAI # 大模型

来源:Heooo AI工具导航