Grok 4.6发布,对标GPT-5.6 Sol
「SpaceXAI正式发布Grok 4.6模型,强化长时间智能体任务与复杂交互,在多项基准测试中与GPT-5.6 Sol持平。模型已登陆Cursor、Grok Build及API平台,首周提供双倍使用额度,并升级安全防护机制。」
北京时间8月12日晚间,SpaceXAI正式发布Grok 4.6模型。作为Grok 4.5的迭代版本,新模型重点强化了长时间运行的智能体任务处理能力,并显著提升了复杂交互和视觉工作表现。
据发布信息,Grok 4.6能够持续处理包含大量步骤的复杂任务,覆盖资料研究、信息分析、大型代码库处理,以及将产品构想转化为完整应用或工作成果等场景。这一能力升级意味着模型不再局限于单轮问答,而是能够在多阶段流程中保持上下文连贯,完成更接近真实工作流的闭环任务。
在基准测试方面,Grok 4.6在多项智能体编程和知识工作测试中达到前沿水平。尤其在综合9项基准测试的Artificial Analysis Intelligence Index上,Grok 4.6与GPT-5.6 Sol取得了相同分数,显示出两者在综合智力表现上已处于同一梯队。
目前,Grok 4.6已在Cursor和Grok Build两个平台上线。首周,两项服务将向用户提供两倍的内含使用额度,以鼓励开发者充分体验新模型的智能体能力。此外,Grok 4.6也已通过API开放,并登陆OpenRouter、Vercel和Cloudflare等合作平台。价格方面,每100万个输入Token收费2美元(约合13.5元人民币),每100万个输出Token收费6美元(约合40.6元人民币),速度更快的版本价格则为普通版本的两倍。
训练层面,Grok 4.6经历了比Grok 4.5更长的补充训练。训练数据包括经过筛选的模型生成推理数据、高级技术概念数据,以及高质量工程数据,并配合改进后的优化器和训练方案,为后续监督微调(SFT)和强化学习(RL)提供了更扎实的基础。训练团队还利用Grok 4.5重新生成SFT轨迹,覆盖不同推理强度、智能体运行框架,以及STEM、软件工程和知识工作等领域,并使用基于模型的检查剔除存在问题的轨迹。
强化学习方面,Grok 4.6接受了广泛的智能体强化学习训练,任务覆盖知识工作、通用编程、内核优化、Web开发和计算机辅助设计等领域。在实际项目测试中,Grok 4.6重点接受了长流程、多步骤任务的考验。测试结果显示,新模型擅长把宽泛的产品构想转化为可运行的初版,包括研究陌生领域、规划应用结构、实现核心交互,以及根据多轮反馈持续完善结果。
在更长的任务流程中,Grok 4.6还表现出更多自主测试和验证行为,会在继续执行任务前检查已经完成的工作,减少错误累积。视觉和交互式项目的初版成果也较Grok 4.5有所提升,面对明确的产品构想时,模型能够一次建立应用的基本结构和视觉语言,显著提高了开发效率。
安全方面,Grok 4.6根据扩展后的模型能力调整了安全防护机制。此次安全评估覆盖部署前能力测试、安全防护校准,以及部署后和第三方测试,规模为历来最大。安全体系面向漏洞修补、工程设计和AI研究等合法使用场景,在提高实用性的同时控制安全风险。整体来看,Grok 4.6在长任务智能体、编程能力和视觉交互方面均有明显进步,与头部模型的竞争也进入白热化阶段。
来源:Heooo AI工具导航