xAI发布Grok Voice语音模型强化智能交互
「人工智能企业xAI推出新一代语音识别与生成模型Grok Voice Think Fast 2.0,面向开发者提供语音交互解决方案。该模型在Artificial Analysis基准测试中综合得分82.9%,较前代提升明显,多语言转录准确率提升1.4倍,抗噪能力增强。定价每分钟0.08美元,无需调整提示词即可提升性能,已在实际业务场景中验证。」
人工智能企业xAI近日正式推出新一代语音识别与生成模型Grok Voice Think Fast 2.0,面向开发者生态提供更可靠的语音交互能力。该模型在权威的Artificial Analysis语音识别基准测试中表现亮眼,综合得分达到82.9%,显著优于前代模型的75.7%,标志着xAI在语音Agent可靠性方向上迈出关键一步。
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约1.4倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大,为语音助手、实时翻译、会议记录等应用提供了更稳定的技术底座。
技术架构上,Grok Voice Think Fast 2.0实现了智能水平、转录准确率、对话能力与工具调用效率的全面升级。开发者无需调整现有提示词即可获得性能提升,降低了集成门槛。该模型定价为每分钟0.08美元,兼顾了性能与成本效益,适合大规模商业化部署。
目前,该技术已在实际业务场景中展开验证,并在多个行业应用中展现出良好的适配性。xAI表示,将持续优化语音模型在真实世界中的表现,推动语音Agent从实验室走向生产环境。
此次发布正值xAI加速模型迭代的时期。此前,马斯克已公布Grok 4.6将于8月7日发布,并预告参数规模达2.1万亿的Grok 4.7。Grok Voice Think Fast 2.0的推出,进一步丰富了xAI的产品矩阵,为开发者提供了从文本到语音的全链路AI能力。
来源:Heooo AI工具导航