行业资讯

Grok 语音转文本 2.0 发布,错误率降低约一半

Heooo 09月19日19时33分 32 阅读

「SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,在价格与 1.0 版本完全一致的前提下,错误率降低约一半。该模型基于 Grok Voice 音频基础模型构建,在 Artificial Analysis 全部 32 款流式模型中准确率位居榜首,并在四个内部真实业务数据集上全面超越前代。」

SpaceXAI 正式发布 Grok Voice Transcribe 2.0 语音转文本模型。官方介绍,新版本在保持价格不变的前提下,将错误率降低约一半,为开发者与企业用户提供更具性价比的语音识别方案。

Grok Voice Transcribe 2.0 基于 Grok Voice 底层的音频基础模型构建。官方表示,Grok Voice 目前已全面赋能实际业务:每天承接数万通客服电话,转录数百万小时的视频旁白,并驱动实体硬件中的各类语音智能体,其中包括特斯拉车辆中搭载的 Grok 助手。这意味着该模型并非停留在实验室阶段的演示,而是在高并发、长时段的生产环境中持续运行。

在准确率方面,Artificial Analysis 榜单显示,Grok Voice Transcribe 2.0 在全部 32 款流式模型中准确率高居榜首,说明其在同类产品中处于第一梯队。

除公开基准外,SpaceXAI 还基于线上实际业务中采样的四个内部数据集,对模型的词错误率进行了系统评测。这四个测试集分别涵盖:客服电话音频、与 Grok 的日常对话(英语)、电话号码与邮箱、地址等口述信息,以及多语种简短语音指令。在四个数据集的评测中,Grok Voice Transcribe 2.0 的表现均全面超越 1.0 版本,说明本次提升并非只在单一场景成立,而是在接近真实业务分布的条件下得到验证。

定价方面,Grok Voice Transcribe 2.0 与 1.0 版本保持完全一致:批量转录为每小时音频 0.10 美元(约合 0.67 元人民币),实时流式转录为每小时音频 0.20 美元(约合 1.3 元人民币)。同时,说话人分离、精确时间戳以及自定义关键词功能均已全部包含在内,无需支付额外费用。

从技术路线看,语音转文本的竞争焦点正从单纯的通用基准分数,转向真实场景下的鲁棒性。客服电话往往伴随嘈杂背景与口音差异,口述信息则涉及数字、邮箱与地址等易错内容,多语种短指令又要求模型快速切换语言。以内部业务数据集作为补充评测,反映出厂商开始把线上业务的词错误率当作核心衡量指标,而不仅是公开榜单上的排名。

对开发者而言,价格不变而错误率减半,意味着单位成本的转录质量明显提升,长音频批量处理与实时流式交互两类场景都能直接受益。语音智能体、会议记录、视频字幕与呼叫中心质检等应用,也有望借此进一步降低人工校对的比例,把更多精力放在下游的语义理解与业务逻辑上。

# 语音转文本 # Grok # 模型发布 # 语音智能体

来源:Heooo AI工具导航