Grok 语音转文本 2.0 发布,错误率降低约一半
「SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,在价格与 1.0 版本完全一致的前提下,错误率降低约一半。该模型基于 Grok Voice 音频基础模型构建,在 Artificial Analysis 全部 32 款流式模型中准确率位居榜首,并在四个内部真实业务数据集上全面超越前代。」
SpaceXAI 正式发布 Grok Voice Transcribe 2.0 语音转文本模型。官方介绍,新版本在保持价格不变的前提下,将错误率降低约一半,为开发者与企业用户提供更具性价比的语音识别方案。
Grok Voice Transcribe 2.0 基于 Grok Voice 底层的音频基础模型构建。官方表示,Grok Voice 目前已全面赋能实际业务:每天承接数万通客服电话,转录数百万小时的视频旁白,并驱动实体硬件中的各类语音智能体,其中包括特斯拉车辆中搭载的 Grok 助手。这意味着该模型并非停留在实验室阶段的演示,而是在高并发、长时段的生产环境中持续运行。
在准确率方面,Artificial Analysis 榜单显示,Grok Voice Transcribe 2.0 在全部 32 款流式模型中准确率高居榜首,说明其在同类产品中处于第一梯队。
除公开基准外,SpaceXAI 还基于线上实际业务中采样的四个内部数据集,对模型的词错误率进行了系统评测。这四个测试集分别涵盖:客服电话音频、与 Grok 的日常对话(英语)、电话号码与邮箱、地址等口述信息,以及多语种简短语音指令。在四个数据集的评测中,Grok Voice Transcribe 2.0 的表现均全面超越 1.0 版本,说明本次提升并非只在单一场景成立,而是在接近真实业务分布的条件下得到验证。
定价方面,Grok Voice Transcribe 2.0 与 1.0 版本保持完全一致:批量转录为每小时音频 0.10 美元(约合 0.67 元人民币),实时流式转录为每小时音频 0.20 美元(约合 1.3 元人民币)。同时,说话人分离、精确时间戳以及自定义关键词功能均已全部包含在内,无需支付额外费用。
从技术路线看,语音转文本的竞争焦点正从单纯的通用基准分数,转向真实场景下的鲁棒性。客服电话往往伴随嘈杂背景与口音差异,口述信息则涉及数字、邮箱与地址等易错内容,多语种短指令又要求模型快速切换语言。以内部业务数据集作为补充评测,反映出厂商开始把线上业务的词错误率当作核心衡量指标,而不仅是公开榜单上的排名。
对开发者而言,价格不变而错误率减半,意味着单位成本的转录质量明显提升,长音频批量处理与实时流式交互两类场景都能直接受益。语音智能体、会议记录、视频字幕与呼叫中心质检等应用,也有望借此进一步降低人工校对的比例,把更多精力放在下游的语义理解与业务逻辑上。
来源:Heooo AI工具导航