Speko推出语音AI路由平台
「由Y Combinator支持的初创公司Speko发布语音AI路由平台,聚合多语言语音识别模型,基于实测性能与成本自动选择最优模型,并兼容OpenAI API标准,简化开发者集成流程。」
近日,Y Combinator S26批次孵化的初创公司Speko正式推出其语音AI路由平台——被称作“语音AI领域的OpenRouter”。该平台旨在解决当前语音识别(ASR)领域模型碎片化、选型困难以及成本效益不透明等问题,为开发者提供统一接入、智能调度的语音处理基础设施。
Speko的核心功能在于其“路由器”机制:系统根据每种语言和具体任务目标(如实时转录、高精度离线识别等),从已集成的数十个主流语音模型中自动选择最优选项。这一决策并非依赖厂商自行发布的英文排行榜,而是基于Speko团队对各模型在不同语言下的实际性能指标(如词错误率WER)与单位成本($/分钟)进行的系统性评测。目前平台已覆盖英语、阿拉伯语、法语、德语、印地语、西班牙语等多种语言,并持续扩展。
从公开的基准数据来看,Speko对多个知名语音模型进行了横向对比。例如,在英语场景下,Universal-3.5 Pro以2.0%的WER和每分钟0.0075美元的成本位居综合表现前列;而GPT-4o Transcribe和GPT-4o-mini Transcribe分别以2.3%和2.7%的WER紧随其后,成本分别为0.0060和0.0030美元/分钟。值得注意的是,部分低成本模型如Velma 2虽WER略高(4.4%),但价格仅为0.0010美元/分钟,适合对成本极度敏感的应用场景。这种细粒度的性能-成本权衡,正是Speko路由策略的基础。
在技术集成方面,Speko极大降低了开发门槛。平台完全兼容OpenAI的语音API规范,开发者只需将原有代码中的baseURL指向Speko的API端点(https://api.speko.ai/v1),并使用Speko提供的API密钥,即可无缝接入其智能路由能力。示例代码显示,无论是LiveKit Agents、LangChain还是其他支持OpenAI插件的框架,均可通过简单配置实现STT(语音转文本)、LLM(大语言模型)和TTS(文本转语音)的全流程调用,且模型参数可设为“auto”,由Speko自动选择最优后端。
此外,Speko还支持MCP(Model Control Protocol)协议,允许通过命令行工具快速注册服务端点,进一步提升开发与部署效率。这种“一次集成、多模型受益”的设计理念,有望显著加速语音AI应用的开发周期,并优化长期运行成本。
随着语音交互在客服、会议记录、无障碍技术等场景的普及,开发者对高性能、低成本、多语言支持的语音处理方案需求日益迫切。Speko通过构建一个开放、透明、智能的语音AI路由层,不仅提升了模型选型的科学性,也为整个语音AI生态提供了新的基础设施范式。
来源:Heooo AI工具导航