Fish Audio获5000万美元融资打造AI语音模型
「AI语音模型初创公司Fish Audio宣布完成5000万美元种子轮融资,由Coreline Ventures和Capital Today领投。该公司提供超过15000种自然语言控制的语音库,自去年推出以来已拥有超过800万用户,年度经常性收入达2100万美元。Fish Audio由前NVIDIA研究员廖世佳创立,其开源项目Fish Speech在GitHub上获得超过31000星标。公司已推出五款模型,包括四款语音生成模型和一款语音转文本模型,最新S2.1 Pro模型仅通过付费API提供。企业客户如HeyGen、Sanas和Plaud已在使用其平台。面对创作者关于语音未经同意被上传的争议,公司已自动化下架流程,确保问题在三分钟内解决。」
AI语音生成领域正迎来新一轮资本热潮。总部位于帕洛阿尔托的Fish Audio近日宣布完成5000万美元种子轮融资,由Coreline Ventures和Capital Today联合领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners及HF0等机构参投。这家专注于为创作者和企业构建AI语音模型的初创公司,正试图通过其庞大的自然语言控制库和开源策略,在竞争激烈的市场中占据独特生态位。
Fish Audio的诞生源于创始人廖世佳的个人挫败感。这位前NVIDIA研究员在市场上找不到足够富有表现力的合成语音,于是决定自己动手。他在单张GPU上训练了一个语音生成模型,并将其开源。这个名为Fish Speech的项目如今在GitHub上已获得超过31000个星标,被独立开发者、视频游戏设计师和内容创作者广泛使用。从一个小众开源项目起步,Fish Audio在短短一年内迅速成长为拥有800万用户、年经常性收入达2100万美元的商业实体。
公司目前已推出五款模型:四款语音生成模型和一款语音转文本模型。其中三款语音生成模型保持开源,但最新的S2.1 Pro模型仅通过付费API提供。这种开源核心加商业增值的策略,帮助Fish Audio在开发者社区中建立了信任基础,同时为企业客户提供了差异化服务。Fish Audio的语音库拥有超过15000种自然语言控制选项,覆盖从情感表达到语调调整的广泛场景。
Fish Audio联合创始人兼CEO Rissa Cao在接受采访时解释了公司产品的差异化定位:“每个企业都有不同的用例和偏好。例如,HeyGen这样的公司使用我们的语音来驱动AI虚拟形象,他们需要声音的真实感;游戏工作室希望角色声音富有表现力;而LiveKit这样的语音代理公司则需要更自然、低延迟且足够表达情感的语音。”这种对细分场景的深入理解,使得Fish Audio能够同时服务于创意行业和自动化企业需求。
在商业模式上,Fish Audio提供面向创作者和团队的月度付费计划,解锁一定数量的生成分钟数和语音克隆功能。企业级API和平台则针对大规模部署进行了优化。目前,HeyGen、Sanas和Plaud等知名AI公司已经成为其企业客户。这种从个人开发者到大型企业的全覆盖策略,帮助公司在短时间内实现了可观的收入增长。
然而,快速扩张也伴随着争议。Fish Audio构建语音库的方式之一是邀请用户提交自己的语音用于模型训练,并在语音被采用时给予补偿。但几个月前,一些创作者声称他们的声音在未经同意的情况下被上传到平台。虽然公司已有DMCA内容下架流程,但处理过程耗时较长。Cao表示,公司现已自动化下架流程:创作者只需提交简短语音样本或合同证明语音归属,其声音将在三分钟内从平台移除。不过她也承认,这一机制仍无法完全防止他人在不知情的情况下上传艺术家的声音。
这轮融资正值AI语音市场快速膨胀之际。从虚拟助手到游戏角色配音,从客服自动化到有声书制作,AI语音生成技术的应用场景不断扩展。Fish Audio的开源策略和丰富的控制选项,使其在技术社区中建立了良好声誉,而企业客户的增长则验证了其商业模式的可行性。随着资金到位,公司有望进一步扩大语音库规模、优化模型性能,并加强版权保护机制。对于AI语音行业而言,Fish Audio的崛起既展示了技术创新的潜力,也提醒着行业需要在开放性与合规性之间找到平衡。
来源:Heooo AI工具导航