AI资讯 / 产业

产业 / 媒体

Fish Audio完成5200万美元种子轮融资,以开源生态切入AI语音市场

TechCrunch AI

Fish Audio于2026年7月28日宣布完成5200万美元种子轮融资,由Coreline Ventures和Capital Today领投,359 Capital、Parable、HF0等多家机构跟投。公司由前英伟达研究员廖世佳创立,最初仅凭一块GPU训练了一个语音生成模型并将其开源,GitHub仓库Fish Speech目前已累计超过3.1万颗星。自去年上线以来,平台用户数已突破800万,年经常性收入达2100万美元。Fish Audio提供超过1.5万种自然语言控制选项,已推出四款语音生成模型和一款语音转文字模型,其中三款已开源,最新的S2.1 Pro模型则通过付费API提供。HeyGen、Sanas等企业已在使用其服务。本轮融资将用于开发更先进的模型,并进一步拓展企业级市场,公司还计划在年内发布音频理解模型和语音转语音模型。

Fish Audio于2026年7月28日宣布完成5200万美元种子轮融资,由Coreline Ventures和Capital Today联合领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners及HF0等机构参与跟投。公司总部位于帕洛阿尔托,专注于为创作者和企业提供高表现力的AI语音模型,目前平台用户数已超过800万,年经常性收入达2100万美元。

Fish Audio的起点颇为低调。公司由前英伟达研究员廖世佳创立,他因市场上现有合成语音缺乏表现力而感到不满,便用一块GPU自行训练了一个语音生成模型,并将其开源发布。该项目在GitHub上的仓库Fish Speech目前已积累超过3.1万颗星,被独立开发者、游戏设计师和内容创作者广泛使用。过去一年间,公司共推出五款模型,其中三款语音生成模型已开源,最新的S2.1 Pro模型则仅通过付费API提供。

在产品定位上,Fish Audio试图同时服务于创作者和企业两类截然不同的需求。公司CEO兼联合创始人曹睿莎表示,HeyGen等AI虚拟形象公司追求声音的真实感,游戏工作室需要角色声音具备丰富表现力,而LiveKit等语音智能体公司则更看重低延迟与自然流畅度。为此,Fish Audio构建了超过1.5万种自然语言控制选项,以满足不同场景下的差异化需求。

Fish Audio的声音库建设依赖用户自主提交声音样本的社区模式,并在声音被采用时给予相应报酬。然而,这一机制数月前引发争议——部分创作者反映其声音在未经授权的情况下被上传至平台。对此,公司已将侵权声音下架流程自动化,创作者只需提交简短声音样本或合同证明,即可在三分钟内完成下架。但领投方Coreline Ventures合伙人本田大辅指出,社区驱动模式的可持续性有赖于创作者对平台的信任,同意授权、透明归因和便捷举报机制必须内嵌于产品设计之中,而非事后补救。

AI语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async及Krisp等公司均在争夺创作者和企业客户的预算。跟投方359 Capital合伙人里科·马洛齐认为,Fish Audio面向开发者的精细化控制能力和高效的模型训练成本,将成为其与大型AI实验室竞争的核心优势。他表示,Fish Audio团队以相对精简的规模构建出业界领先的模型,充分体现了其在缩小人工合成声音与真人声音差距方面的技术实力。

展望未来,Fish Audio计划在2026年内发布音频理解模型,并正在研发语音转语音模型。曹睿莎表示,公司此前以开源项目形式运营时无需外部资本,但为了开发更先进的模型并满足企业客户的需求,此次主动寻求融资。随着企业级市场需求持续升温,Fish Audio正从一个开发者社区项目加速转型为具备商业规模的AI语音基础设施提供商。

要点

  • Fish Audio完成5200万美元种子轮融资,用户数超800万,年经常性收入达2100万美元,展现出强劲的早期商业化能力。
  • 公司以开源生态为基础积累开发者社区,同时通过付费API和企业版平台实现商业变现,形成双轨并行的增长路径。
  • 声音未经授权上传的争议暴露了社区驱动模式的治理风险,平台需将创作者同意与版权保护机制内嵌于产品设计中。
  • AI语音生成赛道竞争白热化,Fish Audio的差异化优势在于超过1.5万种自然语言控制选项以及高效的模型训练能力。
  • 公司计划年内推出音频理解模型和语音转语音模型,持续扩展产品矩阵以覆盖更广泛的音频AI应用场景。
查看原始来源

原始标题:Fish Audio raises $52M seed to build AI voice models for creators and enterprises

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。