Fish Audio筹集了5200万美元种子资金,为创作者和企业构建AI语音模型

人工智能生成的语音模型的市场巨大。创意用例要求人工智能语音模型更具表现力,而寻求自动化客户支持和销售运营的企业则需要它们更具可操纵性。

位于帕洛阿尔托的Fish Audio希望通过其包含15,000多个自然语言控件的库来满足所有这些用例。自去年成立以来,这家初创公司如今已有超过800万人使用其模型的开源或托管版本,目前每年产生的经常性收入为2100万美元。

为了继续巩固这一势头,这家初创公司周二表示,已在由Coreline Ventures和Capital Today领投的种子轮融资中筹集了5200万美元。 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0也参与了本轮融资。

Fish Audio最初是由前NVIDIA研究员Shijia Liao发起的一个小项目,他对市场上缺乏表现力的合成语音感到沮丧,在单个GPU上训练了一个语音生成模型,并将其开源。 GitHub上的Fish Speech存储库现已拥有超过31,000颗星,并被独立开发者、视频游戏设计师和创作者使用。

该公司去年推出了五种模型:四种语音生成模型和一种语音转文本模型。它开源了三个语音生成模型,但其最新的S2.1 Pro模型只能通过其付费API获得。

Fish Audio提供适合创作者和团队的付费月度计划,可解锁设定的生成分钟数,以及语音克隆功能。该公司还提供其API和平台的企业版,并表示HeyGen和Sanas等组织已经在使用它。

“每个企业都有不同的用例和不同的偏好。例如,像HeyGen这样的公司,使用我们的声音来为人工智能化身提供动力,希望声音真实;游戏工作室希望他们的角色具有富有表现力的声音;而像LiveKit这样的语音代理公司则希望声音更自然、低延迟,足以表达通话的声音,”曹说。

该初创公司建立语音库的一种方法是简单地要求用户提交自己的声音来训练其模型,并在使用他们的声音时给予补偿。然而,几个月前这引起了一些麻烦,一些创作者声称他们的声音在未经他们同意的情况下被上传到Fish Audio。该初创公司制定了DMCA内容删除流程来解决此类问题,但删除本身需要很长时间。

Fish Audio的CEO兼联合创始人Rissa Cao告诉TechCrunch,该公司现在已经实现了下架流程的自动化。她说,创作者可以轻松提交简短的语音样本或合同,以证明上传的语音属于他们,他们的语音将在不到3分钟的时间内从初创公司的平台上删除。

尽管如此,这并不能阻止任何人在艺术家不知情的情况下上传他们的声音。在艺术家发现之前,他们的声音将继续在平台上使用,直到他们申请将其删除。

Coreline Ventures的合伙人Osuke Honda表示,社区驱动的模式只有在创作者信任该平台时才有效。

“只有创作者信任该平台,以社区为中心的方法才能成为持久的优势。这意味着同意、透明度和归属必须内置于产品中,而不是被视为事后的想法。我认为该行业需要转向经过验证的声音所有权、明确的许可条款、简单的报告和删除流程,以及最终的收入分享模式,让创作者在他们的声音获得许可或商业使用时获得经济利益,”他说。

曹说,当这家初创公司仅以开源项目的形式提供其产品并为创作者提供计划时,它运行效率很高,并且不需要资金。但它希望开发更先进的模型,并且还希望随着投资者兴趣的增加而容纳企业,这导致它寻求资本。

展望未来,Fish Audio计划今年发布音频理解模型。它还正在构建一个语音到语音模型。

语音生成市场非常拥挤,ElevenLabs、WellSaid、Cartesia、Speechify、Async(以前称为Podcastle)和Krisp等公司都在争夺创作者和企业的钱包。

359 Capital合伙人Rico Mallozzi表示,对开发人员的细粒度控制和经济高效的模型训练将帮助Fish Audio更好地与大型AI实验室竞争。

“我认为,与其他一些资金雄厚的人工智能实验室或公司相比,他们凭借自己的团队能够构建出最先进的模型,这是令人难以置信的。这显示了他们在缩小人工声音和类人声音之间差距方面的技术敏锐度,”马洛齐在电话中告诉TechCrunch。

该故事已更新,以反映该公司在种子轮融资中筹集了5200万美元。

← 上一篇文章 Apple与Klarna合作推出“升级”设备租赁计划 下一篇文章 → WhatsApp现在允许您使用其网络应用程序拨打电话

← 返回列表