一家做 AI 语音模型的创业公司, 种子轮就拿了 5200 万美元。Fish Audio 这个名字, 在技术圈外可能还不怎么响, 但论用户规模, 它已经悄悄跑到了很多同行的前面。
根据 TechCrunch 的报道, Fish Audio 自去年正式推出以来, 开源版本和托管版本的模型累计吸引了超过 800 万人使用, 年经常性收入(ARR)达到 2100 万美元。对一个成立时间不长的团队来说, 这样的数字放在 AI 语音赛道里, 已经称得上亮眼。
一款把门槛压得足够低的语音模型
Fish Audio 的核心业务并不复杂: 让用户用文本生成语音, 也支持声音克隆、语音合成这类典型应用。和很多只做 API 的语音公司不同, 他们一开始就选择了开源加托管的双轨路线。开源模型给了开发者自由实验的空间, 托管服务则承接那些不想自己部署的用户。
这种做法对独立开发者和中小团队尤其友好。你不需要搭 GPU 集群, 也不需要啃厚重的技术文档, 直接在网页上拖几个文件, 或者调用现成的接口, 就能得到一条听起来相当自然的语音。用一位早期用户的话说, 它把以前需要专门音色设计师干的活, 压缩成了几分钟的事。
- 文本转语音: 支持多语言和多种音色, 适合短视频配音、有声内容
- 声音克隆: 上传短样本即可生成相似音色, 降低角色配音门槛
- 开源模型: 社区可以自托管、二次微调, 满足数据合规要求
种子轮 5200 万美元, 钱会花在哪
5200 万美元放在大模型赛道不算夸张, 但作为种子轮, 它已经透露出资本对 AI 语音商业化前景的明确态度。Fish Audio 计划把这笔资金主要用于三件事: 扩充模型训练的算力与数据、扩大研发团队、以及搭建面向企业客户的销售与服务能力。
值得注意的是, 这家公司在营收结构上并不完全依赖大客户买单。800 万用户里, 大量是个人创作者和小型工作室, 他们贡献的客单价不高, 但胜在基数大、增长稳。2100 万美元的 ARR, 更多是靠订阅和按量计费一点点堆出来的。
这种从下往上的打法, 和海外一些只盯着大企业合同的语音公司形成了鲜明对比。对创作者经济敏感的人来说, Fish Audio 的增长数据本身就是个信号: AI 语音的付费意愿正在从专业制作人扩散到普通内容生产者。
对创作者和企业, 意味着什么
对单个创作者来说, 最直接的变化是配音成本大幅下降。过去做一条多角色音频, 可能要请人录、约时间、反复返工, 现在几段文字就能生成一版可用的草稿, 甚至直接用于发布。像播客开场、视频旁白、游戏 NPC 语音这类场景, 以前是专业团队的活, 现在个人也能上手。
对企业的意义则更偏工业化。客服语音、营销视频、内部培训材料, 这些需要稳定音色输出的地方, 正好是 Fish Audio 托管模型的舒适区。加上开源版本的存在, 企业可以先把模型放到自己的环境里验证效果, 再决定要不要进入付费体系。这种灵活度, 在强调数据隐私的行业里尤其有吸引力。
当然, 挑战也是明摆着的。语音克隆技术一旦滥用, 会带来身份冒充、虚假信息等问题。Fish Audio 在合规上做了一些限制, 比如要求授权证明, 但整个行业都在摸索边界。用户在选择这类服务时, 也应该主动了解平台的使用条款和风险提示。
一点看法
AI 语音不是新赛道, 但 Fish Audio 用开源加低门槛产品的组合, 硬是在一片红海里挤出了自己的位置。种子轮就拿到 5200 万美元, 说明资方对它的增长路径是认可的。下一步要看的是, 当用户规模继续膨胀, 它能不能在音质、时延和价格之间保持住平衡——毕竟, 这个领域的用户迁移成本, 比很多人想象中低得多。











评论
暂无评论
成为第一个评论的人