项目简介
CosyVoice 是 FunAudioLLM 开发的开源文本转语音系统,基于大语言模型构建,旨在生成自然、高保真的语音。
核心功能
- 支持九种主要语言和十八种以上中文方言。
- 零样本声音克隆,可跨语言转移说话人。
- 流式推理,首音频延迟约150毫秒。
- 通过指令提示,开发者可调整语言、情感、速度和音量。
技术栈与许可证
主要使用 Python 和 PyTorch,通过 Conda 和 pip 管理依赖。项目采用 Apache 2.0许可证。
获取方式
CosyVoice 可在 ModelScope 和 HuggingFace 平台获取。










评论
暂无评论
成为第一个评论的人