中級Python、PyTorch、Conda + pip

Cosy Voice

CosyVoiceは、成熟したオープンソースのテキスト読み上げ(TTS)ソリューションで、多言語対応、言語横断、感情制御、ゼロサンプル音声クローニング、ストリーミング低遅延合成をサポートしています。プロジェクトはPythonを中核言語とし、クラウドまたはオンプレミスサーバーへのデプロイに適しており、Docker化された本番環境のデプロイもサポートしています。

21.4K スター
2.5K フォーク
799 イシュー
137 閲覧
Python、PyTorch、Conda + pip
Apache-2.0
登録日
更新日

プロジェクト概要

CosyVoiceは、成熟したオープンソースのテキスト読み上げ(TTS)ソリューションで、多言語対応、言語横断、感情制御、ゼロサンプル音声クローニング、ストリーミング低遅延合成をサポートしています。プロジェクトはPythonを中核言語とし、クラウドまたはオンプレミスサーバーへのデプロイに適しており、Docker化された本番環境のデプロイもサポートしています。

CosyVoiceは、オープンソースの多言語音声生成モデルであり、「大規模音声生成とデプロイのフルスタックソリューション」として位置付けられています。テキストからの自然な音声生成、クロスリンガル音声クローニング、感情制御などの高度な機能をサポートし、TTS(Text-to-Speech)、音声アシスタント、ポッドキャスト合成などのシナリオに適しています。


CosyVoiceは、FunAudioLLM組織によって開発され、Apache-2.0ライセンスでオープンソース化されており、コミュニティからの注目度と活発さが高いです。


1、コアハイライト


? 多言語・方言サポート

中国語、英語、日本語、韓国語などの主要言語をサポート。

広東語、四川語、上海語など、さまざまな中国語方言をプロダクションレベルでサポート。

クロスリンガル、混合言語の音声クローニングと合成をサポート。


⚡ 低遅延リアルタイム生成

双方向ストリーミング推論メカニズムを導入し、最初のパケット遅延は約150msにまで低減

文字を入力しながら音声を出力するシナリオでもスムーズさを維持できます。


? 高自然度と制御性

発音精度を改善し、全体的な品質は初期バージョンより明らかに優れています。

感情、話速、音量などの制御タグをサポート(APIまたはサービスレベルで設定可能)。


? ゼロショット音声クローニング

大量のサンプルを必要とせず、1つの音声サンプルから似た声の音声出力を生成可能(Zero-shot Voice Cloning)。


2、コア機能とモジュール


機能説明
TTS音声合成テキストを直接高忠実度音声に変換
Zero-shot音声クローニング少量の音声サンプルで声をクローン
感情音声制御表現する感情、トーンなどのパラメータを設定可能
クロスリンガル合成異なる言語と混合言語の出力をサポート
ストリーミング出力メカニズム低遅延リアルタイム音声生成を実現
多言語音声生成TTS(Text-to-Speech)音声クローニングリアルタイム音声合成低遅延音声モデルPyTorch音声モデルオープンソース音声合成AI音声API機能DockerによるTTSデプロイLLM音声統合

プロジェクト評価

0.0 (0 レビュー)

共有

よくある質問

Cosy Voiceとは?

CosyVoiceは、成熟したオープンソースのテキスト読み上げ(TTS)ソリューションで、多言語対応、言語横断、感情制御、ゼロサンプル音声クローニング、ストリーミング低遅延合成をサポートしています。プロジェクトはPythonを中核言語とし、クラウドまたはオンプレミスサーバーへのデプロイに適しており、Docker化された本番環境のデプロイもサポートしています。

Cosy Voiceはどのプログラミング言語で開発されていますか?

Cosy Voiceは主にPython、PyTorch、Conda + pipで開発されています。

Cosy Voiceのライセンスは何ですか?

Cosy VoiceはApache-2.0ライセンスで公開されています。

関連プロジェクト

該当する結果がありません

もっと見る

コメント

コメント

0
0/500 文字

コメントはまだありません

最初のコメントを書きましょう

オープンソースプロジェクト

オープンソースAIプロジェクトを探求し、学び、貢献して、人工知能技術の発展を推進しましょう

すべて表示