静止画像または入力動画から「話している」動画を生成する機能をサポート:ユーザーが画像または動画+音声トラックを提供すると、システムが口形同期、頭部/身体/表情の動きを備えた動画を生成します。
無限長生成:従来の短い動画(10~15秒)の長さ制限を突破し、理論上任意の長さの連続講話動画を生成可能(ハードウェア・VRAMの制約を受ける)。
より多様な動作次元の同期:口形同期(リップシンク)だけでなく、頭部の動き、身体姿勢、表情を含むため、リアリティが向上します。
複数の入力モードをサポート:
画像+音声 → 動画
動画+音声 → 動画
これにより、アバター生成、仮想スピーチ、人間とコンピュータのインタラクションアニメーションなどに応用可能です。










コメント
コメントはまだありません
最初のコメントを書きましょう