軽量なTTSから1.7Bへの飛躍
Better Stackのデモ動画が示す通り、KittenTTS 2は短い音声録音から、元の話者にそっくりな新しい音声を生成します。これは「ほぼリアルタイムの音声クローン」に向けた注目すべき一歩ですが、最新バージョンは前モデルとは全く異なる性質のものです。
オリジナルのKittenTTSモデルは、15Mから80Mパラメータという非常に小さなものでした。それらのモデルはほぼどこでも動作し、Apache 2.0ライセンスで、サイズも数十メガバイト程度でした。しかし、バージョン2では「1.7Bパラメータの音声言語モデル」へと飛躍しました。
これは、KittenTTSを人気にした軽量でエッジ重視のソリューションとは別物です。このはるかに大きなモデルは、小さなフットプリントを犠牲にする代わりに、音声クローンやより表現力豊かな音声生成といった高度な機能を実現しています。オリジナル版は静的なプリセット音声のみを提供していましたが、KittenTTS 2はわずか5秒の音声から声をクローンできるようになりました。
KittenTTS 2はWhisperを統合しており、参照クリップを自動的に文字起こしすることでプロセスを効率化しています。インストールは簡単で、Python 3.10以降で pip install kitten-ml を実行するだけです。この世代交代は、初期の超コンパクトな設計よりも、洗練された音声合成を優先しています。
5秒の入力で、言ったことのない言葉を生成
Better Stackの動画では、KittenTTS 2のクイックウォークスルーが紹介されています。まず10秒の音声サンプルから始まります。「これはテストです。どんな風に聞こえるか確認するために話しています。1、2、3、4、5。この音声はどうですか?」ユーザーはこのクリップをモデルに渡します。
KittenTTS 2は、バンドルされたWhisperモデルを使用して参照音声を自動的に文字起こしします。これは非常に便利な機能です。多くの音声クローンツールでは、音声に一致するテキストの文字起こしを手動で提供する必要があり、それが面倒な追加ステップとなることが多いためです。
処理後、モデルは「これは私が実際に録音したことのない文章です」という新しい文を生成します。生成された音声は元の話者に驚くほど似ており、短い入力からの「ゼロショット・インコンテキスト・クローン」を実証しています。
印象的ではありますが、これは単一のデモンストレーションであり、科学的なベンチマークではないことに注意してください。実際の環境での結果は大きく異なる可能性があります。「録音の品質」、サンプルの長さ(動画では10秒使用されていますが、5秒でも可能とされています)、そして具体的な音声の内容などがすべて出力に影響します。
簡単なpipインストール、しかし必要なマシンパワーは大幅増
KittenTTS 2のローカル環境構築は、Python 3.10以降で pip install kitten-ml を実行するだけで簡単に見えます。パッケージのインストールは簡単ですが、どんなコンピュータでも快適に動作するという証拠ではありません。
KittenTTS 2の「2」は、17億パラメータモデルへの大幅な飛躍を意味しているからです。そのフットプリントは、量子化バージョンで約506 MiB、通常版で約1.5 GBに及びます。ハードウェアと実行方法がパフォーマンスに大きく影響します。
コンシューマー向けマシンで実行したい場合、選択肢はあります。llama.cppのようなプロジェクトをベースにしたC++/GGMLルートを含む、ローカルでの「CPU推論」が可能です。これにより、1.7BモデルをApple Silicon上でもほぼリアルタイムで実行できるようになります。
インストールを実行する前に、必ず最新のプロジェクト手順とハードウェア要件を確認してください。エコシステムは急速に進化しており、今日動作するものが明日には新しい要件を必要とする可能性があります。軽量なオリジナル版の詳細については、GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU リポジトリをご確認ください。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
音声クローン技術に潜むライセンスの落とし穴
ここが注意点です。軽量で人気を博したオリジナルのKittenTTSは、寛容な Apache 2.0 license を採用していました。しかし、KittenTTS 2は Stellon Labs Community License の下で運用されています。オープンなモデルウェイトと、寛容なオープンソースライセンスを混同しないでください。その条件は大きく異なります。
商用利用の方はご注意ください。KittenTTS 2を製品、ホスト型サービス、または収益化されたワークフローに組み込む前に、現在のライセンス条項を必ず確認してください。Apache 2.0からの変更は重要であり、デプロイ計画に影響を与える可能性があります。
KittenTTS 2は、ローカルでの実験やほぼ瞬時の音声クローンにおいて魅力的な機能を提供します。その性能は非常に印象的です。しかし、デプロイの軽量さ、真に寛容なライセンス、または成熟した商用条件を優先する場合は、旧バージョンのKittenTTSや他のTTSオプションの方が適している可能性があります。常に細かい条項まで確認するようにしてください。
よくある質問
KittenTTS 2とは何ですか?
KittenTTS 2は、短い音声サンプルから参照話者の声で音声を生成できる音声生成モデルです。
KittenTTS 2で音声をクローンするにはどれくらいの長さの音声が必要ですか?
動画では短い録音を使用していますが、研究ノートでは参照音声の範囲として約5〜30秒と記載されています。
KittenTTS 2は参照音声を自動的に文字起こししますか?
デモで使用されているワークフローでは、Whisperを使用して参照クリップを文字起こしするため、手動でトランスクリプトを提供する必要が軽減されます。
KittenTTS 2はApache 2.0ライセンスですか?
いいえ。オリジナルのKittenTTSはApache 2.0を使用していましたが、KittenTTS 2はStellon Labs Community Licenseの下で配布されています。使用前に条項を確認してください。
KittenTTS 2のインストール方法は?
動画では、pip install kitten-ml を使用してPythonパッケージをインストールする方法を示しています。Python 3.10以降が必要です。

