小さなTTSが大きく成長しました
KittenTTSTTS 2は、かつての小さく自己完結型のモデルではありません。バージョン1のモデルは1500万〜8000万パラメータで、数十メガバイトに収まっていました。新しいKittenTTSTTS 2は劇的にスケールアップし、17億パラメータの音声モデルを搭載しています。
この新しいアーキテクチャは、2段階のパイプラインを採用しています。音声モデルがテキストと音声サンプルを処理してオーディオトークンを生成し、これらのトークンがResemble AI AI’s Chatterbox Turbo S3Gen vocoderに送られ、最終的な音声が合成されます。このボコーダーは初回実行時にダウンロードされるため、ローカル環境の占有容量がさらに拡大します。
この複雑さの代償として、短い参照クリップからのインコンテキスト音声クローン、47種類の内蔵音声、詳細な感情制御といった大きなメリットが得られます。しかし、その代償としてサイズが大きくなり、モデルファイルはコンパクトな470MBから最大3.5GBにまで及びます。
数秒で音声クローンを作成—ただし注意点も
KittenTTSTTS 2での音声クローン作成は簡単です。Python 3.10+でpip install KittenTTS-mlを実行してパッケージをセットアップします。短い参照録音を提供すれば、KittenTTSTTSがWhisperを使用して自動的に文字起こしを行い、音声を確実にキャプチャします。
ただし、デモで示された印象的な音声類似度スコア(プロジェクト報告値0.49〜0.81)には、第三者による検証が不足しています。モデルは新しく、外部テストも限定的です。感情タグや音声エフェクトはまだベータ版であり、本番環境での使用には不安定さが残ります。
長いテキスト入力は、途切れや繰り返しのアーティファクトを防ぐために自動的にチャンク分割されます。英語以外の音声サポートは堅牢性に欠けており、ドキュメントの不一致(10言語か20言語か)や、テキスト正規化を無効にする必要があるといった潜在的な問題があります。各非英語音声は、単一の「壊れやすい」可能性のある参照クリップに依存しています。
KittenTTSTTS 1のコンパクトな設計からの転換は明白です。KittenTTSTTS 2は、Torch、Transformers、Diffusersといった重い依存関係に加え、950MBのデフォルトモデルとResemble AI AIのS3Genボコーダーを必要とします。これは私たちが知っていた小さく自己完結型のツールではなく、はるかに大きく複雑なスタックとなっています。
MacではGPUが活用されません
Macユーザーは壁に突き当たります。KittenTTSTTS 2のPythonパッケージはNVIDIA CUDAを厳密にチェックします。CUDA対応のGPUがない場合、デフォルトでCPUが使用され、Apple SiliconのMetal Performance Shaders (MPS) やCoreMLアクセラレーションは完全に無視されます。つまり、Macの強力なGPUはアイドル状態のままです。
プロジェクトのドキュメントでも、このペナルティが確認されています。CPUでの生成はリアルタイムの2〜3倍遅くなります。スレッド調整(例: torch.set_num_threads(8))でわずかに向上する可能性はありますが、ライブ再生は期待できません。これは、かつての軽量でCPU優先のモデルではありません。
KittenTTSTTS 2のフルフットプリントは、前バージョンを大幅に上回ります。インストール時にPyTorch、Transformers、Diffusersが読み込まれ、さらにボコーダーの重み(Resemble AI AIのChatterbox TurboのS3Gen)と文字起こし用のWhisperがダウンロードされます。これにより、新バージョンは以前よりもはるかにポータビリティが低くなっています。
プロジェクトの詳細については、GitHub - KittenTTSML/KittenTTSTTSをご覧ください。オリジナルのKittenTTSTTSは自己完結型で軽量でした。バージョン2は高性能ですが、多大なリソースと外部依存関係を必要とし、その運用プロファイルは根本的に変化しました。これはもはや「KittenTTS」とは呼べないかもしれません。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
出荷前にライセンスを確認してください
ライセンスは地雷原のようなものです。KittenTTSTTS 2 PythonパッケージとそのコードはApache 2.0ライセンスですが、モデルの重みデータはどうでしょうか?これらはStellon Labs Community Licenseの下にあり、これを使用して開発を行う人にとっては極めて重要な区別となります。
開発者はこれらの条件を精査する必要があります。このライセンスでは商用登録が求められ、「Powered by Stellon Labs」という帰属表示を明示する必要があり、また取り消し可能な許諾となっています。さらに悪いことに、企業や資金調達額が100万ドルを超えると無料の商用利用ができなくなるため、多くのスタートアップにとって即座に失格条件となります。利用許諾ポリシーは存在しますが公開されておらず、Stellon Labsに連絡して確認する必要があります。
分単位の料金を気にしなくてよい趣味やローカルでの実験において、KittenTTSTTS 2は魅力的でプライベートな代替手段となります。しかし、本番環境のチームにとってはハードルが高くなります。権利を確認し、ハードウェアでベンチマークを行い、ElevenLabsやVoxCPM2などの代替手段と比較してください。オリジナルのKittenTTSTTSはシンプルでしたが、バージョン2ではデューデリジェンス(適正評価)が求められます。
よくある質問
KittenTTS 2とは何ですか?
KittenTTS 2は、17億パラメータの音声モデルと独立したボコーダーを中心に構築されたローカルテキスト読み上げシステムです。
KittenTTS 2は短い録音から声をクローンできますか?
はい。通常5〜10秒程度の短い参照クリップからの音声クローンをサポートしていますが、結果は異なる場合があります。
KittenTTS 2はMacで快適に動作しますか?
レビューしたPython設定ではMac上でCPUにフォールバックするため、Apple GPUが使用されず、生成速度がリアルタイムよりも遅くなる可能性があります。
KittenTTS 2はオープンソースですか?
コードとパッケージはApache 2.0ですが、モデルの重みデータはStellon Labs Community Licenseを使用しており、商用利用に制限があります。

