Vom Leichtgewicht-TTS zum 1,7B-Sprung
KittenTTS 2 nimmt eine kurze Audioaufnahme und generiert neue Sprache, die wie der ursprüngliche Sprecher klingt, wie das Demo-Video von Better Stack deutlich zeigt. Es ist ein bemerkenswerter Schritt für nahezu sofortiges Voice Cloning, aber die neueste Version ist etwas ganz anderes als ihr Vorgänger.
Die ursprünglichen KittenTTS-Modelle waren winzig, oft mit 15M bis 80M Parametern. Diese Modelle liefen fast überall, hatten eine Apache 2.0-Lizenz und wogen nur wenige zehn Megabyte. Version 2 springt jedoch auf ein 1,7B-Parameter-Sprachmodell.
Dies ist nicht mehr die leichtgewichtige, auf Edge-Geräte ausgerichtete Lösung, die KittenTTS populär gemacht hat. Stattdessen tauscht das wesentlich größere Modell den minimalen Speicherbedarf gegen fortschrittliche Funktionen wie Voice Cloning und eine ausdrucksstärkere Sprachgenerierung ein. Die ursprüngliche Version bot nur statische, voreingestellte Stimmen. Jetzt kann KittenTTS 2 eine Stimme mit nur 5 Sekunden Audiomaterial klonen.
KittenTTS 2 integriert Whisper, um den Referenzclip automatisch zu transkribieren und den Prozess zu optimieren. Die Installation ist unkompliziert: pip install kitten-ml unter Python 3.10 oder neuer. Dieser Generationssprung priorisiert anspruchsvolle Sprachsynthese gegenüber dem ultrakompakten Design seiner früheren Iterationen.
Fünf Sekunden Aufnahme; Worte, die Sie nie gesagt haben
Das Video von Better Stack bietet einen kurzen Überblick über KittenTTS 2. Es beginnt mit einer 10-sekündigen Sprachprobe: "Dies ist ein Test. Ich spreche nur, um zu sehen, wie das klingt. 1, 2, 3, 4, 5. Wie ist dieses Audio?" Der Benutzer übergibt diesen Clip dann an das Modell.
KittenTTS 2 transkribiert das Referenz-Audio automatisch mithilfe eines gebündelten Whisper-Modells. Dies ist ein entscheidender Komfort; viele Voice-Cloning-Tools erfordern, dass Sie manuell ein Texttranskript bereitstellen, das zu Ihrem Audio passt, was ein mühsamer zusätzlicher Schritt sein kann.
Nach der Verarbeitung generiert das Modell einen neuen Satz: "Dies ist ein Satz, den ich nie wirklich aufgenommen habe." Das generierte Audio klingt bemerkenswert ähnlich wie der ursprüngliche Sprecher und demonstriert Zero-Shot In-Context Cloning anhand eines kurzen Inputs.
Obwohl beeindruckend, denken Sie daran, dass dies eine einzelne Demonstration ist, kein wissenschaftlicher Benchmark. Ergebnisse in der Praxis können erheblich variieren. Faktoren wie die Qualität Ihrer Aufnahme, die Länge des Samples (das Video verwendet 10 Sekunden, beworben werden jedoch 5 Sekunden) und der spezifische Sprachinhalt beeinflussen das Ergebnis.
Eine einfache pip-Installation, eine viel größere Maschine
Die lokale Einrichtung von KittenTTS 2 beginnt recht einfach: Python 3.10 oder neuer, dann pip install kitten-ml. Diese Paketinstallation ist der einfache Teil, aber verwechseln Sie dies nicht mit dem Beweis, dass das Modell auf jedem beliebigen Computer gut läuft.
Das liegt daran, dass die "2" in KittenTTS 2 einen bedeutenden Sprung zu einem 1,7-Milliarden-Parameter-Modell darstellt. Der Speicherbedarf reicht von etwa 506 MiB für eine quantisierte Version bis zu etwa 1,5 GB. Ihre Hardware und die Art und Weise, wie Sie es ausführen, beeinflussen die Leistung erheblich.
Für diejenigen, die es auf Consumer-Geräten ausführen möchten, gibt es Optionen. Lokale CPU-Inferenz ist möglich, einschließlich eines C++/GGML-Weges, der auf Projekten wie llama.cpp basiert. Dies ermöglicht es dem 1,7B-Modell, nahezu in Echtzeit zu laufen, selbst auf Apple Silicon.
Bevor Sie die Installation starten, überprüfen Sie immer die aktuellen Projektanweisungen und Hardwareanforderungen. Das Ökosystem entwickelt sich schnell, und was heute läuft, könnte morgen aktualisierte Anforderungen haben. Für mehr Informationen zur ursprünglichen, leichteren Version besuchen Sie das GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU Repository.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Der Lizenz-Haken beim Voice-Trick
Hier ist der Haken: Das ursprüngliche KittenTTS, beliebt für seinen geringen Platzbedarf, nutzte die permissive Apache 2.0 Lizenz. KittenTTS 2 hingegen operiert unter der Stellon Labs Community License. Verwechseln Sie offene Modellgewichte nicht mit permissiver Open Source; die Bedingungen sind sehr unterschiedlich.
Kommerzielle Nutzer, aufgepasst. Bevor Sie KittenTTS 2 in ein Produkt, einen gehosteten Dienst oder einen monetarisierten Workflow integrieren, müssen Sie unbedingt die aktuellen Lizenzbedingungen prüfen. Der Wechsel von Apache 2.0 ist signifikant und könnte Ihre Bereitstellungspläne beeinflussen.
KittenTTS 2 bietet überzeugende Funktionen für lokale Experimente und nahezu sofortiges Voice Cloning. Es ist beeindruckend in dem, was es tut. Wenn jedoch Ihre Prioritäten bei einem winzigen Bereitstellungs-Footprint, einer wirklich permissiven Lizenzierung oder ausgereiften kommerziellen Bedingungen liegen, könnten das ältere KittenTTS oder andere TTS-Optionen besser geeignet sein. Lesen Sie immer das Kleingedruckte.
Häufig gestellte Fragen
Was ist KittenTTS 2?
KittenTTS 2 ist ein Spracherzeugungsmodell, das Sprache in der Stimme eines Referenzsprechers anhand eines kurzen Audio-Samples erzeugen kann.
Wie viel Audio benötigt KittenTTS 2, um eine Stimme zu klonen?
Das Video demonstriert eine kurze Aufnahme, während die Forschungsnotizen einen Bereich von etwa 5–30 Sekunden als Referenz-Audio angeben.
Transkribiert KittenTTS 2 das Referenz-Audio automatisch?
Der demonstrierte Workflow verwendet Whisper, um den Referenz-Clip zu transkribieren, wodurch die manuelle Bereitstellung eines Transkripts entfällt.
Ist KittenTTS 2 unter Apache 2.0 lizenziert?
Nein. Das ursprüngliche KittenTTS nutzte Apache 2.0, aber KittenTTS 2 wird unter der Stellon Labs Community License vertrieben; prüfen Sie die Bedingungen vor der Nutzung.
Wie installiert man KittenTTS 2?
Das Video zeigt die Installation des Python-Pakets mit pip install kitten-ml und erfordert Python 3.10 oder neuer.

