Das winzige TTS ist erwachsen geworden – und zwar gewaltig
KittenTTSTTS 2 ist nicht mehr das winzige, in sich geschlossene Modell, an das Sie sich erinnern. Die Modelle der Version 1 hatten 15–80 Millionen Parameter und passten in wenige zehn Megabyte. Das neue KittenTTSTTS 2 skaliert drastisch nach oben und bietet ein Sprachmodell mit 1,7 Milliarden Parametern.
Diese neue Architektur verwendet eine zweistufige Pipeline. Das Sprachmodell verarbeitet Text und ein Sprachbeispiel und generiert Audio-Token. Diese Token fließen dann in den Resemble AI AI’s Chatterbox Turbo S3Gen Vocoder, der den endgültigen Klang synthetisiert. Dieser Vocoder wird beim ersten Start heruntergeladen, was den lokalen Speicherbedarf weiter erhöht.
Der Lohn für diese Komplexität ist beträchtlich: In-Context Voice Cloning anhand kurzer Referenzclips, 47 integrierte Stimmen und granulare Emotionssteuerung. Dies hat jedoch seinen Preis in Bezug auf die Größe, wobei die Modelldateien von kompakten 470 MB bis zu stattlichen 3,5 GB reichen.
Ein Voice Clone in Sekunden – mit Vorbehalten
Das Klonen einer Stimme mit KittenTTSTTS 2 ist unkompliziert: pip install KittenTTS-ml unter Python 3.10+ richtet das Paket ein. Stellen Sie eine kurze Referenzaufnahme bereit, und KittenTTSTTS transkribiert diese automatisch mit Whisper für eine robuste Spracherfassung.
Die beeindruckenden Ähnlichkeitswerte der Demo (projektseitig berichtet 0,49–0,81) fehlen jedoch unabhängige Überprüfungen. Das Modell ist neu und wurde nur begrenzt extern getestet. Emotions-Tags und Stimmeffekte befinden sich noch im Beta-Status, was auf Instabilität bei der produktiven Nutzung hindeutet.
Längere Texteingaben werden automatisch in Abschnitte unterteilt, um Abbrüche oder Wiederholungsartefakte zu vermeiden. Die Unterstützung für nicht-englische Stimmen ist weniger robust, mit Diskrepanzen in der Dokumentation (10 vs. 20 angegebene Sprachen) und potenziellen Problemen, die das Deaktivieren der Textnormalisierung erfordern. Jede nicht-englische Stimme stützt sich auf einen einzigen, potenziell "fragilen" Referenzclip.
Der Wandel vom kompakten Design von KittenTTSTTS 1 ist eklatant. KittenTTSTTS 2 zieht schwere Abhängigkeiten wie Torch, Transformers und Diffusers nach sich, dazu ein 950 MB großes Standardmodell und den S3Gen-Vocoder von Resemble AI AI. Dies ist nicht mehr das winzige, in sich geschlossene Werkzeug, das wir kannten; es ist ein viel größerer, komplexerer Stack.
Auf einem Mac bleibt die GPU außen vor
Mac-Nutzer stoßen an eine Grenze: Das Python-Paket von KittenTTSTTS 2 prüft strikt auf NVIDIA CUDA. Ohne eine CUDA-fähige GPU greift es standardmäßig auf die CPU zurück und umgeht dabei vollständig die Metal Performance Shaders (MPS) oder die CoreML-Beschleunigung von Apple Silicon. Das bedeutet, dass die leistungsstarke GPU Ihres Macs ungenutzt bleibt.
Die Projektdokumentation bestätigt den Nachteil: Die CPU-Generierung läuft 2–3 Mal langsamer als in Echtzeit. Thread-Optimierungen (z. B. torch.set_num_threads(8)) könnten eine leichte Verbesserung bringen, aber erwarten Sie keine Live-Wiedergabe. Dies ist nicht mehr das leichtgewichtige, auf CPU optimierte Modell von früher.
Der gesamte Speicherbedarf von KittenTTSTTS 2 übertrifft seinen Vorgänger bei weitem. Die Installation zieht PyTorch, Transformers und Diffusers nach sich. Dann werden Vocoder-Gewichte (S3Gen von Resemble AI AI's Chatterbox Turbo) und Whisper für die Transkription heruntergeladen. Das macht die neue Version weitaus weniger portabel.
Für tiefere Einblicke in das Projekt besuchen Sie GitHub - KittenTTSML/KittenTTSTTS. Das ursprüngliche KittenTTSTTS war in sich geschlossen und winzig. Version 2 ist zwar leistungsfähig, erfordert aber erhebliche Ressourcen und externe Abhängigkeiten, was sein Betriebsprofil grundlegend verändert. Dies ist kein "KittenTTS" mehr.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Lesen Sie die Lizenz, bevor Sie das Produkt veröffentlichen
Lizenzierung ist ein Minenfeld. Das KittenTTSTTS 2 Python-Paket und dessen Code stehen unter der Apache 2.0 Lizenz. Aber die Modellgewichte? Sie unterliegen der Stellon Labs Community License, eine entscheidende Unterscheidung für jeden, der damit entwickelt.
Entwickler müssen diese Bedingungen genau prüfen. Die Lizenz erfordert eine kommerzielle Registrierung, verlangt eine gut sichtbare „Powered by Stellon Labs“-Namensnennung und enthält eine widerrufliche Gewährung. Schlimmer noch: Die kostenlose kommerzielle Nutzung endet, sobald Ihr Unternehmen oder Ihre Finanzierung 1 Million Dollar übersteigt – ein schnelles Ausschlusskriterium für viele Startups. Es gibt eine Richtlinie zur akzeptablen Nutzung, die jedoch nicht öffentlich ist; Sie müssen Stellon Labs kontaktieren, um sie einzusehen.
Für Hobbyisten oder lokale Experimente, bei denen keine Gebühren pro Minute anfallen, bietet KittenTTSTTS 2 eine überzeugende, private Alternative. Produktionsteams stehen jedoch vor einer höheren Hürde. Überprüfen Sie Ihre Rechte, führen Sie Benchmarks auf Ihrer Hardware durch und vergleichen Sie Alternativen wie ElevenLabs oder VoxCPM2. Das ursprüngliche KittenTTSTTS war einfach; Version 2 erfordert eine gründliche Due-Diligence-Prüfung.
Häufig gestellte Fragen
Was ist KittenTTS 2?
KittenTTS 2 ist ein lokales Text-to-Speech-System, das auf einem Sprachmodell mit 1,7 Milliarden Parametern und einem separaten Vocoder basiert.
Kann KittenTTS 2 eine Stimme anhand einer kurzen Aufnahme klonen?
Ja. Es unterstützt das Voice Cloning anhand eines kurzen Referenzclips, typischerweise etwa 5–10 Sekunden, wobei die Ergebnisse variieren können.
Läuft KittenTTS 2 gut auf einem Mac?
Das getestete Python-Setup greift auf dem Mac auf die CPU zurück, wodurch die Apple GPU ungenutzt bleibt; die Generierung kann langsamer als in Echtzeit verlaufen.
Ist KittenTTS 2 Open Source?
Der Code und das Paket stehen unter Apache 2.0, aber die Modellgewichte nutzen die Stellon Labs Community License, die kommerzielle Einschränkungen enthält.

