Skip to content
KI-Werkzeug

KittenTTS 2 im Test

KittenTTS 2 ist ein Sprachgenerierungsmodell, das anhand von Text und einer kurzen Audioaufnahme als Stimmreferenz Sprache erzeugt, die einer ursprünglichen sprechenden Person ähnelt.

shipped 8. Okt. 2026freemium
Domain rating20
KittenTTS 2 — product screenshot

Warum es wichtig ist

1Unterstützt Text-to-Speech-Generierung mit In-Context-Voice-Cloning.
2Kann eine kurze Audioaufnahme als Stimmreferenz verwenden.
3Unterstützt Text- und Audioeingaben.
4Eine API ist verfügbar; die Dokumentation finden Sie unter https://platform.kittenml.com.

Spezifikationen

API-Dokumentation

API verfügbar

Ja, öffentliche API

overview

Was ist KittenTTS 2?

KittenTTS 2 ist ein KI-gestütztes Sprachgenerierungstool, mit dem Nutzer Sprache erzeugen können, die einer ursprünglichen sprechenden Person ähnelt. Es unterstützt In-Context-Voice-Cloning anhand einer kurzen Audioaufnahme und generiert Sprache aus Text.

features

Hauptfunktionen von KittenTTS 2

KittenTTS 2 kombiniert textbasierte Sprachgenerierung mit In-Context-Voice-Cloning. Den verfügbaren Produktinformationen zufolge unterstützt es Text- und Audioeingaben und bietet API-Zugriff.

  • Generiert Sprache aus Text.
  • Erzeugt Sprache, die einer ursprünglichen sprechenden Person ähnelt.
  • Unterstützt In-Context-Voice-Cloning.
  • Kann eine kurze Audioaufnahme als Stimmreferenz verwenden.
  • Unterstützt Text- und Audioeingaben.
  • Bietet API-Zugriff.
  • Angegebenes Modell: Stellon Labs kitten-tts-2.

use cases

Für wen eignet sich KittenTTS 2?

KittenTTS 2 ist für Nutzer relevant, die Sprache aus Text generieren oder Sprache erzeugen möchten, die einer sprechenden Person in einer kurzen Audioaufnahme ähnelt.

  • Nutzer, die Sprache aus Text generieren.
  • Nutzer, deren generierte Sprache einer aufgenommenen sprechenden Person ähneln soll.
  • Nutzer, die eine kurze Aufnahme als Stimmreferenz bereitstellen möchten.
  • Entwickler, die per API auf die Sprachgenerierung zugreifen möchten.

how to use

So verwenden Sie KittenTTS 2

Die verfügbaren Informationen bestätigen, dass eine API vorhanden ist, und verweisen auf die Dokumentation unter https://platform.kittenml.com. Anforderungen an ein Konto, Anfrageformate oder Schritte zur Bedienung der Benutzeroberfläche werden jedoch nicht näher erläutert.

  • 1Öffnen Sie die API-Dokumentation unter https://platform.kittenml.com.
  • 2Lesen Sie die dokumentierten Zugriffs- und Anfrageverfahren durch.
  • 3Geben Sie Text für die Sprachgenerierung ein und beachten Sie dabei das dokumentierte Eingabeformat.
  • 4Wenn Sie Voice-Cloning nutzen, stellen Sie eine kurze Audioaufnahme als Stimmreferenz bereit.
  • 5Senden Sie die Anfrage über die dokumentierte API und rufen Sie die generierte Sprache wie dort beschrieben ab.

pricing

Preise und Tarife von KittenTTS 2

KittenTTS 2 ist als Freemium-Angebot gelistet. In den verfügbaren Produktinformationen werden weder Tarifnamen noch Beschränkungen des kostenlosen Tarifs, Preise kostenpflichtiger Tarife oder API-Nutzungsgebühren genannt.

  • Freemium: angegebenes Preismodell; enthaltene Funktionen und Beschränkungen sind nicht spezifiziert.
  • Kostenpflichtige Tarife: Preise und Tarifdetails sind nicht verfügbar.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Pros

  • +Supports in-context voice cloning from a short audio recording.
  • +Generates speech from text.
  • +Supports text and audio modalities.
  • +An API is available, with documentation at platform.kittenml.com.
  • +Listed as freemium.

Cons

  • −Specific free-tier limits and paid prices are not provided.
  • −The available information does not specify supported audio formats or recording requirements.
  • −No API request examples, rate limits, or usage prices are provided.
  • −No benchmark results or hardware requirements are specified.

Ähnliche Tools

KittenTTS 2 im Vergleich zu Wettbewerbern

Die verfügbare Beschreibung bestätigt, dass KittenTTS 2 Text-to-Speech-Generierung und In-Context-Voice-Cloning anhand kurzer Audioaufnahmen bietet. Konkrete Benchmark-Ergebnisse, Hardwareanforderungen und vergleichende Leistungsdaten werden nicht genannt. Daher beschränken sich die folgenden Vergleiche auf die ausdrücklich beschriebenen Produktansätze.

1
Kokoro↗

At just 82M parameters, it produces near-commercial speech quality on standard CPUs without requiring large foundation model compute.

Kokoro focuses strictly on pre-defined high-quality voice profiles rather than dynamic zero-shot reference audio cloning, so you cannot clone arbitrary voices on the fly.

2
F5-TTS↗

Uses non-autoregressive flow matching for fast, robust zero-shot voice cloning and speech editing directly from short reference audio clips.

F5-TTS requires significantly more compute and ideally a dedicated GPU, whereas KittenTTS 2 is quantized to ternary weights specifically to execute on consumer CPUs.

3
Chatterbox↗

An open-source reference implementation by Resemble AI focused specifically on zero-shot cloning with fine-grained emotion and expressiveness transfer.

It is substantially heavier to run locally than KittenTTS 2's lightweight CPU-focused architecture and requires a capable CUDA environment for responsive inference.

4
OpenVoice↗

Decouples voice style/timbre cloning from base speech generation, letting you clone speaker identity with precise control over emotion, accent, and cadence.

Because it operates as a modular two-stage pipeline (base TTS plus tone color converter), its setup and synthesis chain are noticeably more complex than KittenTTS 2's single in-context model.

Mehr auf Stork

Verwandte KI-Tools

Weitere Tools dieser Kategorie, über gemeinsame Tags zugeordnet

Eine kurze E-Mail pro Tag mit Tools, die sich lohnen. Kein Drip-Funnel.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.