Skip to content
Herramienta de IA

Reseña de KittenTTS 2

KittenTTS 2 es un modelo de generación de voz que crea habla similar a la de un hablante original usando texto y una grabación de audio breve como referencia de voz.

shipped 8 oct 2026freemium
Domain rating20
KittenTTS 2 — product screenshot

Por qué importa

1Admite la generación de texto a voz con clonación de voz en contexto.
2Puede usar una grabación de audio breve como referencia de voz.
3Admite modalidades de texto y audio.
4Hay una API disponible; la documentación está en https://platform.kittenml.com.

Especificaciones

Documentación API

API disponible

Sí, API pública

overview

¿Qué es KittenTTS 2?

KittenTTS 2 es una herramienta de generación de voz con IA que permite a los usuarios generar habla similar a la de un hablante original. Admite la clonación de voz en contexto a partir de una grabación de audio breve y genera habla a partir de texto.

features

Características principales de KittenTTS 2

KittenTTS 2 combina la generación de voz basada en texto con la clonación de voz en contexto. La información disponible del producto identifica el texto y el audio como sus modalidades y confirma el acceso a través de API.

  • Genera habla a partir de texto.
  • Produce habla similar a la de un hablante original.
  • Admite la clonación de voz en contexto.
  • Puede usar una grabación de audio breve como referencia de voz.
  • Admite modalidades de texto y audio.
  • Ofrece acceso a través de API.
  • Modelo identificado: Stellon Labs kitten-tts-2.

use cases

¿Quién debería usar KittenTTS 2?

KittenTTS 2 es relevante para usuarios que necesitan generar habla a partir de texto o crear habla similar a la de un hablante en una grabación de audio breve.

  • Usuarios que generan habla a partir de texto.
  • Usuarios que necesitan que el habla generada se parezca a la de un hablante grabado.
  • Usuarios que quieren proporcionar una grabación breve como referencia de voz.
  • Desarrolladores que buscan acceder a la generación de voz mediante una API.

how to use

Cómo usar KittenTTS 2

La información disponible confirma que hay una API y ofrece un enlace a su documentación en https://platform.kittenml.com, pero no especifica los requisitos de cuenta, los formatos de solicitud ni los pasos de la interfaz.

  • 1Abre la documentación de la API en https://platform.kittenml.com.
  • 2Consulta los procedimientos de acceso y solicitud documentados.
  • 3Proporciona texto para generar habla siguiendo el formato de entrada documentado.
  • 4Si usas la clonación de voz, proporciona una grabación de audio breve como referencia de voz.
  • 5Envía la solicitud mediante la API documentada y recupera el habla generada según se describe allí.

pricing

Precios y planes de KittenTTS 2

KittenTTS 2 figura como freemium. La información disponible del producto no especifica los nombres de los niveles, los límites del nivel gratuito, los precios de los planes de pago ni las tarifas de uso de la API.

  • Freemium: modelo de precios indicado; las funciones incluidas y los límites no están especificados.
  • Planes de pago: los precios y los detalles de los planes no están disponibles.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Pros

  • +Supports in-context voice cloning from a short audio recording.
  • +Generates speech from text.
  • +Supports text and audio modalities.
  • +An API is available, with documentation at platform.kittenml.com.
  • +Listed as freemium.

Cons

  • −Specific free-tier limits and paid prices are not provided.
  • −The available information does not specify supported audio formats or recording requirements.
  • −No API request examples, rate limits, or usage prices are provided.
  • −No benchmark results or hardware requirements are specified.

Herramientas similares

KittenTTS 2 frente a la competencia

La descripción disponible establece que KittenTTS 2 genera voz a partir de texto y permite la clonación de voz en contexto desde audios breves. No se proporcionan resultados específicos de pruebas comparativas, requisitos de hardware ni cifras de rendimiento comparativo, por lo que las comparaciones siguientes se limitan a los enfoques de producto indicados.

1
Kokoro↗

At just 82M parameters, it produces near-commercial speech quality on standard CPUs without requiring large foundation model compute.

Kokoro focuses strictly on pre-defined high-quality voice profiles rather than dynamic zero-shot reference audio cloning, so you cannot clone arbitrary voices on the fly.

2
F5-TTS↗

Uses non-autoregressive flow matching for fast, robust zero-shot voice cloning and speech editing directly from short reference audio clips.

F5-TTS requires significantly more compute and ideally a dedicated GPU, whereas KittenTTS 2 is quantized to ternary weights specifically to execute on consumer CPUs.

3
Chatterbox↗

An open-source reference implementation by Resemble AI focused specifically on zero-shot cloning with fine-grained emotion and expressiveness transfer.

It is substantially heavier to run locally than KittenTTS 2's lightweight CPU-focused architecture and requires a capable CUDA environment for responsive inference.

4
OpenVoice↗

Decouples voice style/timbre cloning from base speech generation, letting you clone speaker identity with precise control over emotion, accent, and cadence.

Because it operates as a modular two-stage pipeline (base TTS plus tone color converter), its setup and synthesis chain are noticeably more complex than KittenTTS 2's single in-context model.

Más en Stork

Herramientas IA relacionadas

Otras herramientas de esta categoría, emparejadas por etiquetas comunes

Un correo corto al día con herramientas que valen la pena. Sin embudos de marketing.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.