Skip to content
ai tools

KittenTTS 2 se hizo más grande—y más complicado

Una muestra de voz de cinco segundos ahora puede convertirse en una nueva voz convincente, directamente en tu máquina. Pero los cambios más importantes podrían ser aquellos que no escucharás en la demostración.

Theo Brandt
KittenTTS 2 se hizo más grande—y más complicado

El pequeño TTS creció—y mucho

KittenTTSTTS 2 no es el modelo pequeño y autónomo que recuerdas. Los modelos de la versión 1 tenían entre 15 y 80 millones de parámetros, ocupando decenas de megabytes. El nuevo KittenTTSTTS 2 escala drásticamente, presentando un modelo de voz de 1.7 mil millones de parámetros.

Esta nueva arquitectura emplea un flujo de trabajo de dos etapas. El modelo de voz procesa el texto y una muestra de voz, generando tokens de audio. Estos tokens luego se envían al vocoder Resemble AI AI’s Chatterbox Turbo S3Gen, que sintetiza el sonido final. Este vocoder se descarga en la primera ejecución, expandiendo aún más la huella local.

La recompensa por esta complejidad es significativa: clonación de voz en contexto a partir de clips de referencia cortos, 47 voces integradas y controles de emoción granulares. Sin embargo, esto tiene un costo en tamaño, con archivos de modelo que van desde unos compactos 470 MB hasta unos considerables 3.5 GB.

Un clon de voz en segundos—con advertencias

Clonar una voz con KittenTTSTTS 2 es sencillo: pip install KittenTTS-ml en Python 3.10+ configura el paquete. Proporciona una grabación de referencia corta, y KittenTTSTTS la transcribe automáticamente usando Whisper para una captura de voz robusta.

Sin embargo, las impresionantes puntuaciones de similitud de voz de la demostración (0.49–0.81 reportadas por el proyecto) carecen de verificación independiente. El modelo es nuevo, con pruebas externas limitadas. Las etiquetas de emoción y los efectos vocales siguen estando en beta, lo que sugiere inestabilidad para su uso en producción.

Las entradas de texto más largas se dividen automáticamente para evitar cortes o artefactos de repetición. El soporte para voces que no están en inglés es menos robusto, con discrepancias en la documentación (se citan 10 frente a 20 idiomas) y posibles problemas que requieren desactivar la normalización de texto. Cada voz que no está en inglés depende de un único clip de referencia potencialmente "frágil".

El cambio desde el diseño compacto de KittenTTSTTS 1 es marcado. KittenTTSTTS 2 arrastra dependencias pesadas como Torch, Transformers y Diffusers, además de un modelo predeterminado de 950 MB y el vocoder S3Gen de Resemble AI AI. Esta ya no es la herramienta pequeña y autónoma que conocíamos; es una pila mucho más grande y compleja.

En una Mac, la GPU se queda fuera

Los usuarios de Mac se topan con un muro: el paquete de Python de KittenTTSTTS 2 verifica estrictamente la presencia de NVIDIA CUDA. Sin una GPU compatible con CUDA, utiliza la CPU por defecto, omitiendo por completo la aceleración Metal Performance Shaders (MPS) o CoreML de Apple Silicon. Esto significa que la potente GPU de tu Mac permanece inactiva.

La documentación del proyecto confirma la penalización: la generación por CPU se ejecuta 2–3 veces más lento que en tiempo real. El ajuste de hilos (por ejemplo, torch.set_num_threads(8)) podría ofrecer un ligero impulso, pero no esperes reproducción en vivo. Este ya no es el modelo ligero y centrado en CPU de antes.

La huella completa de KittenTTSTTS 2 supera ampliamente a su predecesor. La instalación descarga PyTorch, Transformers y Diffusers. Luego descarga los pesos del vocoder (S3Gen de Resemble AI AI's Chatterbox Turbo) y Whisper para la transcripción. Esto hace que la nueva versión sea mucho menos portátil.

Para profundizar en el proyecto, consulta GitHub - KittenTTSML/KittenTTSTTS. El KittenTTSTTS original era autónomo y pequeño. La versión 2, aunque capaz, exige recursos significativos y dependencias externas, alterando fundamentalmente su perfil operativo. Esto ya no es un "KittenTTS".

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Lee la licencia antes de publicar

La concesión de licencias es un campo minado. El paquete de Python KittenTTSTTS 2 y su código están bajo licencia Apache 2.0. ¿Pero los pesos del modelo? Están bajo la Stellon Labs Community License, una distinción crítica para cualquiera que desarrolle con él.

Los desarrolladores deben examinar esos términos. La licencia exige registro comercial, requiere una atribución destacada de “Powered by Stellon Labs” y conlleva una concesión revocable. Peor aún, el uso comercial gratuito termina si su empresa o financiación supera el millón de dólares, un factor de descalificación rápido para muchas startups. Existe una política de uso aceptable, pero no es pública; debe contactar a Stellon Labs para revisarla.

Para aficionados o experimentos locales donde las tarifas por minuto no importan, KittenTTSTTS 2 ofrece una alternativa privada y convincente. Los equipos de producción, sin embargo, enfrentan un listón más alto. Verifique sus derechos, realice pruebas comparativas con su hardware y compare alternativas como ElevenLabs o VoxCPM2. El KittenTTSTTS original era simple; la versión 2 exige la debida diligencia.

Preguntas frecuentes

¿Qué es KittenTTS 2?

KittenTTS 2 es un sistema local de conversión de texto a voz construido alrededor de un modelo de voz de 1.7 mil millones de parámetros y un vocoder separado.

¿Puede KittenTTS 2 clonar una voz a partir de una grabación corta?

Sí. Admite la clonación de voz a partir de un clip de referencia corto, generalmente de unos 5 a 10 segundos, aunque los resultados pueden variar.

¿Funciona bien KittenTTS 2 en una Mac?

La configuración de Python revisada recurre a la CPU en Mac, dejando la GPU de Apple sin usar; la generación puede ser más lenta que el tiempo real.

¿Es KittenTTS 2 de código abierto?

El código y el paquete son Apache 2.0, pero los pesos del modelo utilizan la Stellon Labs Community License, que tiene restricciones comerciales.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.