Skip to content
ai tools

KittenTTS 2 clona tu voz, con una condición

Un modelo de voz que alguna vez destacó por ser diminuto ha dado un giro sorprendente hacia una escala de miles de millones de parámetros. La demostración es impresionante, pero la licencia y las limitaciones de hardware podrían importar más que el clon en sí.

Nora Vance
KittenTTS 2 clona tu voz, con una condición

De un TTS ligero a un salto de 1.7B

KittenTTS 2 toma una grabación de audio corta y genera un nuevo discurso que suena como el hablante original, tal como muestra claramente el video de demostración de Better Stack. Es un paso notable para la clonación de voz casi instantánea, pero la última versión es un animal muy diferente a su predecesor.

Los modelos originales de KittenTTS eran diminutos, a menudo de 15M a 80M de parámetros. Esos modelos funcionaban en casi cualquier lugar, tenían una licencia Apache 2.0 y pesaban solo decenas de megabytes. La versión 2, sin embargo, salta a un modelo de lenguaje de voz de 1.7B de parámetros.

Esta no es la misma solución ligera y orientada al edge que hizo popular a KittenTTS. En cambio, el modelo mucho más grande cambia una huella diminuta por capacidades avanzadas como la clonación de voz y una generación de voz más expresiva. La versión original solo ofrecía voces preestablecidas estáticas. Ahora, KittenTTS 2 puede clonar una voz a partir de tan solo 5 segundos de audio.

KittenTTS 2 integra Whisper para transcribir el clip de referencia automáticamente, agilizando el proceso. La instalación es sencilla: pip install kitten-ml en Python 3.10 o superior. Este salto generacional prioriza la síntesis de voz sofisticada sobre el diseño ultracompacto de sus iteraciones anteriores.

Cinco segundos dentro; palabras que nunca dijiste fuera

El video de Better Stack ofrece un recorrido rápido de KittenTTS 2. Comienza con una muestra de voz de 10 segundos: "This is a test. I'm just talking to see how this sounds. 1, 2, 3, 4, 5. How's this voice audio?". Luego, el usuario pasa este clip al modelo.

KittenTTS 2 transcribe automáticamente el audio de referencia utilizando un modelo Whisper incluido. Esta es una conveniencia crucial; muchas herramientas de clonación de voz requieren que proporciones manualmente una transcripción de texto que coincida con tu audio, lo cual puede ser un paso adicional tedioso.

Después del procesamiento, el modelo genera una nueva oración: "This is a sentence I never actually recorded.". El audio generado suena notablemente similar al hablante original, demostrando clonación in-context zero-shot a partir de una entrada breve.

Aunque es impresionante, recuerda que esta es una sola demostración, no un punto de referencia científico. Los resultados en el mundo real pueden variar significativamente. Factores como la calidad de tu grabación, la duración de la muestra (el video usa 10 segundos, pero se anuncian 5 segundos) y el contenido específico del discurso influyen en el resultado.

Una instalación pip simple, una máquina mucho más grande

Configurar KittenTTS 2 localmente comienza de forma sencilla: Python 3.10 o superior, luego pip install kitten-ml. Esta instalación del paquete es la parte fácil, pero no la confundas con una prueba de que el modelo funcionará bien en cualquier computadora.

Esto se debe a que el "2" en KittenTTS 2 representa un salto significativo a un modelo de 1.7 mil millones de parámetros. Su tamaño varía desde unos 506 MiB para una versión cuantizada hasta aproximadamente 1.5 GB. Tu hardware y cómo lo ejecutes influirán fuertemente en el rendimiento.

Para aquellos que buscan ejecutarlo en máquinas de consumo, existen opciones. La inferencia de CPU local es posible, incluida una ruta C++/GGML construida a partir de proyectos como llama.cpp. Esto permite que el modelo de 1.7B se ejecute casi en tiempo real, incluso en Apple Silicon.

Antes de proceder con la instalación, verifica siempre las instrucciones actuales del proyecto y los requisitos de hardware. El ecosistema evoluciona rápidamente y lo que funciona hoy podría tener necesidades actualizadas mañana. Para obtener más información sobre la versión original y más ligera, consulta el repositorio GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

La trampa de la licencia detrás del truco de voz

Aquí está el truco: el KittenTTS original, popular por su tamaño reducido, utilizaba la licencia permisiva Apache 2.0. KittenTTS 2, sin embargo, opera bajo la Stellon Labs Community License. No confundas los pesos de modelos abiertos con el código abierto permisivo; los términos son bastante diferentes.

Usuarios comerciales, tomen nota. Antes de integrar KittenTTS 2 en cualquier producto, servicio alojado o flujo de trabajo monetizado, deben inspeccionar obligatoriamente los términos de licencia actuales. El cambio desde Apache 2.0 es significativo y podría afectar sus planes de implementación.

KittenTTS 2 ofrece capacidades atractivas para la experimentación local y la clonación de voz casi instantánea. Es impresionante por lo que hace. Sin embargo, si tus prioridades incluyen una huella de implementación pequeña, licencias verdaderamente permisivas o términos comerciales maduros, podrías encontrar que el KittenTTS anterior u otras opciones de TTS son más adecuadas. Lee siempre la letra pequeña.

Preguntas frecuentes

¿Qué es KittenTTS 2?

KittenTTS 2 es un modelo de generación de voz que puede producir habla con la voz de un hablante de referencia a partir de una muestra de audio corta.

¿Cuánto audio necesita KittenTTS 2 para clonar una voz?

El video demuestra una grabación corta, mientras que las notas de investigación describen aproximadamente de 5 a 30 segundos como el rango de audio de referencia.

¿KittenTTS 2 transcribe el audio de referencia automáticamente?

El flujo de trabajo demostrado utiliza Whisper para transcribir el clip de referencia, reduciendo la necesidad de proporcionar una transcripción manualmente.

¿Está KittenTTS 2 bajo licencia Apache 2.0?

No. El KittenTTS original usaba Apache 2.0, pero KittenTTS 2 se distribuye bajo la Stellon Labs Community License; revisa sus términos antes de usarlo.

¿Cómo se instala KittenTTS 2?

El video muestra la instalación del paquete de Python con pip install kitten-ml y requiere Python 3.10 o superior.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.