De um TTS leve a um salto de 1.7B
KittenTTS 2 pega uma pequena gravação de áudio e gera uma nova fala que soa como o locutor original, como o vídeo de demonstração da Better Stack mostra claramente. É um passo notável para a clonagem de voz quase instantânea, mas a versão mais recente é um animal muito diferente de seu predecessor.
Os modelos originais do KittenTTS eram minúsculos, muitas vezes com 15M a 80M de parâmetros. Esses modelos rodavam em quase qualquer lugar, possuíam uma licença Apache 2.0 e pesavam apenas dezenas de megabytes. A versão 2, no entanto, salta para um modelo de linguagem de fala de 1.7B de parâmetros.
Esta não é a mesma solução leve e focada em edge que tornou o KittenTTS popular. Em vez disso, o modelo muito maior troca uma pegada minúscula por recursos avançados como clonagem de voz e geração de fala mais expressiva. A versão original oferecia apenas vozes predefinidas estáticas. Agora, o KittenTTS 2 pode clonar uma voz a partir de apenas 5 segundos de áudio.
O KittenTTS 2 integra o Whisper para transcrever o clipe de referência automaticamente, simplificando o processo. A instalação é direta: pip install kitten-ml no Python 3.10 ou mais recente. Este salto geracional prioriza a síntese de voz sofisticada em vez do design ultracompacto de suas iterações anteriores.
Cinco segundos dentro; palavras que você nunca disse fora
O vídeo da Better Stack fornece um passo a passo rápido do KittenTTS 2. Ele começa com uma amostra de voz de 10 segundos: "Este é um teste. Estou apenas falando para ver como isso soa. 1, 2, 3, 4, 5. Como está este áudio de voz?" O usuário então passa este clipe para o modelo.
O KittenTTS 2 transcreve automaticamente o áudio de referência usando um modelo Whisper integrado. Esta é uma conveniência crucial; muitas ferramentas de clonagem de voz exigem que você forneça manualmente uma transcrição de texto correspondente ao seu áudio, o que pode ser uma etapa extra tediosa.
Após o processamento, o modelo gera uma nova frase: "Esta é uma frase que eu nunca gravei de fato." O áudio gerado soa notavelmente semelhante ao locutor original, demonstrando clonagem zero-shot in-context a partir de uma breve entrada.
Embora impressionante, lembre-se de que esta é uma demonstração única, não um benchmark científico. Os resultados no mundo real podem variar significativamente. Fatores como a qualidade da sua gravação, a duração da amostra (o vídeo usa 10 segundos, mas 5 segundos são anunciados) e o conteúdo específico da fala influenciam o resultado.
Um simples pip install, uma máquina muito maior
Configurar o KittenTTS 2 localmente começa de forma simples: Python 3.10 ou mais recente, depois pip install kitten-ml. Esta instalação do pacote é a parte fácil, mas não confunda isso com a prova de que o modelo rodará bem em qualquer computador.
Isso ocorre porque o "2" no KittenTTS 2 representa um salto significativo para um modelo de 1.7 bilhão de parâmetros. Sua pegada varia de cerca de 506 MiB para uma versão quantizada a aproximadamente 1.5 GB. Seu hardware e como você o executa influenciarão fortemente o desempenho.
Para aqueles que desejam executá-lo em máquinas de consumo, existem opções. A inferência de CPU local é possível, incluindo uma rota C++/GGML construída a partir de projetos como o llama.cpp. Isso permite que o modelo de 1.7B rode quase em tempo real, mesmo no Apple Silicon.
Antes de clicar em instalar, verifique sempre as instruções atuais do projeto e os requisitos de hardware. O ecossistema evolui rapidamente, e o que funciona hoje pode ter necessidades atualizadas amanhã. Para mais informações sobre a versão original e mais leve, confira o repositório GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
A pegadinha da licença por trás do truque de voz
Aqui está a pegadinha: o KittenTTS original, popular por sua pegada mínima, usava a licença permissiva Apache 2.0. O KittenTTS 2, no entanto, opera sob a Stellon Labs Community License. Não confunda pesos de modelo abertos com código aberto permissivo; os termos são bem diferentes.
Usuários comerciais, prestem atenção. Antes de integrar o KittenTTS 2 em qualquer produto, serviço hospedado ou fluxo de trabalho monetizado, você deve obrigatoriamente inspecionar os termos de licença atuais. A mudança em relação ao Apache 2.0 é significativa e pode impactar seus planos de implantação.
O KittenTTS 2 oferece capacidades atraentes para experimentação local e clonagem de voz quase instantânea. É impressionante pelo que faz. No entanto, se suas prioridades incluem pegadas de implantação minúsculas, licenciamento verdadeiramente permissivo ou termos comerciais maduros, você pode achar que o KittenTTS mais antigo ou outras opções de TTS são mais adequados. Sempre leia as letras miúdas.
Perguntas Frequentes
O que é o KittenTTS 2?
O KittenTTS 2 é um modelo de geração de fala que pode produzir fala na voz de um locutor de referência a partir de uma pequena amostra de áudio.
Quanto áudio o KittenTTS 2 precisa para clonar uma voz?
O vídeo demonstra uma gravação curta, enquanto as notas de pesquisa descrevem aproximadamente 5 a 30 segundos como o intervalo de áudio de referência.
O KittenTTS 2 transcreve o áudio de referência automaticamente?
O fluxo de trabalho demonstrado usa o Whisper para transcrever o clipe de referência, reduzindo a necessidade de fornecer uma transcrição manualmente.
O KittenTTS 2 é licenciado sob Apache 2.0?
Não. O KittenTTS original usava Apache 2.0, mas o KittenTTS 2 é distribuído sob a Stellon Labs Community License; revise seus termos antes de usar.
Como você instala o KittenTTS 2?
O vídeo mostra a instalação do pacote Python com pip install kitten-ml e requer Python 3.10 ou mais recente.

