O pequeno TTS cresceu — e muito
KittenTTSTTS 2 não é o modelo pequeno e independente que você lembra. Os modelos da versão 1 tinham de 15 a 80 milhões de parâmetros, cabendo em dezenas de megabytes. O novo KittenTTSTTS 2 escala drasticamente, apresentando um modelo de fala de 1,7 bilhão de parâmetros.
Esta nova arquitetura emprega um pipeline de dois estágios. O modelo de fala processa o texto e uma amostra de voz, gerando tokens de áudio. Esses tokens então alimentam o Resemble AI AI’s Chatterbox Turbo S3Gen vocoder, que sintetiza o som final. Este vocoder é baixado na primeira execução, expandindo ainda mais a ocupação local.
A recompensa por essa complexidade é significativa: clonagem de voz em contexto a partir de clipes de referência curtos, 47 vozes integradas e controles granulares de emoção. No entanto, isso tem um custo de tamanho, com arquivos de modelo variando de um compacto 470 MB a robustos 3,5 GB.
Uma clonagem de voz em segundos — com ressalvas
Clonar uma voz com KittenTTSTTS 2 é simples: pip install KittenTTS-ml no Python 3.10+ configura o pacote. Forneça uma gravação de referência curta, e o KittenTTSTTS a transcreve automaticamente usando o Whisper para uma captura de voz robusta.
No entanto, as impressionantes pontuações de similaridade de voz da demonstração (reportadas pelo projeto como 0,49–0,81) carecem de verificação independente. O modelo é novo, com testes externos limitados. Tags de emoção e efeitos vocais permanecem em beta, sugerindo instabilidade para uso em produção.
Entradas de texto mais longas são automaticamente divididas em partes para evitar cortes ou artefatos de repetição. O suporte a vozes que não sejam em inglês é menos robusto, com discrepâncias na documentação (10 vs. 20 idiomas citados) e possíveis problemas que exigem que a normalização de texto seja desativada. Cada voz não inglesa depende de um único clipe de referência potencialmente "frágil".
A mudança em relação ao design compacto do KittenTTSTTS 1 é gritante. O KittenTTSTTS 2 puxa dependências pesadas como Torch, Transformers e Diffusers, além de um modelo padrão de 950 MB e o vocoder S3Gen da Resemble AI AI. Esta não é a ferramenta minúscula e independente que conhecíamos; é uma pilha muito maior e mais complexa.
Em um Mac, a GPU fica de fora
Usuários de Mac encontram um obstáculo: o pacote Python do KittenTTSTTS 2 verifica estritamente por NVIDIA CUDA. Sem uma GPU habilitada para CUDA, ele usa a CPU por padrão, ignorando completamente o Metal Performance Shaders (MPS) ou a aceleração CoreML do Apple Silicon. Isso significa que a poderosa GPU do seu Mac fica ociosa.
A documentação do projeto confirma a penalidade: a geração via CPU roda 2 a 3 vezes mais devagar que o tempo real. O ajuste de threads (por exemplo, torch.set_num_threads(8)) pode oferecer um leve ganho, mas não espere reprodução ao vivo. Este não é o modelo leve e focado em CPU de antigamente.
A ocupação total do KittenTTSTTS 2 supera vastamente seu predecessor. A instalação puxa PyTorch, Transformers e Diffusers. Em seguida, baixa os pesos do vocoder (S3Gen do Chatterbox Turbo da Resemble AI AI) e o Whisper para transcrição. Isso torna a nova versão muito menos portátil.
Para mergulhos mais profundos no projeto, confira GitHub - KittenTTSML/KittenTTSTTS. O KittenTTSTTS original era independente e minúsculo. A versão 2, embora capaz, exige recursos significativos e dependências externas, alterando fundamentalmente seu perfil operacional. Isso não é mais um "KittenTTS".
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
Leia a licença antes de publicar
O licenciamento é um campo minado. O pacote Python KittenTTSTTS 2 e seu código são Apache 2.0. Mas os pesos do modelo? Eles estão sob a Stellon Labs Community License, uma distinção crítica para qualquer pessoa que esteja desenvolvendo com ele.
Os desenvolvedores devem examinar esses termos. A licença exige registro comercial, requer atribuição proeminente de “Powered by Stellon Labs” e possui uma concessão revogável. Pior ainda, o uso comercial gratuito termina se sua empresa ou financiamento exceder US$ 1 milhão — um fator de desqualificação rápido para muitas startups. Existe uma política de uso aceitável, mas não é pública; você deve entrar em contato com a Stellon Labs para analisá-la.
Para entusiastas ou experimentos locais onde taxas por minuto não importam, o KittenTTSTTS 2 oferece uma alternativa privada e atraente. Equipes de produção, no entanto, enfrentam um nível mais alto de exigência. Verifique seus direitos, faça benchmarks com seu hardware e compare alternativas como ElevenLabs ou VoxCPM2. O KittenTTSTTS original era simples; a versão 2 exige a devida diligência.
Perguntas Frequentes
O que é o KittenTTS 2?
O KittenTTS 2 é um sistema local de conversão de texto em fala (text-to-speech) construído em torno de um modelo de fala de 1,7 bilhão de parâmetros e um vocoder separado.
O KittenTTS 2 pode clonar uma voz a partir de uma gravação curta?
Sim. Ele suporta clonagem de voz a partir de um clipe de referência curto, normalmente em torno de 5 a 10 segundos, embora os resultados possam variar.
O KittenTTS 2 roda bem em um Mac?
A configuração Python analisada recorre à CPU no Mac, deixando a GPU da Apple sem uso; a geração pode ser executada mais lentamente do que em tempo real.
O KittenTTS 2 é de código aberto?
O código e o pacote são Apache 2.0, mas os pesos do modelo usam a Stellon Labs Community License, que possui restrições comerciais.

