Skip to content
ai tools

KittenTTS 2 ficou maior — e mais complicado

Uma amostra de voz de cinco segundos agora pode se tornar uma nova voz convincente, diretamente na sua máquina. Mas as mudanças mais importantes podem ser aquelas que você não ouvirá na demonstração.

Theo Brandt
KittenTTS 2 ficou maior — e mais complicado

O pequeno TTS cresceu — e muito

KittenTTSTTS 2 não é o modelo pequeno e independente que você lembra. Os modelos da versão 1 tinham de 15 a 80 milhões de parâmetros, cabendo em dezenas de megabytes. O novo KittenTTSTTS 2 escala drasticamente, apresentando um modelo de fala de 1,7 bilhão de parâmetros.

Esta nova arquitetura emprega um pipeline de dois estágios. O modelo de fala processa o texto e uma amostra de voz, gerando tokens de áudio. Esses tokens então alimentam o Resemble AI AI’s Chatterbox Turbo S3Gen vocoder, que sintetiza o som final. Este vocoder é baixado na primeira execução, expandindo ainda mais a ocupação local.

A recompensa por essa complexidade é significativa: clonagem de voz em contexto a partir de clipes de referência curtos, 47 vozes integradas e controles granulares de emoção. No entanto, isso tem um custo de tamanho, com arquivos de modelo variando de um compacto 470 MB a robustos 3,5 GB.

Uma clonagem de voz em segundos — com ressalvas

Clonar uma voz com KittenTTSTTS 2 é simples: pip install KittenTTS-ml no Python 3.10+ configura o pacote. Forneça uma gravação de referência curta, e o KittenTTSTTS a transcreve automaticamente usando o Whisper para uma captura de voz robusta.

No entanto, as impressionantes pontuações de similaridade de voz da demonstração (reportadas pelo projeto como 0,49–0,81) carecem de verificação independente. O modelo é novo, com testes externos limitados. Tags de emoção e efeitos vocais permanecem em beta, sugerindo instabilidade para uso em produção.

Entradas de texto mais longas são automaticamente divididas em partes para evitar cortes ou artefatos de repetição. O suporte a vozes que não sejam em inglês é menos robusto, com discrepâncias na documentação (10 vs. 20 idiomas citados) e possíveis problemas que exigem que a normalização de texto seja desativada. Cada voz não inglesa depende de um único clipe de referência potencialmente "frágil".

A mudança em relação ao design compacto do KittenTTSTTS 1 é gritante. O KittenTTSTTS 2 puxa dependências pesadas como Torch, Transformers e Diffusers, além de um modelo padrão de 950 MB e o vocoder S3Gen da Resemble AI AI. Esta não é a ferramenta minúscula e independente que conhecíamos; é uma pilha muito maior e mais complexa.

Em um Mac, a GPU fica de fora

Usuários de Mac encontram um obstáculo: o pacote Python do KittenTTSTTS 2 verifica estritamente por NVIDIA CUDA. Sem uma GPU habilitada para CUDA, ele usa a CPU por padrão, ignorando completamente o Metal Performance Shaders (MPS) ou a aceleração CoreML do Apple Silicon. Isso significa que a poderosa GPU do seu Mac fica ociosa.

A documentação do projeto confirma a penalidade: a geração via CPU roda 2 a 3 vezes mais devagar que o tempo real. O ajuste de threads (por exemplo, torch.set_num_threads(8)) pode oferecer um leve ganho, mas não espere reprodução ao vivo. Este não é o modelo leve e focado em CPU de antigamente.

A ocupação total do KittenTTSTTS 2 supera vastamente seu predecessor. A instalação puxa PyTorch, Transformers e Diffusers. Em seguida, baixa os pesos do vocoder (S3Gen do Chatterbox Turbo da Resemble AI AI) e o Whisper para transcrição. Isso torna a nova versão muito menos portátil.

Para mergulhos mais profundos no projeto, confira GitHub - KittenTTSML/KittenTTSTTS. O KittenTTSTTS original era independente e minúsculo. A versão 2, embora capaz, exige recursos significativos e dependências externas, alterando fundamentalmente seu perfil operacional. Isso não é mais um "KittenTTS".

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

Leia a licença antes de publicar

O licenciamento é um campo minado. O pacote Python KittenTTSTTS 2 e seu código são Apache 2.0. Mas os pesos do modelo? Eles estão sob a Stellon Labs Community License, uma distinção crítica para qualquer pessoa que esteja desenvolvendo com ele.

Os desenvolvedores devem examinar esses termos. A licença exige registro comercial, requer atribuição proeminente de “Powered by Stellon Labs” e possui uma concessão revogável. Pior ainda, o uso comercial gratuito termina se sua empresa ou financiamento exceder US$ 1 milhão — um fator de desqualificação rápido para muitas startups. Existe uma política de uso aceitável, mas não é pública; você deve entrar em contato com a Stellon Labs para analisá-la.

Para entusiastas ou experimentos locais onde taxas por minuto não importam, o KittenTTSTTS 2 oferece uma alternativa privada e atraente. Equipes de produção, no entanto, enfrentam um nível mais alto de exigência. Verifique seus direitos, faça benchmarks com seu hardware e compare alternativas como ElevenLabs ou VoxCPM2. O KittenTTSTTS original era simples; a versão 2 exige a devida diligência.

Perguntas Frequentes

O que é o KittenTTS 2?

O KittenTTS 2 é um sistema local de conversão de texto em fala (text-to-speech) construído em torno de um modelo de fala de 1,7 bilhão de parâmetros e um vocoder separado.

O KittenTTS 2 pode clonar uma voz a partir de uma gravação curta?

Sim. Ele suporta clonagem de voz a partir de um clipe de referência curto, normalmente em torno de 5 a 10 segundos, embora os resultados possam variar.

O KittenTTS 2 roda bem em um Mac?

A configuração Python analisada recorre à CPU no Mac, deixando a GPU da Apple sem uso; a geração pode ser executada mais lentamente do que em tempo real.

O KittenTTS 2 é de código aberto?

O código e o pacote são Apache 2.0, mas os pesos do modelo usam a Stellon Labs Community License, que possui restrições comerciais.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.