Skip to content
ai tools

KittenTTS 2 clona a sua voz — com um porém

Um modelo de voz que antes se destacava por ser minúsculo deu uma guinada surpreendente para a escala de bilhões de parâmetros. A demonstração é impressionante, mas a licença e as compensações de hardware podem ser mais importantes do que o próprio clone.

Nora Vance
KittenTTS 2 clona a sua voz — com um porém

De um TTS leve a um salto de 1.7B

KittenTTS 2 pega uma pequena gravação de áudio e gera uma nova fala que soa como o locutor original, como o vídeo de demonstração da Better Stack mostra claramente. É um passo notável para a clonagem de voz quase instantânea, mas a versão mais recente é um animal muito diferente de seu predecessor.

Os modelos originais do KittenTTS eram minúsculos, muitas vezes com 15M a 80M de parâmetros. Esses modelos rodavam em quase qualquer lugar, possuíam uma licença Apache 2.0 e pesavam apenas dezenas de megabytes. A versão 2, no entanto, salta para um modelo de linguagem de fala de 1.7B de parâmetros.

Esta não é a mesma solução leve e focada em edge que tornou o KittenTTS popular. Em vez disso, o modelo muito maior troca uma pegada minúscula por recursos avançados como clonagem de voz e geração de fala mais expressiva. A versão original oferecia apenas vozes predefinidas estáticas. Agora, o KittenTTS 2 pode clonar uma voz a partir de apenas 5 segundos de áudio.

O KittenTTS 2 integra o Whisper para transcrever o clipe de referência automaticamente, simplificando o processo. A instalação é direta: pip install kitten-ml no Python 3.10 ou mais recente. Este salto geracional prioriza a síntese de voz sofisticada em vez do design ultracompacto de suas iterações anteriores.

Cinco segundos dentro; palavras que você nunca disse fora

O vídeo da Better Stack fornece um passo a passo rápido do KittenTTS 2. Ele começa com uma amostra de voz de 10 segundos: "Este é um teste. Estou apenas falando para ver como isso soa. 1, 2, 3, 4, 5. Como está este áudio de voz?" O usuário então passa este clipe para o modelo.

O KittenTTS 2 transcreve automaticamente o áudio de referência usando um modelo Whisper integrado. Esta é uma conveniência crucial; muitas ferramentas de clonagem de voz exigem que você forneça manualmente uma transcrição de texto correspondente ao seu áudio, o que pode ser uma etapa extra tediosa.

Após o processamento, o modelo gera uma nova frase: "Esta é uma frase que eu nunca gravei de fato." O áudio gerado soa notavelmente semelhante ao locutor original, demonstrando clonagem zero-shot in-context a partir de uma breve entrada.

Embora impressionante, lembre-se de que esta é uma demonstração única, não um benchmark científico. Os resultados no mundo real podem variar significativamente. Fatores como a qualidade da sua gravação, a duração da amostra (o vídeo usa 10 segundos, mas 5 segundos são anunciados) e o conteúdo específico da fala influenciam o resultado.

Um simples pip install, uma máquina muito maior

Configurar o KittenTTS 2 localmente começa de forma simples: Python 3.10 ou mais recente, depois pip install kitten-ml. Esta instalação do pacote é a parte fácil, mas não confunda isso com a prova de que o modelo rodará bem em qualquer computador.

Isso ocorre porque o "2" no KittenTTS 2 representa um salto significativo para um modelo de 1.7 bilhão de parâmetros. Sua pegada varia de cerca de 506 MiB para uma versão quantizada a aproximadamente 1.5 GB. Seu hardware e como você o executa influenciarão fortemente o desempenho.

Para aqueles que desejam executá-lo em máquinas de consumo, existem opções. A inferência de CPU local é possível, incluindo uma rota C++/GGML construída a partir de projetos como o llama.cpp. Isso permite que o modelo de 1.7B rode quase em tempo real, mesmo no Apple Silicon.

Antes de clicar em instalar, verifique sempre as instruções atuais do projeto e os requisitos de hardware. O ecossistema evolui rapidamente, e o que funciona hoje pode ter necessidades atualizadas amanhã. Para mais informações sobre a versão original e mais leve, confira o repositório GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

A pegadinha da licença por trás do truque de voz

Aqui está a pegadinha: o KittenTTS original, popular por sua pegada mínima, usava a licença permissiva Apache 2.0. O KittenTTS 2, no entanto, opera sob a Stellon Labs Community License. Não confunda pesos de modelo abertos com código aberto permissivo; os termos são bem diferentes.

Usuários comerciais, prestem atenção. Antes de integrar o KittenTTS 2 em qualquer produto, serviço hospedado ou fluxo de trabalho monetizado, você deve obrigatoriamente inspecionar os termos de licença atuais. A mudança em relação ao Apache 2.0 é significativa e pode impactar seus planos de implantação.

O KittenTTS 2 oferece capacidades atraentes para experimentação local e clonagem de voz quase instantânea. É impressionante pelo que faz. No entanto, se suas prioridades incluem pegadas de implantação minúsculas, licenciamento verdadeiramente permissivo ou termos comerciais maduros, você pode achar que o KittenTTS mais antigo ou outras opções de TTS são mais adequados. Sempre leia as letras miúdas.

Perguntas Frequentes

O que é o KittenTTS 2?

O KittenTTS 2 é um modelo de geração de fala que pode produzir fala na voz de um locutor de referência a partir de uma pequena amostra de áudio.

Quanto áudio o KittenTTS 2 precisa para clonar uma voz?

O vídeo demonstra uma gravação curta, enquanto as notas de pesquisa descrevem aproximadamente 5 a 30 segundos como o intervalo de áudio de referência.

O KittenTTS 2 transcreve o áudio de referência automaticamente?

O fluxo de trabalho demonstrado usa o Whisper para transcrever o clipe de referência, reduzindo a necessidade de fornecer uma transcrição manualmente.

O KittenTTS 2 é licenciado sob Apache 2.0?

Não. O KittenTTS original usava Apache 2.0, mas o KittenTTS 2 é distribuído sob a Stellon Labs Community License; revise seus termos antes de usar.

Como você instala o KittenTTS 2?

O vídeo mostra a instalação do pacote Python com pip install kitten-ml e requer Python 3.10 ou mais recente.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.