D'un TTS poids plume à un bond de 1,7 milliard de paramètres
KittenTTS 2 prend un court enregistrement audio et génère une nouvelle parole qui ressemble à celle du locuteur original, comme le montre clairement la vidéo de démonstration de Better Stack. C'est une étape remarquable pour le clonage vocal quasi instantané, mais la dernière version est très différente de son prédécesseur.
Les modèles KittenTTS originaux étaient minuscules, souvent de 15 à 80 millions de paramètres. Ces modèles fonctionnaient presque partout, bénéficiaient d'une licence Apache 2.0 et ne pesaient que quelques dizaines de mégaoctets. La version 2, cependant, passe à un modèle de langage vocal de 1,7 milliard de paramètres.
Il ne s'agit pas de la même solution légère et orientée vers l'edge computing qui a rendu KittenTTS populaire. Au lieu de cela, le modèle beaucoup plus grand troque une empreinte minuscule contre des capacités avancées comme le clonage vocal et une génération de parole plus expressive. La version originale ne proposait que des voix prédéfinies statiques. Désormais, KittenTTS 2 peut cloner une voix à partir d'à peine 5 secondes d'audio.
KittenTTS 2 intègre Whisper pour transcrire automatiquement le clip de référence, simplifiant ainsi le processus. L'installation est simple : pip install kitten-ml sur Python 3.10 ou une version ultérieure. Ce saut générationnel privilégie une synthèse vocale sophistiquée par rapport à la conception ultra-compacte de ses itérations précédentes.
Cinq secondes d'entrée ; des mots que vous n'avez jamais prononcés en sortie
La vidéo de Better Stack fournit une présentation rapide de KittenTTS 2. Elle commence par un échantillon vocal de 10 secondes : "This is a test. I'm just talking to see how this sounds. 1, 2, 3, 4, 5. How's this voice audio?" L'utilisateur transmet ensuite ce clip au modèle.
KittenTTS 2 transcrit automatiquement l'audio de référence en utilisant un modèle Whisper intégré. Il s'agit d'une commodité cruciale ; de nombreux outils de clonage vocal exigent que vous fournissiez manuellement une transcription textuelle correspondant à votre audio, ce qui peut être une étape supplémentaire fastidieuse.
Après traitement, le modèle génère une nouvelle phrase : "This is a sentence I never actually recorded." L'audio généré ressemble remarquablement au locuteur original, démontrant un clonage in-context zero-shot à partir d'une brève entrée.
Bien qu'impressionnant, rappelez-vous qu'il s'agit d'une démonstration unique, et non d'un benchmark scientifique. Les résultats réels peuvent varier considérablement. Des facteurs tels que la qualité de votre enregistrement, la longueur de l'échantillon (la vidéo utilise 10 secondes, mais 5 secondes sont annoncées) et le contenu spécifique de la parole influencent tous le résultat.
Une simple installation pip, une machine beaucoup plus puissante
La configuration locale de KittenTTS 2 commence assez simplement : Python 3.10 ou plus récent, puis pip install kitten-ml. L'installation du package est la partie facile, mais ne la confondez pas avec la preuve que le modèle fonctionnera bien sur n'importe quel ordinateur.
C'est parce que le "2" dans KittenTTS 2 représente un saut significatif vers un modèle de 1,7 milliard de paramètres. Son empreinte varie d'environ 506 Mo pour une version quantifiée à environ 1,5 Go. Votre matériel et la façon dont vous l'exécutez influenceront fortement les performances.
Pour ceux qui cherchent à l'exécuter sur des machines grand public, des options existent. L'inférence CPU locale est possible, y compris via une méthode C++/GGML basée sur des projets comme llama.cpp. Cela permet au modèle de 1,7 milliard de paramètres de fonctionner en temps quasi réel, même sur Apple Silicon.
Avant de cliquer sur installer, vérifiez toujours les instructions actuelles du projet et la configuration matérielle requise. L'écosystème évolue rapidement, et ce qui fonctionne aujourd'hui pourrait avoir des besoins mis à jour demain. Pour en savoir plus sur la version originale, plus légère, consultez le dépôt GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Le piège de la licence derrière l'astuce vocale
Voici le piège : le KittenTTS original, populaire pour son empreinte minuscule, utilisait la licence permissive Apache 2.0. KittenTTS 2, cependant, fonctionne sous la Stellon Labs Community License. Ne confondez pas les poids de modèle ouverts avec l'open source permissif ; les conditions sont très différentes.
Utilisateurs commerciaux, prenez note. Avant d'intégrer KittenTTS 2 dans un produit, un service hébergé ou un flux de travail monétisé, vous devez absolument inspecter les conditions de licence actuelles. Le passage de l'Apache 2.0 est significatif et pourrait impacter vos plans de déploiement.
KittenTTS 2 offre des capacités convaincantes pour l'expérimentation locale et le clonage vocal quasi instantané. C'est impressionnant pour ce qu'il fait. Cependant, si vos priorités incluent de très petites empreintes de déploiement, une licence vraiment permissive ou des conditions commerciales matures, vous pourriez trouver que l'ancien KittenTTS ou d'autres options TTS sont plus adaptés. Lisez toujours les petits caractères.
Foire aux questions
Qu'est-ce que KittenTTS 2 ?
KittenTTS 2 est un modèle de génération de parole capable de produire de la parole avec la voix d'un locuteur de référence à partir d'un court échantillon audio.
De combien d'audio KittenTTS 2 a-t-il besoin pour cloner une voix ?
La vidéo montre un court enregistrement, tandis que les notes de recherche décrivent une plage d'environ 5 à 30 secondes pour l'audio de référence.
KittenTTS 2 transcrit-il automatiquement l'audio de référence ?
Le flux de travail démontré utilise Whisper pour transcrire le clip de référence, réduisant ainsi le besoin de fournir une transcription manuellement.
KittenTTS 2 est-il sous licence Apache 2.0 ?
Non. Le KittenTTS original utilisait Apache 2.0, mais KittenTTS 2 est distribué sous la Stellon Labs Community License ; examinez ses conditions avant toute utilisation.
Comment installer KittenTTS 2 ?
La vidéo montre l'installation du package Python avec pip install kitten-ml et nécessite Python 3.10 ou une version plus récente.

