Le minuscule TTS a grandi — et beaucoup
KittenTTSTTS 2 n'est plus le modèle minuscule et autonome dont vous vous souvenez. Les modèles de la version 1 comptaient entre 15 et 80 millions de paramètres, tenant dans quelques dizaines de mégaoctets. Le nouveau KittenTTSTTS 2 monte considérablement en gamme, avec un modèle vocal de 1,7 milliard de paramètres.
Cette nouvelle architecture utilise un pipeline à deux étapes. Le modèle vocal traite le texte et un échantillon vocal, générant des jetons audio. Ces jetons sont ensuite transmis au vocodeur Resemble AI AI’s Chatterbox Turbo S3Gen, qui synthétise le son final. Ce vocodeur se télécharge lors de la première exécution, augmentant encore l'empreinte locale.
La contrepartie de cette complexité est significative : clonage vocal in-context à partir de courts clips de référence, 47 voix intégrées et des contrôles d'émotion granulaires. Cependant, cela a un coût en termes de taille, avec des fichiers de modèle allant de 470 Mo compacts à 3,5 Go imposants.
Un clone vocal en quelques secondes — avec des bémols
Cloner une voix avec KittenTTSTTS 2 est simple : pip install KittenTTS-ml sur Python 3.10+ installe le package. Fournissez un court enregistrement de référence, et KittenTTSTTS le transcrit automatiquement en utilisant Whisper pour une capture vocale robuste.
Cependant, les scores de similarité vocale impressionnants de la démo (0,49–0,81 rapportés par le projet) manquent de vérification indépendante. Le modèle est nouveau, avec des tests externes limités. Les balises d'émotion et les effets vocaux restent en bêta, suggérant une instabilité pour une utilisation en production.
Les entrées de texte plus longues sont automatiquement découpées pour éviter les coupures ou les artefacts de répétition. La prise en charge des voix non anglophones est moins robuste, avec des divergences dans la documentation (10 contre 20 langues citées) et des problèmes potentiels nécessitant la désactivation de la normalisation du texte. Chaque voix non anglophone repose sur un seul clip de référence potentiellement "fragile".
Le passage de la conception compacte de KittenTTSTTS 1 est frappant. KittenTTSTTS 2 tire des dépendances lourdes comme Torch, Transformers et Diffusers, plus un modèle par défaut de 950 Mo et le vocodeur S3Gen de Resemble AI AI. Ce n'est plus l'outil minuscule et autonome que nous connaissions ; c'est une pile beaucoup plus grande et complexe.
Sur Mac, le GPU reste sur la touche
Les utilisateurs de Mac se heurtent à un mur : le package Python de KittenTTSTTS 2 vérifie strictement la présence de NVIDIA CUDA. Sans GPU compatible CUDA, il utilise le CPU par défaut, contournant complètement les Metal Performance Shaders (MPS) ou l'accélération CoreML d'Apple Silicon. Cela signifie que le puissant GPU de votre Mac reste inactif.
La documentation du projet confirme la pénalité : la génération par CPU est 2 à 3 fois plus lente que le temps réel. Le réglage des threads (par exemple, torch.set_num_threads(8)) pourrait offrir un léger coup de pouce, mais ne vous attendez pas à une lecture en direct. Ce n'est plus le modèle léger axé sur le CPU d'autrefois.
L'empreinte totale de KittenTTSTTS 2 dépasse largement celle de son prédécesseur. L'installation récupère PyTorch, Transformers et Diffusers. Ensuite, elle télécharge les poids du vocodeur (S3Gen de Resemble AI AI's Chatterbox Turbo) et Whisper pour la transcription. Cela rend la nouvelle version beaucoup moins portable.
Pour des plongées plus approfondies dans le projet, consultez GitHub - KittenTTSML/KittenTTSTTS. Le KittenTTSTTS original était autonome et minuscule. La version 2, bien que capable, exige des ressources importantes et des dépendances externes, modifiant fondamentalement son profil opérationnel. Ce n'est plus un "KittenTTS".
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Lisez la licence avant de publier
L'octroi de licences est un champ de mines. Le package Python KittenTTSTTS 2 et son code sont sous licence Apache 2.0. Mais les poids du modèle ? Ils sont soumis à la Stellon Labs Community License, une distinction cruciale pour quiconque développe avec.
Les développeurs doivent examiner ces conditions de près. La licence exige un enregistrement commercial, une attribution visible « Powered by Stellon Labs » et comporte une concession révocable. Pire encore, l'utilisation commerciale gratuite prend fin si votre entreprise ou votre financement dépasse 1 million de dollars — un facteur d'exclusion rapide pour de nombreuses startups. Une politique d'utilisation acceptable existe, mais elle n'est pas publique ; vous devez contacter Stellon Labs pour l'examiner.
Pour les amateurs ou les expériences locales où les frais à la minute n'ont pas d'importance, KittenTTSTTS 2 offre une alternative privée convaincante. Les équipes de production, cependant, font face à des exigences plus élevées. Vérifiez vos droits, effectuez des tests de performance sur votre matériel et comparez avec des alternatives telles que ElevenLabs ou VoxCPM2. Le KittenTTSTTS original était simple ; la version 2 exige une diligence raisonnable.
Foire aux questions
Qu'est-ce que KittenTTS 2 ?
KittenTTS 2 est un système local de synthèse vocale construit autour d'un modèle de parole de 1,7 milliard de paramètres et d'un vocodeur séparé.
KittenTTS 2 peut-il cloner une voix à partir d'un court enregistrement ?
Oui. Il prend en charge le clonage vocal à partir d'un court clip de référence, généralement d'environ 5 à 10 secondes, bien que les résultats puissent varier.
KittenTTS 2 fonctionne-t-il bien sur Mac ?
La configuration Python examinée revient au processeur (CPU) sur Mac, laissant le GPU Apple inutilisé ; la génération peut être plus lente que le temps réel.
KittenTTS 2 est-il open source ?
Le code et le package sont sous licence Apache 2.0, mais les poids du modèle utilisent la Stellon Labs Community License, qui comporte des restrictions commerciales.

