Крошечный TTS вырос — и значительно
KittenTTSTTS 2 — это уже не та крошечная автономная модель, которую вы помните. Модели первой версии имели от 15 до 80 миллионов параметров и занимали десятки мегабайт. Новый KittenTTSTTS 2 значительно масштабируется, предлагая речевую модель с 1,7 миллиарда параметров.
Эта новая архитектура использует двухэтапный конвейер. Речевая модель обрабатывает текст и образец голоса, генерируя аудиотокены. Затем эти токены поступают в вокодер Resemble AI AI’s Chatterbox Turbo S3Gen, который синтезирует финальный звук. Этот вокодер загружается при первом запуске, дополнительно увеличивая занимаемое локальное пространство.
Результат этой сложности значителен: клонирование голоса в контексте по коротким эталонным клипам, 47 встроенных голосов и детальное управление эмоциями. Однако это достигается ценой размера: файлы моделей варьируются от компактных 470 МБ до внушительных 3,5 ГБ.
Клонирование голоса за секунды — с оговорками
Клонирование голоса с помощью KittenTTSTTS 2 просто: pip install KittenTTS-ml на Python 3.10+ устанавливает пакет. Предоставьте короткую эталонную запись, и KittenTTSTTS автоматически расшифрует её с помощью Whisper для качественного захвата голоса.
Однако впечатляющие показатели сходства голоса в демо (заявленные проектом 0,49–0,81) не имеют независимого подтверждения. Модель новая, с ограниченным внешним тестированием. Теги эмоций и вокальные эффекты остаются в стадии бета, что говорит о нестабильности для промышленного использования.
Длинные текстовые фрагменты автоматически разбиваются на части, чтобы предотвратить обрывы или артефакты повторения. Поддержка языков, отличных от английского, менее надежна: есть расхождения в документации (указано 10 или 20 языков) и потенциальные проблемы, требующие отключения нормализации текста. Каждый неанглийский голос опирается на один, потенциально «хрупкий» эталонный клип.
Переход от компактного дизайна KittenTTSTTS 1 разителен. KittenTTSTTS 2 подтягивает тяжелые зависимости, такие как Torch, Transformers и Diffusers, плюс модель по умолчанию на 950 МБ и вокодер S3Gen от Resemble AI AI. Это уже не тот крошечный автономный инструмент, который мы знали; это гораздо более крупный и сложный стек.
На Mac графический процессор остается в стороне
Пользователи Mac сталкиваются с препятствием: Python-пакет KittenTTSTTS 2 строго проверяет наличие NVIDIA CUDA. Без графического процессора с поддержкой CUDA он переключается на CPU, полностью игнорируя Metal Performance Shaders (MPS) или ускорение CoreML от Apple Silicon. Это означает, что мощный GPU вашего Mac простаивает.
Документация проекта подтверждает потери: генерация на CPU работает в 2–3 раза медленнее реального времени. Настройка потоков (например, torch.set_num_threads(8)) может дать небольшой прирост, но не стоит ожидать воспроизведения в реальном времени. Это уже не та легкая, ориентированная на CPU модель, что была раньше.
Полный объем KittenTTSTTS 2 значительно превосходит своего предшественника. Установка подтягивает PyTorch, Transformers и Diffusers. Затем загружаются веса вокодера (S3Gen из Resemble AI AI’s Chatterbox Turbo) и Whisper для транскрипции. Это делает новую версию гораздо менее портативной.
Для более глубокого изучения проекта посетите GitHub - KittenTTSML/KittenTTSTTS. Оригинальный KittenTTSTTS был автономным и крошечным. Версия 2, хотя и функциональна, требует значительных ресурсов и внешних зависимостей, фундаментально меняя свой операционный профиль. Это больше не «KittenTTS».
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Прочитайте лицензию перед выпуском продукта
Лицензирование — это минное поле. Python-пакет KittenTTSTTS 2 и его код распространяются по лицензии Apache 2.0. Но веса модели? Они подпадают под действие Stellon Labs Community License, что является критически важным различием для всех, кто строит на их основе свои продукты.
Разработчики должны внимательно изучить эти условия. Лицензия требует коммерческой регистрации, обязательного указания «Powered by Stellon Labs» на видном месте и содержит положение об отзыве прав. Хуже того, бесплатное коммерческое использование прекращается, если доход или финансирование вашей компании превышает 1 миллион долларов — это быстро отсеивает многие стартапы. Существует политика допустимого использования, но она не является публичной; вам необходимо связаться со Stellon Labs, чтобы ознакомиться с ней.
Для любителей или локальных экспериментов, где поминутная тарификация не имеет значения, KittenTTSTTS 2 предлагает привлекательную приватную альтернативу. Однако перед продакшн-командами стоит более высокая планка. Проверьте свои права, проведите бенчмаркинг на своем оборудовании и сравните с альтернативами, такими как ElevenLabs или VoxCPM2. Оригинальный KittenTTSTTS был прост; версия 2 требует тщательной проверки.
Часто задаваемые вопросы
Что такое KittenTTS 2?
KittenTTS 2 — это локальная система преобразования текста в речь, построенная на основе речевой модели с 1,7 миллиарда параметров и отдельного вокодера.
Может ли KittenTTS 2 клонировать голос по короткой записи?
Да. Она поддерживает клонирование голоса по короткому эталонному фрагменту, обычно около 5–10 секунд, хотя результаты могут варьироваться.
Хорошо ли KittenTTS 2 работает на Mac?
Рассмотренная настройка Python на Mac переключается на использование CPU, оставляя Apple GPU незадействованным; генерация может работать медленнее реального времени.
Является ли KittenTTS 2 открытым программным обеспечением?
Код и пакет распространяются по лицензии Apache 2.0, но веса модели используют Stellon Labs Community License, которая имеет коммерческие ограничения.

