Skip to content
ai tools

KittenTTS 2 клонирует ваш голос — но есть нюанс

Голосовая модель, которая когда-то выделялась своей миниатюрностью, сделала неожиданный скачок до масштаба в миллиарды параметров. Демонстрация впечатляет, но лицензия и требования к «железу» могут оказаться важнее самого клонирования.

Nora Vance
KittenTTS 2 клонирует ваш голос — но есть нюанс

От легковесного TTS к скачку в 1,7 млрд параметров

KittenTTS 2 берет короткую аудиозапись и генерирует новую речь, которая звучит как голос оригинального диктора, что наглядно демонстрирует видео Better Stack. Это заметный шаг в сторону почти мгновенного клонирования голоса, но последняя версия — это совсем другой уровень по сравнению с предшественником.

Оригинальные модели KittenTTS были крошечными, часто от 15 млн до 80 млн параметров. Эти модели работали практически везде, распространялись под лицензией Apache 2.0 и весили всего десятки мегабайт. Версия 2, однако, переходит к языковой модели речи с 1,7 млрд параметров.

Это уже не то легкое решение для периферийных устройств, которое сделало KittenTTS популярным. Вместо этого гораздо более крупная модель жертвует компактностью ради продвинутых возможностей, таких как клонирование голоса и более выразительная генерация речи. Оригинальная версия предлагала только статические предустановленные голоса. Теперь KittenTTS 2 может клонировать голос всего по 5 секундам аудио.

KittenTTS 2 интегрирует Whisper для автоматической транскрибации эталонного клипа, что упрощает процесс. Установка проста: pip install kitten-ml на Python 3.10 или новее. Этот качественный скачок отдает приоритет сложному синтезу голоса, а не ультракомпактному дизайну ранних версий.

Пять секунд на входе — слова, которые вы никогда не произносили, на выходе

Видео Better Stack дает краткий обзор KittenTTS 2. Оно начинается с 10-секундного голосового сэмпла: «This is a test. I'm just talking to see how this sounds. 1, 2, 3, 4, 5. How's this voice audio?». Затем пользователь передает этот клип модели.

KittenTTS 2 автоматически транскрибирует эталонное аудио с помощью встроенной модели Whisper. Это критически важное удобство; многие инструменты для клонирования голоса требуют вручную предоставлять текстовую расшифровку, соответствующую аудио, что может быть утомительным дополнительным шагом.

После обработки модель генерирует новое предложение: «This is a sentence I never actually recorded.». Сгенерированное аудио звучит поразительно похоже на оригинального диктора, демонстрируя zero-shot in-context клонирование на основе короткого фрагмента.

Хотя это впечатляет, помните, что это лишь одна демонстрация, а не научный бенчмарк. Реальные результаты могут значительно отличаться. Такие факторы, как качество вашей записи, длительность сэмпла (в видео используется 10 секунд, хотя заявлено 5) и конкретное содержание речи, влияют на результат.

Простая установка через pip, но гораздо более мощное оборудование

Настройка KittenTTS 2 локально начинается довольно просто: Python 3.10 или новее, затем pip install kitten-ml. Установка пакета — это легкая часть, но не стоит считать это доказательством того, что модель будет хорошо работать на любом компьютере.

Это связано с тем, что «2» в KittenTTS 2 означает значительный переход к модели с 1,7 миллиарда параметров. Ее размер варьируется от примерно 506 МБ для квантованной версии до примерно 1,5 ГБ. Ваше оборудование и способ запуска будут сильно влиять на производительность.

Для тех, кто хочет запустить ее на потребительских компьютерах, есть варианты. Возможен локальный CPU-инференс, включая путь C++/GGML, построенный на базе таких проектов, как llama.cpp. Это позволяет модели с 1,7 млрд параметров работать почти в реальном времени, даже на Apple Silicon.

Перед установкой всегда проверяйте актуальные инструкции к проекту и системные требования. Экосистема быстро развивается, и то, что работает сегодня, завтра может потребовать обновлений. Подробнее об оригинальной, более легкой версии можно узнать в репозитории GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Лицензионный подвох голосового трюка

В чем подвох: оригинальный KittenTTS, популярный благодаря своей компактности, использовал разрешительную лицензию Apache 2.0. Однако KittenTTS 2 работает на условиях Stellon Labs Community License. Не путайте открытые веса модели с разрешительным открытым исходным кодом; условия использования существенно различаются.

Коммерческим пользователям на заметку. Прежде чем интегрировать KittenTTS 2 в любой продукт, облачный сервис или монетизируемый рабочий процесс, вы обязательно должны изучить текущие условия лицензирования. Переход с Apache 2.0 является значительным и может повлиять на ваши планы по развертыванию.

KittenTTS 2 предлагает впечатляющие возможности для локальных экспериментов и практически мгновенного клонирования голоса. Это впечатляющий инструмент. Однако, если вашими приоритетами являются минимальный размер при развертывании, по-настоящему разрешительная лицензия или зрелые коммерческие условия, возможно, вам лучше подойдут старая версия KittenTTS или другие TTS-решения. Всегда читайте мелкий шрифт.

Часто задаваемые вопросы

Что такое KittenTTS 2?

KittenTTS 2 — это модель генерации речи, которая может воспроизводить речь голосом эталонного диктора на основе короткого аудиофрагмента.

Сколько аудио нужно KittenTTS 2 для клонирования голоса?

В видео демонстрируется короткая запись, а в примечаниях к исследованию указан диапазон эталонного аудио примерно от 5 до 30 секунд.

Транскрибирует ли KittenTTS 2 эталонное аудио автоматически?

Демонстрируемый рабочий процесс использует Whisper для транскрибирования эталонного клипа, что избавляет от необходимости предоставлять транскрипт вручную.

Лицензирован ли KittenTTS 2 под Apache 2.0?

Нет. Оригинальный KittenTTS использовал Apache 2.0, но KittenTTS 2 распространяется по лицензии Stellon Labs Community License; изучите ее условия перед использованием.

Как установить KittenTTS 2?

В видео показана установка пакета Python с помощью команды pip install kitten-ml, для которой требуется Python 3.10 или новее.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.