Skip to content
ai tools

KittenTTS 2가 더 커지고 더 복잡해졌습니다

이제 5초 분량의 음성 샘플만으로도 사용자의 기기에서 설득력 있는 새로운 목소리를 만들어낼 수 있습니다. 하지만 가장 중요한 변화는 데모에서는 들리지 않을 수도 있는 부분들에 있을지 모릅니다.

Theo Brandt
KittenTTS 2가 더 커지고 더 복잡해졌습니다

초소형 TTS가 크게 성장했습니다

KittenTTSTTS 2는 우리가 기억하던 그 작고 독립적인 모델이 아닙니다. 버전 1 모델은 1,500만~8,000만 개의 파라미터로 수십 메가바이트에 불과했습니다. 새로운 KittenTTSTTS 2는 17억 개의 파라미터를 가진 음성 모델을 탑재하며 규모가 대폭 커졌습니다.

이 새로운 아키텍처는 2단계 파이프라인을 사용합니다. 음성 모델이 텍스트와 음성 샘플을 처리하여 오디오 토큰을 생성합니다. 이 토큰들은 Resemble AI AI의 Chatterbox Turbo S3Gen 보코더로 전달되어 최종 사운드를 합성합니다. 이 보코더는 첫 실행 시 다운로드되며, 로컬 저장 공간 사용량을 더욱 늘립니다.

이러한 복잡함에 따른 보상은 상당합니다. 짧은 참조 클립을 통한 인컨텍스트 음성 복제, 47개의 내장 음성, 그리고 세밀한 감정 제어가 가능합니다. 하지만 그 대가로 모델 파일 크기가 470MB에서 최대 3.5GB에 달하는 등 규모가 커졌습니다.

몇 초 만에 음성 복제—주의 사항 포함

KittenTTSTTS 2를 사용한 음성 복제는 간단합니다. Python 3.10+ 환경에서 pip install KittenTTS-ml을 실행하면 패키지가 설치됩니다. 짧은 참조 녹음 파일을 제공하면 KittenTTSTTS가 Whisper를 사용하여 자동으로 전사하여 음성을 강력하게 캡처합니다.

하지만 데모에서 보여준 인상적인 음성 유사도 점수(프로젝트 보고 기준 0.49–0.81)는 독립적인 검증이 부족합니다. 이 모델은 새로운 모델이며 외부 테스트가 제한적입니다. 감정 태그와 음성 효과는 여전히 베타 단계이므로 프로덕션 환경에서 사용하기에는 불안정할 수 있습니다.

긴 텍스트 입력은 잘림이나 반복 현상을 방지하기 위해 자동으로 청크 단위로 나뉩니다. 영어 이외의 언어 지원은 다소 부족하며, 문서마다 지원 언어 수(10개 vs 20개)가 일치하지 않고 텍스트 정규화를 비활성화해야 하는 등의 잠재적 문제가 있습니다. 각 비영어권 음성은 잠재적으로 '취약한' 단일 참조 클립에 의존합니다.

KittenTTSTTS 1의 소형 설계에서 벗어난 변화는 뚜렷합니다. KittenTTSTTS 2는 Torch, Transformers, Diffusers와 같은 무거운 의존성을 포함하며, 950MB의 기본 모델과 Resemble AI AI의 S3Gen 보코더를 사용합니다. 이것은 우리가 알던 작고 독립적인 도구가 아니라 훨씬 더 크고 복잡한 스택입니다.

Mac에서는 GPU를 사용하지 않습니다

Mac 사용자는 장벽에 부딪힙니다. KittenTTSTTS 2의 Python 패키지는 NVIDIA CUDA를 엄격하게 확인합니다. CUDA 지원 GPU가 없으면 CPU를 기본값으로 사용하며, Apple Silicon의 Metal Performance Shaders(MPS)나 CoreML 가속을 완전히 우회합니다. 즉, Mac의 강력한 GPU는 유휴 상태로 남게 됩니다.

프로젝트 문서에서도 성능 저하를 확인해주고 있습니다. CPU 생성 속도는 실시간보다 2~3배 느립니다. 스레드 튜닝(예: torch.set_num_threads(8))으로 약간의 성능 향상을 기대할 수는 있지만, 실시간 재생은 어렵습니다. 이는 예전의 가볍고 CPU 중심적인 모델이 아닙니다.

KittenTTSTTS 2의 전체 설치 용량은 이전 버전을 훨씬 능가합니다. 설치 시 PyTorch, Transformers, Diffusers가 포함됩니다. 또한 보코더 가중치(Resemble AI AI의 Chatterbox Turbo용 S3Gen)와 전사를 위한 Whisper를 다운로드합니다. 이로 인해 새 버전은 이전보다 훨씬 휴대성이 떨어집니다.

프로젝트에 대한 자세한 내용은 GitHub - KittenTTSML/KittenTTSTTS를 확인하세요. 원래의 KittenTTSTTS는 독립적이고 작았습니다. 버전 2는 기능은 뛰어나지만 상당한 리소스와 외부 의존성을 요구하며, 운영 프로필이 근본적으로 바뀌었습니다. 이제는 더 이상 "KittenTTS"라고 부르기 어렵습니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

배포 전 라이선스를 확인하세요

라이선싱은 지뢰밭과 같습니다. KittenTTSTTS 2 Python 패키지와 그 코드는 Apache 2.0을 따릅니다. 하지만 모델 가중치는 어떨까요? 이는 Stellon Labs Community License 하에 있으며, 이를 사용하여 개발하는 모든 사람에게 매우 중요한 차이점입니다.

개발자는 해당 약관을 면밀히 검토해야 합니다. 이 라이선스는 상업적 등록을 요구하며, 눈에 띄는 "Powered by Stellon Labs" 표기를 의무화하고, 취소 가능한 권한을 부여합니다. 더 나쁜 점은 귀사의 매출이나 투자금이 100만 달러를 초과할 경우 무료 상업적 사용이 종료된다는 것인데, 이는 많은 스타트업에게 즉각적인 결격 사유가 됩니다. 허용 가능한 사용 정책(acceptable-use policy)이 존재하지만 공개되어 있지 않으므로, Stellon Labs에 직접 연락하여 검토받아야 합니다.

분당 요금이 중요하지 않은 취미 활동이나 로컬 실험의 경우, KittenTTSTTS 2는 매력적이고 개인적인 대안을 제공합니다. 그러나 프로덕션 팀에게는 더 높은 기준이 요구됩니다. 귀하의 권리를 확인하고, 하드웨어 성능을 벤치마킹하며, ElevenLabs 또는 VoxCPM2와 같은 대안과 비교해 보십시오. 오리지널 KittenTTSTTS는 간단했지만, 버전 2는 철저한 실사가 필요합니다.

자주 묻는 질문

KittenTTS 2란 무엇인가요?

KittenTTS 2는 17억 개의 파라미터를 가진 음성 모델과 별도의 보코더(vocoder)를 기반으로 구축된 로컬 텍스트 음성 변환(TTS) 시스템입니다.

KittenTTS 2로 짧은 녹음에서 음성을 복제할 수 있나요?

네. 일반적으로 5~10초 정도의 짧은 참조 클립을 사용하여 음성 복제를 지원하지만, 결과는 다를 수 있습니다.

KittenTTS 2는 Mac에서 잘 작동하나요?

검토된 Python 설정은 Mac에서 CPU로 대체되어 Apple GPU를 사용하지 않으므로, 생성 속도가 실시간보다 느릴 수 있습니다.

KittenTTS 2는 오픈 소스인가요?

코드와 패키지는 Apache 2.0이지만, 모델 가중치는 상업적 제한이 있는 Stellon Labs Community License를 사용합니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.