Skip to content
ai tools

KittenTTS 2가 당신의 목소리를 복제합니다—단, 조건이 있습니다

한때 작은 크기로 주목받았던 음성 모델이 17억 개의 파라미터 규모로 놀라운 변화를 꾀했습니다. 데모는 인상적이지만, 라이선스와 하드웨어 요구 사항이 복제 기능 자체보다 더 중요할 수 있습니다.

Nora Vance
KittenTTS 2가 당신의 목소리를 복제합니다—단, 조건이 있습니다

초경량 TTS에서 17억 파라미터로의 도약

Better Stack의 데모 영상에서 명확히 보여주듯, KittenTTS 2는 짧은 오디오 녹음을 받아 원본 화자와 유사한 새로운 음성을 생성합니다. 이는 거의 즉각적인 음성 복제를 위한 놀라운 진전이지만, 최신 버전은 이전 모델과는 완전히 다른 성격의 모델입니다.

기존 KittenTTS 모델은 1,500만에서 8,000만 파라미터 정도로 매우 작았습니다. 이 모델들은 거의 어디서나 실행 가능했고, Apache 2.0 라이선스를 따랐으며, 용량도 수십 메가바이트에 불과했습니다. 그러나 버전 2는 17억 파라미터의 음성 언어 모델로 규모가 커졌습니다.

이 모델은 KittenTTS를 유명하게 만들었던 경량화된 엣지 우선 솔루션과는 다릅니다. 대신 훨씬 더 커진 모델은 작은 용량을 포기하는 대신 음성 복제 및 더 표현력 있는 음성 생성과 같은 고급 기능을 제공합니다. 초기 버전은 고정된 사전 설정 음성만 제공했지만, 이제 KittenTTS 2는 단 5초의 오디오만으로도 목소리를 복제할 수 있습니다.

KittenTTS 2는 Whisper를 통합하여 참조 클립을 자동으로 전사함으로써 프로세스를 간소화합니다. 설치는 Python 3.10 이상에서 pip install kitten-ml을 실행하면 될 정도로 간단합니다. 이러한 세대적 도약은 초기 버전의 초소형 설계보다 정교한 음성 합성을 우선시합니다.

5초의 입력, 당신이 말한 적 없는 문장

Better Stack의 영상은 KittenTTS 2에 대한 빠른 가이드를 제공합니다. 영상은 "This is a test. I'm just talking to see how this sounds. 1, 2, 3, 4, 5. How's this voice audio?"라는 10초짜리 음성 샘플로 시작합니다. 사용자는 이 클립을 모델에 전달합니다.

KittenTTS 2는 번들로 제공되는 Whisper 모델을 사용하여 참조 오디오를 자동으로 전사합니다. 이는 매우 중요한 편의 기능입니다. 많은 음성 복제 도구는 오디오와 일치하는 텍스트 스크립트를 수동으로 제공해야 하는데, 이는 번거로운 추가 단계가 될 수 있기 때문입니다.

처리 후 모델은 "This is a sentence I never actually recorded."라는 새로운 문장을 생성합니다. 생성된 오디오는 원본 화자와 놀라울 정도로 유사하며, 짧은 입력으로부터 제로샷 인컨텍스트 복제(zero-shot in-context cloning)가 가능함을 보여줍니다.

인상적이기는 하지만, 이것은 과학적 벤치마크가 아닌 단일 데모라는 점을 기억해야 합니다. 실제 결과는 크게 다를 수 있습니다. 녹음 품질, 샘플 길이(영상에서는 10초를 사용하지만 5초가 권장됨), 특정 음성 콘텐츠와 같은 요소들이 모두 결과물에 영향을 미칩니다.

간단한 pip 설치, 훨씬 더 커진 기계

KittenTTS 2를 로컬에 설정하는 것은 Python 3.10 이상에서 pip install kitten-ml을 실행하는 것으로 충분히 간단하게 시작됩니다. 패키지 설치는 쉬운 부분이지만, 이것이 모든 컴퓨터에서 모델이 잘 작동한다는 증거라고 착각해서는 안 됩니다.

그 이유는 KittenTTS 2의 "2"가 17억 파라미터 모델로의 상당한 도약을 의미하기 때문입니다. 모델 용량은 양자화 버전에 따라 약 506 MiB에서 1.5 GB 정도입니다. 하드웨어 사양과 실행 방식이 성능에 큰 영향을 미칩니다.

일반 소비자용 기기에서 실행하려는 사람들을 위한 옵션도 있습니다. llama.cpp와 같은 프로젝트를 기반으로 구축된 C++/GGML 경로를 포함하여 로컬 CPU 추론이 가능합니다. 이를 통해 17억 파라미터 모델을 Apple Silicon에서도 거의 실시간으로 실행할 수 있습니다.

설치를 시작하기 전에 항상 최신 프로젝트 지침과 하드웨어 요구 사항을 확인하세요. 생태계는 빠르게 발전하며, 오늘 작동하는 것이 내일은 업데이트된 요구 사항을 필요로 할 수 있습니다. 더 가벼운 오리지널 버전에 대한 자세한 내용은 GitHub - KittenML/KittenTTS: Open-source State-of-the-art TTS model which runs on a CPU 저장소를 확인하세요.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

음성 기술에 숨겨진 라이선스 함정

주의할 점이 있습니다. 작은 용량으로 인기를 끌었던 오리지널 KittenTTS는 허용적인 Apache 2.0 라이선스를 사용했습니다. 하지만 KittenTTS 2는 Stellon Labs Community License 하에 운영됩니다. 오픈 모델 가중치와 허용적인 오픈 소스를 혼동하지 마세요. 두 라이선스의 조건은 상당히 다릅니다.

상업적 사용자들은 유의하세요. KittenTTS 2를 제품, 호스팅 서비스 또는 수익화된 워크플로우에 통합하기 전에 반드시 현재 라이선스 약관을 검토해야 합니다. Apache 2.0에서 변경된 점은 중요하며 배포 계획에 영향을 줄 수 있습니다.

KittenTTS 2는 로컬 실험과 즉각적인 음성 복제에 있어 매력적인 기능을 제공합니다. 그 성능은 매우 인상적입니다. 하지만 작은 배포 용량, 진정으로 허용적인 라이선스, 또는 성숙한 상업적 조건이 우선순위라면 이전 버전의 KittenTTS나 다른 TTS 옵션이 더 나은 선택일 수 있습니다. 항상 세부 약관을 꼼꼼히 읽어보세요.

자주 묻는 질문 (FAQ)

KittenTTS 2란 무엇인가요?

KittenTTS 2는 짧은 오디오 샘플을 사용하여 참조 화자의 목소리로 음성을 생성할 수 있는 음성 생성 모델입니다.

KittenTTS 2가 음성을 복제하는 데 필요한 오디오 길이는 어느 정도인가요?

영상에서는 짧은 녹음을 시연하며, 연구 노트에는 참조 오디오 범위로 약 5~30초가 권장된다고 설명되어 있습니다.

KittenTTS 2가 참조 오디오를 자동으로 전사(transcribe)하나요?

시연된 워크플로우는 Whisper를 사용하여 참조 클립을 전사하므로, 수동으로 대본을 제공할 필요가 줄어듭니다.

KittenTTS 2는 Apache 2.0 라이선스를 따르나요?

아니요. 오리지널 KittenTTS는 Apache 2.0을 사용했지만, KittenTTS 2는 Stellon Labs Community License로 배포됩니다. 사용 전 약관을 검토하세요.

KittenTTS 2는 어떻게 설치하나요?

영상에서는 pip install kitten-ml을 사용하여 Python 패키지를 설치하는 방법을 보여주며, Python 3.10 이상이 필요합니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.