Skip to content
research

원시 오디오를 직접 듣는 975B 파라미터 AI

전 OpenAI CTO Mira Murati가 975B 파라미터의 오픈 웨이트 모델인 Inkling을 출시했습니다. 원시 오디오를 처리하는 독보적인 능력과 초정밀 파인튜닝에 집중한 이 모델은 기업이 AI를 구축하는 방식을 바꿀 수 있습니다.

Aki Tanaka
원시 오디오를 직접 듣는 975B 파라미터 AI

OpenAI 전 CTO가 공개한 975B 파라미터의 거대 모델

전 OpenAI CTO Mira Murati가 폐쇄형 AI 개발 환경에 도전장을 내민 120억 달러 규모의 스타트업 Thinking Machines를 설립했습니다. 그녀의 벤처는 강력한 오픈 웨이트 모델을 지향하며, 고급 AI 기능을 대중화하고 기업에 지능형 시스템에 대한 독보적인 제어력과 맞춤화 기능을 제공하는 것을 목표로 합니다.

Thinking Machines의 첫 번째 제품인 Inkling은 9,750억 개의 파라미터를 가진 강력한 모델입니다. 이 인상적인 규모는 정교한 Mixture-of-Experts (MoE) 아키텍처를 통해 관리되며, 토큰당 410억 개의 파라미터만 활성화하여 성능과 컴퓨팅 효율성 사이의 균형을 맞춥니다. Apache 2.0 라이선스로 출시된 Inkling의 전체 가중치는 Hugging Face에서 자유롭게 이용할 수 있습니다.

Thinking Machines는 Inkling을 범용 AI 경쟁자가 아닌 전략적 파운데이션 모델로 포지셔닝합니다. 모든 광범위한 벤치마크에서 최고의 성능을 내지는 못할 수 있지만, 특수 목적 애플리케이션을 위한 시작점으로서 뛰어난 설계를 갖추고 있습니다. Inkling의 진정한 잠재력은 Tinker 플랫폼을 통해서만 가능한 맞춤형 파인튜닝을 통해 발휘되며, 개발자가 특정 대용량 작업을 위한 고도로 맞춤화된 솔루션을 제작할 수 있도록 지원합니다.

이 AI는 텍스트 변환 없이 소리를 직접 듣습니다

Inkling은 비텍스트 입력에 대한 전처리를 생략함으로써 기존의 멀티모달 모델과 차별화됩니다. 오디오를 텍스트로 변환하거나 별도의 비전 인코더로 이미지를 설명하는 대신, 원시 오디오를 스펙트로그램으로, 이미지를 40x40 픽셀 패치로 직접 입력받습니다. 그런 다음 이들은 텍스트 토큰과 함께 통합된 표현 공간에서 처리됩니다.

이 새로운 아키텍처는 풍부한 감각 데이터를 텍스트 중개자로 변환하는 과정에서 필연적으로 발생하는 정보 손실과 압축을 이론적으로 최소화합니다. 이를 통해 Inkling은 단순히 의미론적 내용뿐만 아니라 말하는 스타일과 같은 소리의 뉘앙스까지 파악할 수 있습니다.

Thinking Machines는 Inkling의 일반적인 성능에 대해 투명하게 공개합니다. 지시 이행 능력에서는 GLM 5.2를 앞서지만(79.8 대 73.3), Terminal-Bench 에이전트 작업에서는 상당히 낮은 성능을 보입니다(63.8 대 82.7). 이는 직접적인 명령 실행에는 능숙하지만 자율적인 문제 해결 능력은 다소 약함을 의미합니다.

이러한 벤치마크 결과는 Inkling이 범용 모델이 아닌 파인튜닝 전문가로 설계되었음을 뒷받침합니다. 이 모델의 강점은 광범위하고 비지도적인 추론보다는, 미묘한 오디오나 시각적 입력이 포함된 고도로 구체적이고 대용량인 작업을 위한 강력하고 원시 데이터 인식 기반을 제공하는 데 있습니다.

파인튜닝이 Inkling의 진정한 슈퍼파워인 이유

Inkling의 진정한 힘은 원시적인 일반 성능이 아니라 파인튜닝을 통해 나타납니다. 이 과정은 새로운 사실적 지식을 주입하는 것이 아니라, 톤, 형식, 특정 출력 구조 준수 등 모델이 어떻게 응답해야 하는지를 학습시킵니다.

법률 인용문을 추출하기 위해 더 작은 모델을 파인튜닝한 Harvey AI를 예로 들어보겠습니다. 이 특화된 모델은 F1 점수가 0.56에서 0.68로 향상되었습니다. 또한 93%의 사례에서 GPT-4.0과 대등하거나 더 뛰어난 성능을 보이면서도 더 빠르고 비용 효율적으로 작동했습니다.

Thinking Machines의 Tinker 플랫폼은 이러한 맞춤화를 간소화하여 특정 작업에 대한 신속한 적응을 가능하게 합니다. 흥미로운 데모를 통해 Inkling이 'epsilonphobia'(글자 'e'를 절대 사용하지 않는 것)를 나타내도록 스스로 미세 조정하는 과정이 시연되었습니다. 모델이 학습 데이터를 자동으로 수정하고 전체 미세 조정 프로세스를 실행하도록 프롬프트를 입력한 결과, 언어적 제약에도 불구하고 결과물은 여전히 놀라울 정도로 의미가 통했습니다.

이러한 효율성의 핵심은 Low-Rank Adaptation (LoRA)입니다. LoRA는 기존의 9750억 개의 파라미터를 고정하고 가볍고 작은 행렬을 주입하여 새롭고 구체적인 데이터를 포착합니다. 이 접근 방식은 전체 모델을 재학습하는 것에 비해 맞춤화 비용과 속도를 획기적으로 줄여, 니치 애플리케이션을 위한 맞춤형 AI를 더욱 접근하기 쉽게 만듭니다.

이러한 타겟팅된 적응을 통해 기업은 대량의 좁은 범위 작업에 특화된 고도로 전문화된 에이전트를 구축할 수 있습니다. Inkling의 오픈 웨이트 아키텍처와 자세한 내용을 탐색하는 데 관심이 있는 분들은 thinkingmachines/Inkling - Hugging Face에서 리소스를 확인할 수 있습니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

Inkling을 실제로 언제 사용해야 할까요?

Inkling은 범용적인 작업 도구로 설계되지 않았습니다. Thinking Machines의 제작자들은 Terminal-Bench와 같은 광범위한 벤치마크에서 Inkling의 성능이 최첨단 모델을 뒤따른다는 점을 공개적으로 인정합니다. 광범위하고 비전문화된 작업에는 기존의 폐쇄형 소스 AI가 여전히 우선 선택지입니다. 그러나 강력한 라벨링 데이터가 뒷받침되는 좁고 대량의 작업에 대해서는, 심층 미세 조정을 위해 특별히 제작된 Inkling이 강력한 경쟁자로 떠오릅니다.

Tinker 플랫폼에서 Inkling은 두 가지 독특한 영역을 개척합니다. Inkling은 텍스트 전사 과정에서 발생하는 데이터 손실을 우회하여 raw audio를 스펙트로그램으로 직접 처리할 수 있는 유일한 모델입니다. 이러한 직접적인 접근 방식은 소리의 고유한 속성에 대한 전례 없는 분석을 가능하게 합니다. 또한 사용자는 0-1 사이의 세밀한 슬라이더로 thinking effort를 미세 조정할 수 있어, 다른 모델에서 볼 수 있는 일반적인 낮음, 중간, 높음 설정보다 훨씬 뛰어난 제어 기능을 제공합니다.

Inkling을 선택하는 것은 애플리케이션의 구체성에 달려 있습니다. 의료 받아쓰기와 같은 전문적인 오디오 작업에서 복잡한 약물 이름을 능숙하게 학습하거나, 무언가가 어떻게 말해졌는지 파악하기 위한 정교한 음성 스타일 분류를 수행하는 데 탁월합니다. 심층적인 맞춤화, 직접적인 오디오 분석, 그리고 정확하고 반복 가능한 기능을 위해 모델을 fine-tuning하는 것이 주된 목표라면, Inkling은 타의 추종을 불허하는 오픈 웨이트 솔루션을 제공합니다.

자주 묻는 질문

Inkling AI 모델이란 무엇인가요?

Inkling은 전 OpenAI CTO Mira Murati가 설립한 스타트업 Thinking Machines에서 개발한 9750억 개의 파라미터를 가진 오픈 웨이트 Mixture-of-Experts (MoE) 모델입니다. 주로 특정 작업에 대한 미세 조정을 위해 설계되었습니다.

Inkling은 오디오와 이미지를 어떻게 다르게 처리하나요?

오디오/이미지를 먼저 텍스트 설명으로 변환하는 모델과 달리, Inkling은 원시 데이터를 직접 처리합니다. 오디오는 스펙트로그램으로, 이미지는 픽셀 패치로 받아들여 텍스트 토큰과 혼합함으로써 데이터 손실을 줄이고 정확도를 향상시킵니다.

Inkling이 GPT-4보다 더 나은가요?

Inkling은 GPT-4보다 더 강력한 범용 모델이 되도록 설계되지 않았습니다. Inkling의 강점은 좁고 구체적인 작업에 대해 미세 조정하기 위한 매우 효과적인 기본 모델이라는 점에 있으며, 맞춤형 버전은 정확도와 효율성 면에서 범용 모델을 능가할 수 있습니다.

Tinker 플랫폼이란 무엇인가요?

Tinker는 Inkling과 같은 AI 모델을 맞춤화하고 미세 조정하기 위해 설계된 Thinking Machines의 플랫폼입니다. LoRA와 같은 기술을 사용하여 비용 효율적인 학습을 수행함으로써 모델을 매우 구체적인 작업에 적응시키는 과정을 단순화합니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only