Skip to content
comparisons

Nvidia의 새로운 30B 모델은 사용할 수 없는 수준입니다

두 AI 거대 기업이 같은 주에 강력한 새로운 30B 모델을 출시했으며, 두 모델 모두 소비자용 하드웨어에서 엄청난 성능을 약속했습니다. 그러나 우리의 직접 비교 테스트 결과, 하나에서 실제 작업에 전혀 사용할 수 없게 만드는 치명적인 결함이 발견되었습니다.

Vera Cole
Nvidia의 새로운 30B 모델은 사용할 수 없는 수준입니다

두 거대 기업, 두 가지 아키텍처, 하나의 목표

Meta의 Muse Glimmer와 NVIDIA의 Nemotron Lightning 3.5는 모두 300억 개의 파라미터를 가진 새로운 모델로, 하루 차이로 출시되었습니다. 두 모델 모두 소비자용 하드웨어, 특히 RTX 5090과 같은 GPU에 최적화되도록 설계되었습니다. 이들의 동시 출시는 뚜렷한 아키텍처 차이에도 불구하고 직접적인 비교를 불러일으킵니다.

Meta의 주력 모델인 Muse Spark의 증류 버전인 Muse Glimmer는 일상적인 시스템에서의 효율성을 목표로 합니다. 이 모델은 DFlash 지원을 통합하여 더 작은 초안 모델이 16단어 단위의 청크를 추측하고 메인 모델이 이를 검증하는 추측 디코딩(speculative decoding)을 가능하게 합니다. 이 방식은 출력 품질을 저하시키지 않으면서 3배의 속도 향상을 제공한다고 주장합니다.

속도 향상 외에도 Muse Glimmer는 강력한 비전 기능을 자랑하며, 이미지를 해석하고 추론할 수 있습니다. 또한 128,000 토큰의 상당한 컨텍스트 윈도우를 제공하여 상세하고 짧은 상호작용에 적합합니다.

NVIDIA의 Nemotron Lightning 3.5는 Mixture of Experts (MoE) 아키텍처를 통해 근본적으로 다른 접근 방식을 취합니다. 명목상으로는 300억 개의 파라미터를 가진 모델이지만, 라우터가 추론 시마다 약 30억 개의 파라미터만 활성화하여 매우 빠르고 효율적입니다. 이 설계가 성능의 핵심입니다.

Lightning 3.5는 100만 토큰의 방대한 컨텍스트 윈도우를 갖추어 방대한 문서나 긴 형식의 콘텐츠를 처리하는 데 이상적입니다. 그러나 이 모델은 Muse Glimmer와 비교했을 때 통합된 비전 기능이 전혀 없다는 중요한 단점이 있습니다.

자동화의 시련: 깨진 코드에 대한 이야기

초기 웹 페이지 코딩 테스트에서 즉시 뚜렷한 성능 격차가 드러났습니다. NVIDIA의 Nemotron Lightning 3.5는 총 11분 동안 두 번의 시도에서 일관되게 빈 화면의 작동하지 않는 페이지를 생성했습니다. 수정 사항을 요청한 후에도 동일하게 깨진 결과만 반환했습니다. 반면, Muse Glimmer는 2분 50초 이내에 작동하는 버튼, 핀 레이아웃, 대화형 tooltips가 포함된 부분적으로 기능하는 페이지를 제공했습니다. Glimmer는 기본적인 작업을 수행하는 데 있어 확실한 우위를 보여주었습니다.

이어진 비디오 편집 챌린지는 Lightning의 심각한 한계를 더욱 부각했습니다. 오디오 추가 작업을 수행했을 때, Nemotron Lightning 3.5는 타임라인을 손상시키고 중요한 소스 트랙을 삭제하는 등 치명적인 실패를 보였습니다. 이는 사소한 오류가 아닌 파괴적인 결과였습니다. 반면 Muse Glimmer는 편집을 완벽하게 수행했으며, 오디오 레이어를 올바르게 배치하고 음악 변경에 대한 후속 요청까지 정확하게 처리했습니다.

이러한 테스트를 통해 명확한 패턴이 나타납니다. Muse Glimmer는 일관되게 강력한 추론 능력과 성공적인 도구 사용을 보여주며, multi-step logic을 능숙하게 탐색하여 기능적인 결과물을 도출합니다. 반대로 NVIDIA의 Nemotron Lightning 3.5는 복잡한 지시 사항을 수행하는 데 큰 어려움을 겪으며, 스스로 수정하거나 사용할 수 있는 결과를 생성하지 못합니다. 기본적인 자동화 작업을 수행할 수 없는 이 모델은 실제 적용 측면에서 사실상 사용할 수 없는 수준입니다.

1M 컨텍스트 윈도우가 아무 의미가 없을 때

초기 자동화 테스트에서 Nemotron Lightning 3.5의 치명적인 결함이 드러났습니다. 최종 평가는 이 모델의 광고된 강점인 1M token context window를 활용하도록 설계되었습니다. Muse Glimmer의 128,000 토큰을 훨씬 능가하는 이 엄청난 용량은 Lightning을 방대한 문서 분석을 위한 이상적인 후보로 만들었습니다. 테스터들은 두 모델 모두에게 NVIDIA의 100페이지가 넘는 10K 보고서를 제공했으며, 이는 심층적인 재무 데이터 추출을 위한 완벽한 실제 테스트였습니다.

Nemotron Lightning 3.5는 처참한 실패를 보여주었습니다. 웹 가져오기 도구 호출이 즉시 실패하여 모델이 일반 웹 검색으로 전환해야 했습니다. 이러한 치명적인 실수로 인해 심각한 환각 현상이 발생했습니다. Lightning은 NVIDIA 매출의 23%가 상위 고객으로부터 발생했다고 보고했습니다. 10K 공시 자료에서 쉽게 확인할 수 있는 정확한 수치는 무려 36%입니다. 핵심 재무 데이터에서 13%포인트의 오차는 이 결과물을 근본적으로 쓸모없게 만듭니다.

상대적으로 작은 컨텍스트 윈도우를 가진 Muse Glimmer가 훨씬 더 신뢰할 수 있음이 입증되었습니다. 이 모델 역시 초기 웹 요청 실패를 겪었지만, Glimmer는 이러한 장애물을 성공적으로 극복했습니다. 모델은 정확한 NVIDIA 10K 문서를 검색하여 36%의 매출 수치를 정확하게 추출해 냈으며, 이는 도구 사용의 뛰어난 견고함을 보여줍니다. 이러한 극명한 비교는 방대한 컨텍스트 윈도우와 같은 단순 사양은 신뢰할 수 있는 실행 없이는 무의미하다는 점을 강조합니다. Muse Glimmer를 포함한 모델에 대한 자세한 내용은 muse-glimmer-30b Model by Meta - Nvidia NIM을 참조하십시오.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

결론: 빛나는 Glimmer, 탈락한 Lightning

Muse Glimmer는 이번 30B 모델 대결에서 명확한 승자로 떠올랐으며, 일상적인 작업에 있어 유능하고 놀라울 정도로 신뢰할 수 있는 모델임이 증명되었습니다. 세 가지 복잡한 테스트 중 두 가지를 인상적인 결과로 통과하며 진정한 유용성을 입증했습니다. 대화형 요소와 툴팁이 포함된 부분적으로 기능하는 웹 페이지 생성부터 100페이지가 넘는 문서 분석까지, Glimmer는 지속적으로 사용 가능한 결과물을 제공했습니다. 이 모델은 RTX 5090과 같은 소비자용 GPU에서 본격적인 애플리케이션을 실행할 준비가 되어 있습니다.

반면, NVIDIA의 Nemotron Lightning 3.5는 현재 상태로는 어떠한 진지한 작업에도 사용할 수 없습니다. 전반적인 성능이 매우 저조했습니다. 웹 코딩 테스트 동안 Lightning은 반복적으로 빈 페이지나 작동하지 않는 페이지를 생성했으며, 기본적인 도구 사용이나 논리적 구성을 실행하지 못했습니다. 1M 토큰 컨텍스트 윈도우를 자랑함에도 불구하고 NVIDIA의 10K 공시 자료에서 의미 있는 데이터를 추출하지 못했으며, 부정확하고 신뢰할 수 없는 결과를 내놓았습니다.

개발자에게 주는 교훈은 명확하고 중요합니다. 300억 개의 parameter count나 인상적인 1M 토큰 context window와 같은 서류상의 사양은 근본적인 추론 능력과 신뢰할 수 있는 실행 없이는 무의미합니다. Muse Glimmer는 수행할 수 있는 기초 지능을 갖추고 있어 실행 가능한 선택지입니다. Nemotron Lightning 3.5는 아키텍처상의 약속에도 불구하고 이러한 핵심 능력이 완전히 결여되어 있어 완전히 실패한 모델입니다. 사용을 피하십시오.

자주 묻는 질문

Muse Glimmer와 Nemotron Lightning 3.5는 무엇인가요?

두 모델 모두 Meta와 Nvidia가 각각 출시한 300억 개의 파라미터를 가진 AI 모델로, 소비자용 하드웨어에서 효율적으로 실행되도록 설계되었습니다. Muse Glimmer는 비전 기능을 갖춘 증류(distilled) 모델이며, Nemotron Lightning은 대규모 컨텍스트 윈도우를 가진 Mixture-of-Experts(MoE) 모델입니다.

Nemotron Lightning 3.5는 왜 테스트에서 그렇게 낮은 성능을 보였나요?

복잡한 다단계 작업을 지속적으로 실패했습니다. 도구 사용(웹 가져오기 실패)에 어려움을 겪었고, 오류를 스스로 수정하지 못했으며, 한 경우에는 소스 문서를 검색하지 못한 사실을 보고하는 대신 잘못된 재무 데이터를 환각으로 생성했습니다.

Meta의 Muse Glimmer는 개발자에게 좋은 AI 모델인가요?

이 테스트를 기반으로 볼 때, Muse Glimmer는 놀라울 정도로 유능하고 신뢰할 수 있는 모델입니다. 도구 호출이 포함된 복잡한 코딩 및 자동화 작업을 성공적으로 완료했으며, 강력한 추론 능력과 사소한 오류를 해결하는 능력을 보여주었습니다.

Mixture of Experts(MoE) 모델이란 무엇인가요?

Nemotron Lightning과 같은 MoE 모델은 여러 개의 작은 '전문가(expert)' 서브 네트워크로 구성됩니다. 특정 작업이 주어지면 라우터가 가장 관련성이 높은 전문가만 활성화하므로, 모든 매개변수가 항상 활성화되는 덴스(dense) 모델보다 실행 속도가 빠르고 비용이 저렴합니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only