6.6초라는 결과에는 함정이 있습니다
Strata는 1250억 개의 파라미터를 가진 Qwen 3.8 Flash-Next 모델을 로컬에서 실행하여 긴 답변 프롬프트를 6.6초 만에 완료했습니다. OpenRouter의 클라우드 서비스를 통해 동일한 테스트를 실행했을 때는 33초가 소요되었습니다. 이러한 5배의 로컬 속도 이점은 코딩 및 창의적 글쓰기 작업에서도 나타났습니다.
제작자 Niko1221은 벤치마크 전반에 걸쳐 성능이 다양하게 나타나는 것을 관찰했습니다. 예를 들어, 짧은 논리 퍼즐의 경우 로컬에서 1.4초, 클라우드에서 1.5초로 거의 차이가 없었습니다. 결과는 작업의 복잡성과 답변 길이에 따라 일관되게 변화했으며, 이는 모델의 적응형 동작을 잘 보여줍니다.
중요한 점은 몇 가지 주의 사항이 이 직접적인 비교를 완화한다는 것입니다. 로컬 모델은 2-bit quantized 버전을 사용했는데, 이는 전체 정밀도 변형보다 본질적으로 더 작고 빠릅니다. 클라우드 하드웨어 구성과 공급자 부하는 통제되지 않은 변수였으며, 결과에 영향을 미쳤을 가능성이 있습니다. 또한 로컬 설정은 32GB VRAM을 갖춘 RTX 5090 GPU를 활용했는데, 이는 일반적인 소비자용 하드웨어 성능을 훨씬 뛰어넘는 고사양 부품입니다.
이러한 요소들은 인상적인 속도 향상이 특정 조건에 달려 있음을 시사합니다. GPU, CPU, RAM, SSD 전반에 걸친 분산 처리에 대한 Strata의 혁신적인 접근 방식은 확실히 거대한 모델의 로컬 실행을 가능하게 하지만, 클라우드 서비스와의 비교는 여전히 복잡합니다.
125B 모델이 데스크톱에 들어가는 방법
RTX 5090과 같은 최고급 GPU조차 32GB의 VRAM만 가지고 있다는 점을 고려하면, Qwen 3.8 Flash-Next와 같은 1250억 파라미터 모델로 로컬 추론을 달성하는 것은 불가능해 보일 수 있습니다. 그 비결은 Strata가 독창적으로 활용하는 모델의 Mixture-of-Experts (MoE) 아키텍처에 있습니다. 전체 모델은 125B 파라미터이지만, 특정 토큰에 대해 활성화되는 파라미터는 약 60억 개에 불과하며, 전문가의 작은 하위 집합이 동적으로 선택됩니다.
Strata는 PC의 리소스 전반에 걸쳐 작업 부하를 지능적으로 분산합니다. 공유 모델 구성 요소와 자주 액세스되는 전문가는 GPU의 VRAM에 상주합니다. 그러나 24,576개의 모든 전문가는 시스템 RAM에 저장되어 빠르게 액세스할 수 있습니다.
약 29GB의 룩업 테이블은 SSD에 남아 있습니다. Strata는 필요한 작은 행을 미리 가져와 I/O 병목 현상을 제거하고 원활한 작동을 보장합니다. 이러한 계층화된 메모리 전략을 통해 거대한 모델을 소비자용 하드웨어에서 실행할 수 있습니다.
영상 설정은 필요한 하드웨어를 강조합니다:
- 32GB VRAM을 갖춘 RTX 5090
- Core Ultra 9 285K 프로세서
- 62GB RAM
- 설치를 위해 약 80GB의 여유 디스크 공간.
이 구성은 Strata와 같은 최적화된 소프트웨어를 사용하면 고성능 로컬 AI 추론에 점점 더 쉽게 접근할 수 있음을 보여줍니다.
CPU와 GPU가 협력하게 만드는 ‘도어벨’
Strata의 핵심 혁신은 이기종 하드웨어의 영리한 오케스트레이션에 있습니다. GPU는 특정 레이어에 필요한 10명의 전문가를 식별한 후, ‘도어벨’이라고 불리는 공유 메모리 세그먼트를 통해 해당 ID를 알립니다. 이 알림을 통해 CPU는 시스템 RAM에서 동시에 처리를 시작할 수 있습니다.
전체 레이어를 단순히 오프로드하는 것과 달리, Strata는 사용 가능한 전문가를 GPU에 동적으로 할당하고 캐시 미스를 CPU로 직접 보냅니다. 이를 통해 두 프로세서가 동일한 레이어에서 병렬로 작업할 수 있어, 데이터 이동과 관련된 일반적인 유휴 시간을 제거하고 지속적인 계산을 보장합니다.
프로세스를 더욱 가속화하기 위해 Strata는 speculative decoding을 통합했습니다. 작고 효율적인 헬퍼 모델이 여러 개의 잠재적인 다음 토큰을 제안하면, 메인 Qwen 3.8 Flash-Next 모델이 이를 단일 배치로 검증합니다. 이 접근 방식은 테스트에서 1.6~1.8배의 가속을 기록했으며, 메인 모델은 최종 출력값을 변경하지 않으면서 약 79%의 확률로 헬퍼 모델의 제안에 동의했습니다.
활성 전문가를 위해 GPU VRAM을, 전체 전문가 세트를 위해 시스템 RAM을, 대규모 룩업 테이블을 위해 NVMe SSD를 활용하는 이 통합적 접근 방식은 처리량을 극대화합니다. 이 오픈 소스 프로젝트에 대한 더 자세한 기술적 내용은 GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware에서 확인하실 수 있습니다. Strata는 데스크톱 PC를 강력한 분산 추론 엔진으로 효과적으로 변환합니다.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
빠른 추론이 곧 무료 업그레이드를 의미하지는 않습니다
로컬 추론은 강력한 이점을 제공하지만, Strata의 속도 결과가 모델의 품질이나 성능을 보편적으로 보장하는 것은 아닙니다. Qwen 3.8 Flash-Next의 2비트 로컬 양자화는 영상의 특정 테스트에서는 잘 작동했지만, 이것이 더 높은 정밀도로 실행되는 클라우드 모델과 동등함을 입증하는 것은 아닙니다. 정밀도는 종종 미묘한 추론과 사실 관계 파악에 영향을 미칩니다.
또한 Strata는 상당한 시스템 리소스를 요구합니다. 125B 모델은 사용 가능한 VRAM의 거의 전부(예: RTX 5090에서 32GB)와 시스템 RAM의 상당 부분(영상에서는 최대 39GB)을 소비할 수 있습니다. 첫 모델 로드 시 PC가 몇 분간 멈출 수 있으며, 영상에서도 언급했듯이 더 긴 대화나 다른 프롬프트에 따라 처리량이 달라질 수 있습니다.
이러한 인상적인 벤치마크는 시스템별로 다릅니다. 예를 들어, 영상에서 RTX 5090으로 달성한 3~5배의 속도 향상은 12GB VRAM이나 더 적은 시스템 RAM을 탑재한 환경과 직접 비교할 수 없습니다.
결국 로컬 추론은 개인 정보 보호, 사용자 제어, 낮은 한계 전기 비용을 제공합니다. 반면 클라우드 서비스는 고성능 GPU에 대한 초기 투자 비용을 피할 수 있으며, 더 높은 정밀도와 강력한 모델에 대한 일관된 액세스를 제공할 수 있습니다. Strata의 결과는 최적화된 소프트웨어와 하드웨어로 무엇이 가능한지를 보여주는 강력한 사례이지, 모든 사용자에게 제공되는 무료 업그레이드는 아닙니다.
자주 묻는 질문
Strata란 무엇인가요?
Strata는 GPU, CPU, 시스템 RAM 및 SSD에 작업을 분산하여 Qwen 3.8 Flash-Next를 로컬에서 실행하도록 설계된 오픈 소스 추론 엔진입니다.
영상에서 로컬 모델이 어떻게 클라우드를 이겼나요?
제작자의 RTX 5090 PC에서 Strata는 긴 응답을 6.6초 만에 완료한 반면, 클라우드 실행은 33초가 걸렸습니다. 결과는 프롬프트, 하드웨어, 제공업체의 부하 및 설정에 따라 달라집니다.
Strata를 실행하려면 어떤 PC가 필요한가요?
영상에서는 최소 12GB VRAM, 32GB 시스템 RAM, 약 80GB의 여유 디스크 공간이 필요하다고 보고합니다. 더 많은 메모리와 빠른 SSD가 도움이 될 수 있으며, 해당 모델은 상당한 RAM과 VRAM을 사용했습니다.
Strata는 모든 작업에서 클라우드 AI보다 빠른가요?
아니요. 영상의 논리 퍼즐 테스트는 사실상 무승부였으며 클라우드 성능은 가변적입니다. 또한 로컬 결과는 2비트 양자화 모델을 사용했으므로, 속도 비교가 곧 정확도가 동일함을 의미하지는 않습니다.

