Skip to content
ai agents

2B 모델이 4B 거대 모델을 이겼습니다. 여기 함정이 있습니다.

작은 2B 파라미터 모델이 복잡한 코딩 작업에서 자신보다 두 배 큰 거대 모델들을 능가하며 로컬 AI 에이전트의 새로운 시대를 예고하고 있습니다. 하지만 문서에 숨겨진 단 하나의 설정이 이 모델을 완전히 쓸모없게 만들 수 있습니다.

Sol Aguirre
2B 모델이 4B 거대 모델을 이겼습니다. 여기 함정이 있습니다.

4B 라이벌을 뛰어넘은 2B 모델

OpenBMB의 20억 파라미터 모델인 MiniCPM5-2B가 최근 SWE-bench Verified 벤치마크에서 충격적인 결과를 보여주었습니다. 이 모델은 46점을 기록하며 34점을 기록한 40억 파라미터의 Qwen3.5-4B를 결정적으로 앞섰습니다. 이러한 성능은 모델 규모에 대한 기존의 통념을 뒤엎고, 두 배 더 큰 라이벌을 제치며 '클수록 좋다'는 관념에 도전했습니다.

이러한 도약은 동일한 크기 범주와 비교할 때 더욱 의미가 큽니다. Qwen3.5-2B 및 Gemma-4-E2B와 같은 다른 20억 파라미터 모델들은 각각 5점과 2점을 기록했습니다. MiniCPM5-2B는 단순히 승리한 것이 아니라, 소형 모델이 달성할 수 있는 수준을 재정의하며 특히 자원이 제한된 환경에서 효율적이고 배포 가능한 AI의 새로운 지평을 열었습니다.

SWE-bench는 단순한 학술적 연습이 아니라, 기능적인 코드 패치를 생성하여 실제 GitHub 이슈를 해결하는 모델의 능력을 엄격하게 테스트합니다. 이는 대화 유창성이나 이론적 이해에 관한 것이 아니라, 복잡한 소프트웨어 환경에서의 실용적이고 에이전트적인 문제 해결에 관한 것입니다. 이 수준에서 작동하는 2B 모델은 AI 에이전트 역량의 심오한 변화를 의미하며, 추상적인 잠재력에서 개발자를 위한 실질적이고 검증 가능한 결과물로 나아가고 있음을 보여줍니다.

에이전트를 위해 구축된 모델

MiniCPM5-2B의 놀라운 성능은 우연이 아니며, 모델 설계의 심오한 변화를 나타냅니다. OpenBMB는 지도 미세 조정(SFT) 과정에서 50만 개의 에이전트 궤적을 학습시켜 일반적인 대화 기능을 넘어 에이전트 행동을 위해 훈련 방식을 명시적으로 설계했습니다. 이 엄격한 과정은 이후 고급 강화 학습을 통합하여 16개의 개별 RL 전문가 모델을 단일한 고도로 전문화된 에이전트로 융합하는 것으로 마무리되었습니다.

구조적으로 MiniCPM5-2B는 실용적이면서도 강력한 결정인 일반 Llama 베이스를 채택했습니다. 이는 새로운 구성 요소를 발명하는 것이 아니라, 이전 반복 모델들을 괴롭혔던 커스텀 sparse attention을 피하고 유틸리티와 도달 범위를 극대화하는 데 중점을 둡니다. 이러한 전략적 선택은 모델에 엄청난 호환성을 부여하여 다음과 같은 다양한 환경에서 쉽게 실행할 수 있게 합니다:

  • MLX
  • Llama.cpp
  • WebLLM

이는 에이전트 시스템을 구축하는 개발자들의 진입 장벽을 크게 낮춰줍니다.

결정적으로 MiniCPM5-2B의 기술 사양은 에이전트로서의 기량을 뒷받침합니다. 이 모델은 상태를 유지하고 장기 실행 작업 시퀀스를 이해하는 데 필수적인 128,000개의 네이티브 컨텍스트 윈도우를 갖추고 있습니다. Apache 2.0 라이선스로 출시된 이 모델은 오픈 데이터셋과 함께 투명성과 폭넓은 채택을 장려하며, 새로운 에이전트 애플리케이션을 위한 기초적인 구성 요소가 됩니다.

잘못된 기본 설정 하나가 모든 것을 망칩니다

기본 설정으로 양자화된 4-bit GGUF 모델을 실행하면 MiniCPM5-2B의 치명적인 결함이 드러납니다. 벤치마크에서의 뛰어난 성능에도 불구하고, 이 모델은 92% 이상의 확률로 반복 루프에 빠져 에이전트 작업에 사실상 쓸모없게 될 수 있습니다. 일반적인 기본 구성에 의해 트리거되는 이러한 고유한 불안정성은 초기에는 모델의 진정한 잠재력을 가리고 있었습니다.

문서화되지 않았던 간단한 수정으로 이러한 불규칙한 동작을 바꿀 수 있습니다. 샘플러 설정, 특히 min_p를 0으로 설정하거나 repeat_penalty를 1.15로 설정하면 MiniCPM5-2B의 잠재된 능력이 발휘됩니다. HumanEval+에서 Q4_KM 양자화 버전은 이러한 특정 조정을 통해 6점이라는 저조한 점수에서 71점이라는 인상적인 점수로 도약하며, 설정에 대한 극적인 민감성을 보여줍니다.

이것은 단순한 파라미터 조정이 아니라, 효율적인 AI를 위한 근본적인 설계 고려 사항입니다. MiniCPM5-2B와 같이 작고 고도로 튜닝된 모델의 경우, 샘플러 설정은 단순한 '튜닝'을 넘어 모델의 기능적 설계에서 핵심적인 부분이 되었습니다. 이러한 중요한 기본값을 무시하면 강력한 에이전트조차 완전히 망가질 수 있으며, 이는 해당 시스템이 얼마나 정밀하게 최적화되어 작동하는지를 보여줍니다. GitHub - OpenBMB/MiniCPM: MiniCPM5: SOTA on-device LLMs, small yet powerful. 저장소에서 OpenBMB가 진행 중인 아키텍처 연구를 확인해 보세요.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

현실 점검: 4B 모델이 여전히 우세한 이유

놀라운 에이전트 성능에도 불구하고, MiniCPM5-2B는 특화된 영역을 벗어나면 상당한 한계에 직면합니다. SWE-bench Verified에서는 Qwen3.5-4B를 확실하게 앞서며 뛰어난 성과를 보였지만, 더 광범위하고 다양한 지표에서는 성능이 저하됩니다. SWE-bench Pro에서 MiniCPM5-2B는 14점을 기록했는데, 이는 Qwen3.5-4B의 28점의 정확히 절반 수준입니다. Terminal-Bench에서는 격차가 더 크게 벌어져, MiniCPM5-2B는 약 8.5점을 기록한 반면 Qwen3.5-4B는 26점을 기록하여 3배의 차이를 보였습니다.

중요한 점은 OpenBMB의 벤치마크가 벤더 자체적으로 실행된 것으로, 좁고 선별적인 관점만을 제시한다는 것입니다. 비교 표에는 Qwen과 Gemma 모델만 독점적으로 포함되어 있으며, 더 넓은 생태계의 주요 경쟁 모델들은 의도적으로 누락되었습니다. 다음 모델들에 대한 성능 지표는 없습니다:

  • Llama
  • Phi
  • SmolLM3
  • MiniCPM4 (이전 버전)

이러한 투명성 부족과 커뮤니티에서 요청한 평가 스크립트의 부재는 전체 경쟁 환경에 대한 의문을 제기합니다.

MiniCPM5-2B는 로컬 에이전트 실험, 특히 MacBook Air와 같은 온디바이스 애플리케이션을 위한 흥미로운 도약입니다. 초집중적인 학습 덕분에 특정 코딩 및 도구 사용 작업에 강력한 도구가 됩니다. 그러나 MMLU-Pro, GPQA Diamond, LongBench V2 등 Qwen3.5-4B가 우위를 점하는 다양한 작업에서 더 광범위하고 신뢰할 수 있는 성능을 원한다면, 더 큰 규모의 Qwen3.5-4B가 의심할 여지 없이 더 우수하고 강력한 선택지입니다. 작은 모델은 가능성을 보여주지만, 거대 모델이 여전히 중심을 지키고 있습니다.

자주 묻는 질문 (FAQ)

MiniCPM5-2B란 무엇인가요?

MiniCPM5-2B는 OpenBMB에서 개발한 25억 개의 파라미터를 가진 오픈 소스 언어 모델입니다. AI 에이전트 작업을 위해 특별히 학습되었으며, 폭넓은 호환성을 위해 표준 Llama 아키텍처를 사용합니다.

MiniCPM5-2B와 더 큰 모델인 Qwen3.5-4B는 어떻게 비교되나요?

MiniCPM5-2B는 SWE-bench Verified(46 vs 34)와 같은 특정 에이전트 벤치마크에서 Qwen3.5-4B를 능가합니다. 그러나 더 큰 모델인 Qwen은 SWE-bench Pro, MMLU-Pro, Terminal-Bench와 같은 다른 벤치마크에서 훨씬 높은 점수를 기록하여 전반적으로 더 뛰어난 성능을 보여줍니다.

양자화된 MiniCPM5-2B가 루프에 빠지는 이유는 무엇인가요?

양자화된 GGUF 버전은 Llama.cpp와 같은 프레임워크의 잘못된 기본 샘플러 설정으로 인해 90% 이상의 확률로 무한 루프에 빠질 수 있습니다. min_p를 0으로 설정하거나 repeat_penalty를 약 1.15로 조정하면 문제가 해결되지만, 출시 당시에는 이 점이 명확하게 문서화되지 않았습니다.

MiniCPM5-2B가 에이전트 작업에 뛰어난 이유는 무엇인가요?

강력한 에이전트 성능은 특화된 학습에서 비롯됩니다. 여기에는 50만 개의 에이전트 궤적에 대한 지도 미세 조정(SFT), 강화 학습, 그리고 16개의 개별 RL 전문가 모델을 하나로 병합하는 과정이 포함되었습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.