Le modèle 2B qui a surpassé un rival 4B
MiniCPM5-2B, un modèle à 2 milliards de paramètres d'OpenBMB, a récemment créé la surprise sur le benchmark SWE-bench Verified. Il a obtenu un score de 46, battant de manière décisive le modèle Qwen3.5-4B à 4 milliards de paramètres, qui a atteint 34. Cette performance a défié les idées reçues sur l'échelle des modèles, surpassant un rival deux fois plus grand et remettant en question l'idée que plus grand est toujours mieux.
Ce bond est encore plus significatif si l'on regarde sa catégorie de taille immédiate. D'autres modèles à 2 milliards de paramètres, comme Qwen3.5-2B et Gemma-4-E2B, ont enregistré des scores respectifs de 5 et 2. MiniCPM5-2B n'a pas seulement gagné ; il a redéfini ce qu'un petit modèle peut accomplir, signalant une nouvelle frontière pour une IA efficace et déployable, en particulier dans les environnements aux ressources limitées.
SWE-bench n'est pas un exercice académique ; il teste rigoureusement la capacité d'un modèle à résoudre des problèmes GitHub réels en produisant des correctifs de code fonctionnels. Il ne s'agit pas ici de fluidité conversationnelle ou de compréhension théorique ; il s'agit de résolution de problèmes pratique et agentique dans des environnements logiciels complexes. Un modèle 2B atteignant ce niveau signale un changement profond pour les capacités des agents IA, passant d'un potentiel abstrait à un résultat tangible et vérifiable pour les développeurs.
Conçu, et non ajusté, pour les agents
La performance stupéfiante de MiniCPM5-2B n'est pas un coup de chance ; elle représente un changement profond dans la conception des modèles. OpenBMB a explicitement conçu son régime d'entraînement pour un comportement agentique, allant au-delà des capacités de chat générales en l'alimentant avec 500 000 trajectoires d'agents lors du réglage fin supervisé. Ce processus rigoureux a ensuite intégré un apprentissage par renforcement avancé, aboutissant à la fusion de 16 modèles experts RL distincts en un seul agent hautement spécialisé.
Sur le plan architectural, MiniCPM5-2B prend une décision pragmatique mais puissante : une base Llama standard. Il ne s'agit pas d'inventer des composants inédits, mais de maximiser l'utilité et la portée, en évitant l'attention creuse personnalisée qui a affecté les itérations précédentes. Ce choix stratégique confère au modèle une compatibilité massive, lui permettant de fonctionner sans effort dans divers environnements tels que :
- MLX
- Llama.cpp
- WebLLM
Cela abaisse considérablement la barrière à l'entrée pour les développeurs construisant des systèmes d'agents.
De manière cruciale, les spécifications techniques de MiniCPM5-2B renforcent encore ses prouesses agentiques. Il dispose d'une robuste fenêtre de contexte native de 128 000 jetons, essentielle pour maintenir l'état et comprendre des séquences de tâches de longue durée. La publication du modèle sous licence Apache 2.0, parallèlement à ses jeux de données ouverts, favorise la transparence et une large adoption, en faisant une pièce fondamentale pour les nouvelles applications agentiques.
Une mauvaise valeur par défaut qui casse tout
L'exécution du modèle quantifié GGUF 4-bit avec les paramètres par défaut expose une faille critique dans MiniCPM5-2B. Malgré ses prouesses aux benchmarks, le modèle peut tomber dans une boucle de répétition débilitante plus de 92 % du temps, le rendant effectivement inutile pour les tâches agentiques. Cette instabilité inhérente, déclenchée par des configurations par défaut courantes, a initialement masqué le véritable potentiel du modèle.
Un correctif simple, alors non documenté, transforme ce comportement erratique. La modification des paramètres d'échantillonnage—spécifiquement en réglant min_p sur 0 ou repeat_penalty sur 1.15—libère les capacités latentes de MiniCPM5-2B. Sur HumanEval+, la version quantifiée Q4_KM passe d'un score lamentable de 6 à un impressionnant 71 avec ces ajustements spécifiques, soulignant une sensibilité spectaculaire.
Il ne s'agit pas d'un simple ajustement de paramètres ; c'est une considération de conception fondamentale pour une IA efficace. Pour les petits modèles hautement optimisés comme MiniCPM5-2B, les paramètres d'échantillonnage ne sont plus seulement du « réglage » ; ils font partie intégrante de la conception fonctionnelle du modèle. Ignorer ces paramètres par défaut cruciaux peut totalement briser un agent par ailleurs puissant, démontrant à quel point ces systèmes fonctionnent de manière étroitement optimisée. Explorez les travaux en cours d'OpenBMB sur ces architectures dans leur dépôt GitHub - OpenBMB/MiniCPM: MiniCPM5: SOTA on-device LLMs, small yet powerful..
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Retour à la réalité : quand le 4B gagne toujours
Malgré ses prouesses remarquables en tant qu'agent, MiniCPM5-2B fait face à des limites significatives lorsqu'il sort de sa niche spécialisée. Bien qu'il ait excellé sur SWE-bench Verified, surpassant de manière décisive Qwen3.5-4B, ses performances faiblissent sur des mesures plus larges et plus diversifiées. Sur SWE-bench Pro, MiniCPM5-2B obtient un score de 14, soit exactement la moitié des 28 obtenus par Qwen3.5-4B. Terminal-Bench montre un contraste encore plus frappant, avec MiniCPM5-2B atteignant environ 8,5 contre 26 pour Qwen3.5-4B, soit un facteur de trois.
Il est crucial de noter que les benchmarks d'OpenBMB sont réalisés par le fournisseur, présentant une vision étroite et sélectionnée. Le tableau comparatif présente exclusivement des modèles Qwen et Gemma, omettant ostensiblement des rivaux clés de l'écosystème plus large. Il n'y a aucune mesure de performance pour :
- Llama
- Phi
- SmolLM3
- MiniCPM4, son propre prédécesseur
Ce manque de transparence, aggravé par l'indisponibilité des scripts d'évaluation demandés par la communauté, soulève des questions sur le paysage concurrentiel global.
MiniCPM5-2B représente un bond fascinant pour les expériences d'agents locaux, en particulier pour les applications sur appareil comme un MacBook Air. Son entraînement hyper-spécialisé en fait un outil puissant pour des tâches spécifiques de codage et d'utilisation d'outils. Cependant, pour des performances plus larges et plus fiables sur des tâches diverses — y compris MMLU-Pro, GPQA Diamond et LongBench V2 où Qwen3.5-4B gagne également — le plus grand Qwen3.5-4B reste incontestablement le choix supérieur et plus robuste. Le plus petit modèle nous montre la voie, mais le titan occupe toujours le centre.
Foire aux questions
Qu'est-ce que MiniCPM5-2B ?
MiniCPM5-2B est un modèle de langage open-source de 2,5 milliards de paramètres développé par OpenBMB. Il est spécifiquement entraîné pour les tâches d'agent IA et utilise une architecture Llama standard pour une large compatibilité.
Comment MiniCPM5-2B se compare-t-il au plus grand Qwen3.5-4B ?
MiniCPM5-2B surpasse Qwen3.5-4B sur des benchmarks d'agents spécifiques comme SWE-bench Verified (46 contre 34). Cependant, le modèle Qwen plus grand obtient des scores nettement plus élevés sur d'autres benchmarks comme SWE-bench Pro, MMLU-Pro et Terminal-Bench, ce qui le rend plus performant dans l'ensemble.
Pourquoi le MiniCPM5-2B quantifié reste-t-il bloqué dans une boucle ?
Les versions GGUF quantifiées peuvent entrer dans une boucle infinie plus de 90 % du temps en raison de mauvais paramètres d'échantillonnage par défaut dans des frameworks comme Llama.cpp. Régler min_p sur 0 ou repeat_penalty sur environ 1,15 résout le problème, mais cela n'était pas clairement documenté au lancement.
Qu'est-ce qui rend MiniCPM5-2B si performant pour les tâches d'agent ?
Ses fortes performances en tant qu'agent proviennent de son entraînement spécialisé. Cela comprenait un réglage fin supervisé sur 500 000 trajectoires d'agent, de l'apprentissage par renforcement et la fusion de 16 modèles experts RL distincts en un seul.

