Skip to content
comparisons

Le nouveau modèle 30B de Nvidia est inutilisable

Deux géants de l'IA ont lancé de nouveaux modèles puissants de 30B la même semaine, promettant tous deux des performances élevées sur du matériel grand public. Mais nos tests comparatifs révèlent un défaut fatal chez l'un d'eux qui le rend totalement peu fiable pour des tâches réelles.

Vera Cole
Le nouveau modèle 30B de Nvidia est inutilisable

Deux géants, deux architectures, un seul objectif

Muse Glimmer de Meta et Nemotron Lightning 3.5 de NVIDIA, deux nouveaux modèles de 30 milliards de paramètres, sont sortis à un jour d'intervalle. Tous deux sont conçus pour du matériel grand public, spécifiquement optimisés pour des GPU comme la RTX 5090. Leur sortie simultanée suscite une comparaison directe, malgré des différences architecturales marquées.

Muse Glimmer, une version distillée du modèle phare Muse Spark de Meta, vise l'efficacité sur les systèmes courants. Il intègre le support DFlash, permettant un décodage spéculatif où un modèle rédacteur plus petit devine des segments de 16 mots, que le modèle principal vérifie ensuite. Cette méthode revendique un gain de vitesse de 3x sans sacrifier la qualité de sortie.

Au-delà de ses améliorations de vitesse, Muse Glimmer possède de solides capacités de vision, lui permettant d'interpréter et de raisonner sur des images. Il offre également une fenêtre de contexte substantielle de 128 000 jetons, le positionnant pour des interactions détaillées et plus courtes.

Nemotron Lightning 3.5 de NVIDIA adopte une approche fondamentalement différente avec son architecture Mixture of Experts (MoE). Bien qu'il s'agisse nominalement d'un modèle de 30 milliards de paramètres, un routeur n'active activement qu'environ 3 milliards de paramètres pour chaque inférence, ce qui le rend exceptionnellement rapide et efficace. Cette conception est au cœur de ses performances.

Lightning 3.5 se distingue par une fenêtre de contexte massive de 1 million de jetons, idéale pour traiter des documents volumineux ou du contenu long. Cependant, ce modèle manque notablement de capacités de vision intégrées, un compromis significatif par rapport à Muse Glimmer.

Le défi de l'automatisation : une histoire de code cassé

Le test initial de codage de page web a immédiatement révélé un écart de performance frappant. Nemotron Lightning 3.5 de NVIDIA a systématiquement produit une page blanche et non fonctionnelle, échouant deux fois sur une durée totale de 11 minutes. Même après avoir demandé des corrections, il a produit exactement le même résultat cassé. En revanche, Muse Glimmer a livré une page partiellement fonctionnelle en 2 minutes et 50 secondes, avec des boutons fonctionnels, une mise en page en épingle et des tooltips interactifs. Glimmer a démontré une supériorité claire dans l'exécution de la tâche fondamentale.

Le défi de montage vidéo qui a suivi a mis en évidence les graves limitations de Lightning. Chargé d'ajouter de l'audio, Nemotron Lightning 3.5 a échoué de manière catastrophique, corrompant la chronologie et supprimant des pistes sources cruciales. Ce n'était pas une erreur mineure, mais un résultat destructeur. Muse Glimmer, cependant, a exécuté le montage parfaitement, superposant correctement l'audio et gérant même une demande de suivi pour changer la musique avec précision.

Un schéma clair émerge de ces essais. Muse Glimmer démontre systématiquement un raisonnement robuste et une utilisation réussie des outils, naviguant habilement dans une logique multi-étapes pour obtenir des résultats fonctionnels. Nemotron Lightning 3.5 de NVIDIA, à l'inverse, éprouve de grandes difficultés avec les instructions complexes, échouant à s'auto-corriger ou à produire des résultats utilisables. Son incapacité à effectuer des tâches d'automatisation de base le rend effectivement inutilisable pour une application pratique.

Quand une fenêtre de contexte de 1M ne signifie rien

Les tests d'automatisation initiaux ont exposé les défauts critiques de Nemotron Lightning 3.5. L'évaluation finale a été conçue pour tirer parti de son point fort annoncé : une fenêtre de contexte de 1M de jetons. Cette capacité immense, dépassant largement les 128 000 jetons de Muse Glimmer, positionnait Lightning comme le candidat idéal pour l'analyse documentaire approfondie. Les testeurs ont soumis aux deux modèles le propre dépôt 10K de plus de 100 pages de NVIDIA, un test réel parfait pour l'extraction de données financières approfondies.

Nemotron Lightning 3.5 a essuyé un échec cuisant. Son appel d'outil de récupération web a immédiatement échoué, forçant le modèle à se rabattre sur une recherche web générale. Cette erreur critique a conduit directement à une hallucination sévère : Lightning a rapporté que 23 % du chiffre d'affaires de NVIDIA provenait de ses principaux clients. Le chiffre exact, facilement vérifiable dans le dépôt 10K, est de 36 %. Une erreur de 13 points sur des données financières fondamentales rend ce résultat fondamentalement inutile.

Muse Glimmer, avec sa fenêtre de contexte comparativement plus petite, s'est révélé nettement plus fiable. Il a également rencontré des échecs de requête web initiaux, mais Glimmer a réussi à surmonter ces obstacles. Le modèle a récupéré le bon document NVIDIA 10K et a extrait avec précision le chiffre d'affaires de 36 %, démontrant sa robustesse supérieure dans l'utilisation des outils. Cette comparaison frappante souligne que les spécifications brutes comme une vaste fenêtre de contexte sont sans importance sans une exécution fiable. Pour plus de détails sur les modèles, y compris Muse Glimmer, consultez muse-glimmer-30b Model by Meta - Nvidia NIM.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Le Verdict : Glimmer brille, Lightning fait un flop

Muse Glimmer émerge comme le vainqueur incontestable de ce duel de modèles 30B, se révélant être un modèle capable et étonnamment fiable pour les tâches quotidiennes. Il a réussi deux tests complexes sur trois avec des résultats impressionnants, démontrant une utilité réelle. De la création d'une page web partiellement fonctionnelle avec des éléments interactifs et des infobulles, à la gestion efficace de l'analyse d'un document de plus de 100 pages, Glimmer a systématiquement fourni des résultats exploitables. Ce modèle est prêt pour une application sérieuse sur des GPU grand public comme la RTX 5090.

À l'inverse, le Nemotron Lightning 3.5 de NVIDIA est tout simplement inutilisable dans son état actuel pour tout travail sérieux. Ses performances ont été abyssales sur toute la ligne. Lors du test de codage web, Lightning a produit à plusieurs reprises une page vide et non fonctionnelle, échouant à exécuter une utilisation d'outil de base ou une construction logique. Même avec sa fenêtre de contexte vantée de 1M de jetons, il a échoué à extraire des données significatives du propre dépôt 10K de NVIDIA, produisant des résultats inexacts et indignes de confiance.

La leçon est frappante et critique pour les développeurs : les spécifications sur papier comme un nombre de paramètres de 30 milliards ou une impressionnante fenêtre de contexte de 1M de jetons sont dénuées de sens sans un raisonnement fondamental et une exécution fiable. Muse Glimmer possède l'intelligence fondamentale pour performer, ce qui en fait un choix viable. Nemotron Lightning 3.5, malgré ses promesses architecturales, manque totalement de cette capacité centrale, ce qui en fait un échec complet. Évitez-le.

Foire aux questions

Que sont Muse Glimmer et Nemotron Lightning 3.5 ?

Ce sont tous deux des modèles d'IA à 30 milliards de paramètres publiés respectivement par Meta et Nvidia, conçus pour fonctionner efficacement sur du matériel grand public. Muse Glimmer est un modèle distillé avec des capacités de vision, tandis que Nemotron Lightning est un modèle Mixture-of-Experts (MoE) avec une grande fenêtre de contexte.

Pourquoi Nemotron Lightning 3.5 a-t-il si mal performé lors des tests ?

Il a systématiquement échoué aux tâches complexes en plusieurs étapes. Il a eu du mal avec l'utilisation des outils (échec des récupérations web), n'a pas pu corriger ses erreurs lui-même et, dans un cas, a halluciné des données financières incorrectes au lieu de signaler son échec à récupérer le document source.

Le Muse Glimmer de Meta est-il un bon modèle d'IA pour les développeurs ?

Sur la base de ces tests, Muse Glimmer est un modèle étonnamment capable et fiable. Il a réussi des tâches complexes de codage et d'automatisation impliquant l'appel d'outils, démontrant un raisonnement robuste et la capacité de contourner des erreurs mineures.

Qu'est-ce qu'un modèle Mixture of Experts (MoE) ?

Un modèle MoE, comme Nemotron Lightning, se compose de nombreux sous-réseaux « experts » plus petits. Pour une tâche donnée, un routeur n'active que les experts les plus pertinents, rendant le modèle plus rapide et moins coûteux à exécuter qu'un modèle dense où tous les paramètres sont toujours actifs.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only