Skip to content
comparisons

Nvidiaの新しい30Bモデルは使用不可能

2つのAI大手が同じ週に強力な新しい30Bモデルをリリースし、どちらもコンシューマー向けハードウェアでの高いパフォーマンスを約束しました。しかし、私たちの直接比較テストにより、そのうちの1つに実務では全く信頼できない致命的な欠陥があることが明らかになりました。

Vera Cole
Nvidiaの新しい30Bモデルは使用不可能

2つの巨人、2つのアーキテクチャ、1つの目標

MetaのMuse GlimmerとNVIDIAのNemotron Lightning 3.5という、どちらも新しい300億パラメータモデルが1日違いでリリースされました。両者ともコンシューマーグレードのハードウェア向けに設計されており、特にRTX 5090のようなGPUに最適化されています。アーキテクチャには大きな違いがあるものの、同時期のリリースにより直接比較の対象となっています。

MetaのフラッグシップモデルであるMuse Sparkの蒸留版であるMuse Glimmerは、日常的なシステムでの効率性を重視しています。このモデルはDFlashサポートを統合しており、より小さなドラフターモデルが16単語のチャンクを推測し、メインモデルがそれを検証する投機的デコードを可能にしています。この手法により、出力品質を犠牲にすることなく3倍の速度向上が期待できます。

速度向上に加え、Muse Glimmerは強力な視覚認識機能を備えており、画像を解釈して推論することができます。また、128,000トークンのコンテキストウィンドウを提供しており、詳細で短時間のやり取りに適しています。

NVIDIAのNemotron Lightning 3.5は、Mixture of Experts (MoE) アーキテクチャを採用することで、根本的に異なるアプローチをとっています。公称では300億パラメータモデルですが、推論ごとにルーターが約30億パラメータのみをアクティブにするため、非常に高速で効率的です。この設計がパフォーマンスの核心となっています。

Lightning 3.5は、100万トークンという巨大なコンテキストウィンドウを備えており、膨大な文書や長文コンテンツの処理に最適です。しかし、このモデルにはMuse Glimmerと比較して、統合された視覚認識機能が欠けているという大きなトレードオフがあります。

自動化の試練:壊れたコードの物語

最初のWebページコーディングテストで、パフォーマンスの明らかな差がすぐに露呈しました。NVIDIAのNemotron Lightning 3.5は一貫して空白で機能しないページを生成し、合計11分間で2回失敗しました。修正を促した後でも、全く同じ壊れた結果を出力しました。対照的に、Muse Glimmerは2分50秒以内に部分的に機能するページを作成し、動作するボタン、ピンレイアウト、インタラクティブなツールチップを備えていました。Glimmerは基本的なタスクの実行において明らかな優位性を示しました。

続く動画編集の課題は、Lightningの深刻な制限をさらに浮き彫りにしました。音声を追加するタスクにおいて、Nemotron Lightning 3.5は壊滅的に失敗し、タイムラインを破損させ、重要なソーストラックを削除しました。これは軽微なエラーではなく、破壊的な結果でした。一方、Muse Glimmerは編集を完璧に実行し、音声を正しくレイヤー化し、音楽を変更するという追加リクエストにも正確に対応しました。

これらの試練から明確なパターンが浮かび上がります。Muse Glimmerは一貫して堅牢な推論とツール利用の成功を示し、マルチステップロジックを巧みに操って機能的な出力を達成します。対照的に、NVIDIAのNemotron Lightning 3.5は複雑な指示に深く苦戦し、自己修正や使用可能な結果の生成ができません。基本的な自動化タスクを実行できないため、実用的なアプリケーションには事実上使用不可能です。

100万トークンのコンテキストウィンドウが無意味なとき

初期の自動化テストで、Nemotron Lightning 3.5の致命的な欠陥が露呈しました。最終評価は、その宣伝文句である100万トークンのコンテキストウィンドウという強みを活かすように設計されました。Muse Glimmerの128,000トークンをはるかに超えるこの巨大な容量により、Lightningは膨大な文書分析に理想的な候補と位置付けられていました。テスターは両モデルにNVIDIA自身の100ページを超える10K報告書を提示し、詳細な財務データ抽出のための完璧な実世界テストを行いました。

Nemotron Lightning 3.5は驚くべき失敗を露呈しました。Webフェッチツール呼び出しが即座に失敗し、モデルは一般的なWeb検索への切り替えを余儀なくされました。この重大なミスにより、深刻なハルシネーション(幻覚)が発生しました。Lightningは、NVIDIAの収益の23%が主要顧客によるものだと報告しましたが、10K報告書で容易に確認できる正確な数値は36%です。主要な財務データにおける13ポイントもの誤差は、この出力を根本的に無価値なものにしています。

Muse Glimmerは、比較的小さなコンテキストウィンドウでありながら、はるかに高い信頼性を示しました。初期のWebリクエストで失敗したものの、Glimmerはこれらの障害をうまく乗り越えました。このモデルは正しいNVIDIA 10Kドキュメントを取得し、36%という収益数値を正確に抽出しました。これは、その優れたツール使用の堅牢性を証明しています。この対照的な結果は、広大なコンテキストウィンドウのような生の仕様も、信頼できる実行力がなければ無意味であることを強調しています。Muse Glimmerを含むモデルの詳細については、muse-glimmer-30b Model by Meta - Nvidia NIMを参照してください。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

結論:Glimmerの輝き、Lightningの敗北

Muse Glimmerは、この30Bモデルの対決において文句なしの勝者であり、日常的なタスクにおいて有能かつ驚くほど信頼できるモデルであることが証明されました。3つの複雑なテストのうち2つを印象的な結果でクリアし、真の有用性を示しました。インタラクティブな要素やツールチップを備えた部分的に機能するWebページの作成から、100ページを超えるドキュメント分析の効率的な管理まで、Glimmerは一貫して実用的な出力を提供しました。このモデルは、RTX 5090のようなコンシューマー向けGPUでの本格的なアプリケーション利用に耐えうるものです。

対照的に、NVIDIAのNemotron Lightning 3.5は、現状では本格的な作業には全く使用できません。そのパフォーマンスは全体的にひどいものでした。Webコーディングテスト中、Lightningは何度も空白で機能しないページを生成し、基本的なツール使用や論理的な構築を実行できませんでした。1Mトークンのコンテキストウィンドウを謳いながら、NVIDIA自身の10K報告書から意味のあるデータを抽出することさえできず、不正確で信頼できない結果をもたらしました。

開発者にとっての教訓は厳しく、重要です。300億というパラメータ数や印象的な1Mトークンのコンテキストウィンドウといった紙の上の仕様は、基本的な推論能力と信頼できる実行力がなければ無意味です。Muse Glimmerは実行に必要な基礎的な知能を備えており、実行可能な選択肢となります。Nemotron Lightning 3.5は、そのアーキテクチャ上の約束にもかかわらず、この核となる能力を完全に欠いており、完全な失敗作と言えます。避けるべきです。

よくある質問

Muse GlimmerとNemotron Lightning 3.5とは何ですか?

どちらもMetaとNvidiaがそれぞれリリースした300億パラメータのAIモデルで、コンシューマーグレードのハードウェア上で効率的に動作するように設計されています。Muse Glimmerは視覚機能を備えた蒸留モデルであり、Nemotron Lightningは大きなコンテキストウィンドウを持つMixture-of-Experts(MoE)モデルです。

なぜNemotron Lightning 3.5はテストでこれほど低いパフォーマンスだったのですか?

複雑で多段階のタスクを一貫して完了できませんでした。ツール使用(Webフェッチの失敗)に苦戦し、エラーを自己修正できず、あるケースではソースドキュメントの取得失敗を報告する代わりに、誤った財務データをハルシネーションとして生成しました。

MetaのMuse Glimmerは開発者にとって良いAIモデルですか?

これらのテストに基づくと、Muse Glimmerは驚くほど有能で信頼できるモデルです。ツール呼び出しを伴う複雑なコーディングや自動化タスクを成功させ、堅牢な推論能力と軽微なエラーを回避する能力を示しました。

Mixture of Experts(MoE)モデルとは何ですか?

Nemotron LightningのようなMoEモデルは、多数の小さな「エキスパート」サブネットワークで構成されています。特定のタスクに対して、ルーターが最も関連性の高いエキスパートのみをアクティブにするため、すべてのパラメーターが常にアクティブな密なモデルよりも高速かつ低コストで実行できます。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only