- Muse Glimmerのパフォーマンスは、30Bモデルを24GB VRAMに収めるK-Quantビルドに依存します
- DFlashコンパニオンモデルは、トークン生成を最大で毎秒233トークンまで加速します
- 131,072トークンのコンテキストにより、外部API呼び出しなしで大規模なエージェントループが可能です
- Apache 2.0ライセンスにより、コンシューマー向けGPUやMacでの無料のローカルデプロイが可能です
- MCP Atlasスコア75.5は、エージェントのツール使用において同サイズクラスをリードしています
Muse Glimmer パフォーマンスの概要
Muse Glimmerは、Meta Superintelligence Labsによって開発された300億パラメータのエージェントモデルです。コンシューマー向けハードウェアでローカルに実行される常時稼働のエージェント作業専用に設計されています。このモデルは、関数呼び出し、ローカルコーディング、および他のモデルの出力の評価に最適化された密結合トランスフォーマーとして提供されています。
動画のハイライト:
- K-Quantビルドを使用して30Bパラメータを20GB未満に圧縮
- DFlashスペキュラティブデコーディングがRTX 5090で毎秒最大233トークンを達成
- Metaのより大きなクローズドウェイトの教師モデルであるMuse Sparkから蒸留
- Hugging Faceで事前量子化されたGGUFビルドが利用可能なApache 2.0ライセンス
- 2026年1月時点の知識のカットオフ
Muse Glimmerの核心的な価値提案は、クラウドへの依存をなくすことです。従来のエージェントスタックはすべてのステップをAPIを通じてルーティングするため、レイテンシ、トークンコスト、およびデータ露出が発生します。Glimmerはこれを逆転させ、ファイルの横に存在し、オフラインで動作し、個人のコンテキストを完全にマシン上に保持します。
Muse Glimmerはゼロから学習されたものではありません。ロジット蒸留を使用してMuse Sparkから蒸留され、その後、より長いコンテキスト、エージェント中心のデータ、より豊かな推論トレースを用いた中期学習が行われました。学習後には、推論、コーディング、エージェントタスク全体にわたる教師ありファインチューニング、オンポリシー蒸留、強化学習が含まれました。
ハードウェア要件と量子化
300億パラメータのモデルを単一のコンシューマー向けGPUに収めるには、積極的な最適化が必要です。フル精度では、モデルは55ギガバイト以上のメモリを要求します。現在、その容量を搭載したコンシューマー向けグラフィックカードは存在しません。Metaは、約4ビット精度のK-Quantビルドを提供することでこれに対処しています。
| ビルドタイプ | 精度 | モデルサイズ | ターゲットハードウェア | 備考 |
|---|---|---|---|---|
| フル精度 | 16-bit | ~55GB+ | データセンターGPU | コンシューマーには適さない |
| K-Quant (17GB) | ~4-bit | 17GB未満 | 24GBコンシューマー向けGPU | RTX 4090/5090に適合 |
| K-Quant (コンパクト) | ~4-bit | 12GB未満 | 16GB GPU | より厳しいKVキャッシュ制限 |
| GGUF (Mac) | Q4_K_M | ~18-20GB | Apple Silicon (統合) | Ollama経由で実行 |
17ギガバイトのビルドは24ギガバイトのカードをターゲットにしています。そのメモリ枠には、KVキャッシュ、知覚エンコーダー、およびDFlashドラフトモデルも保持する必要があります。安定した動作のためには、VRAMの予算計画が重要です。
24GBのVRAM枠は、言語モデルの重み、131Kコンテキストウィンドウ用のKVキャッシュ、画像処理用の知覚エンコーダー、およびDFlashドラフトを収容できなければなりません。長いエージェントループ中に追加のバックグラウンドアプリケーションを実行すると、メモリ不足エラーが発生する場合があります。
Metaは、量子化されたビルドにおいてエッジケースでわずかな品質の違いが生じる可能性があると警告しています。24ギガバイトのビルドは、フル精度と比較して平均して約1%の品質偏差となります。ほとんどのエージェントワークフローでは、このトレードオフは無視できますが、常に特定のタスクでテストしてください。
DFlashアクセラレーションと速度ベンチマーク
速度は、ローカルエージェントのパフォーマンスにおける2番目の大きな壁です。言語モデルは通常一度に1つのトークンを出力するため、長いエージェントループは非常に直列的になりがちです。Muse Glimmerには、トークンブロック全体を提案するDFlashと呼ばれる小さなコンパニオンモデルが同梱されています。その後、メインモデルがそれらを並行して検証します。
| ハードウェア | トークン/秒 | 高速化 | ソース |
|---|---|---|---|
| RTX 5090 (NVIDIA) | 最大233 | 3.1倍高速 | Meta公表 |
| Radeon AI Pro (AMD) | 最大53 | ベースライン | AMD公表 |
| Ryzen AI Max (ラップトップ) | 最大24 | ベースライン | AMD公表 |
| Apple Silicon (Mac) | various | チップに依存 | コミュニティテスト |
DFlashを通じて承認されたトークンは、通常のデコーディング出力と同じです。メインモデルが提案を検証するため、スペキュラティブデコーディングによる品質低下はありません。
DFlashのメカニズム
- ブロックレベルのトークン提案
- メインモデルによる並列検証
- 承認されたトークンの品質低下なし
- 制御可能な推論労力
制御可能な推論
- 品質と速度のバランス
- タスクごとに動的に調整
- 単純なクエリにはより高速な応答
- 複雑なチェーンにはより深い推論
知覚エンコーダー
- 画像とスクリーンショットの読み取り
- チャートやドキュメントの処理
- 会話とのインターリーブ
- エージェントが自身の画面を見ることが可能
最大のスループットを得るには、ランタイム設定でDFlashが有効になっていることを確認してください。OllamaとLM Studioでは、ドラフトモデルが検出されるとスペキュラティブデコーディングが自動的にアクティブになります。ユーザーからは、NVIDIA RTX 5090ハードウェアで最も安定した速度が報告されています。
ベンチマークスコアと比較
Metaは、エージェントのツール使用において、Muse Glimmerを同サイズクラスのリーダーとして位置づけています。MCP Atlasでは、Glimmerは75.5のスコアを獲得し、54および62を獲得した競合製品を大幅に上回っています。ただし、ベンチマークの状況はすべてのカテゴリで完全な勝利というわけではありません。
| ベンチマーク | Muse Glimmer | トップ競合 | リーダー |
|---|---|---|---|
| MCP Atlas (エージェントツール) | 75.5 | 62 (Qwen 3.6) | Muse Glimmer |
| OSWorld | 競争力あり | より高い | Qwen 3.6 |
| Terminal-Bench | 競争力あり | より高い | Qwen 3.6 |
| GDPval | 競争力あり | より高い | Qwen 3.6 |
| 安全性指標 | 中程度 | より高い | Gemma |
これらは、Metaが選択したハーネスで測定されたベンダー報告の数値です。独立した検証はまだ出始めたばかりです。Glimmerはエージェントのツール使用においてリードしていますが、OSWorld、Terminal-Bench、GDPvalではQwen 3.6に遅れをとっています。常に独自のワークロードで評価してください。
Meta自身の安全性の項目では、GlimmerよりもGemmaを支持しています。Glimmerは競合製品よりも頻繁にメモリ制約に違反するため、エージェントが不可逆的なアクションを実行する前に、Metaは人間によるレビューを強く求めています。
ローカルデプロイのセットアップガイド
ランタイムエコシステムはローンチ時に急速に動き出しました。Llama.cppとTransformersは初日からMuse Glimmerをサポートしていました。Ollama、LM Studio、Unslothも同日にサポートを発表しました。ほとんどのプラットフォームで最小限の設定で開始できます。
ランタイムを選択
プラットフォームに基づいて、Ollama、LM Studio、またはllama.cppから選択します。Ollamaは、Apple Silicon Mac用に単一のコマンドで最もシンプルなセットアップを提供します。LM StudioはGUIエクスペリエンスを提供します。Llama.cppは上級ユーザーに最大限の制御を提供します。
モデルの重みをダウンロード
Hugging Faceから事前量子化されたGGUFビルドをプルします。24GBのNVIDIAカードの場合、17ギガバイトのK-Quantビルドを選択します。Apple Silicon Macの場合、Q4_K_M GGUFビルドが推奨されます。フル精度の重みもApache 2.0の下で利用可能です。
VRAMの予算を設定
VRAMの割り当てが、モデルの重み、目的のコンテキスト長のKVキャッシュ、知覚エンコーダー、およびDFlashドラフトをカバーしていることを確認します。短いコンテキストウィンドウから始めて、安定性が許す限り拡張します。
DFlashアクセラレーションを有効化
ランタイムでスペキュラティブデコーディングがアクティブであることを確認します。Ollamaでは、DFlashドラフトが自動的に検出されるはずです。LM Studioでは、アクセラレーション設定パネルを確認します。このステップは、競争力のあるトークン速度を達成するために重要です。
エージェントループをテスト
マルチステップのエージェントタスクを実行して、エンドツーエンドのパフォーマンスを検証します。VRAMの使用量、トークンのスループット、および出力品質を監視します。タスクごとに推論労力の設定を調整して、速度と精度の最適なバランスを見つけます。
Apple Silicon Macでは、デプロイは ollama run muse-glimmer の1つのコマンドで完了します。OllamaでのNVIDIAおよびAMDのサポートは、ローンチ時にもまだ進行中でした。AMDは独自の測定値を公開し、Radeon AI Proで毎秒最大53トークン、Ryzen AI Maxラップトップチップで24トークンを示しています。
デプロイ前チェックリスト:
- GPUに少なくとも24GBのVRAM(NVIDIA)または32GBの統合メモリ(Mac)があることを確認
- Hugging Faceから正しいK-Quant GGUFビルドをダウンロード
- Ollama、LM Studio、またはllama.cppの最新バージョンをインストール
- DFlashスペキュラティブデコーディングが有効になっていることを確認
- 131Kトークンにスケールアップする前に、短いコンテキストウィンドウでテスト
- 不可逆的なエージェントアクションに対して人間によるレビューを設定
制限事項と安全性への考慮
Muse Glimmerの限界を理解することは、責任あるデプロイに不可欠です。このモデルには、エージェントのワークフローを設計する際にユーザーが考慮しなければならない特定の制約があります。
| カテゴリ | 制限事項 | 影響 | 軽減策 |
|---|---|---|---|
| 入力モダリティ | テキストと画像のみ | オーディオ処理なし | 別のオーディオモデルとペアにする |
| 出力モダリティ | テキストのみ | オーディオ生成なし | 音声出力にTTSを使用 |
| 知識のカットオフ | 2026年1月 | 最近のイベントの欠落 | Webツールで補完 |
| メモリコンプライアンス | 制約への違反がより頻繁 | 長いループでOOMが発生する可能性 | VRAMを積極的に監視 |
| 安全性プロファイル | 安全性の項目でGemmaに遅れをとる | よりリスクの高い自律的アクション | 人間によるレビューが必要 |
| 量子化 | 約1%の品質偏差 | マイナーなエッジケースの違い | 重要なタスクでテスト |
Metaは、Muse Glimmerが不可逆的なアクションを実行する前に、人間によるレビューを強く求めています。モデルは脳(頭脳)にすぎません。ツール、アクセス許可、および実行の最終決定を所有するのはあなたのハーネスです。監視ゲートなしに破壊的な操作への自律的なアクセスを許可しないでください。
Muse Glimmerはテキストと画像のみを処理します。オーディオ入力やオーディオ出力の機能はありません。知覚エンコーダーは会話とインターリーブされたスクリーンショット、チャート、ドキュメントを読み取ることができ、エージェントが自身の画面を見ることを可能にしますが、オーディオワークフローには外部ツールが必要です。
よくある質問
Q: Muse Glimmerが他のローカルAIモデルと違う点は何ですか?
Muse Glimmerは、一般的な会話ではなく、エージェントの動作のために特別に学習されています。ロジット蒸留を使用してMetaのより大きなMuse Sparkモデルから蒸留され、その後、エージェント中心のデータを用いた中期学習と、強化学習を用いた学習後処理を受けました。これにより、正確なツール呼び出し、障害を乗り越えるマルチステップの計画、および一般的なチャットモデルにはない回復動作が実現します。
Q: Muse Glimmerのパフォーマンスはクラウドベースのエージェントモデルに匹敵しますか?
MCP Atlasなどのエージェントツール使用ベンチマークにおいて、Muse Glimmerは75.5のスコアを獲得し、同サイズクラスの競合製品を上回っています。ただし、OSWorld、Terminal-Bench、GDPvalでは一部のモデルに遅れをとっています。主な利点は、コンシューマー向けハードウェアで競争力のあるエージェント能力を維持しながら、トークンごとのコスト、レイテンシ、データ露出を排除できることです。
Q: Muse Glimmerをローカルで実行するにはどのようなハードウェアが必要ですか?
主なターゲットは、RTX 4090やRTX 5090などの24GB VRAM GPUです。17ギガバイトのK-Quantビルドは、KVキャッシュ、知覚エンコーダー、DFlashドラフトとともにその枠内に収まります。十分な統合メモリを備えたApple Silicon Macも、Ollama経由で機能します。AMD Radeon AI ProおよびRyzen AI Maxチップもサポートされており、それぞれ毎秒53および24トークンの測定速度が得られます。
Q: DFlashスペキュラティブデコーディングはどのように機能しますか?
DFlashは、一度に1つのトークンを生成するのではなく、トークンブロック全体を提案する小さなコンパニオンモデルです。次に、メインのMuse Glimmerモデルがこれらの提案を並行して検証します。承認されたトークンは通常のデコーディング出力と同じであり、品質低下はありません。RTX 5090では、これにより毎秒最大233トークンを達成し、標準デコーディングよりも3.1倍高速になります。
Q: Muse Glimmerは自律的なエージェント操作において安全ですか?
Metaは、不可逆的なアクションを実行する前に人間によるレビューを強く求めています。Glimmerは一部の競合製品よりも頻繁にメモリ制約に違反し、Meta自身の安全性の項目でもGemmaが支持されています。モデルは脳にすぎません。ツール、アクセス許可、および実行の最終決定を管理するのはあなたのハーネスです。破壊的な操作には常に監視ゲートを実装してください。