Muse Glimmer パフォーマンス:ローカル AI エージェント セットアップガイド - ベンチマーク

Muse Glimmer パフォーマンス:ローカル AI エージェント セットアップガイド

コンシューマー向けハードウェアでMuse Glimmerのパフォーマンスを最大化する方法。量子化、DFlashアクセラレーション、ローカルエージェントのベンチマークスコアについて学びましょう。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmerのパフォーマンスは、30Bモデルを24GB VRAMに収めるK-Quantビルドに依存します
  • DFlashコンパニオンモデルは、トークン生成を最大で毎秒233トークンまで加速します
  • 131,072トークンのコンテキストにより、外部API呼び出しなしで大規模なエージェントループが可能です
  • Apache 2.0ライセンスにより、コンシューマー向けGPUやMacでの無料のローカルデプロイが可能です
  • MCP Atlasスコア75.5は、エージェントのツール使用において同サイズクラスをリードしています

Muse Glimmer パフォーマンスの概要

Muse Glimmerは、Meta Superintelligence Labsによって開発された300億パラメータのエージェントモデルです。コンシューマー向けハードウェアでローカルに実行される常時稼働のエージェント作業専用に設計されています。このモデルは、関数呼び出し、ローカルコーディング、および他のモデルの出力の評価に最適化された密結合トランスフォーマーとして提供されています。

動画のハイライト:

  • K-Quantビルドを使用して30Bパラメータを20GB未満に圧縮
  • DFlashスペキュラティブデコーディングがRTX 5090で毎秒最大233トークンを達成
  • Metaのより大きなクローズドウェイトの教師モデルであるMuse Sparkから蒸留
  • Hugging Faceで事前量子化されたGGUFビルドが利用可能なApache 2.0ライセンス
  • 2026年1月時点の知識のカットオフ

Muse Glimmerの核心的な価値提案は、クラウドへの依存をなくすことです。従来のエージェントスタックはすべてのステップをAPIを通じてルーティングするため、レイテンシ、トークンコスト、およびデータ露出が発生します。Glimmerはこれを逆転させ、ファイルの横に存在し、オフラインで動作し、個人のコンテキストを完全にマシン上に保持します。

コアアーキテクチャ

Muse Glimmerはゼロから学習されたものではありません。ロジット蒸留を使用してMuse Sparkから蒸留され、その後、より長いコンテキスト、エージェント中心のデータ、より豊かな推論トレースを用いた中期学習が行われました。学習後には、推論、コーディング、エージェントタスク全体にわたる教師ありファインチューニング、オンポリシー蒸留、強化学習が含まれました。

ハードウェア要件と量子化

300億パラメータのモデルを単一のコンシューマー向けGPUに収めるには、積極的な最適化が必要です。フル精度では、モデルは55ギガバイト以上のメモリを要求します。現在、その容量を搭載したコンシューマー向けグラフィックカードは存在しません。Metaは、約4ビット精度のK-Quantビルドを提供することでこれに対処しています。

ビルドタイプ精度モデルサイズターゲットハードウェア備考
フル精度16-bit~55GB+データセンターGPUコンシューマーには適さない
K-Quant (17GB)~4-bit17GB未満24GBコンシューマー向けGPURTX 4090/5090に適合
K-Quant (コンパクト)~4-bit12GB未満16GB GPUより厳しいKVキャッシュ制限
GGUF (Mac)Q4_K_M~18-20GBApple Silicon (統合)Ollama経由で実行

17ギガバイトのビルドは24ギガバイトのカードをターゲットにしています。そのメモリ枠には、KVキャッシュ、知覚エンコーダー、およびDFlashドラフトモデルも保持する必要があります。安定した動作のためには、VRAMの予算計画が重要です。

VRAMの予算割り当て

24GBのVRAM枠は、言語モデルの重み、131Kコンテキストウィンドウ用のKVキャッシュ、画像処理用の知覚エンコーダー、およびDFlashドラフトを収容できなければなりません。長いエージェントループ中に追加のバックグラウンドアプリケーションを実行すると、メモリ不足エラーが発生する場合があります。

量子化のトレードオフ

Metaは、量子化されたビルドにおいてエッジケースでわずかな品質の違いが生じる可能性があると警告しています。24ギガバイトのビルドは、フル精度と比較して平均して約1%の品質偏差となります。ほとんどのエージェントワークフローでは、このトレードオフは無視できますが、常に特定のタスクでテストしてください。

DFlashアクセラレーションと速度ベンチマーク

速度は、ローカルエージェントのパフォーマンスにおける2番目の大きな壁です。言語モデルは通常一度に1つのトークンを出力するため、長いエージェントループは非常に直列的になりがちです。Muse Glimmerには、トークンブロック全体を提案するDFlashと呼ばれる小さなコンパニオンモデルが同梱されています。その後、メインモデルがそれらを並行して検証します。

ハードウェアトークン/秒高速化ソース
RTX 5090 (NVIDIA)最大2333.1倍高速Meta公表
Radeon AI Pro (AMD)最大53ベースラインAMD公表
Ryzen AI Max (ラップトップ)最大24ベースラインAMD公表
Apple Silicon (Mac)variousチップに依存コミュニティテスト

DFlashを通じて承認されたトークンは、通常のデコーディング出力と同じです。メインモデルが提案を検証するため、スペキュラティブデコーディングによる品質低下はありません。

DFlashのメカニズム

  • ブロックレベルのトークン提案
  • メインモデルによる並列検証
  • 承認されたトークンの品質低下なし
  • 制御可能な推論労力

制御可能な推論

  • 品質と速度のバランス
  • タスクごとに動的に調整
  • 単純なクエリにはより高速な応答
  • 複雑なチェーンにはより深い推論

知覚エンコーダー

  • 画像とスクリーンショットの読み取り
  • チャートやドキュメントの処理
  • 会話とのインターリーブ
  • エージェントが自身の画面を見ることが可能
速度の最適化

最大のスループットを得るには、ランタイム設定でDFlashが有効になっていることを確認してください。OllamaとLM Studioでは、ドラフトモデルが検出されるとスペキュラティブデコーディングが自動的にアクティブになります。ユーザーからは、NVIDIA RTX 5090ハードウェアで最も安定した速度が報告されています。

ベンチマークスコアと比較

Metaは、エージェントのツール使用において、Muse Glimmerを同サイズクラスのリーダーとして位置づけています。MCP Atlasでは、Glimmerは75.5のスコアを獲得し、54および62を獲得した競合製品を大幅に上回っています。ただし、ベンチマークの状況はすべてのカテゴリで完全な勝利というわけではありません。

ベンチマークMuse Glimmerトップ競合リーダー
MCP Atlas (エージェントツール)75.562 (Qwen 3.6)Muse Glimmer
OSWorld競争力ありより高いQwen 3.6
Terminal-Bench競争力ありより高いQwen 3.6
GDPval競争力ありより高いQwen 3.6
安全性指標中程度より高いGemma
ベンチマークの背景

これらは、Metaが選択したハーネスで測定されたベンダー報告の数値です。独立した検証はまだ出始めたばかりです。Glimmerはエージェントのツール使用においてリードしていますが、OSWorld、Terminal-Bench、GDPvalではQwen 3.6に遅れをとっています。常に独自のワークロードで評価してください。

Meta自身の安全性の項目では、GlimmerよりもGemmaを支持しています。Glimmerは競合製品よりも頻繁にメモリ制約に違反するため、エージェントが不可逆的なアクションを実行する前に、Metaは人間によるレビューを強く求めています。

ローカルデプロイのセットアップガイド

ランタイムエコシステムはローンチ時に急速に動き出しました。Llama.cppとTransformersは初日からMuse Glimmerをサポートしていました。Ollama、LM Studio、Unslothも同日にサポートを発表しました。ほとんどのプラットフォームで最小限の設定で開始できます。

1

ランタイムを選択

プラットフォームに基づいて、Ollama、LM Studio、またはllama.cppから選択します。Ollamaは、Apple Silicon Mac用に単一のコマンドで最もシンプルなセットアップを提供します。LM StudioはGUIエクスペリエンスを提供します。Llama.cppは上級ユーザーに最大限の制御を提供します。

2

モデルの重みをダウンロード

Hugging Faceから事前量子化されたGGUFビルドをプルします。24GBのNVIDIAカードの場合、17ギガバイトのK-Quantビルドを選択します。Apple Silicon Macの場合、Q4_K_M GGUFビルドが推奨されます。フル精度の重みもApache 2.0の下で利用可能です。

3

VRAMの予算を設定

VRAMの割り当てが、モデルの重み、目的のコンテキスト長のKVキャッシュ、知覚エンコーダー、およびDFlashドラフトをカバーしていることを確認します。短いコンテキストウィンドウから始めて、安定性が許す限り拡張します。

4

DFlashアクセラレーションを有効化

ランタイムでスペキュラティブデコーディングがアクティブであることを確認します。Ollamaでは、DFlashドラフトが自動的に検出されるはずです。LM Studioでは、アクセラレーション設定パネルを確認します。このステップは、競争力のあるトークン速度を達成するために重要です。

5

エージェントループをテスト

マルチステップのエージェントタスクを実行して、エンドツーエンドのパフォーマンスを検証します。VRAMの使用量、トークンのスループット、および出力品質を監視します。タスクごとに推論労力の設定を調整して、速度と精度の最適なバランスを見つけます。

プラットフォーム固有の注意事項

Apple Silicon Macでは、デプロイは ollama run muse-glimmer の1つのコマンドで完了します。OllamaでのNVIDIAおよびAMDのサポートは、ローンチ時にもまだ進行中でした。AMDは独自の測定値を公開し、Radeon AI Proで毎秒最大53トークン、Ryzen AI Maxラップトップチップで24トークンを示しています。

デプロイ前チェックリスト:

  • GPUに少なくとも24GBのVRAM(NVIDIA)または32GBの統合メモリ(Mac)があることを確認
  • Hugging Faceから正しいK-Quant GGUFビルドをダウンロード
  • Ollama、LM Studio、またはllama.cppの最新バージョンをインストール
  • DFlashスペキュラティブデコーディングが有効になっていることを確認
  • 131Kトークンにスケールアップする前に、短いコンテキストウィンドウでテスト
  • 不可逆的なエージェントアクションに対して人間によるレビューを設定

制限事項と安全性への考慮

Muse Glimmerの限界を理解することは、責任あるデプロイに不可欠です。このモデルには、エージェントのワークフローを設計する際にユーザーが考慮しなければならない特定の制約があります。

カテゴリ制限事項影響軽減策
入力モダリティテキストと画像のみオーディオ処理なし別のオーディオモデルとペアにする
出力モダリティテキストのみオーディオ生成なし音声出力にTTSを使用
知識のカットオフ2026年1月最近のイベントの欠落Webツールで補完
メモリコンプライアンス制約への違反がより頻繁長いループでOOMが発生する可能性VRAMを積極的に監視
安全性プロファイル安全性の項目でGemmaに遅れをとるよりリスクの高い自律的アクション人間によるレビューが必要
量子化約1%の品質偏差マイナーなエッジケースの違い重要なタスクでテスト
重要な安全性の勧告

Metaは、Muse Glimmerが不可逆的なアクションを実行する前に、人間によるレビューを強く求めています。モデルは脳(頭脳)にすぎません。ツール、アクセス許可、および実行の最終決定を所有するのはあなたのハーネスです。監視ゲートなしに破壊的な操作への自律的なアクセスを許可しないでください。

モデルの境界

Muse Glimmerはテキストと画像のみを処理します。オーディオ入力やオーディオ出力の機能はありません。知覚エンコーダーは会話とインターリーブされたスクリーンショット、チャート、ドキュメントを読み取ることができ、エージェントが自身の画面を見ることを可能にしますが、オーディオワークフローには外部ツールが必要です。

よくある質問

Q: Muse Glimmerが他のローカルAIモデルと違う点は何ですか?

Muse Glimmerは、一般的な会話ではなく、エージェントの動作のために特別に学習されています。ロジット蒸留を使用してMetaのより大きなMuse Sparkモデルから蒸留され、その後、エージェント中心のデータを用いた中期学習と、強化学習を用いた学習後処理を受けました。これにより、正確なツール呼び出し、障害を乗り越えるマルチステップの計画、および一般的なチャットモデルにはない回復動作が実現します。

Q: Muse Glimmerのパフォーマンスはクラウドベースのエージェントモデルに匹敵しますか?

MCP Atlasなどのエージェントツール使用ベンチマークにおいて、Muse Glimmerは75.5のスコアを獲得し、同サイズクラスの競合製品を上回っています。ただし、OSWorld、Terminal-Bench、GDPvalでは一部のモデルに遅れをとっています。主な利点は、コンシューマー向けハードウェアで競争力のあるエージェント能力を維持しながら、トークンごとのコスト、レイテンシ、データ露出を排除できることです。

Q: Muse Glimmerをローカルで実行するにはどのようなハードウェアが必要ですか?

主なターゲットは、RTX 4090やRTX 5090などの24GB VRAM GPUです。17ギガバイトのK-Quantビルドは、KVキャッシュ、知覚エンコーダー、DFlashドラフトとともにその枠内に収まります。十分な統合メモリを備えたApple Silicon Macも、Ollama経由で機能します。AMD Radeon AI ProおよびRyzen AI Maxチップもサポートされており、それぞれ毎秒53および24トークンの測定速度が得られます。

Q: DFlashスペキュラティブデコーディングはどのように機能しますか?

DFlashは、一度に1つのトークンを生成するのではなく、トークンブロック全体を提案する小さなコンパニオンモデルです。次に、メインのMuse Glimmerモデルがこれらの提案を並行して検証します。承認されたトークンは通常のデコーディング出力と同じであり、品質低下はありません。RTX 5090では、これにより毎秒最大233トークンを達成し、標準デコーディングよりも3.1倍高速になります。

Q: Muse Glimmerは自律的なエージェント操作において安全ですか?

Metaは、不可逆的なアクションを実行する前に人間によるレビューを強く求めています。Glimmerは一部の競合製品よりも頻繁にメモリ制約に違反し、Meta自身の安全性の項目でもGemmaが支持されています。モデルは脳にすぎません。ツール、アクセス許可、および実行の最終決定を管理するのはあなたのハーネスです。破壊的な操作には常に監視ゲートを実装してください。