- Muse Glimmer RTX 5090: DFlashブロック拡散で233.4トークン/秒を達成
- 24GB VRAMに収容: 4ビット量子化により30Bモデルを20GB未満に維持
- DFlashドラフター: パスごとに16トークンを検証し、正確でロスのない出力を実現
- エージェントの能力: ローカルツール呼び出しのMCP Atlasで75.5をスコアリング
- プライバシー重視: 完全にオンデバイスで実行され、個人のコンテキストを安全に保護
Muse Glimmer RTX 5090: アーキテクチャと適合性
MetaのMuse Glimmerは、常時稼働のローカルエージェント向けに特別に設計された、296億パラメータの密結合言語モデルです。2026年8月10日にApache 2.0ライセンスでリリースされ、18億パラメータのビジョンエンコーダを搭載し、131,000トークンのコンテキストウィンドウをサポートしています。中核となる設計思想は、ユーザーデータをクラウドAPIに送信することなく、深い個人のコンテキストを可能にすることです。
30Bモデルをフル精度で実行するには55GB以上のVRAMが必要であり、コンシューマー向けハードウェアの限界を超えています。Metaはこれをモデルを約4ビットに量子化することで解決し、メモリフットプリントを20GB未満に抑えました。これにより、RTX 5090の24GB VRAMの範囲内に、KVキャッシュ、ビジョンエンコーダ、およびDFlashドラフターのための重要な余裕が残ります。
動画のハイライト:
- 18億のビジョンエンコーダを備えた296億の密結合パラメータ
- ユーザー制限のないApache 2.0ライセンス
- 131Kトークンのコンテキストウィンドウ
- 20GB未満の4ビット量子化
- DFlashがRTX 5090で233.4トークン/秒を達成
RTX 5090でMuse Glimmerを正常に実行するには、4ビット量子化ビルドを使用してください。これにより、KVキャッシュとビジョンエンコーダを常駐させて瞬時にアクセスできるようにしながら、24GBのVRAM制限内に収めることができます。
パフォーマンスとDFlashの最適化
RTX 5090ユーザーにとって際立つ特徴は、5層のブロック拡散ネットワークであるDFlashドラフターです。標準的な自己回帰モデルは、フォワードパスごとに1つのトークンを出力するため、長い推論チェーンが遅く感じられます。DFlashは1回のパスで16トークンのブロック全体を提案します。
次に、メインモデルがすべての16トークンを並行して検証します。一致したトークンを保持し、最初に失敗したものを修正します。検証は正確であるため、出力は標準的なトークンごとのデコーディングと同じになります。モデルの回答を変えることなく、速度を向上させることができます。
| ハードウェア | 標準 (トークン/秒) | DFlash使用時 (トークン/秒) | 高速化 |
|---|---|---|---|
| RTX 5090 | 74.9 | 233.4 | 3.1x |
| M5 Max | - | ベースラインから1.8x | 1.8x |
| M4 Max | - | ベースラインから1.5x | 1.5x |
233.4トークン/秒という数値は、ベンダーによって測定されたバッチサイズ1の貪欲デコーディングに基づいています。ツール呼び出しやAPIインタラクションを含む実際のエージェントループは、生のテキスト生成ベンチマークよりも自然と遅く実行されます。
4ビットへの量子化は、15のベンチマーク全体でわずか1%の平均劣化をもたらします。これは、強力な30Bエージェントモデルを単一のコンシューマーGPUに収めるための、取るに足らないトレードオフです。
ステップバイステップのローカルセットアップ
Muse Glimmerをダウンロードして設定するには、適切な重みと推論エンジンを選択する必要があります。重みは、meta-llama組織の下でHugging Faceでホストされています。RTX 5090のような24GBのカードの場合、特定の4ビット量子化ビルドが必要です。
重みをダウンロードする
Hugging Faceにアクセスし、4ビット量子化ビルド(約17GB)をダウンロードします。ファインチューニングのためにフル精度のBF16が必要な場合は、55GB以上のVRAMを必要とするエンタープライズハードウェアが必要になることに注意してください。
推論エンジンを選択する
サーバーベースの提供にはvLLMまたはSGLangを使用してください。どちらもモデルのパスを直接受け取ります。デスクトップでの使用については、ローンチ時にはまだ対応が追いついていたため、llama.cpp、MLX、またはExecuTorchの統合が完全に完了しているかどうかを確認してください。
生成設定を構成する
Metaは最適なパフォーマンスのための特定の設定を推奨しています。ベンチマークの条件に合わせるため、temperatureを1.0、top Pを0.95、top Kを64に設定してください。
推論強度を設定する
システムプロンプトで推論強度を設定します。オプションには、low、medium、high、またはextra highが含まれます。エージェントおよびコーディングタスクの場合、ベンチマークで読んだモデルを得るために、常にhighまたはextra highを使用してください。
OllamaとLM Studioのサポートは、最初のローンチ時に「近日対応」とされていました。これらの洗練されたローカルアプリに依存している場合は、デプロイメントのセッションを計画する前に、最新のアップデートを確認してください。
エージェントベンチマークと比較
Muse Glimmerは、ツール呼び出しやエージェントワークフローに優れるように明示的に設計されています。Gemma 431BやQwen 3.6 27Bなどの競合と比較すると、エージェントとしての勝利は大幅です。ただし、開発者は太字のハイライトだけでなく、ベンチマークの表を注意深く読むべきです。
| ベンチマーク | Muse Glimmer | Qwen 3.6 27B | Gemma 431B |
|---|---|---|---|
| MCP Atlas (ツール呼び出し) | 75.5 | 62.5 | 54.2 |
| Terminal Bench | 51.7 | 60.7 | - |
| OSWorld (検証済み) | 65.9 | 75.6 | - |
| S2E Bench (検証済み) | 76.0 | 77.2 | - |
Muse Glimmerはツール呼び出しを支配していますが、Terminal BenchとOSWorldではQwen 3.6に負けています。主な使用目的が深い作業を行う実際のコーディングエージェントである場合、Code Llama 3.6またはQwenの方が依然として強力なケースを持っているかもしれません。
エージェントツール呼び出し
- MCP Atlas: 75.5
- 深い検索QAの勝利
- 指示追従
- 最高のローカルエージェントベース
コーディング & ターミナル
- Terminal Bench: 51.7
- OSWorld: 65.9
- Qwen 3.6に後れを取る
- Code Llama 3.6を検討
プライバシー & セキュリティ
- CI Memory Leaks: 26.4%
- Gemmaの12.1%より高い
- サンドボックス化が必要
- 受信トレイへのアクセスを監視
セキュリティとプライバシーの考慮事項
常時稼働のエージェントをローカルで実行することは、プライバシーの面で大きなメリットをもたらしますが、同時に特有のリスクももたらします。モデルが画面を読み取り、ファイルを整理する際、個人のコンテキストに深くアクセスします。これらのモデルが機密データをどのように扱うかを理解することが重要です。
CI Memories(ユーザーの代わりに行動する際に、モデルが漏らしてはいけない情報を漏らすかどうかをテストするベンチマーク)において、Muse Glimmerの違反率は26.4%です。Gemma 4は12.1%です。このモデルを実際の受信トレイに向ける場合、このギャップには真剣な注意が必要です。
リークのリスクにもかかわらず、Muse Glimmerのローカル性質は依然としてその最大のセールスポイントです。個人の画面録画やファイルの内容をクラウドAPIに送信することは、多くのエンタープライズユーザーやプライバシーを重視するユーザーにとっては論外です。
デプロイメントセキュリティチェックリスト:
- ファイルシステムへのアクセスを制限するためにローカル環境をサンドボックス化する
- API呼び出しとツール使用のログを毎日監視する
- 受信トレイとコミュニケーションアプリの権限を制限する
- セキュリティパッチのために推論エンジンを定期的に更新する
FAQ
Q: Muse Glimmerは完全に単一のRTX 5090で実行できますか?
はい。4ビット量子化ビルドを使用することで、モデルのフットプリントは20GB未満に低下します。これにより、KVキャッシュ、ビジョンエンコーダ、およびDFlashドラフターが同時に実行するための十分な余裕がRTX 5090の24GB VRAM内に残ります。
Q: 4ビット量子化はモデルの知能を低下させますか?
劣化はわずかです。Metaは、フル精度と比較して4ビットビルドを使用した場合、15のベンチマーク全体で平均わずか1%の劣化しかないと報告しており、ローカルデプロイメントのための非常に価値のあるトレードオフとなっています。
Q: Muse Glimmerはコーディングに最適なローカルモデルですか?
エージェントのツール呼び出しに優れていますが、Terminal BenchとOSWorldではQwen 3.6 27Bに遅れをとっています。主な目的が専用のコーディングエージェントである場合、Meta自身のベンチマーク表に基づくと、Code Llama 3.6またはQwen 3.6の方が依然として良い選択かもしれません。
Q: DFlashとは何ですか?また、生成をどのように高速化しますか?
DFlashは、フォワードパスごとに16トークンを提案する5層のブロック拡散ネットワークです。メインモデルがそれらを並行して検証し、正しいものを保持し、最初のエラーを修正します。これにより、数学的に正確な出力でRTX 5090上で3.1倍の高速化を実現します。