- Muse Glimmer ベンチマーク: マルチモーダル推論、視覚的鋭敏さ、エージェントタスクに優れています
- ハードウェア要件: フル精度には64GB〜96GBのVRAMが必要、量子化GGUFは24GB GPUに対応
- 推論速度: RTX 5090で最大74.9トークン/秒、RTX 3090で60〜65トークン/秒
- コンテキストウィンドウ: 128Kのコンテキスト長をサポートし、大規模なドキュメント処理が可能
- ライセンス: Apache 2.0で公開され、オープンソースのローカルAI開発を促進
Muse Glimmer ベンチマークの概要
Muse Glimmer 30Bモデルは、296億のパラメータを持つ密なアーキテクチャを提供し、オープンソースAIにおける重要な進歩を表しています。信頼性の高いツール呼び出し、複数ステップの推論、障害回復のために設計されており、エージェントワークフローを構築する開発者に最適です。このモデルはテキストと画像の両方の入力を処理し、最大100言語をサポートし、知識のカットオフ日は2026年1月4日です。
動画のハイライト:
- VLLM Dockerを使用したクアッドRTX 3090セットアップでフル精度モデルをテスト
- 24GB GPU構成で利用可能なGGUF量子化バージョン
- 視覚的推論テストでは、画像分析において並外れた精度を示す
- コーディングベンチマークでSWE-bench Proにおいて51.2をスコア
Muse Glimmerベンチマークを現在の競合他社と比較して評価すると、Gemma 4 31B(思考モード)とQwen 3.6 27Bの間で強力な位置を占めています。Qwen 3.6 27Bは検証済みのコーディングタスクとターミナルベンチのパフォーマンスで優位性を保っていますが、Muse Glimmerは一般的なエージェント機能と印象的なマルチモーダル処理において優れています。
Muse Glimmerは、AIM 2026推論ベンチマークで94.7を獲得し、94.1のQwen 3.6 27Bをわずかに上回っています。エージェントタスク処理とマルチモーダル推論を優先する開発者にとって、このモデルは魅力的なオープンソースの代替手段を提供します。
ハードウェア要件とVRAMの階層
Muse Glimmerを効率的に実行するには、慎重なハードウェア計画が必要です。このモデルはいくつかのバリアントで提供されており、それぞれが異なるVRAM割り当てを要求します。フル精度は最大の精度を提供しますが、かなりのGPUリソースを必要とします。一方、量子化されたGGUFフォーマットは、精度の低下を最小限に抑えながら、コンシューマー向けハードウェアで利用可能にします。
| バリアント | 必要なVRAM | 精度の低下 | 最適な用途 |
|---|---|---|---|
| フル精度 | 64GB-96GB | なし | 本番環境、最高品質 |
| K-Quant | 32GB | 最小限 | ワークステーションデプロイ |
| KQ-Quant (GGUF) | 17GB-24GB | 約1%と報告 | コンシューマーGPU(RTX 3090/4090) |
完全な128Kコンテキストウィンドウを使用してフル精度で実行する場合、実際にはベースラインの64GBではなく、96GBに近いVRAMが必要になります。推論中のメモリ不足エラーを避けるため、コンテキスト処理用のヘッドルームを常に確保してください。
Muse Glimmerの密なアーキテクチャは、ディスクリートGPUを搭載した高帯域幅システムで最も高いパフォーマンスを発揮します。テンソル並列処理を4に設定するとマルチGPU構成で効果的に機能し、最適なスループットを得るためにGPUメモリ使用率は0.9が推奨されます。
推論速度とトークンパフォーマンス
スループットベンチマークは、異なるハードウェア階層間で強力なパフォーマンスを示しています。このモデルは競争力のある1秒あたりのトークン生成レートを提供し、リアルタイムアプリケーションやインタラクティブなワークフローに適しています。
| GPU構成 | 1秒あたりのトークン | 精度 | 備考 |
|---|---|---|---|
| RTX 5090 | 74.9 | フル | 報告された最適速度 |
| 4x RTX 3090 | 60-65 | フル | テンソル並列 = 4 |
| 4x RTX 3090 | 40 | フル | 高負荷コンテキスト時 |
| 単一の24GB GPU | 26-40 | GGUF | 量子化バリアント |
Metaは、Dlashアクセラレーションにより3倍の速度向上を報告しています。ただし、最新のテスト時点では、Dlashは公式のDockerコンテナ内では機能しません。この機能を有効にするコンテナの更新については、Metaのリポジトリを監視してください。
プロンプト処理速度は常に高速であり、プロンプト取り込み中の観測レートは46.4トークン/秒で、生成速度は高性能なハードウェア構成でピーク時に71〜74トークン/秒に達します。
マルチモーダルおよびコーディングベンチマーク
Muse Glimmerのマルチモーダル機能は、最も強力な差別化要因の1つです。視覚的推論テストは、人間に近いレベルの画像分析を実証し、オブジェクトの正確な識別、アイテムのカウント、細かいテキストの読み取り、写真からの環境コンテキストの推論を行います。
視覚的推論
- 優れたオブジェクト検出
- 正確な色とテクスチャの識別
- タイムスタンプとラベルの読み取り
- 地理的コンテキストの推論
コーディングパフォーマンス
- SWE-bench Pro: 51.2
- Terminal bench: 51.7
- 堅実なエージェントツール呼び出し
- 複数ステップの推論が可能
マルチモーダルの制限
- テキストと画像のみ
- 動画処理なし
- ChartVixで強力
- MMU Proで競争力あり
実際のテストでは、Muse Glimmerはマイナーなハードウェアコンポーネントを正しく識別し、パッチパネルからRJ45ポート番号を読み取り、ぼやけた背景から樹木の種類を特定し、視覚的な手がかりだけでテキサス・ヒル・カントリーの地理を推論しました。このレベルの視覚的理解は、最新のGemma 4モデルに匹敵します。
| ベンチマークカテゴリ | Muse Glimmer 30B | Qwen 3.6 27B | 備考 |
|---|---|---|---|
| AIM 2026 推論 | 94.7 | 94.1 | Muse Glimmerがリード |
| SWE-bench Pro (コーディング) | 51.2 | より高い | 検証済みでQwenが強い |
| Terminal Bench | 51.7 | 60.7 | Qwenがリード |
| 一般的なエージェントタスク | 強力 | 適度 | Muse Glimmerの優位性 |
| ChartVix / MMU Pro | 競争力あり | わずかに先行 | 接戦のマルチモーダル競争 |
ローカルデプロイメントセットアップガイド
Muse Glimmerをローカルにデプロイするには、公式のDockerコンテナを使用してVLLMを構成する必要があります。セットアッププロセスには、CUDAデバイスマッピング、メモリ割り当て、パーサー構成が含まれます。
公式Dockerコンテナをプルする
Muse Glimmer用のMeta公式VLLM Dockerイメージをダウンロードします。Docker環境がGPUパススルーをサポートしており、すべてのターゲットGPUがコンテナの名前空間内で認識されていることを確認してください。
CUDAデバイスマッピングを構成する
デバイスがコンテナ内で正しい順序で表示されるように、CUDAの再マッピングを適用します。このステップは、ホストとコンテナ環境間でデバイスの順序が異なる可能性があるマルチGPUセットアップで非常に重要です。
メモリとコンテキストパラメータを設定する
GPUメモリ使用率を0.9に設定し、最大モデル長を65536トークンに設定します。これにより、効率的なVRAM使用量を維持しながら、長時間の会話中のメモリ不足エラーを防ぐことができます。
テンソル並列処理を有効にする
クアッドGPU構成の場合、テンソル並列処理を4に設定します。適切な出力フォーマットとツール呼び出しの互換性を確保するために、プールの選択と推論パーサーを「muse Glimmer」に割り当てます。
Open WebUIに接続する
実行中のVLLMインスタンスをOpen WebUIまたはお好みのフロントエンドにリンクします。トークン生成速度を確認し、画像をアップロードしてマルチモーダル入力をテストします。
llama.cppユーザーの場合、付属のmmrojファイルをGGUFバリアントと一緒に使用してください。構成でランタイムブロックを正しく指定します。KQ-Quantバリアントは24GB GPUに適合し、精度低下は約1%であるため、単一GPUのデプロイメントに最適です。
制限事項と既知の問題
モデルにトレードオフがないことはありません。Muse Glimmerには、本番環境にデプロイする前に開発者が理解しておくべき特定の制限があります。
Metaモデルとして、Muse Glimmerは厳格な安全ガードレールを実装しています。危害、強要、武器を伴うシナリオでは頻繁に拒否されることが予想されます。テストでは、「Armageddon with a Twist」というプロンプトは詳細な理由なしに拒否され、DeepSeek V4 Flashなどの競合他社よりも情報量が少なくなりました。
| 制限事項 | 影響 | 回避策 |
|---|---|---|
| SVG生成 | 品質が悪く、出力が歪む | 専用の画像生成モデルを使用する |
| 安全性の拒否 | 頻繁で、時には曖昧 | 許容範囲内でプロンプトを作成する |
| DockerでのDlash | 3倍の高速化が利用不可 | Metaからのコンテナ更新を待つ |
| 動画処理 | サポート対象外 | テキスト/画像のみのパイプラインを使用する |
| ハードウェアIDエラー | ニッチなコンポーネントの誤認 | プロンプトでテキストのコンテキストを提供する |
8K未満のトークンを使用してフェンスの上に猫のSVGを作成するタスクを与えられた際、Muse Glimmerは不適切にレンダリングされたフェンスの上にひどく歪んだ一つ目の生き物を生成しました。ベクターグラフィックスの生成には、汎用LLMではなく、専門のモデルを使用してください。
デプロイ前チェックリスト:
- フル精度には64GB以上、GGUFには24GBのVRAMがあることを確認する
- DockerのGPUパススルーが機能していることを確認する
- GPUの数に合わせてテンソル並列処理を設定する
- サンプル画像でマルチモーダル入力をテストする
- ユースケースの安全性ポリシーを確認する
- 予想される負荷下でトークン速度をベンチマークする
FAQ
Q: Qwen 3.6 27Bと比較したMuse Glimmerのベンチマークパフォーマンスはどうですか?
Muse GlimmerはAIM 2026推論で94.7を獲得し、Qwenの94.1を上回り、一般的な推論で優位に立っています。ただし、Qwen 3.6 27Bは検証済みのコーディングタスクとターミナルベンチ(60.7対51.7)で優れたパフォーマンスを発揮します。Muse Glimmerはエージェントタスク処理とマルチモーダル視覚推論に優れています。
Q: 単一の24GB GPUでMuse Glimmerを実行できますか?
はい、KQ-Quant GGUFバリアントは約17〜24GBのVRAMを必要とし、報告されている精度低下はわずか約1%です。単一GPUのデプロイには、llama.cppと付属のmmrojファイルを使用してください。フル精度には、複数のGPUにまたがって64〜96GBのVRAMが必要です。
Q: Muse Glimmerは動画入力をサポートしていますか?
いいえ、Muse Glimmerはテキストと画像の入力のみを処理します。動画処理はサポートしていません。コンテキストウィンドウは最大128Kトークンをサポートし、広範なテキストと複数の画像分析に対応します。
Q: Muse Glimmerからどのような推論速度が期待できますか?
RTX 5090では、約74.9トークン/秒が期待できます。クアッドRTX 3090のセットアップでは、フル精度で60〜65トークン/秒を提供し、高負荷コンテキストでは約40トークン/秒に低下します。単一の24GB GPU上のGGUF量子化バリアントは、26〜40トークン/秒で実行されます。
Q: Muse Glimmerはコーディングタスクに適していますか?
SWE-bench Proで51.2のスコアを獲得し、エージェントツール呼び出しを確実に処理するため、合理的なパフォーマンスを発揮します。ただし、検証済みのコーディング精度に関しては、現在Qwen 3.6 27Bがより強力なパフォーマンスを提供しています。Muse Glimmerは、一般的なエージェントワークフローとマルチモーダル推論に適しています。