- Muse Glimmer は、Apache 2.0 ライセンスで公開された Meta の 30B パラメータの密結合型マルチモーダル LLM です。
- マルチモーダルの強み:画像理解、視覚的推論、オブジェクトの識別に優れています。
- ハードウェア要件:フル精度では 64〜96 GB の VRAM が必要ですが、量子化された GGUF は 24 GB に収まります。
- パフォーマンス:RTX 3090 と 128K コンテキスト長で 60〜65 トークン/秒を記録。
- コーディングベンチマーク:SWE-bench Pro で 51.2 を記録し、Qwen 3.6 27B と競合します。
Muse Glimmer 30B:アーキテクチャと仕様
Muse Glimmer 30B モデルは、Meta のオープンソース AI への回帰を象徴しており、エージェントワークフローとマルチモーダル処理用に設計された密結合アーキテクチャを提供します。Apache 2.0 ライセンスで公開されたこのモデルは、296億6000万のパラメータ、128K のコンテキストウィンドウ、および 2026年1月4日の知識のカットオフを備えています。
動画のハイライト:
- vLLM Docker を介してクアッド RTX 3090 構成でテストされたフル精度モデル
- 24 GB GPU 構成で利用可能な GGUF 量子化バリアント
- 複数の現実世界の画像シナリオでテストされた視覚的推論
- ベンチマークでは Gemma 4 31B と Qwen 3.6 27B の中間に位置付けられます
このアーキテクチャはテキストと画像の入力をサポートしていますが、動画の処理は行いません。最大100の言語を処理でき、エージェントアプリケーションに不可欠な信頼性の高いツール呼び出し、複数ステップの推論、および障害回復機能を備えています。
| 仕様 | 値 |
|---|---|
| パラメータ数 | 296億6000万 (密結合) |
| コンテキスト長 | 128K トークン |
| ライセンス | Apache 2.0 |
| 知識のカットオフ | 2026年1月4日 |
| 言語 | 最大100 |
| 入力モダリティ | テキストと画像 |
| 動画処理 | サポート対象外 |
Mixture of Experts (MoE) ではなく密結合モデルであるため、Muse Glimmer はディスクリート GPU を搭載した高帯域幅システムでより優れたパフォーマンスを発揮します。すべての推論中に完全なパラメータセットがアクティブになるため、VRAM 使用量の増加と引き換えに、より高品質な推論が可能になります。
ハードウェア要件と VRAM の階層
Muse Glimmer をローカルで実行するには、慎重なハードウェア計画が必要です。このモデルはいくつかの精度階層で提供されており、それぞれが異なる VRAM 割り当てを要求します。フル精度は最大の精度を提供しますがエンタープライズグレードのハードウェアが必要になる一方で、量子化された GGUF フォーマットによりコンシューマー向け GPU でも利用可能になります。
| 精度階層 | 必要な VRAM | 最適な用途 |
|---|---|---|
| フル精度 (FP16) | 64-96 GB | 最大の精度、完全なコンテキスト |
| K-Quant GGUF | ~32 GB | ハイエンドのデュアル GPU 構成 |
| KQU-Quant GGUF | ~17-24 GB | シングル 24 GB GPU (RTX 3090/4090/5090) |
レビューアーは、完全なコンテキストウィンドウを使用したフル精度での動作には、記載されている最小要件の 64 GB ではなく、実際には 96 GB に近い VRAM が必要になることに言及しました。クアッド RTX 3090 構成では、テンソル並列処理を 4 に設定した場合、1枚あたり約 23.4 GB でモデルが配置されました。
フル精度で完全な 128K コンテキストウィンドウを使用する予定の場合は、ベースラインの 64 GB ではなく、96 GB の VRAM を想定してください。VRAM が不十分だと、長時間の会話や大きなドキュメントの処理中にメモリ不足 (OOM) エラーが発生します。
精度階層を選択する
利用可能な VRAM を評価してください。シングル 24 GB GPU の場合は、精度の低下が約 1% の KQU-Quant GGUF バリアントを使用します。合計 64 GB 以上の VRAM を持つマルチ GPU 構成の場合は、vLLM を介してフル精度で実行します。
vLLM Docker コンテナをセットアップする
Meta が提供する公式 Docker イメージを使用します。会話の途中でのクラッシュを防ぐため、GPU メモリ使用率を 0.9 に設定し、最大モデル長を 65536 に設定します。複数の GPU を実行する場合は、コンテナ内でデバイスの順序が正しくなるよう、CUDA デバイスの再マッピングを適用してください。
ランタイムパラメータを構成する
GPU 数に合わせてテンソル並列処理を設定します。プールの選択と推論パーサーを Muse Glimmer の設定に構成します。GGUF ユーザーは、マルチモーダル画像処理を有効にするために、llama.cpp ランタイムブロックで mmproj ファイルを指定する必要があります。
Open WebUI に接続する
チャットインターフェース用に、vLLM または llama.cpp バックエンドを Open WebUI にリンクします。これにより、画像をアップロードし、推論チェーンをテストし、リアルタイムでトークン生成速度を監視できます。
マルチモーダル視覚的推論のパフォーマンス
Muse Glimmer の際立った能力は、その視覚的理解です。このモデルは4つの多様な画像シナリオでテストされ、その結果は一貫して素晴らしいものでした。テキサスの牧草地でヒトコブラクダを識別することから、作業台のハードドライブを数えることまで、このモデルは人間に近いレベルの画像理解力を示しました。
| テスト画像 | タスク | 評価 | 備考 |
|---|---|---|---|
| 牧草地のラクダ | オブジェクト識別、環境の説明 | A+ | ラクダ、フェンス、植物相、時間帯を正確に識別 |
| 猫とパッチパネル | 詳細なシーンの説明 | A+ | RJ45 ポート番号を読み取り、ケーブルの色を識別 |
| 屋外グリルでの調理 | ブランドと道具の識別 | A | Blackstone グリルを正しく識別し、パティをカウント |
| サーバーラックの解体 | ハードウェアのインベントリ | B- | SAS を SATA と誤認し、Optane 900P を 800P と誤認 |
複雑な視覚シーンを解析するモデルの能力は、その最大の強みです。ハードウェアコンポーネントの細かいテキストを正確に読み取り、コンテキストの手がかりを使用してぼやけた背景から樹木の種類を特定し、明示的なプロンプトなしで環境の詳細から地理的位置を推測することさえありました。
画像処理の速度も注目に値しました。マルチモーダル推論中、トークン生成は画像の複雑さとプロンプト処理のオーバーヘッドに応じて、1秒あたり 26 から 60 トークンの間で維持されました。これにより、Muse Glimmer はスピードが重要視されるバッチ画像処理パイプラインに適しています。
強み
- 卓越した視覚的鋭さ
- 画像内の細かいテキストを読み取る
- オブジェクトを正確にカウントする
- 環境からコンテキストを推測する
弱点
- ハードウェアの誤認
- 類似したコンポーネントを混同する (SATA と SAS など)
- 部分的にトリミングされたオブジェクトについて時折ハルシネーションを起こす
- 画像の解像度による制限がある
最適なユースケース
- 画像記述パイプライン
- ドキュメント分析
- 視覚的 QA ワークフロー
- シーン理解タスク
ベンチマーク比較と速度分析
Muse Glimmer は、オープンソースモデルの中で競争力のある階層に位置づけられています。そのベンチマークスコアは Gemma 4 31B (思考モード) と Qwen 3.6 27B の中間に位置していますが、今後リリースされる Qwen 3.8 27B により状況は変わる可能性があります。
| ベンチマーク | Muse Glimmer 30B | Qwen 3.6 27B | 備考 |
|---|---|---|---|
| SWE-bench Pro | 51.2 | より高い | コーディングタスク、堅実なパフォーマンス |
| Terminal Bench | 51.7 | 60.7 | Qwen がターミナル操作をリード |
| AIME 2026 | 94.7 | 94.1 | Muse Glimmer がわずかにリード |
| ChartVix/MMU Pro | 良好 | わずかに良い | マルチモーダル推論 |
| トークン速度 (5090) | 74.9 t/s | N/A | Meta により報告 |
| トークン速度 (3090) | 60-65 t/s | N/A | フル精度、クアッド GPU |
Muse Glimmer はフロンティアモデルではなく、Meta もそのようには主張していません。しかし、一般的なエージェントタスクやマルチモーダル推論においては、確立された競合他社に対して十分に渡り合えます。コーディングのパフォーマンスはまともですが、検証済みのベンチマークでは Qwen に遅れをとっています。
Meta が 3 倍の高速化をもたらすと報告している Dlash アクセラレーション機能は、現在 Docker コンテナでは機能していません。これにより、Docker ベースのデプロイメントでの初期状態のパフォーマンス向上が制限されています。ネイティブ構成で実行しているユーザーは、この問題が解決されれば恩恵を受けられる可能性があります。
推論、コーディング、SVG 生成
視覚的タスクだけでなく、Muse Glimmer は標準的な推論ベンチマーク、創造的な生成、およびコーディングに関連する課題でテストされました。その結果、このモデルは構造化されたロジックをうまく処理できるものの、特定の創造的な出力には苦労することが明らかになりました。
| テストカテゴリ | タスク | 結果 | 評価 |
|---|---|---|---|
| 論理パズル | 単語の位置と母音のチェック | 合格 | 2番目の単語の3番目の文字を正しく識別 |
| 数学/配列 | 任意の配列マッピング (a=0) | 合格 | m=12, s=18, z=25 を正しく計算 |
| 創造的 SVG | フェンスの上を歩く猫 | 失敗 | 歪んだ一つ目の猫を生成、フェンスの品質も悪い |
| 安全性拒否 | アルマゲドンのロールプレイシナリオ | 拒否 | 予想される Meta の動作、冗長な説明 |
最近の Meta モデルのリリースと同様に、暴力、強制、または有害なロールプレイを含むシナリオでは頻繁に拒否されることが予想されます。アルマゲドンテストでは、モデルがなぜ応じられないのかを説明する詳細な拒否反応が示されました。これは一般的な拒否よりも有益ですが、創造的なユースケースは依然として制限されます。
SVG 生成テストは特にがっかりするものでした。8K トークンの予算内でフェンスの上を歩く猫を作成するよう求められたところ、モデルは最低限の努力で作られた太陽とともに、不十分にレンダリングされたフェンスの上に歪んだ一つ目の生き物を生成しました。これは、推論および視覚分析タスクにおける全体的な強力なパフォーマンスとは鮮やかな対比をなしています。
デプロイ前チェックリスト:
- 選択した精度階層の要件を満たす合計 VRAM があるか確認する
- Meta のリポジトリから公式 Docker イメージまたは GGUF ウェイトをプルする
- GPU 数に合わせてテンソル並列処理を構成する
- 長時間のセッション中の OOM を防ぐために最大モデル長を設定する
- 本番環境で使用する前にサンプル画像でマルチモーダル入力をテストする
- お使いのハードウェア構成でトークン速度のベンチマークを取る
FAQ
Q: Muse Glimmer 30B とは何ですか?また、誰が開発しましたか?
Muse Glimmer 30B は、Meta によって開発され、Apache 2.0 ライセンスで公開された密結合型のマルチモーダル大規模言語モデルです。296億6000万のパラメータを備え、100の言語にわたるテキストと画像の入力をサポートし、2026年1月4日の知識カットオフを持つ 128K のコンテキストウィンドウが含まれています。
Q: Muse Glimmer をシングル 24 GB GPU で実行できますか?
はい、KQU-Quant GGUF バリアントは約 17〜24 GB の VRAM を必要とし、シングル RTX 3090、4090、または 5090 に収まります。Meta は、フル精度と比較して約 1% の精度低下しかないと報告しています。マルチモーダル画像処理を有効にするには、mmproj ファイルを構成した llama.cpp が必要です。
Q: Muse Glimmer は Qwen 3.6 27B と比較してどうですか?
Muse Glimmer は AIME 2026 推論 (94.7 対 94.1) でわずかに高いスコアを記録しましたが、Terminal Bench (51.7 対 60.7) および検証済みのコーディングベンチマークでは Qwen に遅れをとっています。マルチモーダルタスクに関しては、Qwen 3.6 27B が ChartVix と MMU Pro でわずかに優位性を持っていますが、Muse Glimmer は実用的な画像理解テストにおいて競争力があります。
Q: Muse Glimmer は動画入力をサポートしていますか?
いいえ、Muse Glimmer はテキストと画像の入力のみを処理します。動画の処理はサポートされていません。このモデルは動画から抽出された個々のフレームを分析することはできますが、連続した媒体として動画コンテンツを直接取り込んで推論することはできません。