Muse Glimmer 30B: ローカルセットアップとパフォーマンスレビュー - ガイド

Muse Glimmer 30B: ローカルセットアップとパフォーマンスレビュー

Muse Glimmer 30Bの機能、ベンチマーク、マルチモーダルビジョンスキル、およびエージェントAIワークフロー向けのローカルデプロイ要件を探ります。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmer 30Bは、296億パラメータを持つMetaの高密度マルチモーダルLLMです
  • Apache 2.0ライセンスにより、完全な商用利用と柔軟なローカルデプロイが可能です
  • 128Kのコンテキストウィンドウが、テキストと画像処理をネイティブにサポートします
  • フル精度では64〜96 GBのVRAMが必要ですが、量子化GGUFは24 GB GPUに収まります
  • マルチモーダルビジョンのパフォーマンスは、Gemma 4やQwen 3.6などのトップクラスのモデルに匹敵します

Muse Glimmer 30B: アーキテクチャと仕様

Muse Glimmer 30Bは、Metaによって開発され、Apache 2.0ライセンスの下でリリースされた、高密度のトランスフォーマーベースの大規模言語モデルです。エージェントワークフロー向けに設計されており、信頼性の高いツール呼び出し、多段階推論、障害回復を重視しています。296.6億パラメータを持ち、特にディスクリートGPU構成などの高帯域幅システムで効率的に動作するように構築されています。

このモデルは最大100言語をサポートし、128Kのコンテキスト長を特徴としています。知識のカットオフは2026年1月4日であり、現在の開発ワークフローに非常に適しています。一部の競合とは異なり、テキストと画像の入力を処理しますが、動画は処理しません。

動画のハイライト:

  • クアッドRTX 3090構成でフル精度モデルをテスト
  • 24 GB GPU構成向けのGGUF量子化バリアントが利用可能
  • 複数の実世界の画像シナリオで視覚的推論をテスト
  • ベンチマークではGemma 4 31BとQwen 3.6 27Bの中間に位置付けられる

コア仕様表

仕様
パラメータ数296.6億 (高密度)
ライセンスApache 2.0
コンテキスト長128Kトークン
知識のカットオフ2026年1月4日
サポート言語最大100
入力モダリティテキストと画像
出力モダリティテキスト
アーキテクチャに関するメモ

Mixture of Experts (MoE) ではなく高密度モデルであるため、Muse Glimmer 30Bは高メモリ帯域幅システムの恩恵を受けます。高速なインターコネクトを備えたディスクリートGPUが、このアーキテクチャにおいて最高の推論パフォーマンスを提供します。

ハードウェア要件と量子化オプション

Muse Glimmer 30Bをローカルで実行するには、慎重なハードウェア計画が必要です。フル精度モデルは大量のVRAMを要求しますが、Metaはコンシューマー向けハードウェアのユーザーでもモデルにアクセスできるように、複数の量子化GGUFバリアントを提供しています。

モデルバリアント別のVRAM要件

バリアント必要なVRAM備考
フル精度 (FP16)64-96 GBフル128Kコンテキストには約96 GBが必要
K-Quant約32 GBデュアル16 GBまたはシングル32 GB GPUに適合
KQ-Quant (小容量GGUF)約17-24 GBシングル24 GB GPUに適合、精度低下は約1%

報告されている推論速度

ハードウェア構成1秒あたりのトークン数精度
RTX 509074.9フル精度
クアッドRTX 309060-65フル精度
クアッドRTX 3090 (負荷時)40-46フル精度
VRAMの計画

最大128Kのコンテキストウィンドウでフル精度モデルを実行する場合、ベースラインの64 GBではなく、96 GBに近いVRAMが必要です。拡張エージェントタスク中のメモリ不足エラーを避けるため、ハードウェアの割り当てを適切に計画してください。

フル精度

  • 64-96 GB VRAM
  • 最大の精度
  • ベンチマークに最適
  • マルチGPU構成が必要

K-Quant GGUF

  • 約32 GB VRAM
  • 最小限の精度低下
  • 速度と品質のバランスが良い
  • llama.cppと互換性あり

KQ-Quant GGUF

  • 約17-24 GB VRAM
  • シングル24 GB GPUに適合
  • 報告される精度低下は約1%
  • コンシューマー向けハードウェアに最適

ベンチマークパフォーマンスと比較

Muse Glimmer 30Bは、ミッドティアのオープンソースLLMの領域において競争力のある位置を占めています。ベンチマーク結果は、ほとんどのカテゴリでGemma 4 31B (思考モード) とQwen 3.6 27Bの中間に位置しており、特にエージェントタスクの処理と一般的な推論において強みを発揮します。

ベンチマーク結果の概要

ベンチマークカテゴリMuse Glimmer 30BQwen 3.6 27B備考
SWE-bench Pro (コーディング)51.2より高い検証済みコーディングでQwenがリード
Terminal Bench51.760.7ターミナルタスクでQwenが強い
AIME 2026 (推論)94.794.1Muse Glimmerがわずかにリード
ChartVix (マルチモーダル)強いわずかに高い接戦
MMU Pro (マルチモーダル)強いわずかに高いQwenが僅差でリードを維持
競争環境

Qwen 3.6 27BはまもなくQwen 3.8 27Bに置き換えられると予想されており、競争環境は変化する可能性があります。しかし、Muse Glimmer 30Bは一般的なエージェントタスク処理とAIME 2026の推論スコアにおいて明確な優位性を持っています。

このモデルは、SWE-bench Proで51.2というスコアをマークし、堅実なコーディング能力を示していますが、検証済みのコーディングタスクではQwen 3.6 27Bが上回っています。Muse Glimmerが真に輝くのは一般的な推論においてであり、AIME 2026でQwenの94.1に対し94.7を獲得しています。マルチモーダル機能は堅牢で、ChartVixおよびMMU Proベンチマークで良好なパフォーマンスを発揮しますが、どちらのカテゴリでもQwen 3.6 27Bにわずかに遅れをとっています。

マルチモーダルビジョン機能

Muse Glimmer 30Bの際立った特徴の1つは、視覚的理解と推論です。テストでは、画像分析、オブジェクト識別、および視覚入力からの文脈推論において卓越したパフォーマンスを明らかにしています。このモデルは、複雑なシーンを正確に描写し、オブジェクトをカウントし、環境のコンテキストについての推測を行うことさえあります。

ビジョンテスト結果

テストシナリオ精度評価
動物の識別 (ラクダ)素晴らしいA+
室内シーンの詳細 (猫とケーブル)素晴らしいA+
屋外の調理 (グリドルと食べ物)素晴らしいA+
樹木の種類の推定良い (正しい推測)A
サーバーハードウェアの識別良い (軽微なエラーあり)B-
ビジョンの強み

このモデルは、ブランド名の識別、オブジェクトのカウント、テキストラベルの読み取り、環境コンテキストの推論が得意です。テストでは、Blackstoneグリドルのブランドを正しく識別し、RJ45ポートの番号をカウントし、位置情報のプロンプトなしで背景の植生からテキサス州中部の地理を推測することさえありました。

注目すべきビジョンの成果

  • ブランド認識: 部分的な文字からBlackstoneグリドルを正しく識別
  • ポートカウント: パッチパネルからRJ45ポート番号 (18-24) を正確に読み取り
  • 地理的推論: 樹木の種類と風景からテキサス・ヒル・カントリーを推測
  • オブジェクトカウント: 3つのハンバーグーのパティと6つの2.5インチHDDを正しくカウント
  • 素材の識別: 木、金属、コンクリートの表面を区別

このモデルは、ハードウェアの識別においてわずかな弱点を示しました。SASケーブルをSATAケーブルと間違えたり、Intel Optane 900Pドライブを800P U.2モジュールと誤認したり、画像の端で一部切り取られたオブジェクトについて幻覚 (ハルシネーション) を起こすことがありました。これらのエラーはまれであり、全体的なパフォーマンスを著しく損なうものではありませんでした。

ローカルデプロイセットアップガイド

Muse Glimmer 30Bのローカルデプロイは、vLLMを使用した公式Dockerコンテナ、またはllama.cppを使用したGGUF形式の2つの主要な方法で実現できます。それぞれのアプローチには、ハードウェアとユースケースに応じて異なる利点があります。

1

ランタイムの選択

フル精度の推論にはvLLMを搭載した公式Dockerコンテナを選択するか、VRAMが限られている場合はllama.cpp用のGGUFバリアントをダウンロードします。Dockerアプローチは最も正確な結果を提供しますが、はるかに多くのGPUメモリを必要とします。

2

GPUリソースの設定

GPUメモリ使用率を0.9に設定し、GPUの数に基づいてテンソル並列処理を構成します。マルチGPUのセットアップでは、コンテナ内でデバイスの順序が正しくなるようにCUDAデバイスの再マッピングが必要になる場合があります。推論中のメモリ枯渇を防ぐため、最大モデル長を65536に設定します。

3

モデルパーサーの選択

プールの選択 (pool choice) を「muse-glimmer」に、推論パーサー (reasoning parser) を「muse-glimmer」に設定してランタイムを構成します。これらの設定により、サービングフレームワーク内でモデルがエージェント呼び出しと推論チェーンを正しく処理できるようになります。

4

読み込みとテスト

Open WebUIまたはお好みのフロントエンドからモデルを読み込みます。まず簡単な画像記述タスクから始めてマルチモーダル機能を検証し、その後、エージェントのツール呼び出しワークフローに進み、多段階推論と障害回復機能をテストします。

DockerのFlash Attention

最新のテストの時点で、公式Dockerコンテナ内ではFlash Attentionは機能しません。Flash Attentionを有効にすると3倍の高速化が報告されていますが、この機能を利用するには標準のDockerデプロイ以外の追加の設定が必要です。

推奨されるvLLM構成

パラメータ推奨値目的
GPU Memory Utilization0.9オーバーヘッド用のバッファを確保
Max Model Length65536推論中のOOMを防止
Tensor Parallel4 (クアッドGPUの場合)GPU間で負荷を分散
Pool Choicemuse-glimmer正しいモデルルーティング
Reasoning Parsermuse-glimmer推論チェーンを解析

デプロイ前チェックリスト:

  • 選択したバリアントの最小要件をVRAMが満たしているか確認
  • DockerとNVIDIA Container Toolkitをインストール
  • 公式リポジトリからモデルの重みをダウンロード
  • マルチGPUセットアップ用にCUDAデバイスの順序を構成
  • サンプル画像でマルチモーダル入力をテスト
  • トークン生成速度が期待を満たしているか確認

制限事項と既知の問題

Muse Glimmer 30Bはほとんどのタスクで素晴らしいパフォーマンスを発揮しますが、デプロイ前にユーザーが理解しておくべきいくつかの注目すべき制限があります。

テストされた制限のカテゴリ

カテゴリ動作影響
コンテンツの拒否厳格な安全フィルタリング創造的なシナリオを拒否する可能性
SVG生成視覚的出力が貧弱猫の描画テストに失敗
ハードウェア識別軽微な誤分類SAS/SATAとOptaneの混同
動画処理サポート対象外テキストと画像のみ
Flash AttentionDockerで機能しないコンテナ内で3倍の高速化なし
安全上の拒否

Metaのモデルであるため、Muse Glimmer 30Bは保守的な安全動作を示します。テストでは、「ひねりを加えたアルマゲドン」という創造的なシナリオを拒否し、仮想的なロールプレイに参加する代わりに、一般的なAIアシスタントの回答を提供しました。制限の少ない出力を必要とするユーザーは、この傾向を考慮する必要があります。

SVG生成テストでは、特に貧弱な結果が生成されました。8Kトークンの予算内で柵の上を歩く猫を作成するよう求めたところ、モデルは柵や背景の要素に対する努力が最小限の、歪んだ一つ目の figure を生成しました。このテストは明らかな失敗と評価され、複雑なベクターグラフィックスの生成が依然として弱点であることが示唆されています。

一方で、このモデルは論理パズルをうまく処理しました。(2番目の単語の3番目の文字を特定する) 単語の位置パズルや、任意の配列マッピングの質問をエラーなく正しく解決し、強力なステップバイステップの推論能力を示しました。

FAQ

Q: Muse Glimmer 30Bとは何ですか?また、誰が開発しましたか?

Muse Glimmer 30Bは、296.6億パラメータを持つ高密度のマルチモーダル大規模言語モデルで、Metaによって開発され、Apache 2.0ライセンスの下でリリースされました。128Kのコンテキストウィンドウでテキストと画像の入力をサポートし、ツール呼び出しや多段階推論を含むエージェントワークフロー向けに設計されています。

Q: Muse Glimmer 30Bをシングル24 GB GPUで実行できますか?

はい、KQ-Quant GGUFバリアントは約17〜24 GBのVRAMを必要とし、報告されている精度の低下は約1%のみで、シングル24 GB GPUに収まります。マルチモーダル機能を使用するには、llama.cppと付属のmmprojファイルを使用する必要があります。

Q: Muse Glimmer 30BはQwen 3.6 27Bと比較してどうですか?

Muse Glimmer 30BはAIME 2026推論 (94.7対94.1) でより高いスコアを記録し、一般的なエージェントタスクをうまく処理します。ただし、Qwen 3.6 27Bは検証済みのコーディングタスクやターミナルベンチマークで上回っており、ChartVixやMMU Proなどのマルチモーダルベンチマークでもわずかにリードしています。

Q: Muse Glimmer 30Bは動画入力を処理しますか?

いいえ、Muse Glimmer 30Bはテキストと画像の入力のみを処理します。動画処理はサポートしていません。このモデルは、オブジェクト識別、シーンの記述、カウント、および文脈推論のための静的画像を高い精度で分析できます。