Muse Glimmer: 人工分析とローカルAIレビュー - ベンチマーク

Muse Glimmer: 人工分析とローカルAIレビュー

Muse Glimmer 30Bの詳細分析:マルチモーダル機能、ベンチマーク性能、VRAM要件、およびローカルデプロイのコツ。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmer 30B: Metaによる296億パラメータの高密度なマルチモーダルLLM
  • Apache 2.0ライセンス: 商用および個人利用のために完全にオープンソース
  • 128Kコンテキスト長: 大規模なテキストと画像入力をネイティブに処理
  • ハードウェア要件: 最低24GBのVRAM(量子化版)から最大96GB(フル精度版)が必要
  • マルチモーダルの強み: 視覚的推論、オブジェクトカウント、シーン描写に優れる

Muse Glimmer 30B: コアアーキテクチャと仕様

Muse Glimmer 30Bは、オープンソースAIエコシステムに対するMetaの最新の貢献を代表しています。Apache 2.0ライセンスの下でリリースされたこの高密度なマルチモーダルモデルは、エージェントワークフロー、複数ステップの推論、および視覚的理解のために設計されています。2026年1月4日の知識カットオフにより、ローカルデプロイメントに最新の情報をもたらします。

動画のハイライト:

  • フル精度モデルは最適なパフォーマンスのために64〜96GBのVRAMを必要とします
  • GGUF量子化バリアントは、精度を約1%失うだけで24GBのGPUに収まります
  • テキストと画像を処理しますが、動画入力は処理しません
  • RTX 3090構成で1秒間に60〜65トークンを達成します
  • オブジェクト識別とシーン分析において強力な視覚力を発揮します

このモデルは、異なるハードウェア構成に対応するために複数の形式で提供されています。vLLMを備えた公式Dockerコンテナを介して実行する場合でも、llama.cppでGGUFとして実行する場合でも、Muse GlimmerはローカルAI愛好家のための柔軟なデプロイメントパスを提供します。

フォーマットの選択

利用可能なハードウェアに基づいてフォーマットを選択してください。フル精度は最大の精度を提供しますが、64〜96GBのVRAMを要求します。K-QuantおよびKQ-Quant GGUFバリアントは要件をそれぞれ32GBと17GBに削減し、RTX 3090や4090カードなどのコンシューマーグレードのハードウェアでモデルを利用しやすくします。

技術仕様表

仕様
パラメータ296億 (高密度)
ライセンスApache 2.0
コンテキスト長128Kトークン
知識カットオフ2026年1月4日
サポート言語最大100言語
入力モダリティテキストと画像
動画処理サポート対象外

ベンチマーク性能とモデルの比較

Muse Glimmer 30Bは、現在のオープンソースの状況において競争力のある位置づけにあります。人工分析テストでは、全体的な品質においてGemma 4 31B(思考モード)とQwen 3.6 27Bの中間に位置しています。Qwen 3.6 27Bが検証済みのコーディングタスクとターミナルベンチマークで優位性を維持している一方、Muse Glimmerは一般的なエージェント操作においてその地位を保っています。

ベンチマーク比較表

ベンチマークMuse Glimmer 30BQwen 3.6 27B備考
SWE-bench Pro51.2より高いコーディング性能
Terminal Bench51.760.7ここではQwenがリード
AIME 202694.794.1Muse Glimmerがわずかにリード
ChartVix強力わずかに良いマルチモーダルスコアリング
MMU Pro強力わずかに良いマルチモーダル理解
安全性による拒否

Meta製品として、Muse Glimmer 30Bは顕著な安全性による拒否を示します。テストでは、紛争を伴うロールプレイシナリオを拒否し、物理的に危険であると見なしたタスクを辞退しました。創造的または無制限のワークフローのためにこのモデルをデプロイするユーザーは、これらのガードレールを予期し、それに応じて計画する必要があります。

推論能力は顕著です。AIME 2026ベンチマークで、Muse Glimmerは94.7を獲得し、94.1のQwen 3.6 27Bをわずかに上回っています。これにより、数学的および論理的推論タスクにおいて、現在のオープンソースモデルの上位層にしっかりと位置づけられています。

マルチモーダル視覚推論分析

Muse Glimmer 30Bの際立った特徴は、その視覚処理能力です。体系的な画像テストを通じて、このモデルは、最新のGemma 4リリースに匹敵するかそれに一致する、例外的なシーン理解、オブジェクト識別、および文脈推論を示しています。

画像分析性能表

テストカテゴリ正確性詳細レベル評価
屋外の風景素晴らしい粒度細かいA+
屋内のオブジェクト素晴らしい正確A+
ハードウェア識別良い軽微なエラーB-
オブジェクトカウント非常に良い控えめA
樹木/植物の識別 (推論)印象的控えめだが正確A
視覚力の強み

Muse Glimmerは、部分的な文字からBlackstoneグリルブランドを正しく識別し、植生と地形だけからテキサス・ヒル・カントリーの地理を推測し、パッチパネル上のネットワークポートを正確に数えました。これらの機能により、画像ベースのエージェントワークフロー向けの最有力候補となっています。

シーン描写

  • 粒度の細かい環境の詳細
  • 正確な照明と時間の推測
  • 背景要素の識別
  • 色とテクスチャの認識

オブジェクトカウント

  • 控えめだが正確
  • HDDとSSDのフォームファクタを区別
  • 部分的か完全に見えるかを識別
  • 過大評価を回避

文脈推論

  • 手がかりからの地理的推論
  • 部分的なテキストからのブランド識別
  • 活動認識(料理、解体)
  • 材質の組成分析

このモデルは、ハードウェア固有の識別においてわずかな弱点を示しています。サーバーラックの分析中に、SASケーブルをSATAと誤認し、Intel Optane 900Pドライブを800Pモデルと混同し、PCIeフォーマットのドライブをU.2として誤って分類しました。これらのエラーは、モデルのトレーニングデータにエンタープライズハードウェアのカテゴリにおける深さが欠けている可能性を示唆しています。

ハードウェア要件とデプロイ

Muse Glimmer 30Bをローカルで実行するには、慎重なハードウェア計画が必要です。モデルの高密度なアーキテクチャは、ディスクリートGPUを搭載した高帯域幅システムで最も高いパフォーマンスを発揮することを意味します。異なる量子化レベルにわたるVRAM要件を理解することは、デプロイを成功させるために重要です。

フォーマット別VRAM要件

フォーマット必要なVRAMユースケース精度への影響
フル精度64-96GB最高品質、研究ベースライン
K-Quant GGUF~32GB高品質、セミプロ最小限の損失
KQ-Quant GGUF~17-24GBコンシューマー向けハードウェア約1%の精度低下
コンテキストウィンドウのVRAM

完全な128Kコンテキストウィンドウを備えたフル精度で実行する場合、ベースラインの64GBではなく、96GBに近いVRAMが必要です。長時間の会話中のメモリ不足エラーを回避するために、コンテキスト処理用のヘッドルームを常に確保してください。

測定された推論速度

ハードウェア構成フォーマットトークン/秒備考
RTX 5090フル精度~74.9報告された数値
4x RTX 3090フル精度60-65テンソル並列 = 4
4x RTX 3090フル精度 (ロード済み)40-46生成中
1

ランタイムを選択

最大のパフォーマンスを得るために公式のvLLM Dockerコンテナを選択するか、より幅広いハードウェア互換性のためにGGUFファイルを備えたllama.cppを選択します。Dockerルートでは、マルチGPUセットアップのためにCUDAデバイスの再マッピングが必要です。

2

GPUメモリを設定

会話の途中でのクラッシュを防ぐために、GPUメモリ使用率を0.9に、最大モデル長を65536に設定します。クアッドGPU構成の場合、テンソル並列を4に設定します。

3

パーサーパラメータを設定

ランタイムブロックでプールチョイスと推論パーサーを「Muse Glimmer」に設定します。llama.cppでGGUFを使用する場合は、mmprojファイルが正しく指定されていることを確認してください。

4

マルチモーダル入力でテスト

テキストプロンプトと一緒に画像入力でテストを開始します。Muse Glimmerはテキストと画像を処理しますが、動画は受け付けません。トークン速度を確認し、それに応じてバッチサイズを調整します。

長所、短所、およびSVG生成

完璧なモデルはなく、Muse Glimmer 30Bには顕著な制限と並んで明確な優れた領域があります。これらを理解することは、ユーザーが特定のワークフローのニーズに合った適切なツールを選択するのに役立ちます。

能力評価表

能力評価詳細
視覚的推論素晴らしいトップクラスのシーン分析と推論
エージェントツール呼び出し非常に良い信頼できる複数ステップの推論
コーディング (SWE-bench)良い堅実だがクラス最高ではない
数学/推論 (AIME)非常に良い94.7、Qwen 3.6をわずかに上回る
SVG生成悪い基本的な猫がフェンスを歩くテストに失敗
安全性の柔軟性低い創造的なタスクで頻繁に拒否
SVG生成の失敗

8Kトークンの予算内でフェンスの上を歩く猫のSVGの作成を任されたとき、Muse Glimmerは、最小限の労力で作られた太陽と一緒に、不十分にレンダリングされたフェンスの上に歪んだ一つ目の生き物を生成しました。これは、構造化された視覚的出力タスクにおいて競合モデルと比較した際の重大な弱点を表しています。

このモデルは、いくつかの論理と推論のテストにも合格しました。任意の配列の問題を正しく解決し、特定の単語の位置で子音と母音を識別し、エラーなしで複数ステップの文字カウントタスクを処理しました。

デプロイ前チェックリスト:

  • 選択したフォーマットの最小要件をVRAMが満たしていることを確認する
  • Dockerをインストールし、CUDAデバイスマッピングを構成する
  • 正しいモデルウェイト(フル精度またはGGUF)をダウンロードする
  • GPU数に合わせてテンソル並列値を設定する
  • サンプル画像を使用してマルチモーダル入力をテストする
  • 典型的なワークロード下でトークン速度をベンチマークする

FAQ

Q: Muse Glimmer 30Bのライセンスは何ですか?商用利用できますか?

Muse Glimmer 30BはApache 2.0ライセンスの下でリリースされており、個人および商用利用の両方が許可されています。これにより、本番環境のデプロイメントに利用可能な、よりアクセスしやすいオープンウェイトモデルの一つとなっています。

Q: Muse Glimmer 30Bは動画入力を処理できますか?

いいえ、Muse Glimmer 30Bは動画処理をサポートしていません。テキストと画像の入力のみを処理します。動画ベースのワークフローの場合は、フレームを抽出し、それらを個別に画像として処理する必要があります。

Q: Muse GlimmerはQwen 3.6 27Bと比較してどうですか?

Muse Glimmer 30BはAIME 2026でわずかに高いスコア(94.7対94.1)を獲得しましたが、ターミナルベンチマーク(51.7対60.7)と検証済みのコーディングタスクではQwen 3.6 27Bに遅れをとっています。一般的なエージェントタスクとマルチモーダル推論においては、Muse Glimmerが競争力があります。重いコーディングワークロードの場合は、Qwen 3.6 27Bが引き続き強力な選択肢です。

Q: Muse Glimmerをローカルで実行するために必要な最小のハードウェアは何ですか?

KQ-Quant GGUFバリアントは、約1%の精度低下で、単一の24GB GPU(RTX 3090や4090など)で実行できます。フル精度の場合は最低64GBのVRAMが必要であり、完全な128Kコンテキストウィンドウを利用する場合は96GB近くになります。

Q: Muse Glimmer 30Bは安全性による拒否が多いですか?

はい、Metaモデルとして、Muse Glimmerは顕著な安全ガードレールを示します。暴力を伴うロールプレイシナリオを拒否し、身体的危害を伴うタスクを辞退し、出力に対するポリシーチェックを適用します。ユーザーはこれをデプロイの計画に組み込む必要があります。

最終評価

Muse Glimmer 30Bは、ローカルAIに対するMetaの継続的な取り組みを示す強力なオープンソースリリースです。その視覚的推論能力は本当に印象的であり、エージェントのツール呼び出しの信頼性により、本番ワークフローに適しています。安全性による拒否と弱いSVG生成がその多用途性を制限するものの、このモデルはマルチモーダルおよび推論タスクに対する確固たる推奨を得ています。