- Muse Glimmerは、ローカルのエージェントワークフロー向けに設計されたMetaによる30Bパラメータのオープンウェイトモデルです。
- Apache 2.0ライセンスにより、商用利用、変更、再配布が無制限に許可されます。
- 131K以上のコンテキストウィンドウは、長時間のコーディングセッション、ドキュメント分析、マルチステップ推論をサポートします。
- 量子化GGUFフォーマットにより、VRAM 24GB以下のコンシューマーハードウェアへの展開が可能になります。
- マルチモーダル機能には、専用の知覚エンコーダーによるテキストと画像の処理が含まれます。
Muse Glimmer 30Bとは?
Muse Glimmerは、2026年8月10日にMeta Superintelligence Labsがリリースした300億パラメータのオープンウェイトAIモデルです。このモデルは、コンシューマーグレードのハードウェア上で、エージェントコーディング、ツール呼び出し、ビジョン理解、長コンテキスト推論をローカルに展開することを目的としています。クラウドホストAPIとは異なり、Muse Glimmerは完全に独自のマシンで実行されるため、ソースコードとプロジェクトデータはプライベートのまま維持されます。
公式モデルは、Meta Developer portalおよびHugging Faceを通じて配布されており、BF16ウェイト、GGUF量子化ビルド、ExecuTorch、DFlash Drafter variantsなど、複数のフォーマットが提供されています。
Muse Glimmerには約29.6Bのパラメータがあり、テキストと画像の入力をサポートし、131,072トークンを超えるコンテキスト長を処理し、Apache 2.0ライセンスで提供されています。このモデルは100以上の言語でトレーニングされており、多言語開発ワークフローに適しています。
モデル仕様概要
| 仕様 | 値 | メモ |
|---|---|---|
| パラメータ | ~29.6B | 30Bクラスモデル |
| コンテキストウィンドウ | 131,072+ トークン | 長いドキュメントとコードベースをサポート |
| 入力モダリティ | テキスト + 画像 | ビジョン用の専用知覚エンコーダー |
| ライセンス | Apache 2.0 | 商用利用が可能な寛容なライセンス |
| トレーニング言語 | 100以上 | 多言語サポート |
| 主な使用ケース | コーディング、エージェント、ビジョン | ローカルファースト展開 |
Hugging Faceのモデルコレクションには、異なる展開ターゲット向けの特殊なバリアントも含まれており、開発者はハードウェアとユースケースに適したフォーマットを柔軟に選択できます。
モデルフォーマットとGGUF量子化
メモリ使用量、推論速度、出力品質のバランスを取るには、適切なモデルフォーマットを選択することが重要です。Muse Glimmerは、それぞれが異なるハードウェア構成と展開シナリオをターゲットにしたいくつかの公式フォーマットで利用できます。
利用可能なモデルフォーマット
| フォーマット | メモリ使用量 | 速度 | 品質 | 推奨用途 |
|---|---|---|---|---|
| BF16オリジナル | 最高(約60GB) | ハードウェア依存 | 最高の忠実度 | 十分なVRAMを持つシステム |
| 高精度GGUF | 高い | 中程度 | オリジナルに近い | 32GB以上のVRAMを持つワークステーション |
| バランス量子化GGUF | 中程度(約15-20GB) | より高速な展開 | バランスの取れた品質 | 一般的なローカルコーディングとエージェント |
| 低精度GGUF | 最低 | 最も実行しやすい | 品質のトレードオフが最大 | メモリが限られたコンシューマーハードウェア |
| ExecuTorch | 可変 | エッジ向けに最適化 | 展開固有 | モバイルおよびエッジ推論 |
| DFlash Drafter | 可変 | 投機的デコードによる加速 | 高速化を伴う高品質 | RTX 5090およびハイエンドNVIDIA GPU |
16-bit精度の30Bモデルでは、ランタイムのオーバーヘッドを除いて、ウェイトだけで約60GBが必要です。4-bit量子化バージョンでは、生のパラメータフットプリントは約15GBに削減されますが、メタデータ、KVキャッシュ、推論オーバーヘッドにより、実際のファイルサイズとランタイムメモリはこれより大きくなります。
BF16ウェイト
- 最高品質の出力
- 約60GB以上のメモリが必要
- 研究と評価に最適
- 完全な数値精度が維持される
GGUF量子化
- ローカル使用向けのバランスの取れたパフォーマンス
- 4-bitで15-20GBに収まる
- llama.cppおよびOllamaと互換性あり
- コンシューマーGPUに最適
DFlash Drafter
- **投機的デコード(Speculative decoding)**による加速
- RTX 5090でのテストで平均233.4 tok/sを記録
- DrafterモデルとVerifierモデルを組み合わせる
- ハイエンドハードウェアでの最大スループット
ハードウェア要件と展開
30Bモデルをローカルで実行するには、慎重なハードウェア計画が必要です。モデルのメモリフットプリントは、選択する精度と量子化レベルに大きく依存します。Metaは、Muse Glimmerをコンシューマーグレードの展開向けに最適化しており、公式ターゲット層は24GB、32GB、64GBのVRAM構成になっています。
ハードウェア展開層
| ハードウェアクラス | メモリモデル | 展開タイプ | 最適な用途 |
|---|---|---|---|
| NVIDIA RTX 5090 | 32GB専用VRAM | GPUアクセラレーション対応ローカルエージェント | DFlashによる最大速度 |
| NVIDIA RTX 4090 | 24GB専用VRAM | GPUアクセラレーション推論 | ハイエンドコンシューマーコーディングエージェント |
| AMD Radeon GPU | 専用VRAM + システムRAM | GPUアクセラレーション対応ローカル推論 | Radeonハードウェアを持つデスクトップユーザー |
| AMD Ryzen AI Max | 大きな共有ユニファイドメモリ | ローカルアクセラレーション推論 | コンパクトAIワークステーション |
| 高メモリPC | システムRAM + 一部GPUオフロード | 量子化ローカル推論 | RAMは十分だがVRAMが限られているユーザー |
| CPUのみのシステム | システムRAMのみ | CPU推論 | 互換性テストのみ |
NVIDIA RTX 5090とDFlash投機的デコードを組み合わせた公式テストでは、平均秒速233.4トークンを達成しました。これにより、Muse Glimmerはモデルが繰り返し出力を生成、評価、反復するインタラクティブなエージェントワークフローにおいて、実用的な速度を提供します。
VRAMターゲット層
| VRAMターゲット | 推奨フォーマット | 期待されるエクスペリエンス |
|---|---|---|
| 24GB | 4-bit量子化GGUF | 快適なインタラクティブコーディング |
| 32GB | バランスGGUF以上 | スムーズなマルチステップエージェントワークフロー |
| 64GB | BF16または高精度GGUF | 最高品質、長コンテキスト |
| 16GB以下 | 低精度GGUF | 機能するが品質のトレードオフあり |
ローカルセットアップ手順
Muse Glimmerをローカルで実行するには、ランタイムの選択、適切なモデルフォーマットのダウンロード、推論環境の設定が含まれます。最も簡単な方法は、グラフィカルインターフェースのためにLM Studioを使用することですが、より詳細な制御を望む開発者は、Transformers、vLLM、SGLang、またはllama.cppを直接使用できます。
ローカルランタイムを選択する
最も設定が簡単なグラフィカルセットアップにはLM Studioを使用してください。推論スタックをより詳細に制御するには、公式Hugging Faceリポジトリからモデルウェイトを直接ダウンロードし、Transformers、vLLM、llama.cppなどのお好みのフレームワークと統合します。
適切なモデルフォーマットをダウンロードする
利用可能なメモリに基づいてフォーマットを選択します。24GB VRAM GPUの場合、4-bit量子化GGUFビルドを選択します。32GB以上のシステムの場合、バランスの取れたGGUFまたは高精度GGUFの方がより良い品質を提供します。公式GGUFコレクションからダウンロードしてください。
モデルを読み込み、設定する
推論アプリケーションでダウンロードしたモデルを開きます。十分なGPUまたはユニファイドメモリを割り当てます。利用可能な場合はハードウェアアクセラレーションを有効にします。プロンプトを送信する前に、モデルがメモリ不足エラーなしで読み込まれることを確認してください。
最初のプロンプトを送信する
コーディングや推論タスクに焦点を当てて開始します。例:「この関数をレビューし、バグを特定して、短い説明を含む修正版を返してください」。推論、コンテキスト処理、出力生成がすべて正しく機能することを確認するために、最初のプロンプトは小さく保ってください。
ツールを接続し、エージェントワークフローを構築する
基本的な推論が機能するようになったら、ファイルアクセス、ターミナル実行、構造化されたツール呼び出しを提供するエージェントフレームワークにMuse Glimmerを接続します。これにより、モデルはチャットインターフェースからマルチステップの自律コーディングアシスタントへと変身します。
Muse Glimmerは、Transformers、vLLM、SGLang、Dockerベースの展開、llama.cpp、Ollamaなど、主要なローカル推論フレームワークと互換性があります。展開ターゲットと既存のインフラに最も一致するフレームワークを選択してください。
ローカルセットアップ検証:
- 利用可能なVRAMまたはシステムRAMが、選択したフォーマットの要件を満たしていることを確認する
- 公式Hugging Faceリポジトリからモデルウェイトをダウンロードする
- 推論ランタイムでモデルがメモリエラーなしで読み込まれることを検証する
- 単純なコーディングプロンプトで基本的なテキスト生成をテストする
- 画像とテキスト指示を一緒に提供してマルチモーダル入力を検証する
- エージェントワークフローテストのために少なくとも1つの外部ツールを接続する
エージェント型AIとコーディング機能
Muse Glimmerは、モデルが複数のステップにわたって推論し、外部ツールを呼び出し、失敗から回復する必要があるエージェントワークロード専用に構築されています。単一ターンのチャットモデルとは異なり、エージェントアプリケーションは、モデルを計画、アクション実行、結果観察、反復のループ内に配置し、タスクが完了するまで繰り返します。
コアエージェント機能
| 機能 | 説明 | 実用的なアプリケーション |
|---|---|---|
| マルチステップ計画 | 目標をより小さなアクションに分割 | リポジトリレベルのコード変更 |
| 関数呼び出し | 構造化されたツール引数を生成 | ファイル操作、テスト実行 |
| ツール使用 | 外部機能を要求 | シェルコマンド、検索、開発ツール |
| 観察ループ | ツールの結果を推論にフィードバック | テストと修正のサイクル |
| 失敗回復 | アクションが失敗したときにアプローチを変更 | ファイル欠如の処理、エラー修正 |
| 長時間実行ワークフロー | 多くの反復にわたってタスクを持続 | 機能実装、マルチファイルリファクタリング |
エージェントセットアップでは、Muse Glimmerが推論エンジンとして機能し、周囲の足場(Scaffold)がツール実行、会話状態、権限、停止条件を管理します。足場はタスクと利用可能なツールをモデルに送信し、選択されたアクションを実行し、観察結果を返し、ワークフローが完了するまで継続します。
プライベートコーディングエージェント
- ローカルソースコード分析
- 外部APIにデータを送信しない
- リポジトリQ&Aおよびリファクタリング
- 自動化されたテストと修正のループ
ツール使用アシスタント
- 構造化されたアクションのための関数呼び出し
- ファイル読み取り/書き込み操作
- ターミナルコマンド実行
- テストランナー統合
自律開発者
- マルチステップタスク完了
- 機能を計画し実装する
- エラーを検査し修正する
- リポジトリレベルの変更を処理する
コーディングワークフローアプリケーション
| ワークフロー | 入力 | モデルアクション | 出力 |
|---|---|---|---|
| バグ修正 | エラーメッセージ + ソースコード | 根本原因を診断 | 説明付きの修正コード |
| 機能実装 | 仕様 + 既存のコードベース | 変更を計画し記述する | マルチファイル実装 |
| コードレビュー | プルリクエスト差分 | ロジックとスタイルを分析 | レビューコメントと提案 |
| テスト生成 | ソースファイル | テストケースを生成 | カバレッジ付きテストスイート |
| リファクタリング | レガシーコード | 改善領域を特定 | 現代化されたコード構造 |
ビジョンとマルチモーダル機能
Muse Glimmerは、言語処理と並んで視覚理解を可能にする専用の知覚エンコーダーを統合しています。このマルチモーダル機能により、モデルはテキストと画像を交互に処理できるため、視覚情報を含むコーディングやエージェントワークフローにおいて特に有用です。
マルチモーダル使用ケース
| 使用ケース | 入力タイプ | ワークフロー統合 |
|---|---|---|
| スクリーンショット理解 | アプリケーションのスクリーンショット | UIデバッグ、レイアウト分析 |
| チャート解釈 | チャートとグラフ | データ抽出、トレンド分析 |
| ドキュメント理解 | ドキュメント画像 | テキストと画像が混在した推論 |
| 視覚的検証 | エージェントループ内のUIスクリーンショット | スクリーンショット駆動開発 |
| 図解分析 | アーキテクチャ図 | システム設計推論 |
視覚入力は、ローカルソフトウェアエージェントのもう一つのコンテキストソースとして機能できます。ワークフローでは、次のアクションを計画する際に、コード、ターミナル出力、書面による指示、スクリーンショットを同時に組み合わせることができます。これは、モデルがコードとレンダリングされたインターフェースの両方を確認する必要があるUIデバッグに特に役立ちます。
知覚エンコーダーは、視覚的特徴を言語モデルの表現と融合させる前に、画像を独立して処理します。このアーキテクチャにより、Muse Glimmerはテキスト処理品質を犠牲にすることなく、視覚コンテンツについて推論することができます。
ベンチマークとパフォーマンス
Muse Glimmerは、エージェントタスク完了、コーディング、ツール使用、持続的なマルチステップワークフローなど、処理するように設計されたワークロード全体で評価されます。パフォーマンスは、モデルの精度、メモリ帯域幅、アクセラレータハードウェアに基づいて大きく異なります。
ベンチマークカテゴリ
| ワークロード | 測定内容 | 重要な理由 |
|---|---|---|
| エージェントタスク完了 | マルチステップ実行の成功率 | モデルが自律ワークフローを維持できるかどうかを判断 |
| コーディング (SWE-Bench) | コード生成とソフトウェア推論 | 開発者生産性への直接的な関連性 |
| ツール使用 (MCP Atlas) | 構造化されたアクション選択 | シェル、ファイル、API相互作用を可能にする |
| 長時間実行ワークフロー | 反復間でのタスク永続性 | 複雑なマルチファイルタスクに必須 |
| 失敗回復 | エラー後のエージェント堅牢性 | ワークフロー放棄率の低減 |
| ローカル推論スループット | ローカルハードウェアでの秒速トークン数 | インタラクティブな応答性を決定 |
| メモリ効率 | 精度別メモリフットプリント | より小さなハードウェアへの展開を可能にする |
公式テストによると、DFlashを使用したRTX 5090の平均スループットは約秒速233.4トークンです。4-bit量子化GGUFを実行する24GB VRAMのコンシューマーGPUは、コーディングアシスタンスやエージェントワークフローに適した機能的なインタラクティブ速度が期待できます。
ハードウェア別推論速度
| ハードウェア | フォーマット | 想定速度 | 実用的な用途 |
|---|---|---|---|
| RTX 5090 + DFlash | DFlash Drafter | ~233 tok/s 平均 | 最大パフォーマンスのエージェントワークフロー |
| RTX 4090 (24GB) | 4-bit GGUF | 高速インタラクティブ | スムーズなコーディングアシスタンス |
| RTX 3090 (24GB) | 4-bit GGUF | 中程度のインタラクティブ | 機能的なエージェントワークフロー |
| AMD Radeon GPU | 量子化GGUF | ハードウェア依存 | GPUアクセラレーション対応ローカル推論 |
| AMD Ryzen AI Max | 量子化 | ユニファイドメモリの利点 | コンパクトワークステーション展開 |
| CPUのみ | 低精度GGUF | 遅い | テストおよび互換性のみ |
FAQ
Q: Muse Glimmer 30Bは何のために設計されていますか?
Muse Glimmer 30Bは、ローカルのエージェントコーディング、ツール呼び出し、ビジョン理解、長コンテキスト推論のために設計されています。クラウドAPIを必要とせずコンシューマーグレードのハードウェアで実行できるため、プライベートな開発者アシスタントや自律コーディングエージェントに適しています。
Q: Muse Glimmerをローカルで実行するには、どのくらいのVRAMが必要ですか?
VRAM要件はモデルフォーマットによって異なります。4-bit量子化GGUFビルドは24GB VRAMをターゲットとしていますが、高精度フォーマットは32GBまたは64GBが推奨されます。BF16オリジナルはウェイトだけで約60GBが必要です。Metaの公式ターゲット層は24GB、32GB、64GBのVRAM構成です。
Q: Muse Glimmerを商用アプリケーションで使用できますか?
はい。Muse GlimmerはApache 2.0ライセンスでリリースされており、商用利用、変更、再配布が許可されています。開発者は、ライセンスの通知および帰属要件に従いつつ、モデル上に構築された製品を構築および販売できます。
Q: Muse Glimmerと互換性のある推論フレームワークは何ですか?
Muse Glimmerは、Transformers、vLLM、SGLang、Dockerベースの展開、llama.cpp、Ollama、LM Studioと互換性があります。公式Hugging Faceリポジトリでは、異なる展開ターゲット向けにBF16ウェイト、GGUFファイル、ExecuTorchビルド、DFlash Drafter variantsが提供されています。
Q: Muse Glimmerは画像入力をサポートしていますか?
はい。Muse Glimmerには、テキストと並んで視覚入力を処理する専用の知覚エンコーダーが含まれています。スクリーンショット、チャート、図、ドキュメント画像を理解できるため、マルチモーダルコーディングやエージェントワークフローに役立ちます。
入門リソース
- Meta Developer Model Page: developer.meta.com/ai/models/muse-glimmer
- Hugging Face Model: huggingface.co/meta-models/Muse-Glimmer-30B
- Model Collection (GGUF, ExecuTorch, DFlash): huggingface.co/collections/meta-models/muse-glimmer
- Community Discussions: Hugging Face Discussions
セットアップ後の次のステップ:
- コミュニティトラブルシューティングのためにHugging Face Discussionsに参加する
- 最適なバランスを見つけるために異なる量子化レベルを試す
- 開発環境からのスクリーンショットでマルチモーダル入力をテストする
- ファイル操作用の関数呼び出しでシンプルなエージェントループを構築する
- より長いワークフローの容量を計画するためにローカル推論スループットを測定する