Muse Glimmer: ローカル設定、仕様、およびパフォーマンスガイド - ハードウェア

Muse Glimmer: ローカル設定、仕様、およびパフォーマンスガイド

エージェントコーディング、ツール使用、ビジョンタスクのためにMuse Glimmer 30Bをローカルで実行する方法を学びます。GGUFフォーマット、ハードウェア要件、ベンチマークを比較します。

2026-08-11
muse glimmer Wikiチーム
クイックガイド
  • Muse Glimmerは、ローカルのエージェントワークフロー向けに設計されたMetaによる30Bパラメータのオープンウェイトモデルです。
  • Apache 2.0ライセンスにより、商用利用、変更、再配布が無制限に許可されます。
  • 131K以上のコンテキストウィンドウは、長時間のコーディングセッション、ドキュメント分析、マルチステップ推論をサポートします。
  • 量子化GGUFフォーマットにより、VRAM 24GB以下のコンシューマーハードウェアへの展開が可能になります。
  • マルチモーダル機能には、専用の知覚エンコーダーによるテキストと画像の処理が含まれます。

Muse Glimmer 30Bとは?

Muse Glimmerは、2026年8月10日にMeta Superintelligence Labsがリリースした300億パラメータのオープンウェイトAIモデルです。このモデルは、コンシューマーグレードのハードウェア上で、エージェントコーディング、ツール呼び出し、ビジョン理解、長コンテキスト推論をローカルに展開することを目的としています。クラウドホストAPIとは異なり、Muse Glimmerは完全に独自のマシンで実行されるため、ソースコードとプロジェクトデータはプライベートのまま維持されます。

公式モデルは、Meta Developer portalおよびHugging Faceを通じて配布されており、BF16ウェイト、GGUF量子化ビルド、ExecuTorch、DFlash Drafter variantsなど、複数のフォーマットが提供されています。

コアアーキテクチャ

Muse Glimmerには約29.6Bのパラメータがあり、テキストと画像の入力をサポートし、131,072トークンを超えるコンテキスト長を処理し、Apache 2.0ライセンスで提供されています。このモデルは100以上の言語でトレーニングされており、多言語開発ワークフローに適しています。

モデル仕様概要

仕様メモ
パラメータ~29.6B30Bクラスモデル
コンテキストウィンドウ131,072+ トークン長いドキュメントとコードベースをサポート
入力モダリティテキスト + 画像ビジョン用の専用知覚エンコーダー
ライセンスApache 2.0商用利用が可能な寛容なライセンス
トレーニング言語100以上多言語サポート
主な使用ケースコーディング、エージェント、ビジョンローカルファースト展開

Hugging Faceのモデルコレクションには、異なる展開ターゲット向けの特殊なバリアントも含まれており、開発者はハードウェアとユースケースに適したフォーマットを柔軟に選択できます。

モデルフォーマットとGGUF量子化

メモリ使用量、推論速度、出力品質のバランスを取るには、適切なモデルフォーマットを選択することが重要です。Muse Glimmerは、それぞれが異なるハードウェア構成と展開シナリオをターゲットにしたいくつかの公式フォーマットで利用できます。

利用可能なモデルフォーマット

フォーマットメモリ使用量速度品質推奨用途
BF16オリジナル最高(約60GB)ハードウェア依存最高の忠実度十分なVRAMを持つシステム
高精度GGUF高い中程度オリジナルに近い32GB以上のVRAMを持つワークステーション
バランス量子化GGUF中程度(約15-20GB)より高速な展開バランスの取れた品質一般的なローカルコーディングとエージェント
低精度GGUF最低最も実行しやすい品質のトレードオフが最大メモリが限られたコンシューマーハードウェア
ExecuTorch可変エッジ向けに最適化展開固有モバイルおよびエッジ推論
DFlash Drafter可変投機的デコードによる加速高速化を伴う高品質RTX 5090およびハイエンドNVIDIA GPU
メモリ計算

16-bit精度の30Bモデルでは、ランタイムのオーバーヘッドを除いて、ウェイトだけで約60GBが必要です。4-bit量子化バージョンでは、生のパラメータフットプリントは約15GBに削減されますが、メタデータ、KVキャッシュ、推論オーバーヘッドにより、実際のファイルサイズとランタイムメモリはこれより大きくなります。

BF16ウェイト

  • 最高品質の出力
  • 約60GB以上のメモリが必要
  • 研究と評価に最適
  • 完全な数値精度が維持される

GGUF量子化

  • ローカル使用向けのバランスの取れたパフォーマンス
  • 4-bitで15-20GBに収まる
  • llama.cppおよびOllamaと互換性あり
  • コンシューマーGPUに最適

DFlash Drafter

  • **投機的デコード(Speculative decoding)**による加速
  • RTX 5090でのテストで平均233.4 tok/sを記録
  • DrafterモデルとVerifierモデルを組み合わせる
  • ハイエンドハードウェアでの最大スループット

ハードウェア要件と展開

30Bモデルをローカルで実行するには、慎重なハードウェア計画が必要です。モデルのメモリフットプリントは、選択する精度と量子化レベルに大きく依存します。Metaは、Muse Glimmerをコンシューマーグレードの展開向けに最適化しており、公式ターゲット層は24GB、32GB、64GBのVRAM構成になっています。

ハードウェア展開層

ハードウェアクラスメモリモデル展開タイプ最適な用途
NVIDIA RTX 509032GB専用VRAMGPUアクセラレーション対応ローカルエージェントDFlashによる最大速度
NVIDIA RTX 409024GB専用VRAMGPUアクセラレーション推論ハイエンドコンシューマーコーディングエージェント
AMD Radeon GPU専用VRAM + システムRAMGPUアクセラレーション対応ローカル推論Radeonハードウェアを持つデスクトップユーザー
AMD Ryzen AI Max大きな共有ユニファイドメモリローカルアクセラレーション推論コンパクトAIワークステーション
高メモリPCシステムRAM + 一部GPUオフロード量子化ローカル推論RAMは十分だがVRAMが限られているユーザー
CPUのみのシステムシステムRAMのみCPU推論互換性テストのみ
パフォーマンスベンチマーク

NVIDIA RTX 5090とDFlash投機的デコードを組み合わせた公式テストでは、平均秒速233.4トークンを達成しました。これにより、Muse Glimmerはモデルが繰り返し出力を生成、評価、反復するインタラクティブなエージェントワークフローにおいて、実用的な速度を提供します。

VRAMターゲット層

VRAMターゲット推奨フォーマット期待されるエクスペリエンス
24GB4-bit量子化GGUF快適なインタラクティブコーディング
32GBバランスGGUF以上スムーズなマルチステップエージェントワークフロー
64GBBF16または高精度GGUF最高品質、長コンテキスト
16GB以下低精度GGUF機能するが品質のトレードオフあり

ローカルセットアップ手順

Muse Glimmerをローカルで実行するには、ランタイムの選択、適切なモデルフォーマットのダウンロード、推論環境の設定が含まれます。最も簡単な方法は、グラフィカルインターフェースのためにLM Studioを使用することですが、より詳細な制御を望む開発者は、Transformers、vLLM、SGLang、またはllama.cppを直接使用できます。

1

ローカルランタイムを選択する

最も設定が簡単なグラフィカルセットアップにはLM Studioを使用してください。推論スタックをより詳細に制御するには、公式Hugging Faceリポジトリからモデルウェイトを直接ダウンロードし、Transformers、vLLM、llama.cppなどのお好みのフレームワークと統合します。

2

適切なモデルフォーマットをダウンロードする

利用可能なメモリに基づいてフォーマットを選択します。24GB VRAM GPUの場合、4-bit量子化GGUFビルドを選択します。32GB以上のシステムの場合、バランスの取れたGGUFまたは高精度GGUFの方がより良い品質を提供します。公式GGUFコレクションからダウンロードしてください。

3

モデルを読み込み、設定する

推論アプリケーションでダウンロードしたモデルを開きます。十分なGPUまたはユニファイドメモリを割り当てます。利用可能な場合はハードウェアアクセラレーションを有効にします。プロンプトを送信する前に、モデルがメモリ不足エラーなしで読み込まれることを確認してください。

4

最初のプロンプトを送信する

コーディングや推論タスクに焦点を当てて開始します。例:「この関数をレビューし、バグを特定して、短い説明を含む修正版を返してください」。推論、コンテキスト処理、出力生成がすべて正しく機能することを確認するために、最初のプロンプトは小さく保ってください。

5

ツールを接続し、エージェントワークフローを構築する

基本的な推論が機能するようになったら、ファイルアクセス、ターミナル実行、構造化されたツール呼び出しを提供するエージェントフレームワークにMuse Glimmerを接続します。これにより、モデルはチャットインターフェースからマルチステップの自律コーディングアシスタントへと変身します。

フレームワーク互換性

Muse Glimmerは、Transformers、vLLM、SGLang、Dockerベースの展開、llama.cpp、Ollamaなど、主要なローカル推論フレームワークと互換性があります。展開ターゲットと既存のインフラに最も一致するフレームワークを選択してください。

ローカルセットアップ検証:

  • 利用可能なVRAMまたはシステムRAMが、選択したフォーマットの要件を満たしていることを確認する
  • 公式Hugging Faceリポジトリからモデルウェイトをダウンロードする
  • 推論ランタイムでモデルがメモリエラーなしで読み込まれることを検証する
  • 単純なコーディングプロンプトで基本的なテキスト生成をテストする
  • 画像とテキスト指示を一緒に提供してマルチモーダル入力を検証する
  • エージェントワークフローテストのために少なくとも1つの外部ツールを接続する

エージェント型AIとコーディング機能

Muse Glimmerは、モデルが複数のステップにわたって推論し、外部ツールを呼び出し、失敗から回復する必要があるエージェントワークロード専用に構築されています。単一ターンのチャットモデルとは異なり、エージェントアプリケーションは、モデルを計画、アクション実行、結果観察、反復のループ内に配置し、タスクが完了するまで繰り返します。

コアエージェント機能

機能説明実用的なアプリケーション
マルチステップ計画目標をより小さなアクションに分割リポジトリレベルのコード変更
関数呼び出し構造化されたツール引数を生成ファイル操作、テスト実行
ツール使用外部機能を要求シェルコマンド、検索、開発ツール
観察ループツールの結果を推論にフィードバックテストと修正のサイクル
失敗回復アクションが失敗したときにアプローチを変更ファイル欠如の処理、エラー修正
長時間実行ワークフロー多くの反復にわたってタスクを持続機能実装、マルチファイルリファクタリング
エージェントアーキテクチャ

エージェントセットアップでは、Muse Glimmerが推論エンジンとして機能し、周囲の足場(Scaffold)がツール実行、会話状態、権限、停止条件を管理します。足場はタスクと利用可能なツールをモデルに送信し、選択されたアクションを実行し、観察結果を返し、ワークフローが完了するまで継続します。

プライベートコーディングエージェント

  • ローカルソースコード分析
  • 外部APIにデータを送信しない
  • リポジトリQ&Aおよびリファクタリング
  • 自動化されたテストと修正のループ

ツール使用アシスタント

  • 構造化されたアクションのための関数呼び出し
  • ファイル読み取り/書き込み操作
  • ターミナルコマンド実行
  • テストランナー統合

自律開発者

  • マルチステップタスク完了
  • 機能を計画し実装する
  • エラーを検査し修正する
  • リポジトリレベルの変更を処理する

コーディングワークフローアプリケーション

ワークフロー入力モデルアクション出力
バグ修正エラーメッセージ + ソースコード根本原因を診断説明付きの修正コード
機能実装仕様 + 既存のコードベース変更を計画し記述するマルチファイル実装
コードレビュープルリクエスト差分ロジックとスタイルを分析レビューコメントと提案
テスト生成ソースファイルテストケースを生成カバレッジ付きテストスイート
リファクタリングレガシーコード改善領域を特定現代化されたコード構造

ビジョンとマルチモーダル機能

Muse Glimmerは、言語処理と並んで視覚理解を可能にする専用の知覚エンコーダーを統合しています。このマルチモーダル機能により、モデルはテキストと画像を交互に処理できるため、視覚情報を含むコーディングやエージェントワークフローにおいて特に有用です。

マルチモーダル使用ケース

使用ケース入力タイプワークフロー統合
スクリーンショット理解アプリケーションのスクリーンショットUIデバッグ、レイアウト分析
チャート解釈チャートとグラフデータ抽出、トレンド分析
ドキュメント理解ドキュメント画像テキストと画像が混在した推論
視覚的検証エージェントループ内のUIスクリーンショットスクリーンショット駆動開発
図解分析アーキテクチャ図システム設計推論
マルチモーダルエージェントワークフロー

視覚入力は、ローカルソフトウェアエージェントのもう一つのコンテキストソースとして機能できます。ワークフローでは、次のアクションを計画する際に、コード、ターミナル出力、書面による指示、スクリーンショットを同時に組み合わせることができます。これは、モデルがコードとレンダリングされたインターフェースの両方を確認する必要があるUIデバッグに特に役立ちます。

知覚エンコーダーは、視覚的特徴を言語モデルの表現と融合させる前に、画像を独立して処理します。このアーキテクチャにより、Muse Glimmerはテキスト処理品質を犠牲にすることなく、視覚コンテンツについて推論することができます。

ベンチマークとパフォーマンス

Muse Glimmerは、エージェントタスク完了、コーディング、ツール使用、持続的なマルチステップワークフローなど、処理するように設計されたワークロード全体で評価されます。パフォーマンスは、モデルの精度、メモリ帯域幅、アクセラレータハードウェアに基づいて大きく異なります。

ベンチマークカテゴリ

ワークロード測定内容重要な理由
エージェントタスク完了マルチステップ実行の成功率モデルが自律ワークフローを維持できるかどうかを判断
コーディング (SWE-Bench)コード生成とソフトウェア推論開発者生産性への直接的な関連性
ツール使用 (MCP Atlas)構造化されたアクション選択シェル、ファイル、API相互作用を可能にする
長時間実行ワークフロー反復間でのタスク永続性複雑なマルチファイルタスクに必須
失敗回復エラー後のエージェント堅牢性ワークフロー放棄率の低減
ローカル推論スループットローカルハードウェアでの秒速トークン数インタラクティブな応答性を決定
メモリ効率精度別メモリフットプリントより小さなハードウェアへの展開を可能にする
速度の参考ポイント

公式テストによると、DFlashを使用したRTX 5090の平均スループットは約秒速233.4トークンです。4-bit量子化GGUFを実行する24GB VRAMのコンシューマーGPUは、コーディングアシスタンスやエージェントワークフローに適した機能的なインタラクティブ速度が期待できます。

ハードウェア別推論速度

ハードウェアフォーマット想定速度実用的な用途
RTX 5090 + DFlashDFlash Drafter~233 tok/s 平均最大パフォーマンスのエージェントワークフロー
RTX 4090 (24GB)4-bit GGUF高速インタラクティブスムーズなコーディングアシスタンス
RTX 3090 (24GB)4-bit GGUF中程度のインタラクティブ機能的なエージェントワークフロー
AMD Radeon GPU量子化GGUFハードウェア依存GPUアクセラレーション対応ローカル推論
AMD Ryzen AI Max量子化ユニファイドメモリの利点コンパクトワークステーション展開
CPUのみ低精度GGUF遅いテストおよび互換性のみ

FAQ

Q: Muse Glimmer 30Bは何のために設計されていますか?

Muse Glimmer 30Bは、ローカルのエージェントコーディング、ツール呼び出し、ビジョン理解、長コンテキスト推論のために設計されています。クラウドAPIを必要とせずコンシューマーグレードのハードウェアで実行できるため、プライベートな開発者アシスタントや自律コーディングエージェントに適しています。

Q: Muse Glimmerをローカルで実行するには、どのくらいのVRAMが必要ですか?

VRAM要件はモデルフォーマットによって異なります。4-bit量子化GGUFビルドは24GB VRAMをターゲットとしていますが、高精度フォーマットは32GBまたは64GBが推奨されます。BF16オリジナルはウェイトだけで約60GBが必要です。Metaの公式ターゲット層は24GB、32GB、64GBのVRAM構成です。

Q: Muse Glimmerを商用アプリケーションで使用できますか?

はい。Muse GlimmerはApache 2.0ライセンスでリリースされており、商用利用、変更、再配布が許可されています。開発者は、ライセンスの通知および帰属要件に従いつつ、モデル上に構築された製品を構築および販売できます。

Q: Muse Glimmerと互換性のある推論フレームワークは何ですか?

Muse Glimmerは、Transformers、vLLM、SGLang、Dockerベースの展開、llama.cpp、Ollama、LM Studioと互換性があります。公式Hugging Faceリポジトリでは、異なる展開ターゲット向けにBF16ウェイト、GGUFファイル、ExecuTorchビルド、DFlash Drafter variantsが提供されています。

Q: Muse Glimmerは画像入力をサポートしていますか?

はい。Muse Glimmerには、テキストと並んで視覚入力を処理する専用の知覚エンコーダーが含まれています。スクリーンショット、チャート、図、ドキュメント画像を理解できるため、マルチモーダルコーディングやエージェントワークフローに役立ちます。

入門リソース

公式リンク

セットアップ後の次のステップ:

  • コミュニティトラブルシューティングのためにHugging Face Discussionsに参加する
  • 最適なバランスを見つけるために異なる量子化レベルを試す
  • 開発環境からのスクリーンショットでマルチモーダル入力をテストする
  • ファイル操作用の関数呼び出しでシンプルなエージェントループを構築する
  • より長いワークフローの容量を計画するためにローカル推論スループットを測定する