Muse Glimmer ローカルセットアップ: ステップバイステップのインストールガイド - インストール

Muse Glimmer ローカルセットアップ: ステップバイステップのインストールガイド

vLLMを使用してMuse Glimmer 30Bをローカルで実行する方法を学びましょう。エージェントワークフロー向けのステップバイステップのセットアップ、ハードウェア要件、最適化のヒントを紹介します。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmerのローカルセットアップには、スムーズな動作のために約24 GBのVRAMが必要です
  • Apache 2.0ライセンスにより、制限なく完全な商用利用が可能です
  • vLLMが推奨される、本番環境向けの推論用サービングフレームワークです
  • D-flashスペキュラティブデコーディングは、最大3倍の高速なトークン生成を実現します
  • 128kのコンテキストウィンドウが、複雑な複数ステップのエージェントワークフローをサポートします

Muse Glimmer 30Bのアーキテクチャを理解する

Muse Glimmer 30Bは、より大きなMuse Sparkアーキテクチャから蒸留されたオープンウェイトのエージェントモデルです。Metaはこのモデルを、完全にローカルハードウェア上で実行される自律型エージェント向けに特別に設計し、複数ステップの推論、正確なツール呼び出し、障害回復メカニズムを備えています。

動画のハイライト:

  • 専用の知覚エンコーダを備えたMuse Sparkからの蒸留
  • マルチモーダルモデルとしてテキストと画像の両方の入力を処理
  • ローカルデプロイメントのために約24 GBのVRAMに収まる
  • 完全なBF16ウェイトと共にApache 2.0でリリース
  • ビジョンエンコーダとD-flashドラフタコンポーネントを含む

このモデルは、テキストと共に視覚データを処理する専用の知覚エンコーダを備えており、チャートの読み取り、UIの理解、ドキュメント分析を必要とするタスクに適しています。D-flashスペキュラティブデコーディングシステムは、小さなコンパニオンモデルを使用してトークンブロック全体を予測し、メインモデルがそれを1パスで検証します。

アーキテクチャの洞察

D-flashドラフタこそが、ローカルエージェントを実用的にするものです。一度に1つのトークンを書き込む代わりに、小さなコンパニオンモデルが先のトークンブロックを推測し、メインモデルがそれを1パスで検証します。出力品質を変更することなく、スループットが大幅に向上します。

コアモデルの仕様

コンポーネント詳細
パラメータ数300億
コンテキストウィンドウ128,000トークン
VRAM要件~24 GB(量子化)、~77 GB(フル)
ライセンスApache 2.0
ウェイト形式BF16、量子化バリアントあり
モダリティマルチモーダル(テキスト + 画像)

ドメイン別のベンチマークの強み

ドメインMuse GlimmerのパフォーマンスQuen 3.6 27Bとの比較
MCPツールオーケストレーション強力な優位性中程度
ディープサーチ強力な優位性中程度
バンキングワークフロー強力な優位性中程度
ロングコンテキストリコール強力な優位性中程度
コンピュータ使用 / ターミナル中程度強力な優位性
一般的なSWE-bench中程度強力な優位性
プロンプトインジェクション耐性中程度中程度

ハードウェア要件と前提条件

Muse Glimmerをローカルで実行するには、本格的なハードウェアが必要です。NVIDIA A100 80 GBで完全なKVキャッシュを使用してサービングする場合、モデルは約77 GBのVRAMを消費しますが、量子化ビルドははるかに小さなフットプリントに収めることができます。

ハードウェアの警告

完全なBF16推論には大量のVRAMが必要です。24 GBのコンシューマーGPUで実行している場合は、量子化ビルド(GGUFまたはAWQ)を使用し、KVキャッシュサイズを削減してください。不十分なハードウェアでフル精度の推論を試みると、メモリ不足(OOM)エラーが発生します。

推奨されるハードウェア階層

階層GPUVRAM期待されるパフォーマンス
エンタープライズNVIDIA A100 80 GB80 GBフル精度、最大スループット
ワークステーションRTX 509024-32 GB量子化、D-flashで約3倍の高速化
コンシューマーRTX 409024 GB量子化、削減されたKVキャッシュ
Apple SiliconM5 Ultra64 GB統合小さいが実在するD-flashの効果

最小セットアップ

  • 24 GB VRAM(量子化)
  • Ubuntu 22.04以降
  • CUDA 12.0+
  • Python 3.10+
  • vLLMフレームワーク

推奨セットアップ

  • 48+ GB VRAM(混合精度)
  • Ubuntu 22.04 LTS
  • CUDA 12.2+
  • GPUサポートを備えたDocker
  • D-flashが有効なvLLM

エンタープライズセットアップ

  • 80 GB VRAM(フルBF16)
  • DGXまたは同等のもの
  • CUDA 12.2+
  • Kubernetesオーケストレーション
  • 完全なKVキャッシュ割り当て
GPUレンタルオプション

ローカルハードウェアをお持ちでない場合、クラウドGPUプロバイダーは競争力のある価格でA100およびH100インスタンスを提供しています。Range GPUsなどのプロバイダーの割引コードを探して、開発およびテストのコンピューティングコストを最大50%削減しましょう。

ステップバイステップのMuse Glimmerローカルセットアップ

インストールプロセスでは、サービングフレームワークとしてvLLMを使用します。このガイドは、NVIDIA GPUとCUDAツールキットがすでにインストールされているUbuntu環境を想定しています。

1

vLLMフレームワークのインストール

pipまたはconda経由でvLLMをインストールします。CUDAのバージョンがvLLMのビルドと一致していることを確認してください。最新の安定版リリースを取得するにはpip install vllmを実行します。依存関係の競合が存在しないことを確認するために、vllm --versionでインストールを検証します。

2

モデルウェイトのダウンロード

Hugging FaceからMuse Glimmer 30Bのウェイトをプルします。リポジトリには、完全なBF16ウェイト、量子化ビルド、ビジョンエンコーダ、およびD-flashドラフタが含まれています。huggingface-cli downloadを使用して、モデルをローカルストレージにフェッチします。

3

サービングパラメータの構成

OpenAI互換のvLLMサーバーを起動します。GPUの数に基づいてテンソル並列サイズを設定します。80 GBのVRAMを備えたシステムではGPUメモリ使用率を0.90に設定するか、より小さなカードの場合は0.85に下げます。スペキュラティブデコーディングのためにD-flashドラフタフラグを有効にします。

4

モデル読み込みの検証

ウェイトが正常に読み込まれたかどうか、ターミナル出力を監視します。nvidia-smiを使用してVRAM消費量を確認します。A100で完全なKVキャッシュを使用すると、モデルは約77 GBを占有します。推論が機能していることを確認するために、curl経由でローカルエンドポイントにテストプロンプトを送信します。

5

KVキャッシュの最適化

VRAMが厳しい場合は、KVキャッシュサイズを削減します。これにより、同時リクエストの最大数が犠牲になりますが、より小さなGPUでモデルを実行できるようになります。--gpu-memory-utilizationおよび--max-model-lenフラグを試して、適切なバランスを見つけます。

セットアップ完了

vLLMサーバーが実行されると、ローカルエンドポイントはOpenAI APIクライアントと互換性があります。エージェントフレームワーク、コーディングアシスタント、またはカスタムアプリケーションをhttp://localhost:8000/v1に向けて、Muse Glimmerの使用を開始します。

vLLM起動設定リファレンス

パラメータフル精度量子化(24 GB)
gpu-memory-utilization0.900.85
max-model-len13107265536
tensor-parallel-size11
quantizationなしawq / gptq
enable-flash-drafterTrueTrue
KVキャッシュ割合フル削減

D-Flashスペキュラティブデコーディングの最適化

D-flashスペキュラティブデコーディングシステムは、ローカルのエージェントワークフローにとって重要な機能です。従来の自己回帰生成は一度に1つのトークンを書き込むため、エージェントが複数の推論ステップを考えてツール呼び出しを発行する際にボトルネックになります。

D-Flashの仕組み

ステージプロセス利点
ドラフト小さなコンパニオンモデルがトークンブロックを予測並列予測
検証メインモデルがブロック全体を1パスで検証出力品質を維持
受け入れ正しいトークンは保持され、エラーは修正される品質低下なし
スループットフォワードパスあたりの複数トークンRTX 5090で最大3倍
D-Flashのパフォーマンスに関する注意

高速化の度合いは、プロンプトの複雑さに基づいて大きく異なります。予測可能なテキストはうまく推測されますが、珍しいテキストや非常に創造的なテキストは受け入れ率を下げます。見出しの「3倍」という乗数は、Metaのリファレンスハードウェアでのベストケースとして扱い、保証されたベースラインとは見なさないでください。

Apple Siliconでは、効果は小さくなりますが、それでも測定可能です。M5はスペキュラティブデコーディングのスループットでM4を上回っており、これはMacワークステーションでローカルエージェントを実行する開発者にとって重要です。

ベストケースのシナリオ

  • 構造化されたコード生成
  • バンキングワークフローのチェーン
  • 予測可能なフォーマットでのツール呼び出し
  • ロングコンテキストリコールタスク
  • 多言語の構造化された出力

効果が低下するケース

  • クリエイティブライティング
  • 非常に珍しいトークンシーケンス
  • 低リソース言語の生成
  • 斬新な問題解決
  • 敵対的プロンプトへの応答

パフォーマンステストとユースケース

Muse Glimmerは、すべてのベンチマークで広範な優位性を示すというよりも、明確な専門性を示しています。それがどこで優れているかを理解することで、ワークロードに適切なモデルを選択するのに役立ちます。

モデルのポジショニング

Muse Glimmerは、総合的なトップウォナーというよりも、エージェント作業に鋭い専門性を持つモデルです。デスクトップ自動化や重いコーディングの場合、Quen 3.6 27Bは依然として十分に競争力があり、それらの特定のユースケースではより良い選択かもしれません。

テストされた機能の結果

テストカテゴリ入力の複雑さ結果の品質ノート
ビジョン + コード生成密集した技術画像からWebアプリへ強い7つのレスポンシブタブ、正しい数字、依存関係なし
複数ステップのバンキング推論6段階のキャリートレードチェーン優秀丸め規則のエッジケースを事前に捕捉
多言語生成78言語、構造化された祝福非常に良い一部の直訳、ちんぷんかんぷんを拒否
MCPツールオーケストレーションマルチツールエージェントワークフロー強いライバルに対する説得力のある優位性
コンピュータ使用 / ターミナルデスクトップ自動化タスク中程度このドメインではQuenが上回る

強みと制限のマトリックス

側面評価説明
エージェントツール呼び出し★★★★★MCPオーケストレーションとディープサーチのために構築
バンキング / 金融ロジック★★★★★複雑な複数ステップの金融推論を処理
ビジョン理解★★★★☆強力なチャートおよびドキュメント読み取り機能
多言語サポート★★★★☆78言語(品質にばらつきあり)
デスクトップ自動化★★★☆☆ここではQuen 3.6が優位
一般的なコーディング(SWE-bench)★★★☆☆有能だがリーディングではない
プロンプトインジェクション防御★★★☆☆中間的位置、ローカルツールアクセスにおいて重要
セキュリティに関する考慮事項

モデルを直接ツールアクセスを伴ってローカルで実行する場合、プロンプトインジェクション耐性は通常よりも重要になります。Muse Glimmerはこのベンチマークで中間に位置しています。自律型エージェントにファイルシステムまたはネットワークアクセスを許可する前に、脅威モデルを慎重に評価してください。

デプロイメントチェックリストとFAQ

実際のワークフローにエージェントをデプロイする前に、このチェックリストを使用して、Muse Glimmerのローカルセットアップが本番環境に対応していることを確認してください。

デプロイ前の検証:

  • vLLMサーバーが実行され、テストプロンプトに応答している
  • VRAM消費量が予想範囲内にある
  • D-flashスペキュラティブデコーディングが有効化され、検証されている
  • ビジョンエンコーダが画像を正しく処理している
  • 同時負荷に合わせてKVキャッシュが適切にサイズ設定されている
  • 脅威モデルに対してプロンプトインジェクション防御が評価されている
  • エージェントフレームワークからローカルエンドポイントにアクセスできる
本番環境の準備完了

すべてのチェックリスト項目がパスしたら、Muse Glimmerインスタンスは自律型エージェントワークフローに対応します。負荷下での信頼性を検証するために、複雑な複数ステップのチェーンをデプロイする前に、簡単なツール呼び出しタスクから始めてください。

Q: Muse GlimmerのローカルセットアップにはどれくらいのVRAMが必要ですか?

完全なBF16推論には、A100で完全なKVキャッシュを使用した場合、約77 GBのVRAMが必要です。ただし、量子化ビルドは約24 GBのVRAMに収めることができます。KVキャッシュサイズを下げることで消費量をさらに削減できますが、これは同時リクエスト容量を犠牲にします。

Q: D-flashスペキュラティブデコーディングとは何ですか?また、有効にすべきですか?

D-flashは小さなコンパニオンモデルを使用してトークンブロック全体を先読み予測し、メインモデルがそれを1パスで検証します。RTX 5090などのハードウェアで最大3倍のスループットを提供できます。予測可能なトークンパターンを持つエージェントワークロードに対して有効にしますが、非常に創造的または珍しいテキストでは効果の低下が予想されます。

Q: Muse GlimmerはすべてのタスクにおいてQuen 3.6 27Bより優れていますか?

いいえ。Muse Glimmerはエージェント作業、MCPツールオーケストレーション、ディープサーチ、バンキングワークフロー、およびロングコンテキストリコールにおいて圧倒的です。ただし、Quen 3.6 27Bはコンピュータ使用、ターミナル作業、および一般的なSWE-benchタスクにおいて上回ります。主なユースケースに基づいて選択してください。

Q: Muse Glimmerを商用アプリケーションに使用できますか?

はい。MetaはApache 2.0ライセンスの下でMuse Glimmer 30Bをリリースし、これにより完全な商用利用が許可されています。このリリースには、完全なBF16ウェイト、量子化ビルド、ビジョンエンコーダ、およびD-flashドラフタが含まれており、使用制限はありません。