Muse Glimmer Apache 2.0: セットアップガイドとローカルエージェントのコツ - ガイド

Muse Glimmer Apache 2.0: セットアップガイドとローカルエージェントのコツ

ローカルAIエージェント向けにApache 2.0でMuse Glimmerをデプロイする方法を学びましょう。スペック、ベンチマーク、量子化、ステップバイステップのセットアップを探求します。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmer Apache 2.0: Meta Super Intelligence Labsによる300億パラメータのオープンウェイトエージェントモデル
  • ローカルデプロイ: 4-bit量子化により、20GB未満のコンシューマーハードウェアで実行可能
  • エージェントファースト設計: マルチステップタスク、ツール呼び出し、エラー回復に特化してトレーニング
  • マルチモーダル入力: 画像理解のための18億パラメータのビジョンエンコーダーを内蔵
  • クリーンなライセンス: Apache 2.0がカスタム法的制限なしの商用利用を許可

Muse Glimmer Apache 2.0: コアスペック

Muse Glimmerは、Meta Super Intelligence Labsによって真に寛容なApache 2.0ライセンスの下でリリースされた300億パラメータのオープンウェイトモデルです。制限的なコミュニティライセンスを持つモデルとは異なり、Muse Glimmerは世界中の主要なインフラストラクチャープロジェクトを支えているのと同じライセンスで提供されています。このモデルは、データセンターインフラを必要とするのではなく、MacやシングルGPUのPCで実行されることを目的とした、常時稼働のローカルエージェントワークフローをターゲットにしています。

動画のハイライト:

  • 量子化により20GB未満で実行される30Bパラメータモデル
  • カスタム利用制限のないApache 2.0ライセンス
  • 実際のコードベースに対応する131Kトークンのコンテキストウィンドウ
  • 最大3.1倍の高速な生成を実現する投機的デコーディング

アーキテクチャは、密なコーサルトランスフォーマーに接続されたViT-G14ビジョンエンコーダーを組み合わせています。総パラメータ数は296億に達し、知識のカットオフ日は2026年1月4日となっています。このモデルは100以上の言語をサポートし、専用の知覚エンコーダーを通じてマルチモーダル入力を受け入れます。

アーキテクチャに関する注意

ビジョンエンコーダーは個別の18億パラメータのモジュールとして動作するため、画像理解が不要な場合は、テキストのみの推論でビジョン処理をバイパスし、速度を向上させることができます。

技術仕様表

仕様備考
総パラメータ数29.6Bビジョンエンコーダーを含む
ビジョンエンコーダー1.8B (ViT-G14)画像/ドキュメント入力を処理
コンテキストウィンドウ131,000+ トークン長いエージェントの軌跡をサポート
言語100以上多言語サポート
知識のカットオフ2026年1月4日トレーニングデータの境界
フル精度サイズ~55 GB非圧縮ウェイト
量子化サイズ (4-bit)20GB未満Kquant動的スキーム
ライセンスApache 2.0商用利用が許可

ベンチマークパフォーマンスと評価

Muse Glimmerの評価プロファイルは、生のチャットボットのパフォーマンスではなく、エージェントの能力をターゲットとしています。このモデルは、数学、コーディング、マルチステップのエージェントベンチマーク全体で強力な数値を記録し、他のプロバイダーの27〜31Bの範囲のモデルと直接競合します。

ベンチマークの背景

Metaの比較対象には、Gemma 4 31BやQwen 3.6 27Bが含まれています。Muse Glimmerはエージェントスイートでリードしており、一部の一般知識タスクでは勝敗が混在しています。

ベンチマーク結果表

ベンチマークスコアカテゴリ
MATH (AMC 2020)94.7数学
SWE-bench Verified76.0コーディング/エージェント
MCP Atlas75.5エージェント/ツール使用
Deep Search QA74.6エージェント/検索
SWE-bench Pro51.2コーディング (難問)
Gaia 243.3マルチステップアシスタント

エージェントの列が最大の差別化要因を表しています。ベンチマークの汚染に強く難しいバリアントであるSWE-bench Proは51.2を記録し、このサイズのモデルがローカルで実行されるとしては注目すべきです。過酷なマルチステップアシスタントベンチマークと形容されるGaia 2は、43.3に留まっています。

競合比較表

モデルサイズエージェントフォーカスライセンスローカルデプロイ
Muse Glimmer29.6B特化型Apache 2.020GB未満
Gemma 431B汎用カスタム様々
Qwen 3.627B混合カスタム様々
現実的な期待

クラウドのフロンティアモデルは、依然として生の能力の上限で勝っています。30Bのローカルモデルは、大規模なホスト型システムの推論能力を上回るようには設計されていません。価値提案は、高頻度で長時間実行されるプライバシーに敏感なエージェントワークロードをターゲットにしています。

蒸留トレーニングパイプライン

Muse Glimmerはスクラッチからトレーニングされたモデルではありません。Metaのより大きなティーチャーモデルであるMuse Sparkの圧縮版です。蒸留プロセスは3つの異なるフェーズにまたがり、それぞれが特定の能力の次元をターゲットにしています。

蒸留戦略

トレーニングの哲学は明確な原則に従っています。ティーチャーの品質を入れ、コンシューマーハードウェアで動かすことです。各フェーズは、ローカルエージェントのデプロイに向けて学生モデルを段階的に形成します。

トレーニングフェーズ表

フェーズフォーカス手法結果
フェーズ1: 事前トレーニング基盤ロジット蒸留ティーチャーの出力分布に一致
フェーズ2: ミッドトレーニングコンテキスト/エージェントロングコンテキストデータ推論の軌跡、マルチステップ作業
フェーズ3: ポストトレーニング特化SFT + RLドメイン全体でのポリシー蒸留

フェーズ1: 基盤

  • Muse Sparkからのロジット蒸留
  • 学生モデルが完全な出力分布を学習
  • ティーチャーと同様のデータミックス
  • コアな知識ベースを構築

フェーズ2: エージェントトレーニング

  • 拡張コンテキストトレーニング
  • エージェント中心のデータ拡充
  • 推論軌跡への露出
  • マルチステップワークフローの形成

フェーズ3: 特化

  • RLと組み合わせた教師ありファインチューニング
  • ポリシー蒸留の適用
  • 推論、コーディング、エージェントをターゲット
  • 最終的な能力の調整

ローカルデプロイメントセットアップガイド

Muse Glimmerをローカルにデプロイするには、ハードウェアとユースケースに合った適切なパッケージ形式を選択する必要があります。Metaは3つのリポジトリオプションを提供しており、それぞれが異なるデプロイメントシナリオをターゲットにしています。

リポジトリを選択

ほとんどのユーザーは、コンシューマーハードウェアに対応した事前量子化ビルドを含むGGUFリポジトリから始めるべきです。ファインチューニングやエンタープライズGPUサービングのためにフル精度が必要な場合のみ、ベースのsafetensorsリポジトリを使用してください。

リポジトリ選択表

リポジトリ形式最適な用途ターゲットハードウェア
BaseSafetensors (フル精度)ファインチューニング、エンタープライズサービングマルチGPUサーバー
GGUF事前量子化ビルドローカル推論、コンシューマー利用シングルGPU、Mac
Executor PTEモバイルランタイム組み込み/エッジデプロイメントスマートフォン、エッジデバイス
1

ランタイムを選択

Alma(最短のパス)、llama.cpp、LM Studio、Executor、MLX、vLLM、またはSGLangから選択します。Almaはコマンド1つでのセットアップを提供します。vLLMとSGLangは、本番サービングに向けたOpenAI互換のエンドポイントを提供します。

2

量子化モデルをダウンロード

GGUFリポジトリ、具体的には4-bit Kquant動的バリアントをプルします。これにより、エージェントタスクの品質をほとんどまたは全く低下させることなく、ウェイトが20GB未満に圧縮されます。

3

ハードウェア要件を確認

システムに合計24〜32GBのメモリがあることを確認してください。実行エンベロープにはKVキャッシュ、エンコーダー、およびドラフトモデルが含まれており、すべてハイエンドコンシューマーマシンの容量内に収まります。

4

投機的デコーディングを有効化

バンドルされている投機的デコーディングドラフターであるDL Flashを有効化します。複数のトークンを同時に提案し、メインモデルに1パスで検証させることで、大幅な速度向上を実現します。

5

エージェントスタックを接続

実行中のエンドポイントに既存のオーケストレーションフレームワークを向けます。このモデルは、OpenClawスタイルのパターンとMCPツールエコシステムを直接サポートしています。

DL Flashによる速度向上

投機的デコーディングは測定可能な加速をもたらします。RTX 5090で3.1倍、M5 Max MacBookで1.8倍、M4 Maxで1.5倍の生成速度向上です。これにより、エージェントの応答性がキューのような遅延から、リアルタイムのツールパフォーマンスへと変化します。

機能とユースケース

Muse Glimmerは、ローカルのエージェントデプロイメントで通常壊れてしまう特定の機能をターゲットにしています。チャットボットにツールを後付けするのではなく、トレーニングはエンドツーエンドのタスク完了に明示的に焦点を当てています。

エージェントファースト設計

このリリースの特徴は、コンシューマーハードウェア向けにサイズ設定されたモデルで、すべてのエージェント機能を同時にターゲットにし、それぞれの機能を証明する評価スイートを公開していることです。

機能マトリクス表

機能説明実用的な応用
関数呼び出し正確なスキーマ準拠信頼性の高いAPI統合
マルチステップ推論長いワークフローで維持複雑なタスクチェーン
障害回復エラーを診断して再試行自己修復エージェント
画像理解スクリーンショットやドキュメント視覚データ処理
推論労力ダイヤルリクエストごとの速度と品質適応型パフォーマンス
オーケストレーションサポート既存のスタックとの互換性ドロップイン統合

理想的なワークロード

  • リポジトリを監視するコードベースウォッチャー
  • メール管理のための受信トレイトリアージ
  • UI自動化のための画面理解
  • ホームオートメーションルーティン
  • ダッシュボード監視アラート

ハイブリッドアーキテクチャ

  • ローカルGlimmerが一定のバックグラウンドループを処理
  • 難しい5%の決定にはフロンティアAPI
  • ローカルトークンあたりの限界コストはゼロ
  • データがマシンから外部に出ない
  • 接続の切断が障害モードにならない
トークンあたりのコストの現実

フォルダを監視し、メールをトリアージし、ダッシュボードを監視する常時稼働のエージェントは、トークンあたりのAPI価格設定では経済的に非現実的です。ローカルデプロイは限界トークンコストを排除し、継続的なエージェント操作を実現可能にします。

デプロイメントチェックリストとFAQ

デプロイ前チェックリスト:

  • ターゲットマシンで24〜32GBの利用可能なRAM/VRAMを確認
  • Hugging FaceからGGUF 4-bit Kquant動的バリアントをダウンロード
  • Alma、llama.cpp、またはLM Studioランタイムをインストール
  • 速度向上のためにDL Flash投機的デコーディングを有効化
  • ツールスキーマに対して関数呼び出しをテスト
  • MCPエコシステムとの互換性を検証
  • ワークロードに合わせて推論労力ダイヤルを設定
クラウドでの可用性

Muse Glimmerは、ローカルインフラにコミットする前にテストするために、Together、Fireworks、OpenRouterなどのクラウドプラットフォームでも利用可能です。Torch Titanがファインチューニングワークフローを処理します。

ランタイムサポート表

ランタイムプラットフォームユースケース難易度
Almaクロスプラットフォームクイックスタート、コマンド1つ初級
llama.cppクロスプラットフォーム軽量なローカル推論中級
LM StudioデスクトップGUIユーザーフレンドリーなローカルサービング初級
MLXApple SiliconMacのネイティブ最適化中級
vLLMLinux/サーバー本番OpenAI互換API上級
SGLangLinux/サーバー高パフォーマンスサービング上級
Executorモバイル/エッジ組み込みデプロイメント上級

Q: Muse Glimmer Apache 2.0は、他のオープンウェイトモデルと何が違うのですか?

Muse Glimmerは、エージェントファーストのトレーニング、マルチモーダル入力、131Kのコンテキストウィンドウ、そしてクリーンなApache 2.0ライセンスを30Bパラメータのパッケージに組み合わせています。ほとんどのオープンウェイトモデルは、使用制限のあるカスタムコミュニティライセンスを使用しています。Muse Glimmerは、主要なインフラストラクチャーソフトウェアと同じ寛容なライセンスの下で提供されており、カスタム条項の法的レビューなしで商用デプロイメントが可能です。

Q: Muse Glimmerはコンシューマーハードウェアだけで完全に実行できますか?

はい。4-bit Kquant動的量子化スキームにより、モデルのウェイトは20GB未満に圧縮されます。KVキャッシュ、エンコーダー、ドラフトモデルを含む完全な実行エンベロープは、ハイエンドのコンシューマーGPUやApple Silicon Macで利用可能な24〜32GBのメモリ範囲内に収まります。

Q: 投機的デコーディングはパフォーマンスをどのように向上させますか?

DL Flashは、モデルにバンドルされている軽量な投機的デコーディングドラフターです。複数のトークンを同時に提案し、メインモデルに1パスで検証させます。これにより、RTX 5090で3.1倍、M5 Max MacBookで1.8倍、M4 Maxで1.5倍の生成速度向上が実現し、エージェントがキューに入れられているように感じるのではなく、応答性が高まります。

Q: どのエージェントフレームワークとツールエコシステムがサポートされていますか?

Muse Glimmerは、OpenClawスタイルのオーケストレーションパターンとMCPツールエコシステムを直接サポートしています。vLLMまたはSGLangを通じてサーブされる場合、OpenAI互換のエンドポイントを提供するため、既存のエージェントスタックを変更せずに統合できます。

Q: Muse Glimmerはクラウドのフロンティアモデルより優れていますか?

いいえ。クラウドのフロンティアモデルは、依然として生の能力の上限で勝っています。Muse Glimmerは異なるユースケースをターゲットにしています。それは、トークンあたりのAPI価格設定が非現実的な、高頻度で長時間実行され、プライバシーに敏感なエージェントワークロードです。推奨されるアーキテクチャはハイブリッドであり、ローカルのGlimmerが一定のバックグラウンド操作を処理し、複雑な決定についてのみフロンティアAPIにエスカレーションします。