- Muse Glimmer Apache 2.0: Meta Super Intelligence Labsによる300億パラメータのオープンウェイトエージェントモデル
- ローカルデプロイ: 4-bit量子化により、20GB未満のコンシューマーハードウェアで実行可能
- エージェントファースト設計: マルチステップタスク、ツール呼び出し、エラー回復に特化してトレーニング
- マルチモーダル入力: 画像理解のための18億パラメータのビジョンエンコーダーを内蔵
- クリーンなライセンス: Apache 2.0がカスタム法的制限なしの商用利用を許可
Muse Glimmer Apache 2.0: コアスペック
Muse Glimmerは、Meta Super Intelligence Labsによって真に寛容なApache 2.0ライセンスの下でリリースされた300億パラメータのオープンウェイトモデルです。制限的なコミュニティライセンスを持つモデルとは異なり、Muse Glimmerは世界中の主要なインフラストラクチャープロジェクトを支えているのと同じライセンスで提供されています。このモデルは、データセンターインフラを必要とするのではなく、MacやシングルGPUのPCで実行されることを目的とした、常時稼働のローカルエージェントワークフローをターゲットにしています。
動画のハイライト:
- 量子化により20GB未満で実行される30Bパラメータモデル
- カスタム利用制限のないApache 2.0ライセンス
- 実際のコードベースに対応する131Kトークンのコンテキストウィンドウ
- 最大3.1倍の高速な生成を実現する投機的デコーディング
アーキテクチャは、密なコーサルトランスフォーマーに接続されたViT-G14ビジョンエンコーダーを組み合わせています。総パラメータ数は296億に達し、知識のカットオフ日は2026年1月4日となっています。このモデルは100以上の言語をサポートし、専用の知覚エンコーダーを通じてマルチモーダル入力を受け入れます。
ビジョンエンコーダーは個別の18億パラメータのモジュールとして動作するため、画像理解が不要な場合は、テキストのみの推論でビジョン処理をバイパスし、速度を向上させることができます。
技術仕様表
| 仕様 | 値 | 備考 |
|---|---|---|
| 総パラメータ数 | 29.6B | ビジョンエンコーダーを含む |
| ビジョンエンコーダー | 1.8B (ViT-G14) | 画像/ドキュメント入力を処理 |
| コンテキストウィンドウ | 131,000+ トークン | 長いエージェントの軌跡をサポート |
| 言語 | 100以上 | 多言語サポート |
| 知識のカットオフ | 2026年1月4日 | トレーニングデータの境界 |
| フル精度サイズ | ~55 GB | 非圧縮ウェイト |
| 量子化サイズ (4-bit) | 20GB未満 | Kquant動的スキーム |
| ライセンス | Apache 2.0 | 商用利用が許可 |
ベンチマークパフォーマンスと評価
Muse Glimmerの評価プロファイルは、生のチャットボットのパフォーマンスではなく、エージェントの能力をターゲットとしています。このモデルは、数学、コーディング、マルチステップのエージェントベンチマーク全体で強力な数値を記録し、他のプロバイダーの27〜31Bの範囲のモデルと直接競合します。
Metaの比較対象には、Gemma 4 31BやQwen 3.6 27Bが含まれています。Muse Glimmerはエージェントスイートでリードしており、一部の一般知識タスクでは勝敗が混在しています。
ベンチマーク結果表
| ベンチマーク | スコア | カテゴリ |
|---|---|---|
| MATH (AMC 2020) | 94.7 | 数学 |
| SWE-bench Verified | 76.0 | コーディング/エージェント |
| MCP Atlas | 75.5 | エージェント/ツール使用 |
| Deep Search QA | 74.6 | エージェント/検索 |
| SWE-bench Pro | 51.2 | コーディング (難問) |
| Gaia 2 | 43.3 | マルチステップアシスタント |
エージェントの列が最大の差別化要因を表しています。ベンチマークの汚染に強く難しいバリアントであるSWE-bench Proは51.2を記録し、このサイズのモデルがローカルで実行されるとしては注目すべきです。過酷なマルチステップアシスタントベンチマークと形容されるGaia 2は、43.3に留まっています。
競合比較表
| モデル | サイズ | エージェントフォーカス | ライセンス | ローカルデプロイ |
|---|---|---|---|---|
| Muse Glimmer | 29.6B | 特化型 | Apache 2.0 | 20GB未満 |
| Gemma 4 | 31B | 汎用 | カスタム | 様々 |
| Qwen 3.6 | 27B | 混合 | カスタム | 様々 |
クラウドのフロンティアモデルは、依然として生の能力の上限で勝っています。30Bのローカルモデルは、大規模なホスト型システムの推論能力を上回るようには設計されていません。価値提案は、高頻度で長時間実行されるプライバシーに敏感なエージェントワークロードをターゲットにしています。
蒸留トレーニングパイプライン
Muse Glimmerはスクラッチからトレーニングされたモデルではありません。Metaのより大きなティーチャーモデルであるMuse Sparkの圧縮版です。蒸留プロセスは3つの異なるフェーズにまたがり、それぞれが特定の能力の次元をターゲットにしています。
トレーニングの哲学は明確な原則に従っています。ティーチャーの品質を入れ、コンシューマーハードウェアで動かすことです。各フェーズは、ローカルエージェントのデプロイに向けて学生モデルを段階的に形成します。
トレーニングフェーズ表
| フェーズ | フォーカス | 手法 | 結果 |
|---|---|---|---|
| フェーズ1: 事前トレーニング | 基盤 | ロジット蒸留 | ティーチャーの出力分布に一致 |
| フェーズ2: ミッドトレーニング | コンテキスト/エージェント | ロングコンテキストデータ | 推論の軌跡、マルチステップ作業 |
| フェーズ3: ポストトレーニング | 特化 | SFT + RL | ドメイン全体でのポリシー蒸留 |
フェーズ1: 基盤
- Muse Sparkからのロジット蒸留
- 学生モデルが完全な出力分布を学習
- ティーチャーと同様のデータミックス
- コアな知識ベースを構築
フェーズ2: エージェントトレーニング
- 拡張コンテキストトレーニング
- エージェント中心のデータ拡充
- 推論軌跡への露出
- マルチステップワークフローの形成
フェーズ3: 特化
- RLと組み合わせた教師ありファインチューニング
- ポリシー蒸留の適用
- 推論、コーディング、エージェントをターゲット
- 最終的な能力の調整
ローカルデプロイメントセットアップガイド
Muse Glimmerをローカルにデプロイするには、ハードウェアとユースケースに合った適切なパッケージ形式を選択する必要があります。Metaは3つのリポジトリオプションを提供しており、それぞれが異なるデプロイメントシナリオをターゲットにしています。
ほとんどのユーザーは、コンシューマーハードウェアに対応した事前量子化ビルドを含むGGUFリポジトリから始めるべきです。ファインチューニングやエンタープライズGPUサービングのためにフル精度が必要な場合のみ、ベースのsafetensorsリポジトリを使用してください。
リポジトリ選択表
| リポジトリ | 形式 | 最適な用途 | ターゲットハードウェア |
|---|---|---|---|
| Base | Safetensors (フル精度) | ファインチューニング、エンタープライズサービング | マルチGPUサーバー |
| GGUF | 事前量子化ビルド | ローカル推論、コンシューマー利用 | シングルGPU、Mac |
| Executor PTE | モバイルランタイム | 組み込み/エッジデプロイメント | スマートフォン、エッジデバイス |
ランタイムを選択
Alma(最短のパス)、llama.cpp、LM Studio、Executor、MLX、vLLM、またはSGLangから選択します。Almaはコマンド1つでのセットアップを提供します。vLLMとSGLangは、本番サービングに向けたOpenAI互換のエンドポイントを提供します。
量子化モデルをダウンロード
GGUFリポジトリ、具体的には4-bit Kquant動的バリアントをプルします。これにより、エージェントタスクの品質をほとんどまたは全く低下させることなく、ウェイトが20GB未満に圧縮されます。
ハードウェア要件を確認
システムに合計24〜32GBのメモリがあることを確認してください。実行エンベロープにはKVキャッシュ、エンコーダー、およびドラフトモデルが含まれており、すべてハイエンドコンシューマーマシンの容量内に収まります。
投機的デコーディングを有効化
バンドルされている投機的デコーディングドラフターであるDL Flashを有効化します。複数のトークンを同時に提案し、メインモデルに1パスで検証させることで、大幅な速度向上を実現します。
エージェントスタックを接続
実行中のエンドポイントに既存のオーケストレーションフレームワークを向けます。このモデルは、OpenClawスタイルのパターンとMCPツールエコシステムを直接サポートしています。
投機的デコーディングは測定可能な加速をもたらします。RTX 5090で3.1倍、M5 Max MacBookで1.8倍、M4 Maxで1.5倍の生成速度向上です。これにより、エージェントの応答性がキューのような遅延から、リアルタイムのツールパフォーマンスへと変化します。
機能とユースケース
Muse Glimmerは、ローカルのエージェントデプロイメントで通常壊れてしまう特定の機能をターゲットにしています。チャットボットにツールを後付けするのではなく、トレーニングはエンドツーエンドのタスク完了に明示的に焦点を当てています。
このリリースの特徴は、コンシューマーハードウェア向けにサイズ設定されたモデルで、すべてのエージェント機能を同時にターゲットにし、それぞれの機能を証明する評価スイートを公開していることです。
機能マトリクス表
| 機能 | 説明 | 実用的な応用 |
|---|---|---|
| 関数呼び出し | 正確なスキーマ準拠 | 信頼性の高いAPI統合 |
| マルチステップ推論 | 長いワークフローで維持 | 複雑なタスクチェーン |
| 障害回復 | エラーを診断して再試行 | 自己修復エージェント |
| 画像理解 | スクリーンショットやドキュメント | 視覚データ処理 |
| 推論労力ダイヤル | リクエストごとの速度と品質 | 適応型パフォーマンス |
| オーケストレーションサポート | 既存のスタックとの互換性 | ドロップイン統合 |
理想的なワークロード
- リポジトリを監視するコードベースウォッチャー
- メール管理のための受信トレイトリアージ
- UI自動化のための画面理解
- ホームオートメーションルーティン
- ダッシュボード監視アラート
ハイブリッドアーキテクチャ
- ローカルGlimmerが一定のバックグラウンドループを処理
- 難しい5%の決定にはフロンティアAPI
- ローカルトークンあたりの限界コストはゼロ
- データがマシンから外部に出ない
- 接続の切断が障害モードにならない
フォルダを監視し、メールをトリアージし、ダッシュボードを監視する常時稼働のエージェントは、トークンあたりのAPI価格設定では経済的に非現実的です。ローカルデプロイは限界トークンコストを排除し、継続的なエージェント操作を実現可能にします。
デプロイメントチェックリストとFAQ
デプロイ前チェックリスト:
- ターゲットマシンで24〜32GBの利用可能なRAM/VRAMを確認
- Hugging FaceからGGUF 4-bit Kquant動的バリアントをダウンロード
- Alma、llama.cpp、またはLM Studioランタイムをインストール
- 速度向上のためにDL Flash投機的デコーディングを有効化
- ツールスキーマに対して関数呼び出しをテスト
- MCPエコシステムとの互換性を検証
- ワークロードに合わせて推論労力ダイヤルを設定
Muse Glimmerは、ローカルインフラにコミットする前にテストするために、Together、Fireworks、OpenRouterなどのクラウドプラットフォームでも利用可能です。Torch Titanがファインチューニングワークフローを処理します。
ランタイムサポート表
| ランタイム | プラットフォーム | ユースケース | 難易度 |
|---|---|---|---|
| Alma | クロスプラットフォーム | クイックスタート、コマンド1つ | 初級 |
| llama.cpp | クロスプラットフォーム | 軽量なローカル推論 | 中級 |
| LM Studio | デスクトップGUI | ユーザーフレンドリーなローカルサービング | 初級 |
| MLX | Apple Silicon | Macのネイティブ最適化 | 中級 |
| vLLM | Linux/サーバー | 本番OpenAI互換API | 上級 |
| SGLang | Linux/サーバー | 高パフォーマンスサービング | 上級 |
| Executor | モバイル/エッジ | 組み込みデプロイメント | 上級 |
Q: Muse Glimmer Apache 2.0は、他のオープンウェイトモデルと何が違うのですか?
Muse Glimmerは、エージェントファーストのトレーニング、マルチモーダル入力、131Kのコンテキストウィンドウ、そしてクリーンなApache 2.0ライセンスを30Bパラメータのパッケージに組み合わせています。ほとんどのオープンウェイトモデルは、使用制限のあるカスタムコミュニティライセンスを使用しています。Muse Glimmerは、主要なインフラストラクチャーソフトウェアと同じ寛容なライセンスの下で提供されており、カスタム条項の法的レビューなしで商用デプロイメントが可能です。
Q: Muse Glimmerはコンシューマーハードウェアだけで完全に実行できますか?
はい。4-bit Kquant動的量子化スキームにより、モデルのウェイトは20GB未満に圧縮されます。KVキャッシュ、エンコーダー、ドラフトモデルを含む完全な実行エンベロープは、ハイエンドのコンシューマーGPUやApple Silicon Macで利用可能な24〜32GBのメモリ範囲内に収まります。
Q: 投機的デコーディングはパフォーマンスをどのように向上させますか?
DL Flashは、モデルにバンドルされている軽量な投機的デコーディングドラフターです。複数のトークンを同時に提案し、メインモデルに1パスで検証させます。これにより、RTX 5090で3.1倍、M5 Max MacBookで1.8倍、M4 Maxで1.5倍の生成速度向上が実現し、エージェントがキューに入れられているように感じるのではなく、応答性が高まります。
Q: どのエージェントフレームワークとツールエコシステムがサポートされていますか?
Muse Glimmerは、OpenClawスタイルのオーケストレーションパターンとMCPツールエコシステムを直接サポートしています。vLLMまたはSGLangを通じてサーブされる場合、OpenAI互換のエンドポイントを提供するため、既存のエージェントスタックを変更せずに統合できます。
Q: Muse Glimmerはクラウドのフロンティアモデルより優れていますか?
いいえ。クラウドのフロンティアモデルは、依然として生の能力の上限で勝っています。Muse Glimmerは異なるユースケースをターゲットにしています。それは、トークンあたりのAPI価格設定が非現実的な、高頻度で長時間実行され、プライバシーに敏感なエージェントワークロードです。推奨されるアーキテクチャはハイブリッドであり、ローカルのGlimmerが一定のバックグラウンド操作を処理し、複雑な決定についてのみフロンティアAPIにエスカレーションします。