Muse Glimmer オープンウェイト: セットアップガイド & ローカルデプロイ - ガイド

Muse Glimmer オープンウェイト: セットアップガイド & ローカルデプロイ

量子化、投機的デコード、エージェントセットアップのヒントを交えながら、Muse Glimmer 30B オープンウェイトモデルをローカルでダウンロード、設定、実行する方法を学びましょう。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmer オープンウェイトは、Apache 2.0ライセンスの下でリリースされたMetaの30B稠密モデルです
  • ターゲットハードウェア: 24GB〜32GBのVRAMを搭載するGPU(RTX 3090、4090、5090、AMD 9700)に最適化
  • 量子化: ローカルデプロイ向けの公式4ビット量子化バージョンが利用可能
  • エージェント重視: マルチステップ推論、ツール使用、長期軌跡のために構築
  • 可用性: 現在、Hugging Faceでウェイトがホストされており、すぐにダウンロード可能

Muse Glimmer オープンウェイトの概要

Muse Glimmer オープンウェイトのリリースは、オープンウェイトのAIモデル市場におけるMetaの待望の復帰を告げるものです。Mark Zuckerbergによって直接発表されたこの300億パラメータの稠密モデルは、オープンソースコミュニティにおける主要なミドルサイズモデルと直接競合するように設計されており、特に既存の27Bクラスモデルのパフォーマンス領域をターゲットとしています。

動画のハイライト:

  • MetaがApache 2.0ライセンスのオープンモデルのリリースに復帰
  • 30B稠密モデルアーキテクチャ(Mixture of Expertsではない)
  • 公式の4ビット量子化バージョンは24GB/32GB VRAMカードに収まる
  • より大きなMuse Sparkモデルからの蒸留を使用してトレーニング
  • エージェントタスク、マルチステップ推論、ツール使用のために特別に構築

Muse Glimmerの開発チームは、元のMuseモデルのリリース以来大幅に成長しました。注目すべきは、MetaがGeminiチームから推論の責任者を引き抜いたことであり、これがモデルの強力なポストトレーニングパイプラインに貢献しました。トレーニング手法は、単にクリーンアップされたインターネットデータに依存するのではなく、より大きなMuse Sparkの出力からのポリシー上蒸留と強化学習を組み合わせています。

アーキテクチャの洞察

Muse GlimmerはMixture of Experts(MoE)ではなく、稠密モデルです。これは、同サイズのMoEモデルほど推論が速くない可能性があることを意味しますが、すべてのタスクで一貫したパフォーマンスを保証し、ローカルハードウェアのセットアップでのデプロイを簡素化します。

モデルの仕様とベンチマーク

Muse Glimmerオープンウェイトモデルの技術仕様を理解することは、お使いのハードウェアでサポートできるかどうかや、同じティアの代替品とどう比較されるかを判断するために不可欠です。

仕様詳細
パラメータ数300億(稠密)
アーキテクチャ稠密(非MoE)
ライセンスApache 2.0
主な用途エージェントAI、マルチステップ推論
トレーニング手法蒸留 + 強化学習
教師モデルMuse Spark(より大規模)
ウェイトのホストHugging Face

ベンチマークのパフォーマンスは、Muse Glimmerを他のミドルティアのオープンモデルと直接競合する位置に置いています。チームは特に打ち負かすべきベースラインとしてQwen 3.6 27Bをターゲットにしており、結果はほとんどのカテゴリでGemma 4などのモデルを凌駕し、さまざまなタスクにおいてQwen 3.6と互角に渡り合っていることを示しています。

ベンチマークカテゴリMuse Glimmer 30BQwen 3.6 27BGemma 4
一般的な推論強い強い中程度
コーディングタスク強い強い中程度
マルチステップエージェント最適化済み良い中程度
ツール使用最適化済み良い限定
ローカル実行の可否可能(4ビット)可能可能
競争環境

Metaは、待望のQwen 3.8 27Bのローンチ直前にMuse Glimmerをリリースしました。モデルの選択を検討している場合は、オープンウェイトの状況は週単位で急速に変化するため、今後のベンチマーク比較に注目してください。

ハードウェア要件と量子化

Muse Glimmerオープンウェイトリリースの最も重要な側面の一つは、コンシューマーのハードウェアで実行できるようにするというMetaのコミットメントです。ローカルでの実行が後回しにされていた以前の世代とは異なり、このモデルは明示的にエンスージアスト向けGPUに合わせてサイズ調整および量子化されています。

24GB VRAM GPU

  • RTX 3090
  • RTX 4090
  • RTX 5090
  • KVキャッシュのためのヘッドルームを確保しつつ4ビット量子化に収まる

32GB VRAM GPU

  • AMD RX 9700
  • プロフェッショナル向けカード
  • より大きなコンテキストウィンドウ
  • 快適なマルチタスク処理

Apple Silicon

  • MacBook Pro 64GB
  • 統合メモリの利点
  • 投機的デコードをサポート
  • NVIDIAより遅いトークン速度

Metaはフルウェイトのリリースと同時に、公式の4ビット量子化バージョンを出荷しました。この量子化は、モデルが24GBおよび32GBカードのVRAM制限内に収まるだけでなく、推論中に十分なサイズのKVキャッシュのための大幅なヘッドルームを残すように慎重に調整されました。

ハードウェア構成量子化KVキャッシュのヘッドルーム期待されるパフォーマンス
RTX 3090 (24GB)4ビット中程度高いトークン速度
RTX 4090 (24GB)4ビット中程度高いトークン速度
RTX 5090 (32GB)4ビット大きい非常に高いトークン速度
AMD 9700 (32GB)4ビット大きい高いトークン速度
MacBook Pro 64GB4ビット大きい中程度のトークン速度
投機的デコードの有効化

Metaは、d-Flash投機的デコードをMuse Glimmerオープンウェイトリリースに直接統合しました。これにより推論速度が大幅に向上し、デモでは64GBの統合メモリを搭載したMacBook Proでのスムーズな動作が示されています。これは、前世代のLlamaモデルでは実現不可能だったシナリオです。

ローカルデプロイのステップバイステップ

Muse Glimmerオープンウェイトモデルをローカルにデプロイするには、環境の慎重な準備と、Hugging Faceからの正しいモデルファイルの選択が必要です。

1

ハードウェアの確認

24GB以上のVRAMを搭載したGPU(NVIDIA RTX 3090/4090/5090またはAMD 9700)、または64GBの統合メモリを搭載したMacを所有していることを確認してください。GPUドライバーとCUDA/ROCmツールキットを最新バージョンに更新してください。

2

Hugging Faceからウェイトをダウンロード

公式のMuse Glimmer Hugging Faceリポジトリに移動します。コンシューマー向けGPUで実行している場合は公式の4ビット量子化バージョンを、エンタープライズグレードのハードウェアをお持ちの場合はフルウェイトをダウンロードしてください。

3

推論エンジンの設定

お好みのローカル推論エンジン(LM Studio、Ollama、vLLMなど)をセットアップします。トークン生成速度を最大化するために、エンジンがd-Flash投機的デコードをサポートしていることを確認してください。

4

KVキャッシュ制限の設定

残りのVRAMをKVキャッシュに割り当てます。Metaは4ビット量子化において特別にヘッドルームを残しているため、長文のエージェント軌跡やマルチステップ推論タスクのための実質的なコンテキストウィンドウをサポートできます。

5

エージェントハーネスのテスト

デプロイしたモデルをOpen ClawやHermes Agentなどのエージェントハーネスに接続します。Muse Glimmerはツール使用とマルチステップ推論のために明示的にトレーニングされており、自律型エージェントのワークフローに最適です。

コミュニティによる量子化

今後数週間にわたり、コミュニティから追加の量子化フォーマット(GGUF、AWQ、EXL2)がリリースされることが期待されます。公式の4ビットバージョンがお使いのセットアップに完全に適合しない場合は、異なるハードウェアプロファイルに合わせた代替フォーマットについてHugging Faceを監視してください。

エージェント機能とトレーニングパイプライン

Metaは、エージェント機能を重視してMuse Glimmerオープンウェイトモデルを設計しました。汎用チャットボットとは異なり、このモデルは拡張された推論チェーンと外部ツールの相互作用を必要とするシナリオで優れるようにポストトレーニングされています。

トレーニングパイプラインは、生のインターネットデータをスクレイピングしてクリーンアップする標準的なアプローチから逸脱しています。代わりに、チームはより大きなMuse Sparkモデルからの蒸留と強化学習手法の組み合わせを利用しました。

トレーニングフェーズ手法目的
事前トレーニングMuse Sparkからの蒸留知識の転送
ポストトレーニングポリシー上蒸留挙動の調整
ファインチューニング強化学習推論の最適化
評価エージェントハーネステストツール使用の検証
エージェントファーストの設計

Metaはドキュメント内で、Muse Glimmerはマルチステップ推論、ツール使用、長期軌跡のために構築されていると明記しています。Open ClawやHermes Agentのようなコーディングハーネスやエージェントフレームワークとそのまま統合できます。

デプロイメントチェックリストとFAQ

Muse Glimmerオープンウェイトモデルを本番環境または個人環境で実行する前に、このチェックリストを使用してスムーズなデプロイを確保してください。

ローカルデプロイチェックリスト:

  • GPUが24GB以上のVRAMを搭載していることを確認
  • Hugging Faceから公式の4ビット量子化ウェイトをダウンロード
  • 互換性のある推論エンジンをインストールして設定
  • 速度向上のためにd-Flash投機的デコードを有効化
  • エージェントハーネス(Open Claw、Hermes Agent)でモデルをテスト
  • ターゲットワークロードに対してトークン速度をベンチマーク
今後のリリース

Metaは、Muse Spark 1.2 オープンウェイトが次にリリースされることを確認しました。Artificial Analysis Intelligence Indexからの初期の兆候は、そのモデルがClaude Opus 4.8と同等のパフォーマンスを発揮することを示唆しています。より大きなモデルをローカルで実行する予定の場合は、それに応じてハードウェアのアップグレードを計画してください。

Q: Muse Glimmerオープンウェイトモデルとは何ですか?

Muse Glimmerは、Apache 2.0ライセンスの下でMetaがリリースした300億パラメータの稠密AIモデルです。エージェントタスク、マルチステップ推論、ツール使用のために設計されており、オープンウェイトモデルの状況へのMetaの復帰として機能します。

Q: コンシューマー向けGPUでMuse Glimmerをローカルに実行できますか?

はい。Metaは、RTX 3090、4090、5090などの24GB VRAMカードや、AMD 9700などの32GBカードに収まるように特別に設計された公式の4ビット量子化バージョンをリリースしました。これにはKVキャッシュ用のヘッドルームも残されています。

Q: Muse Glimmerは他のオープンモデルと比較してどうですか?

Muse GlimmerはQwen 3.6 27Bと直接ベンチマークを比較します。ほとんどのカテゴリでGemma 4などのモデルを凌駕し、推論やコーディングタスクにおいてQwen 3.6と互角に渡り合いますが、今後リリースされるQwen 3.8が競争環境を変える可能性があります。

Q: Muse Glimmerのオープンウェイトはどこでダウンロードできますか?

公式の4ビット量子化バージョンを含むモデルウェットは、Hugging Faceで入手できます。LM Studio、Ollama、vLLMなどのツールを使用して直接ダウンロードし、ローカルの推論パイプラインに統合できます。