Muse Glimmer: ローカルセットアップガイドとパフォーマンスのヒント - インストール

Muse Glimmer: ローカルセットアップガイドとパフォーマンスのヒント

Unslothとllama.cppを使用してMuse Glimmerをローカルで実行する方法を学びましょう。セットアップ手順、量子化フォーマット、パフォーマンスベンチマークをご紹介します。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmerは、エージェントタスク向けに設計されたMetaの30Bパラメータの密なオープンウェイトモデルです
  • ローカルデプロイには、4-bit量子化バージョンを使用して約20 GBのRAMが必要です
  • Unslothとllama.cppが、効率的なローカル推論を実行するための主要なフレームワークを提供します
  • 最適な設定には、最高の生成品質を得るためにtemperature 1、top P 0.95、top K 64が含まれます
  • コーディングと推論が主な強みですが、複雑なフロントエンドの生成は依然として困難です

Muse Glimmerの概要とアーキテクチャ

Muse Glimmerは、オープンウェイトLLMの領域へのMetaの回帰を代表しています。これは、ローカルエージェント、関数呼び出し、およびマルチステップ推論を処理するために構築された300億パラメータの密なモデルです。これらの数十億のパラメータのうち、20億はビジョントランスフォーマーに専用で割り当てられており、残りはテキストエンコーダーおよびデコーダーの操作を処理します。

このモデルは、非常に寛容なApache 2.0ライセンスの下でリリースされており、個人プロジェクトと商用アプリケーションの両方に利用可能です。Metaは蒸留を通じてMuse Glimmerを最適化し、watch distillation手法を使用して、より大規模なMuse Sparkモデルの出力でトレーニングしました。

動画のハイライト:

  • 2Bをビジョントランスフォーマーに割り当てた30Bの密なパラメータモデル
  • オープンソースコミュニティのアクセスのためにApache 2.0ライセンスの下でリリース
  • ローカルエージェント、関数呼び出し、LLM-as-a-judge評価に最適化
  • Muse Sparkの出力からの蒸留を使用して事前トレーニング
  • 48 GBの統合メモリを搭載したM5 Proでローカルテスト済み
モデルのポジショニング

Muse Glimmerは、Gemma 4 31BやQwen 3.0.6 27Bと同じミッドサイズカテゴリをターゲットにしています。ベンチマークでは一部のコーディングタスクでQwenに遅れをとっているものの、Metaの新しいモデルラインナップからの強力な最初のリリースであり続けています。

ベンチマーク比較

モデルパラメータTerminal BenchSWE Bench Verifiedライセンス
Muse Glimmer30B (2B vision)中程度中程度Apache 2.0
Qwen 3.0.627B高いより高い寛容
Gemma 431B中程度中程度寛容

量子化オプションとUnslothの統合

300億パラメータのモデルをローカルで実行するには、コンシューマハードウェアの制約に収まるように量子化が必要です。元のMuse GlimmerリリースにはGGUFファイルが含まれていましたが、複数の量子化バリアントが欠けていました。Unslothのコントリビューターが介入し、異なるハードウェア構成に最適化された適切な量子化バージョンを提供しました。

バランスの取れたパフォーマンスに推奨される量子化は、dynamic quant 4-bit K Excelフォーマットです。これにより、モデルのフットプリントは約20 GBのRAMに削減され、同時にモデルの推論能力の大部分が保持されます。

ハードウェア要件

4-bit量子化されたMuse Glimmerモデルを実行するには、最低24 GBの利用可能なRAMが必要です。統合メモリを備えたApple Siliconでは、48 GBのシステムがモデルとオペレーティングシステムの両方に快適な余裕を提供します。

量子化フォーマット比較

フォーマットRAM使用量品質保持速度最適な用途
Dynamic Quant 4-bit K~20 GB良い速い一般的なローカル使用
Unquantized FP16~60 GB完全遅い研究と評価
8-bit Quant~30 GB非常に良い中程度より高い品質が必要な場合

4-bit Quant (推奨)

  • ~20 GBのRAM使用量
  • 最速の推論速度
  • 日常的なローカル使用に最適
  • わずかな品質低下

8-bit Quant

  • ~30 GBのRAM使用量
  • より高い品質保持
  • 中程度の推論速度
  • 精度が求められるタスクに適しています

FP16 Unquantized

  • ~60 GBのRAM使用量
  • 完全なモデルの忠実度
  • 最も遅い推論速度
  • ベンチマークに最適

llama.cppを使用したステップバイステップのローカルセットアップ

Muse Glimmerをローカルにセットアップするには、llama.cppリポジトリをダウンロードし、ハードウェアに合わせてコンパイルして、量子化されたモデルファイルを読み込む必要があります。以下の手順では、モデルをローカルサーバーとして実行するプロセスの概要を説明しています。

前提条件

セットアッププロセスを開始する前に、Git、C/C++コンパイラ(またはmacOSのXcode Command Line Tools)、および少なくとも24 GBの空きRAMがあることを確認してください。

1

llama.cppのダウンロードとコンパイル

GitHubから最新のllama.cppリポジトリをクローンします。特定のハードウェアアーキテクチャに合わせてソースコードをコンパイルします。M5 ProなどのApple Siliconマシンでは、GPUアクセラレーションのためにコンパイル中にMetalフレームワークのサポートを有効にしてください。

2

量子化されたモデルのダウンロード

UnslothリポジトリからMuse Glimmerの4-bit量子化GGUFファイルを取得します。バランスの取れたパフォーマンスと品質を得るために、dynamic quant 4-bit K Excelバリアントが特別に推奨されます。

3

サーバー設定の構成

Muse Glimmerモデルでllama.cppサーバーを起動します。推奨される生成パラメータ(temperatureを1、top Pを0.95、top Kを64)を設定します。これらの値は、首尾一貫した創造的な出力のための最適なバランスを提供します。

4

クライアントの接続

サーバーが読み込まれると、デフォルトでポート8080でリッスンします。お好みのクライアント、コーディングハーネス、またはAPIツールをこのローカルエンドポイントに接続して、モデルとの対話を開始します。

5

初期テストの実行

モデルが正しく機能していることを確認するために、洗車シナリオなどの簡単な推論テストから始めます。48 GBの統合メモリを搭載したM5 Proで、1秒間に約17トークンに達するはずのトークン生成速度を監視します。

パフォーマンステストと機能

Muse Glimmerは、異なるタスクカテゴリ全体で明確な強みと弱みを示しています。4-bit量子化バージョンでのハンズオンテストに基づくと、モデルは堅実な推論能力を示していますが、複雑なフロントエンドコードの生成には苦労しています。

タスクパフォーマンスの内訳

タスクタイプ生成トークン所要時間品質評価備考
論理推論 (Car Wash)~150~10秒優秀正解、高速な生成
物理学 (Vacuum Drop)~1,500~90秒優秀質量無関係の正解
HTML/CSS Weather Cards~8,600~8分不良4枚中3枚のみ、悪いビジュアル
CV Webpage Generation~3,300~3.5分良い素晴らしいタイポグラフィ、妥当なテキスト
Newsletter Platform~大規模~10分中程度良好な計画、機能しないUI
コーディングハーネスの強み

OpenCodeのような適切なコーディング環境に統合されると、Muse Glimmerは構造化されたタスク計画の作成に優れています。To-doリストを正常に作成し、ワークスペースを探索し、コードを記述する前に複雑なプロジェクトを管理しやすいステップに分割します。

このモデルは、高品質のテクニカルライティングとコピー生成を生成します。CV、ドキュメント、プロジェクトの説明のテキストコンテンツは、自然でプロフェッショナルに読めます。ただし、ビジュアルデザイン要素やインタラクティブなフロントエンドコンポーネントは、Qwen 3.0.6などの代替品と比較してモデルが苦手な分野です。

フロントエンドの制限

複数のインタラクティブ要素(機能するサブスクライバーフォームやメールビルダーなど)を含む複雑なフロントエンドタスクは、機能しない結果を生み出す可能性があります。デプロイする前に、生成されたWebアプリケーションを常に徹底的にテストしてください。

最適化のヒントとベストプラクティス

Muse Glimmerのパフォーマンスを最大化するには、慎重な構成とその強みの理解が必要です。以下の推奨事項は、この300億パラメータモデルを最大限に活用するのに役立ちます。

セットアップ最適化チェックリスト:

  • Use dynamic quant 4-bit K Excel for balanced speed and quality
  • Set temperature to 1, top P to 0.95, top K to 64
  • Allocate minimum 24 GB RAM for stable inference
  • Use a coding harness like OpenCode for complex development tasks
  • Test with simple reasoning prompts before complex generation

推奨される生成パラメータ

パラメータ推奨値目的影響
Temperature1.0ランダム性を制御創造性と一貫性のバランス
Top P0.95Nucleus samplingの閾値低確率トークンをフィルタリング
Top K64トークン選択の制限ステップごとの語彙を制限
Context Windowモデル依存入力長の容量タスクの複雑さを決定
エージェントタスクの最適化

エージェントワークフローでは、Muse Glimmerの組み込みのマルチステップ推論と障害回復機能を活用してください。このモデルは、オープンエンドな創造的なプロンプトではなく、明示的なステップバイステップの要件を含む明確で構造化された指示を与えられた場合に最も効果を発揮します。

最適なユースケース

  • バックエンドコードのスキャフォールディング
  • テクニカルドキュメントの作成
  • マルチステップ推論タスク
  • 関数呼び出しとツール使用
  • LLM-as-a-judge評価

使用を避けるべきケース

  • 複雑なフロントエンドデザイン
  • インタラクティブなUI生成
  • 画像理解(テスト限定)
  • 長編のクリエイティブライティング
  • ピクセル単位の正確な出力が必要なタスク

よくある質問

Q: Muse Glimmerとは何ですか?パラメータはいくつありますか?

Muse Glimmerは、Metaの300億パラメータの密なオープンウェイトモデルです。20億のパラメータがビジョントランスフォーマーに専用で割り当てられており、残りの280億がテキストのエンコードとデコードを処理します。Apache 2.0ライセンスの下でリリースされています。

Q: Muse Glimmerをローカルで実行するにはどれくらいのRAMが必要ですか?

推奨される4-bit量子化バージョン(dynamic quant 4-bit K Excel)を使用すると、モデルには約20 GBのRAMが必要です。オペレーティングシステムと一緒に安定して動作させるために、最低24 GBの利用可能なメモリを搭載したシステムが推奨されます。

Q: Muse GlimmerはQwen 3.0.6と比較してどうですか?

ベンチマーク比較に基づくと、Qwen 3.0.6(27B)はTerminal BenchとSWE Bench VerifiedでMuse Glimmerを上回っています。ただし、Muse Glimmerは強力な推論能力を示し、そのサイズとしては高品質なテクニカルライティングを生成します。

Q: Muse Glimmerは機能的なWebアプリケーションを生成できますか?

Muse Glimmerはバックエンドコードをスキャフォールディングし、プロジェクト構造を効果的に生成できます。ただし、インタラクティブな要素を含む複雑なフロントエンドアプリケーションは、機能しない結果を生み出す可能性があります。モデルは計画とバックエンドロジックに優れていますが、ビジュアルデザインやインタラクティブなUIコンポーネントには苦労しています。

Q: Muse Glimmerの推奨される生成設定は何ですか?

推奨設定は、temperature 1.0、top P 0.95、top K 64です。これらのパラメータは、ほとんどのコーディングおよび推論タスクにおいて、創造的な出力と首尾一貫した生成の最適なバランスを提供します。

今後のアップデート

Metaは、Muse Spark 1.2を含むMuseラインナップで追加のオープンウェイトモデルをリリースすると予想されています。llama.cppや量子化ツールが改善され続けるにつれて、Muse Glimmerのローカルパフォーマンスは時間とともに大幅な向上を見る可能性があります。