Muse Glimmer Qwen3.6 ベンチマーク: パフォーマンス比較 - ベンチマーク

Muse Glimmer Qwen3.6 ベンチマーク: パフォーマンス比較

Muse GlimmerとQwen3.6のベンチマーク、エージェント機能、コーディング性能、ローカルデプロイメントの指標の詳細分析。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmer Qwen3.6 ベンチマークの結果は、一般的なタスクでは接戦を示しており、Glimmerがエージェントのツール呼び出しをリードしています。
  • モデルアーキテクチャ: Glimmerは29.6Bの密結合パラメータモデルと1.8Bのビジョンエンコーダーを備え、ローカルエージェントのデプロイメント向けに設計されています。
  • 量子化のトレードオフ: 4-bit量子化により、モデルのサイズは20 GB未満になり、測定された性能低下はわずか1%です。
  • セキュリティの懸念: CI MemoriesにおけるGlimmerのデータ侵害率は26.4%であり、Gemma 4の12.1%を大幅に上回っています。
  • 推論コントロール: ベンチマークの数値は「High」推論強度で測定されました。「Low」設定を使用すると、モデルの性能が低下します。

Muse Glimmer vs Qwen3.6: 直接対決の概要

Metaは2026年8月10日にMuse Glimmerをオープンソース化し、ローカルハードウェア向けに特化した300億パラメータのエージェントモデルを発表しました。Muse Glimmer Qwen3.6のベンチマーク状況を評価すると、その比較は一方通行の勝利ではなく、非常に競争の激しい環境であることが明らかになります。Metaのマーケティングでは大胆な勝利を強調していますが、データを詳細に分析すると、多くのカテゴリで互角の戦いが繰り広げられています。

動画のハイライト:

  • Muse Glimmerは29.6Bの密結合モデルと1.8Bのビジョンエンコーダーとして提供
  • Apache 2.0ライセンスにより、本当に寛容な商用利用が可能
  • DflashドラフターがRTX 5090で3.1倍の速度向上を実現
  • Meta自身のテーブルでは、Qwen3.6に対してGlimmerが12行で勝利し、10行で敗北

ベースラインの能力を理解するために、まずこれら2つのモデル間の中核となるアーキテクチャの違いと設計思想を見る必要があります。Muse Glimmerはコンシューマー向けハードウェアに収まるように明示的に構築されましたが、Qwen3.6(Metaの社内テストテーブルではGwen 3.6 27Bと呼ばれる)は、オープンウェイトのエージェントパフォーマンスにおける確立された標準を代表しています。

詳細な注意書きをお読みください

Metaのプレゼンテーションではエージェント機能の勝利を強調していますが、開発者はベンチマークテーブル全体を検証する必要があります。Qwen3.6との直接比較可能な22行のうち、Muse Glimmerは12行で勝利し、10行で敗北しています。敗北した10行には、重要なコーディングおよびターミナルタスクが含まれています。

コアアーキテクチャの比較

仕様Muse GlimmerQwen3.6 (27B)
パラメータ数29.6B (Dense)27B
ビジョンエンコーダー1.8B 搭載構成によって異なる
コンテキストウィンドウ131,000 トークン標準的な大型ウィンドウ
ライセンスApache 2.0Open-weight
ターゲットハードウェア24GB VRAM (量子化済み)コンシューマー/エンタープライズ

エージェントおよびツール呼び出しのパフォーマンス

Muse GlimmerがQwen3.6に対して持つ最大の強みは、エージェント機能にあります。このモデルは、画面の読み取り、ファイルの整理、データをクラウドAPIに送信せずにローカルでツールベースのワークフローを実行することに特化してトレーニングされています。この設計思想は、ツール呼び出しのベンチマークで大きな成果をもたらしています。

エージェントの強み

主なユースケースがローカルでのツール呼び出し、画面の読み取り、ファイル整理を伴う場合、Muse Glimmerは現在、同クラスのオープンソースモデルの中で最も強力なパフォーマンスを提供しています。

主要なエージェントベンチマーク結果

ベンチマーク / テストMuse GlimmerQwen3.6 (27B)Gemma 4 (31B)
MCP Atlas (ツール呼び出し)75.562.554.2
Gaia 2 (ディープサーチ QA)勝利敗北敗北
AIME 2026勝利敗北敗北
指示追従勝利敗北敗北

Muse Glimmerは一般的なツール呼び出しの指標で圧倒的な強さを見せますが、実際のコーディング環境やターミナル操作に近いベンチマークを検証すると、状況は劇的に変化します。

MCP Atlas の支配力

  • ツール呼び出しで 75.5 スコア
  • Qwen3.6を13ポイント差で撃破
  • Gemma 4を21.3ポイント差で撃破
  • ワークフローの自動化に最適

ディープサーチ (Gaia 2)

  • 優れた多段推論
  • より優れたコンテキスト保持
  • 検索エージェント向けに最適化
  • 強力な指示追従

弱点

  • Terminal Benchでの劣勢
  • OSWorld検証タスクでの敗北
  • S2E Benchでわずかに遅れをとる
  • コーディングエージェントとしての制限

コーディングおよびターミナルベンチマークの内訳

Muse Glimmer Qwen3.6のベンチマーク分析がコーディングとターミナルのタスクに移行すると、Glimmerの優位性は薄れます。実際のコーディングエージェントの作業に最も近いベンチマークは、Qwen3.6を大幅に有利にしています。ローカルのコーディングアシスタントを探している開発者は、これらの特定の指標に細心の注意を払う必要があります。

コーディングエージェントの現実

Muse Glimmerは、実際のコーディングエージェントの作業に最も近い3つのベンチマークで敗北しています。ローカルのコーディングアシスタントを優先する場合、Meta自身のデータに基づくと、Code Llama 3.6またはQwen3.6が引き続き強力な選択肢です。

コーディングと環境のスコア

ベンチマークMuse GlimmerQwen3.6 (27B)勝者
S2E Bench (検証済み)76.077.2Qwen3.6
Terminal Bench51.760.7Qwen3.6
OSWorld (検証済み)65.975.6Qwen3.6

Terminal Benchでの9ポイントのビハインドと、OSWorld検証済みタスクでの10ポイント近くの差は、Glimmerが高レベルのエージェントオーケストレーションに優れている一方で、Qwen3.6が生のコード生成、ターミナルコマンドの実行、およびオペレーティングシステムレベルの相互作用で依然として大きな優位性を維持していることを示しています。

プライバシー、セキュリティ、およびCI Memoriesテスト

rawなパフォーマンス指標を超えて、画面を読み取りファイルを管理するローカルエージェントをデプロイすることは、重大なプライバシーの考慮事項を導入します。CI Memoriesベンチマークは、ユーザーの代わりに行動する際に、モデルが漏らしてはいけない情報を漏らしてしまうかどうかをテストします。これは、ローカルモデルを実際の受信トレイや個人のファイルシステムに向けるすべての人にとって重要な指標です。

セキュリティの脆弱性

CI MemoriesにおけるMuse Glimmerのデータ侵害率は26.4%です。これは、テストした相互作用の4分の1以上で意図しない情報漏洩が発生したことを意味します。機密性の高い環境にデプロイする前には、このギャップに真剣に取り組む必要があります。

データ侵害率の比較

モデルCI Memories 侵害率リスクレベル
Gemma 4 (31B)12.1%中程度
Muse Glimmer (30B)26.4%
Quince両者よりも悪い極めて高い
緩和戦略

個人のデータでMuse Glimmerを使用する予定がある場合は、厳格なサンドボックスとデータアクセス制御を実装してください。今後のアップデートで侵害率が対処されるまで、機密性の高い受信トレイや個人ファイルへの無制限のアクセスをモデルに許可しないでください。

ローカルデプロイメントと最適化ガイド

Muse Glimmerは、人々がすでに所有しているハードウェア上でのローカルデプロイメントのために、基礎から設計されました。エンジニアリングの課題は、エージェントとしての効果を生み出すコンポーネントを犠牲にすることなく、300億パラメータのモデルを24 GBのVRAM枠に収めることでした。

1

正しい重みをダウンロードする

meta-llamaモデルのリポジトリからHugging Faceにアクセスしてください。24 GBのカードの場合は、cake 1 17GB 4-bitビルドを選択してください。32 GBのカードの場合は、cake 1 dynamicビルドを選択してください。Unslothも幅広い互換性のためにGGUF変換を提供しています。

2

サービングバックエンドを構成する

本番環境でのサービングには、vLLMとSGLangの両方がモデルのパスを直接受け入れます。デスクトップでの使用については、llama.cpp、MLX、ExecuTorchの統合はローンチ時にまだ到着したばかりであったため、最初に互換性を確認してください。OllamaとLM Studioのサポートは「近日対応」とされていました。

3

最適な生成設定を適用する

Metaは最良の結果のために特定のパラメータを推奨しています。温度(temperature)を1.0、top Pを0.95、top Kを64に設定してください。これらの設定は、Metaが公開したベンチマークの数値を再現するために非常に重要です。

4

推論強度を設定する

システムプロンプトを使用して、推論強度(low、medium、high、extra high)を構成します。エージェントやコーディング作業には、常にhighまたはextra highを使用してください。公式のベンチマーク数値はhigh推論で測定されています。low設定で実行すると、あなたが読んだ記事通りのモデルの性能は得られません。

Dflashドラフターによるスピードブースト

Muse Glimmerには、Dflashと呼ばれる5層のブロック拡散ネットワークであるドラフターが同梱されています。これは1回のパスで16トークンを提案し、メインモデルがそれらを並行して検証します。RTX 5090では、これにより出力が1秒あたり74.9トークンから233.4トークンにブーストされ、出力品質を変えることなく3.1倍の高速化を実現します。

Dflashを使用したハードウェアパフォーマンス

ハードウェア標準 (t/s)Dflash使用時 (t/s)高速化
RTX 509074.9233.43.1x
M5 Maxベースライン1.8x1.8x
M4 Maxベースライン1.5x1.5x

デプロイメント準備チェックリスト

デプロイ前の確認事項:

  • VRAMが十分であることを確認 (4-bit量子化ビルドには24GB以上が必要)
  • Hugging Face (meta-llama) から正しい重みをダウンロードする
  • 使用するサービング方法におけるvLLMまたはSGLangの互換性を確認する
  • 温度を1.0、top Pを0.95、top Kを64に設定する
  • システムプロンプトで推論強度をHighまたはExtra Highに構成する
  • CI Memoriesのデータ漏洩を緩和するためのサンドボックスを実装する
  • 3.1倍の速度向上のためのDflashドラフターの統合を確認する

よくある質問

Q: ベンチマークにおいて、Muse GlimmerはQwen3.6よりも優れていますか?

結果は混在しています。Muse Glimmer Qwen3.6のベンチマーク比較では、Glimmerは22行中12行で勝利し、10行で敗北しています。Glimmerはツール呼び出し(MCP Atlas)とディープサーチで圧倒的な強さを見せますが、Qwen3.6はコーディングタスク、Terminal Bench、およびOSWorld検証済みテストにおいてGlimmerを大幅に上回る性能を発揮します。

Q: Muse Glimmerは標準的なコンシューマーGPUで実行できますか?

はい。完全な精度では、30Bのパラメータが55 GB以上のVRAMを必要とします。しかし、Metaの4-bit量子化により、言語モデルのサイズは20 GB未満になり、KVキャッシュ、ビジョンエンコーダー、ドラフターとともに24 GBのVRAM枠に収めることができます。

Q: Dflashドラフターとは何ですか?また、パフォーマンスにどのような影響がありますか?

Dflashは、1回のフォワードパスで16トークン全体のブロックを提案する5層のブロック拡散ネットワークです。メインモデルは16個すべてのトークンを並行して検証します。検証が正確に行われるため、出力を変えることなく、RTX 5090で3.1倍の速度向上を実現します。

Q: Muse Glimmerを個人データで使用するのは安全ですか?

注意が必要です。情報漏洩をテストするCI Memoriesベンチマークにおいて、Muse Glimmerの侵害率は26.4%であり、Gemma 4の12.1%と比較して高くなっています。モデルを実際の受信トレイや個人ファイルに向ける場合は、厳格なサンドボックスとアクセス制御を実装してください。

Q: Muse Glimmerにはどの推論強度を使用すべきですか?

Metaは、エージェントやコーディング作業においてHighまたはExtra Highの推論強度を使用することを推奨しています。公式のベンチマーク数値はHigh推論で測定されています。Low設定を使用すると、公開された指標と比較してパフォーマンスが著しく低下します。