Muse Glimmer コーディングベンチマーク:パフォーマンスとローカルテスト結果 - ベンチマーク

Muse Glimmer コーディングベンチマーク:パフォーマンスとローカルテスト結果

Muse Glimmerのコーディングベンチマークの詳細な結果、ローカルデプロイの仕様、および競合するオープンウェイトLLMと比較したエージェントタスクのパフォーマンス。

2026-08-11
muse glimmer Wiki チーム
クイックガイド
  • Muse Glimmerは、ローカルエージェントやコーディングタスクのために設計された、Metaの30Bパラメータの密なオープンウェイトモデルです。
  • ベンチマークパフォーマンスは、強力な推論とテキスト生成を示しますが、複雑なフロントエンドUIのレンダリングには苦労しています。
  • エージェント機能には、信頼性の高いツール呼び出し、マルチステップの推論、および構造化されたタスク計画が含まれます。
  • ハードウェア要件は、4ビット量子化されたローカル推論に約20 GBのRAMを必要とします。
  • Apache 2.0ライセンスにより、商用およびオープンソースの開発プロジェクトで非常に利用しやすくなっています。

Muse Glimmer モデルのアーキテクチャと仕様

Muse Glimmerは、300億パラメータの密なモデルとして登場し、MetaのオープンウェイトLLMの領域への復帰を代表します。アーキテクチャはビジョントランスフォーマーに約20億パラメータを割り当てており、残りはテキストのエンコードとデコードを処理します。非常に寛容なApache 2.0ライセンスの下でリリースされたこのモデルは、ローカルエージェント、関数呼び出しシステム、コーディングアシスタントを構築する開発者をターゲットにしています。

動画のハイライト:

  • ビジョントランスフォーマーを統合した30B密パラメータモデル
  • Watch蒸留技術を使用してMuse Sparkから蒸留
  • エンドツーエンドのエージェントタスク完了とツール呼び出しに最適化
  • 48 GBの統合メモリを備えたM5 Proハードウェアでローカルテスト済み

このモデルは、Muse Sparkの出力からの蒸留を使用して事前トレーニングされ、ティーチャーモデルと同様のデータミックスを活用しています。このアプローチにより、Muse Glimmerはマルチステップの推論、信頼性の高いツール使用、障害回復、およびマルチモーダル入力処理に最適化されています。

アーキテクチャの洞察

Muse Sparkからの蒸留により、Muse Glimmerは洗練された推論パターンを継承しつつ、ローカルデプロイのシナリオに対応できる管理可能なパラメータ数を維持しています。

コアモデルの仕様

仕様備考
総パラメータ数300億密なアーキテクチャ
ビジョントランスフォーマー約20億マルチモーダル入力を処理
テキストエンコーダ/デコーダ約280億主要な言語処理
ライセンスApache 2.0商用利用可能
主なユースケースローカルエージェント、コーディング、ツール呼び出しエージェントワークフローに最適化
蒸留ソースMuse SparkWatch蒸留メソッド

コーディングベンチマークの結果と比較

Muse Glimmerの最初のベンチマーク結果は、複雑ですが有望な状況を示しています。Metaの比較では、現在のAIの状況において比較的確立されたモデルと見なされているGemma 4 31BおよびQwen 3 0.6 27Bに対してモデルを位置づけています。競争力の差は、特定のベンチマークカテゴリによって大きく異なります。

ベンチマークパフォーマンスの比較

ベンチマークMuse Glimmer (30B)Qwen 3 0.6 (27B)Gemma 4 (31B)勝者
Terminal Bench中程度より高いスコア中程度Qwen 3 0.6
SWE Bench Verified中程度わずかな優位性中程度Qwen 3 0.6
一般的な推論強力強力中程度引き分け
テキスト生成高品質良好良好Muse Glimmer
タスク計画強力中程度中程度Muse Glimmer
ベンチマークの背景

Qwen 3 0.6は、Terminal BenchとSWE Bench VerifiedでMuse Glimmerを上回っています。ただし、Muse Glimmerは、そのパラメータサイズに対して、優れたタスク計画と技術的なテキスト生成の品質を示しています。

ベンチマークデータによると、Muse GlimmerはTerminal BenchやSWE Bench Verifiedなどの重要なコーディング固有のベンチマークでQwen 3 0.6に遅れをとっているものの、300億パラメータのモデルの期待を超える、著しく強力な記述力と構造化されたタスク計画能力で補っています。

ローカルコーディングとフロントエンド生成テスト

実際のテストは、Muse Glimmerの現実世界のコーディング能力に関する重要な洞察を明らかにします。このモデルは、単純なHTML生成からフルスタックアプリケーション開発まで、複数のコーディングシナリオで評価されました。

フロントエンド生成テスト結果

テストタスク生成されたトークン完了時間品質評価主な問題
天気カード (HTML/CSS/JS)約8,600約8分不良4つのカードのうち3つのみレンダリング、視覚品質が悪い
CVウェブページ (HTML)約3,300約3.5分普通良いタイポグラフィ、妥当なコピー
ニュースレタープラットフォーム (フルスタック)10,000以上約10分中程度良好なコード構造、機能しないUI
画像理解 (ペリカン)N/AN/A失敗正しくレンダリングできなかった
フロントエンドの制限

Muse Glimmerは、視覚的なフロントエンドタスクで大幅に苦労しています。天気カードのテストでは、視覚品質の悪い3つのカードのみが生成され、画像レンダリングテスト(バイクに乗ったペリカン)は完全に失敗しました。

コード生成における強み

フロントエンドのレンダリングの弱点にもかかわらず、Muse Glimmerはコーディングワークフローにおいていくつかの注目すべき強みを示しています。

タスク計画

  • 構造化されたToDoリストを作成
  • コーディング前に実行手順を計画
  • ワークスペースを体系的に探索
  • 段階的に構築

技術的ライティング

  • 高品質なコードコメント
  • プロフェッショナルなドキュメントスタイル
  • 明確な変数名付け
  • 妥当なアーキテクチャの決定

バックエンドロジック

  • 機能的なExpress.jsのセットアップ
  • 適切なCRUDの実装
  • クリーンなサーバーアーキテクチャ
  • 良好なパッケージ構造

ニュースレタープラットフォームのテストでは、コードを記述する前に構造化された開発計画を作成するMuse Glimmerの能力が示されました。モデルは、ワークスペースの探索、サーバーの作成、購読者のCRUD実装、メールビルダーの構築を含むToDoリストを生成しました。この計画行動は、戦略的計画なしにすぐにコードに飛び込む、より小さく能力の低いモデルと一線を画しています。

最適なユースケース

Muse Glimmerは、バックエンドコードの生成と技術的なテキストの作成に優れています。フロントエンドの視覚タスクについては、専門のUIモデルとペアにするか、視覚デザインを別々に処理することを検討してください。

ローカルデプロイのセットアップガイド

Muse Glimmerをローカルで実行するには、ハードウェアとソフトウェアの環境を慎重に準備する必要があります。このモデルは、48 GBの統合メモリを備えたM5 Proで正常にテストされ、4ビット量子化バージョンで約17トークン/秒の生成速度を達成しました。

1

llama.cppのダウンロードとコンパイル

最新のllama.cppリポジトリをクローンし、特定のハードウェア用にコンパイルします。Apple Siliconユーザーは、最適な推論パフォーマンスを得るために、コンパイル中にMetalフレームワークのサポートが有効になっていることを確認してください。

2

量子化モデルの取得

dynamic quant 4-K Excelバリアントを使用して、Muse Glimmer GGUFファイルをダウンロードします。Ansuelリポジトリは、参照用の詳細なセットアップガイドとともに、事前に量子化されたバージョンを提供しています。

3

サーバー設定の構成

推奨される推論パラメータを適用します。温度1、top P 0.95、top K 64。これらの設定は、最も信頼性の高いコーディングと推論の出力を生成します。

4

起動と接続

llama.cppサーバーを起動し、モデルがメモリに完全にロードされるまで待ちます。サーバーは通常、ポート8080でリッスンします。コーディングハーネスまたはチャットインターフェースをこのエンドポイントに接続します。

5

OpenCodeとの統合

ローカルのMuse GlimmerサーバーエンドポイントをOpenCodeの構成に追加します。複雑なエージェントタスクを割り当てる前に、簡単なプロンプトでサーバーをウォームアップします。

ハードウェア要件とパフォーマンス

ハードウェア層利用可能なRAM量子化期待される速度実現可能性
M5 Pro (48 GB)約20 GB使用4ビット (Q4_K_M)約17 tok/sテスト済みで動作中
M4 Max (64 GB)約20 GB使用4ビット (Q4_K_M)20+ tok/s優秀
標準32 GBきつい余裕4ビット (Q4_K_M)10-15 tok/s可能
16 GB以下不十分推奨されませんN/A実行不可
メモリ割り当て

4ビット量子化されたMuse Glimmerモデルは、推論中に約20 GBのRAMを消費します。スワップなしで安定して動作させるために、システムに少なくとも24 GBの利用可能な統合メモリがあることを確認してください。

推論と論理の評価

コーディングタスクだけでなく、Muse Glimmerは基本的な推論と常識的な論理のシナリオで評価されました。これらのテストは、現実世界の問題解決と物理的推論を処理するモデルの能力を明らかにします。

推論テスト結果

テストシナリオ正解モデルの応答使用トークン時間結果
洗車ロジック車を運転する車を運転する約200約12秒正解
真空中の落下テスト全て同時に落ちるAとDが同時に到着する約1,500約90秒正解
フロントエンド視覚4つの天気カード3つのカード、貧弱な視覚約8,600約8分失敗
画像レンダリングバイクに乗ったペリカンひどく間違っているN/AN/A失敗
推論の強み

Muse Glimmerは、洗車の論理パズルと真空の物理テストの両方を正しく解きました。洗車の応答は、洗車まで歩くことは健康的ですが、車は洗ってもらえないと指摘し、実用的な常識を示しました。

推論テストは、Muse Glimmerのコア論理能力が堅実であることを確認しています。モデルは、真空中では質量は無関係であり、車は自分自身を洗うことはできないことを正しく特定しました。これらの結果は、Muse Sparkからのモデルの蒸留と一致しており、堅牢なマルチステップ推論の基盤に貢献している可能性があります。

Muse Glimmer 能力評価:

  • 常識的な論理パズル(洗車、真空テスト)に合格
  • コーディング前に構造化されたタスク計画を生成
  • 高品質な技術テキストとコードコメントを生成
  • 視覚的なフロントエンドレンダリングタスクに苦労する
  • 4ビットのローカル推論に20 GB以上のRAMが必要
  • Terminal BenchとSWE Bench VerifiedでQwen 3 0.6に遅れをとる

Muse Glimmer コーディングベンチマーク:総合評価

Muse Glimmerは、オープンウェイトモデルの分野におけるMetaの意味のある最初のリリースを代表します。現在、専門のコーディングベンチマークでQwen 3 0.6を上回っていませんが、このモデルは開発者コミュニティの注目に値する明確な利点をもたらします。

強みと弱みのまとめ

カテゴリ強み弱み評価
推論物理学と常識に関する正しい論理複雑な推論に対する生成速度が遅い強力
バックエンドコーディングクリーンなExpress.js、適切なCRUD、良好な構造コードの品質は並外れたものではない良好
フロントエンドコーディング妥当なHTML/CSSのタイポグラフィ貧弱な視覚デザイン、機能しないボタン弱点
タスク計画ToDoリストを作成し、実行前に計画するN/A優秀
技術的ライティングプロフェッショナルなコピー、明確なドキュメントN/A優秀
エージェントタスクツール呼び出し、マルチステップの推論複雑なチェーンでスタックする可能性がある有望
モデル選択の推奨事項

バックエンド開発、技術ドキュメント、エージェントタスク計画にはMuse Glimmerを選択してください。フロントエンド中心の作業やトップクラスのコーディングベンチマークスコアについては、同じパラメータ範囲でQwen 3 0.6が現在より良い結果をもたらします。

最適な用途

  • ローカルエージェント開発
  • バックエンドコード生成
  • 技術ドキュメントの作成
  • タスク計画と構造化されたワークフロー
  • マルチステップ推論アプリケーション
  • Apache 2.0ライセンスの商用プロジェクト

推奨されない用途

  • 複雑なフロントエンドUIのレンダリング
  • 視覚的な画像生成タスク
  • トップクラスのベンチマークの追求
  • リソースが制限された環境(24 GB RAM未満)
  • 最大のコーディング精度を必要とするシナリオ
将来の展望

llama.cppの最適化と改善された量子化メソッドが登場するにつれて、Muse Glimmerのパフォーマンスは大幅に向上する可能性があります。モデルの現在の癖は、根本的なアーキテクチャの制限というよりは、初期段階のツールに起因する可能性があります。さらに、待望のMuse Spark 1.2のオープンウェイトリリースは、このエコシステムをさらに強化する可能性があります。

よくある質問

Q: Qwen 3 0.6と比較して、Muse Glimmerのコーディングベンチマークのパフォーマンスはどのくらいですか?

Muse Glimmerは、Terminal BenchやSWE Bench Verifiedなどの主要なコーディングベンチマークでQwen 3 0.6に遅れをとっています。ただし、Muse Glimmerは、同サイズのモデルと比較して、優れたタスク計画、技術テキスト生成の品質、および構造化されたコードドキュメントを示しています。

Q: ローカル推論にMuse GlimmerはどれくらいのRAMを必要としますか?

4ビット量子化バージョンのMuse Glimmerは、推論中に約20 GBのRAMを必要とします。スワップなしで安定して動作させるために、少なくとも24 GBの利用可能な統合メモリを備えたシステムが推奨されます。48 GBを備えたM5 Proでのテストでは、約17トークン/秒を達成しました。

Q: Muse Glimmerは機能的なフロントエンドアプリケーションを生成できますか?

Muse Glimmerはフロントエンドの視覚タスクに苦労しています。テストでは、要求された4つの天気カードのうち3つのみを視覚品質の悪い状態で生成し、ニュースレタープラットフォームのフロントエンドには機能しないボタンがありました。バックエンドコードの品質は、フロントエンドの出力よりも大幅に優れています。

Q: Muse Glimmerはどのライセンスでリリースされていますか?

Muse Glimmerは、非常に寛容で商用利用とオープンソース利用の両方を許可するApache 2.0ライセンスの下でリリースされています。これにより、制限的なライセンスの懸念なしに、幅広い開発プロジェクトにアクセスできるようになります。

Q: Muse Glimmerはエージェントワークフローに適していますか?

はい、Muse Glimmerは、エンドツーエンドのエージェントタスク完了、信頼性の高いツール呼び出し、マルチステップ推論、障害回復のために特別に最適化されています。コードを実行する前に構造化されたタスク計画を正常に作成します。これはエージェント能力の強力な指標です。