Muse Glimmer 성능: 로컬 AI 에이전트 설정 가이드 - 벤치마크

Muse Glimmer 성능: 로컬 AI 에이전트 설정 가이드

소비자용 하드웨어에서 Muse Glimmer 성능을 극대화하세요. 양자화, DFlash 가속 및 로컬 에이전트를 위한 벤치마크 점수를 알아봅니다.

2026-08-11
muse glimmer Wiki 팀
빠른 가이드
  • Muse Glimmer 성능은 30B 모델을 24GB VRAM에 맞추는 K-Quant 빌드에 달려 있습니다.
  • DFlash 동반 모델은 초당 최대 233개의 토큰 생성을 가속화합니다.
  • 131,072 토큰 컨텍스트를 통해 외부 API 호출 없이 대규모 에이전트 루프가 가능합니다.
  • Apache 2.0 라이선스를 통해 소비자용 GPU 및 Mac에서 무료 로컬 배포가 가능합니다.
  • MCP Atlas 점수 75.5는 에이전트 툴 사용 부문에서 동급 최고 수준입니다.

Muse Glimmer 성능 개요

Muse Glimmer는 Meta Superintelligence Labs에서 개발한 300억 개 파라미터의 에이전트 모델입니다. 이 모델은 소비자용 하드웨어에서 로컬로 실행되는 상시 실행형(always-on) 에이전트 작업을 위해 특별히 설계되었습니다. 함수 호출, 로컬 코딩, 다른 모델의 출력을 판단하도록 최적화된 밀집(dense) 트랜스포머 형태로 제공됩니다.

동영상 하이라이트:

  • K-Quant 빌드를 사용하여 30B 파라미터를 20GB 미만으로 압축
  • RTX 5090에서 DFlash 추적 디코딩으로 초당 최대 233 토큰 달성
  • Meta의 더 큰 폐쇄형(closed-weight) 교사 모델인 Muse Spark에서 증류(Distilled)됨
  • Hugging Face에서 사전 양자화된 GGUF 빌드를 제공하는 Apache 2.0 라이선스
  • 2026년 1월 기준 지식 컷오프

Muse Glimmer의 핵심 가치 제안은 클라우드 의존성을 제거하는 것입니다. 기존 에이전트 스택은 모든 단계를 API를 통해 라우팅하여 지연 시간, 토큰 비용 및 데이터 노출을 초래합니다. Glimmer는 파일 옆에 위치하며, 오프라인으로 작동하고 개인 컨텍스트를 기계 내에 완전히 유지함으로써 이를 역전시킵니다.

핵심 아키텍처

Muse Glimmer는 처음부터 학습되지 않았습니다. 로짓 증류(logit distillation)를 사용하여 Muse Spark에서 증류되었으며, 그 후 더 긴 컨텍스트, 에이전트 중심 데이터, 더 풍부한 추론 추적(trace)을 사용하여 중간 훈련을 거쳤습니다. 사후 훈련에는 지도 미세 조정, 오피셰(policy) 증류, 추론 및 코딩, 에이전트 작업에 대한 강화 학습이 포함되었습니다.

하드웨어 요구 사항 및 양자화

300억 개 파라미터 모델을 단일 소비자용 GPU에 맞추려면 적극적인 최적화가 필요합니다. 전체 정밀도에서 모델은 55기가바이트 이상의 메모리를 요구합니다. 현재 소비자용 그래픽 카드는 그 용량을 제공하지 않습니다. Meta는 약 4비트 정밀도의 K-Quant 빌드를 제공하여 이 문제를 해결합니다.

빌드 유형정밀도모델 크기대상 하드웨어참고
전체 정밀도16-bit~55GB+데이터 센터 GPU소비자용으로는 부적합
K-Quant (17GB)~4-bit17GB 미만24GB 소비자용 GPURTX 4090/5090에 적합
K-Quant (Compact)~4-bit12GB 미만16GB GPU더 tight한 KV 캐시 제한
GGUF (Mac)Q4_K_M~18-20GBApple Silicon (통합)Ollama를 통해 실행

17기가바이트 빌드는 24기가바이트 카드를 대상으로 합니다. 해당 메모리 공간에는 KV 캐시, 인지 인코더(perception encoder), DFlash 드래프트(drafter) 모델도 있어야 합니다. 안정적인 작동을 위해 VRAM 예산을 계획하는 것이 중요합니다.

VRAM 예산 책정

24GB VRAM 공간에는 언어 모델 가중치, 131K 컨텍스트 윈도우를 위한 KV 캐시, 이미지 처리를 위한 인지 인코더, DFlash 드래프트가 수용되어야 합니다. 추가 백그라운드 애플리케이션을 실행하면 긴 에이전트 루프 도중 메모리 부족 오류가 발생할 수 있습니다.

양자화 절충안

Meta는 양자화된 빌드가 일부 예외적인 경우 사소한 품질 차이를 보일 수 있다고 경고합니다. 24GB 빌드는 전체 정밀도와 비교하여 평균 약 1%의 품질 편차를 보입니다. 대부분의 에이전트 워크플로우의 경우 이 절충안은 무시할 수 있지만, 특정 작업에서는 항상 테스트하십시오.

DFlash 가속 및 속도 벤치마크

속도는 로컬 에이전트 성능의 두 번째 주요 장벽입니다. 언어 모델은 일반적으로 한 번에 하나의 토큰을 생성하므로 긴 에이전트 루프가 매우 느려집니다. Muse Glimmer는 토큰 블록을 제안하는 DFlash라는 작은 동반 모델과 함께 제공됩니다. 그런 다음 기본 모델이 이를 병렬로 검증합니다.

하드웨어토큰/초속도 향상출처
RTX 5090 (NVIDIA)최대 2333.1배 더 빠름Meta 발표
Radeon AI Pro (AMD)최대 53기준선AMD 발표
Ryzen AI Max (노트북)최대 24기준선AMD 발표
Apple Silicon (Mac)다양함칩에 따라 달라짐커뮤니티 테스트

DFlash를 통해 승인된 토큰은 일반 디코딩 출력과 동일합니다. 기본 모델이 제안을 검증할 때 추적 디코딩으로 인한 품질 저하는 없습니다.

DFlash 메커니즘

  • 블록 수준 토큰 제안
  • 기본 모델에 의한 병렬 검증
  • 승인된 토큰의 품질 손실 없음
  • 제어 가능한 추론 노력

제어 가능한 추론

  • 품질 대 속도 균형
  • 작업별 동적 조정
  • 간단한 쿼리에 대한 더 빠른 응답
  • 복잡한 체인에 대한 더 깊은 추론

인지 인코더

  • 이미지 및 스크린샷 읽기
  • 차트 및 문서 처리
  • 대화와 인터리브(Interleaved)
  • 에이전트가 자신의 화면을 볼 수 있음
속도 최적화

최대 처리량을 위해서는 런타임 구성에서 DFlash가 활성화되어 있는지 확인하십시오. Ollama 및 LM Studio에서는 드래프트 모델이 감지되면 추적 디코딩이 자동으로 활성화됩니다. 사용자들은 NVIDIA RTX 5090 하드웨어에서 가장 일관된 속도를 보고합니다.

벤치마크 점수 및 비교

Meta는 Muse Glimmer를 에이전트 툴 사용 부문에서 동급 최고로 positioning합니다. MCP Atlas에서 Glimmer는 75.5점을 기록하여 54점과 62점을 기록한 경쟁사를 크게 앞섭니다. 그러나 벤치마크 전반에서 모든 카테고리를 sweeping하는 것은 아닙니다.

벤치마크Muse Glimmer최고 경쟁사리더
MCP Atlas (에이전트 툴)75.562 (Qwen 3.6)Muse Glimmer
OSWorld경쟁력 있음더 높음Qwen 3.6
Terminal-Bench경쟁력 있음더 높음Qwen 3.6
GDPval경쟁력 있음더 높음Qwen 3.6
안전성 지표보통더 높음Gemma
벤치마크 문맥

이러한 수치는 Meta가 선택한 하니스(harness)에서 측정된 공급업체 보고 수치입니다. 독립적인 검증은 아직 진행 중입니다. Glimmer는 에이전트 툴 사용에서 특히 리더하지만 OSWorld, Terminal-Bench 및 GDPval에서는 Qwen 3.6보다 뒤처집니다. 항상 자신의 워크로드에서 평가하십시오.

Meta의 자체 안전성 행(Row)은 Glimmer보다 Gemma를 선호합니다. Glimmer는 경쟁사보다 더 자주 메모리 제약 조건을 위반하므로, Meta는 에이전트가 되돌릴 수 없는 조치를 취하기 전에 사람의 검토를 촉구합니다.

로컬 배포 설정 가이드

런타임 생태계는 출시 시 빠르게 움직였습니다. Llama.cpp와 Transformers는 출시일(Muse Glimmer Day 0)부터 Muse Glimmer를 지원했습니다. Ollama, LM Studio, Unsloth는 당일 지원을 따랐습니다. 시작하는 것은 대부분의 플랫폼에서 최소한의 구성이 필요합니다.

1

런타임 선택

플랫폼에 따라 Ollama, LM Studio 또는 llama.cpp 중에서 선택합니다. Ollama는 단일 명령으로 Apple Silicon Mac을 위한 가장 간단한 설정을 제공합니다. LM Studio는 GUI 환경을 제공합니다. Llama.cpp는 고급 사용자를 위한 최대 제어 권한을 제공합니다.

2

모델 가중치 다운로드

Hugging Face에서 사전 양자화된 GGUF 빌드를 가져옵니다. 24GB NVIDIA 카드의 경우 17GB K-Quant 빌드를 선택합니다. Apple Silicon Mac의 경우 Q4_K_M GGUF 빌드가 권장됩니다. 전체 정밀도 가중치도 Apache 2.0 하에서 사용 가능합니다.

3

VRAM 예산 구성

VRAM 할당이 모델 가중치, 원하는 컨텍스트 길이에 대한 KV 캐시, 인지 인코더, DFlash 드래프트를 포함하는지 확인하십시오. 안정성이 허용하는 대로 더 짧은 컨텍스트 윈도우로 시작하고 점차 확장하십시오.

4

DFlash 가속 활성화

런타임에서 추적 디코딩이 활성화되어 있는지 확인하십시오. Ollama에서는 DFlash 드래프트가 자동으로 감지됩니다. LM Studio에서는 가속 설정 패널을 확인하십시오. 이 단계는 경쟁력 있는 토큰 속도를 달성하는 데 중요합니다.

5

에이전트 루프 테스트

엔드 투 엔드 성능을 검증하기 위해 다단계 에이전트 작업을 실행하십시오. VRAM 사용량, 토큰 처리량, 출력 품질을 모니터링하십시오. 속도와 정확도 사이의 최적의 균형을 찾기 위해 작업별 추론 노력 설정을 조정하십시오.

플랫폼별 참고 사항

Apple Silicon Mac에서 배포는 단일 명령입니다: ollama run muse-glimmer. Ollama의 NVIDIA 및 AMD 지원은 출시 당시 아직 적용 중이었습니다. AMD는 Radeon AI Pro에서 초당 최대 53 토큰, Ryzen AI Max 노트북 칩에서 24 토큰을 보여주는 자체 측정값을 발표했습니다.

배포 전 체크리스트:

  • GPU에 최소 24GB VRAM (NVIDIA) 또는 32GB 통합 메모리 (Mac)가 있는지 확인
  • Hugging Face에서 올바른 K-Quant GGUF 빌드 다운로드
  • 최신 버전의 Ollama, LM Studio 또는 llama.cpp 설치
  • DFlash 추적 디코딩이 활성화되어 있는지 확인
  • 131K 토큰으로 확장하기 전에 짧은 컨텍스트 윈도우로 테스트
  • 되돌릴 수 없는 에이전트 작업에 대해 사람의 검토 설정

제한 사항 및 안전성 고려 사항

Muse Glimmer의 경계를 이해하는 것은 책임 있는 배포를 위해 필수적입니다. 모델에는 사용자가 에이전트 워크플로우를 설계할 때 고려해야 하는 특정 제약 조건이 있습니다.

카테고리제한 사항영향완화
입력 모달리티텍스트 및 이미지만오디오 처리 없음별도의 오디오 모델과 함께 사용
출력 모달리티텍스트만오디오 생성 없음음성 출력을 위해 TTS 사용
지식 컷오프2026년 1월최근 이벤트 누락웹 툴로 보완
메모리 준수제약 조건을 더 자주 위반긴 루프에서 잠재적 OOMVRAM 활발히 모니터링
안전성 프로필안전성 행에서 Gemma보다 뒤처짐더 위험한 자율 작업사람의 검토 필요
양자화~1% 품질 편차사소한 예외적 차이중요한 작업에서 테스트
중요 안전성 권고 사항

Meta는 Muse Glimmer가 되돌릴 수 없는 조치를 취하기 전에 명시적으로 사람의 검토를 촉구합니다. 모델은 뇌일 뿐입니다. 하니스가 도구, 권한 및 행동에 대한 최종 결정을 소유합니다. 감독 게이트(oversight gates) 없이 파괴적인 작업에 대한 자율 액세스를 부여하지 마십시오.

모델 경계

Muse Glimmer는 텍스트와 이미지만 처리합니다. 오디오 입력 및 출력 기능이 없습니다. 인지 인코더는 대화와 인터리브된 스크린샷, 차트 및 문서를 읽을 수 있어 에이전트가 자신의 화면을 볼 수 있지만, 오디오 워크플로우에는 외부 툴링이 필요합니다.

자주 묻는 질문

Q: Muse Glimmer는 다른 로컬 AI 모델과 어떻게 다른가요?

Muse Glimmer는 일반 대화가 아닌 에이전트 행동을 위해 특별히 훈련되었습니다. 로짓 증류를 사용하여 Meta의 더 큰 Muse Spark 모델에서 증류되었으며, 그 후 에이전트 중심 데이터로 중간 훈련을 거치고 강화 학습으로 사후 훈련을 받았습니다. 이는 일반 채팅 모델에는 없는 정밀한 툴 호출, 실패를 견디는 다단계 계획, 복구 행동을 생성합니다.

Q: Muse Glimmer의 성능이 클라우드 기반 에이전트 모델과 일치할 수 있나요?

MCP Atlas와 같은 에이전트 툴 사용 벤치마크에서 Muse Glimmer는 75.5점을 기록하여 동급 경쟁 모델을 능가합니다. 그러나 OSWorld, Terminal-Bench 및 GDPval에서는 일부 모델보다 뒤처집니다. 주요 이점은 소비자용 하드웨어에서 경쟁력 있는 에이전트 기능을 유지하면서 토큰당 비용, 지연 시간 및 데이터 노출을 제거하는 것입니다.

Q: 로컬에서 Muse Glimmer를 실행하려면 어떤 하드웨어가 필요한가요?

주요 대상은 RTX 4090 또는 RTX 5090과 같은 24GB VRAM GPU입니다. 17GB K-Quant 빌드는 KV 캐시, 인지 인코더 및 DFlash 드래프트와 함께 해당 공간에 맞습니다. 충분한 통합 메모리를 갖춘 Apple Silicon Mac도 Ollama를 통해 작동합니다. AMD Radeon AI Pro 및 Ryzen AI Max 칩은 각각 53 및 24 토큰/초의 측정된 속도로 지원됩니다.

Q: DFlash 추적 디코딩은 어떻게 작동하나요?

DFlash는 한 번에 하나의 토큰을 생성하는 대신 전체 토큰 블록을 제안하는 작은 동반 모델입니다. 그런 다음 기본 Muse Glimmer 모델이 이 제안을 병렬로 검증합니다. 승인된 토큰은 품질 손실 없이 일반 디코딩 출력과 동일합니다. RTX 5090에서 이는 초당 최대 233 토큰을 달성하여 표준 디코딩보다 3.1배 더 빠릅니다.

Q: Muse Glimmer는 자율 에이전트 작업에 안전한가요?

Meta는 되돌릴 수 없는 조치를 취하기 전에 사람의 검토를 촉구합니다. Glimmer는 일부 경쟁사보다 더 자주 메모리 제약 조건을 위반하며, Meta의 자체 안전성 행은 Gemma를 선호합니다. 모델은 뇌일 뿐입니다. 하니스는 도구, 권한 및 행동에 대한 최종 결정에 대한 제어권을 유지합니다. 파괴적인 작업에 대해서는 항상 감독 게이트를 구현하십시오.