- Muse Glimmer 성능은 30B 모델을 24GB VRAM에 맞추는 K-Quant 빌드에 달려 있습니다.
- DFlash 동반 모델은 초당 최대 233개의 토큰 생성을 가속화합니다.
- 131,072 토큰 컨텍스트를 통해 외부 API 호출 없이 대규모 에이전트 루프가 가능합니다.
- Apache 2.0 라이선스를 통해 소비자용 GPU 및 Mac에서 무료 로컬 배포가 가능합니다.
- MCP Atlas 점수 75.5는 에이전트 툴 사용 부문에서 동급 최고 수준입니다.
Muse Glimmer 성능 개요
Muse Glimmer는 Meta Superintelligence Labs에서 개발한 300억 개 파라미터의 에이전트 모델입니다. 이 모델은 소비자용 하드웨어에서 로컬로 실행되는 상시 실행형(always-on) 에이전트 작업을 위해 특별히 설계되었습니다. 함수 호출, 로컬 코딩, 다른 모델의 출력을 판단하도록 최적화된 밀집(dense) 트랜스포머 형태로 제공됩니다.
동영상 하이라이트:
- K-Quant 빌드를 사용하여 30B 파라미터를 20GB 미만으로 압축
- RTX 5090에서 DFlash 추적 디코딩으로 초당 최대 233 토큰 달성
- Meta의 더 큰 폐쇄형(closed-weight) 교사 모델인 Muse Spark에서 증류(Distilled)됨
- Hugging Face에서 사전 양자화된 GGUF 빌드를 제공하는 Apache 2.0 라이선스
- 2026년 1월 기준 지식 컷오프
Muse Glimmer의 핵심 가치 제안은 클라우드 의존성을 제거하는 것입니다. 기존 에이전트 스택은 모든 단계를 API를 통해 라우팅하여 지연 시간, 토큰 비용 및 데이터 노출을 초래합니다. Glimmer는 파일 옆에 위치하며, 오프라인으로 작동하고 개인 컨텍스트를 기계 내에 완전히 유지함으로써 이를 역전시킵니다.
Muse Glimmer는 처음부터 학습되지 않았습니다. 로짓 증류(logit distillation)를 사용하여 Muse Spark에서 증류되었으며, 그 후 더 긴 컨텍스트, 에이전트 중심 데이터, 더 풍부한 추론 추적(trace)을 사용하여 중간 훈련을 거쳤습니다. 사후 훈련에는 지도 미세 조정, 오피셰(policy) 증류, 추론 및 코딩, 에이전트 작업에 대한 강화 학습이 포함되었습니다.
하드웨어 요구 사항 및 양자화
300억 개 파라미터 모델을 단일 소비자용 GPU에 맞추려면 적극적인 최적화가 필요합니다. 전체 정밀도에서 모델은 55기가바이트 이상의 메모리를 요구합니다. 현재 소비자용 그래픽 카드는 그 용량을 제공하지 않습니다. Meta는 약 4비트 정밀도의 K-Quant 빌드를 제공하여 이 문제를 해결합니다.
| 빌드 유형 | 정밀도 | 모델 크기 | 대상 하드웨어 | 참고 |
|---|---|---|---|---|
| 전체 정밀도 | 16-bit | ~55GB+ | 데이터 센터 GPU | 소비자용으로는 부적합 |
| K-Quant (17GB) | ~4-bit | 17GB 미만 | 24GB 소비자용 GPU | RTX 4090/5090에 적합 |
| K-Quant (Compact) | ~4-bit | 12GB 미만 | 16GB GPU | 더 tight한 KV 캐시 제한 |
| GGUF (Mac) | Q4_K_M | ~18-20GB | Apple Silicon (통합) | Ollama를 통해 실행 |
17기가바이트 빌드는 24기가바이트 카드를 대상으로 합니다. 해당 메모리 공간에는 KV 캐시, 인지 인코더(perception encoder), DFlash 드래프트(drafter) 모델도 있어야 합니다. 안정적인 작동을 위해 VRAM 예산을 계획하는 것이 중요합니다.
24GB VRAM 공간에는 언어 모델 가중치, 131K 컨텍스트 윈도우를 위한 KV 캐시, 이미지 처리를 위한 인지 인코더, DFlash 드래프트가 수용되어야 합니다. 추가 백그라운드 애플리케이션을 실행하면 긴 에이전트 루프 도중 메모리 부족 오류가 발생할 수 있습니다.
Meta는 양자화된 빌드가 일부 예외적인 경우 사소한 품질 차이를 보일 수 있다고 경고합니다. 24GB 빌드는 전체 정밀도와 비교하여 평균 약 1%의 품질 편차를 보입니다. 대부분의 에이전트 워크플로우의 경우 이 절충안은 무시할 수 있지만, 특정 작업에서는 항상 테스트하십시오.
DFlash 가속 및 속도 벤치마크
속도는 로컬 에이전트 성능의 두 번째 주요 장벽입니다. 언어 모델은 일반적으로 한 번에 하나의 토큰을 생성하므로 긴 에이전트 루프가 매우 느려집니다. Muse Glimmer는 토큰 블록을 제안하는 DFlash라는 작은 동반 모델과 함께 제공됩니다. 그런 다음 기본 모델이 이를 병렬로 검증합니다.
| 하드웨어 | 토큰/초 | 속도 향상 | 출처 |
|---|---|---|---|
| RTX 5090 (NVIDIA) | 최대 233 | 3.1배 더 빠름 | Meta 발표 |
| Radeon AI Pro (AMD) | 최대 53 | 기준선 | AMD 발표 |
| Ryzen AI Max (노트북) | 최대 24 | 기준선 | AMD 발표 |
| Apple Silicon (Mac) | 다양함 | 칩에 따라 달라짐 | 커뮤니티 테스트 |
DFlash를 통해 승인된 토큰은 일반 디코딩 출력과 동일합니다. 기본 모델이 제안을 검증할 때 추적 디코딩으로 인한 품질 저하는 없습니다.
DFlash 메커니즘
- 블록 수준 토큰 제안
- 기본 모델에 의한 병렬 검증
- 승인된 토큰의 품질 손실 없음
- 제어 가능한 추론 노력
제어 가능한 추론
- 품질 대 속도 균형
- 작업별 동적 조정
- 간단한 쿼리에 대한 더 빠른 응답
- 복잡한 체인에 대한 더 깊은 추론
인지 인코더
- 이미지 및 스크린샷 읽기
- 차트 및 문서 처리
- 대화와 인터리브(Interleaved)
- 에이전트가 자신의 화면을 볼 수 있음
최대 처리량을 위해서는 런타임 구성에서 DFlash가 활성화되어 있는지 확인하십시오. Ollama 및 LM Studio에서는 드래프트 모델이 감지되면 추적 디코딩이 자동으로 활성화됩니다. 사용자들은 NVIDIA RTX 5090 하드웨어에서 가장 일관된 속도를 보고합니다.
벤치마크 점수 및 비교
Meta는 Muse Glimmer를 에이전트 툴 사용 부문에서 동급 최고로 positioning합니다. MCP Atlas에서 Glimmer는 75.5점을 기록하여 54점과 62점을 기록한 경쟁사를 크게 앞섭니다. 그러나 벤치마크 전반에서 모든 카테고리를 sweeping하는 것은 아닙니다.
| 벤치마크 | Muse Glimmer | 최고 경쟁사 | 리더 |
|---|---|---|---|
| MCP Atlas (에이전트 툴) | 75.5 | 62 (Qwen 3.6) | Muse Glimmer |
| OSWorld | 경쟁력 있음 | 더 높음 | Qwen 3.6 |
| Terminal-Bench | 경쟁력 있음 | 더 높음 | Qwen 3.6 |
| GDPval | 경쟁력 있음 | 더 높음 | Qwen 3.6 |
| 안전성 지표 | 보통 | 더 높음 | Gemma |
이러한 수치는 Meta가 선택한 하니스(harness)에서 측정된 공급업체 보고 수치입니다. 독립적인 검증은 아직 진행 중입니다. Glimmer는 에이전트 툴 사용에서 특히 리더하지만 OSWorld, Terminal-Bench 및 GDPval에서는 Qwen 3.6보다 뒤처집니다. 항상 자신의 워크로드에서 평가하십시오.
Meta의 자체 안전성 행(Row)은 Glimmer보다 Gemma를 선호합니다. Glimmer는 경쟁사보다 더 자주 메모리 제약 조건을 위반하므로, Meta는 에이전트가 되돌릴 수 없는 조치를 취하기 전에 사람의 검토를 촉구합니다.
로컬 배포 설정 가이드
런타임 생태계는 출시 시 빠르게 움직였습니다. Llama.cpp와 Transformers는 출시일(Muse Glimmer Day 0)부터 Muse Glimmer를 지원했습니다. Ollama, LM Studio, Unsloth는 당일 지원을 따랐습니다. 시작하는 것은 대부분의 플랫폼에서 최소한의 구성이 필요합니다.
런타임 선택
플랫폼에 따라 Ollama, LM Studio 또는 llama.cpp 중에서 선택합니다. Ollama는 단일 명령으로 Apple Silicon Mac을 위한 가장 간단한 설정을 제공합니다. LM Studio는 GUI 환경을 제공합니다. Llama.cpp는 고급 사용자를 위한 최대 제어 권한을 제공합니다.
모델 가중치 다운로드
Hugging Face에서 사전 양자화된 GGUF 빌드를 가져옵니다. 24GB NVIDIA 카드의 경우 17GB K-Quant 빌드를 선택합니다. Apple Silicon Mac의 경우 Q4_K_M GGUF 빌드가 권장됩니다. 전체 정밀도 가중치도 Apache 2.0 하에서 사용 가능합니다.
VRAM 예산 구성
VRAM 할당이 모델 가중치, 원하는 컨텍스트 길이에 대한 KV 캐시, 인지 인코더, DFlash 드래프트를 포함하는지 확인하십시오. 안정성이 허용하는 대로 더 짧은 컨텍스트 윈도우로 시작하고 점차 확장하십시오.
DFlash 가속 활성화
런타임에서 추적 디코딩이 활성화되어 있는지 확인하십시오. Ollama에서는 DFlash 드래프트가 자동으로 감지됩니다. LM Studio에서는 가속 설정 패널을 확인하십시오. 이 단계는 경쟁력 있는 토큰 속도를 달성하는 데 중요합니다.
에이전트 루프 테스트
엔드 투 엔드 성능을 검증하기 위해 다단계 에이전트 작업을 실행하십시오. VRAM 사용량, 토큰 처리량, 출력 품질을 모니터링하십시오. 속도와 정확도 사이의 최적의 균형을 찾기 위해 작업별 추론 노력 설정을 조정하십시오.
Apple Silicon Mac에서 배포는 단일 명령입니다: ollama run muse-glimmer. Ollama의 NVIDIA 및 AMD 지원은 출시 당시 아직 적용 중이었습니다. AMD는 Radeon AI Pro에서 초당 최대 53 토큰, Ryzen AI Max 노트북 칩에서 24 토큰을 보여주는 자체 측정값을 발표했습니다.
배포 전 체크리스트:
- GPU에 최소 24GB VRAM (NVIDIA) 또는 32GB 통합 메모리 (Mac)가 있는지 확인
- Hugging Face에서 올바른 K-Quant GGUF 빌드 다운로드
- 최신 버전의 Ollama, LM Studio 또는 llama.cpp 설치
- DFlash 추적 디코딩이 활성화되어 있는지 확인
- 131K 토큰으로 확장하기 전에 짧은 컨텍스트 윈도우로 테스트
- 되돌릴 수 없는 에이전트 작업에 대해 사람의 검토 설정
제한 사항 및 안전성 고려 사항
Muse Glimmer의 경계를 이해하는 것은 책임 있는 배포를 위해 필수적입니다. 모델에는 사용자가 에이전트 워크플로우를 설계할 때 고려해야 하는 특정 제약 조건이 있습니다.
| 카테고리 | 제한 사항 | 영향 | 완화 |
|---|---|---|---|
| 입력 모달리티 | 텍스트 및 이미지만 | 오디오 처리 없음 | 별도의 오디오 모델과 함께 사용 |
| 출력 모달리티 | 텍스트만 | 오디오 생성 없음 | 음성 출력을 위해 TTS 사용 |
| 지식 컷오프 | 2026년 1월 | 최근 이벤트 누락 | 웹 툴로 보완 |
| 메모리 준수 | 제약 조건을 더 자주 위반 | 긴 루프에서 잠재적 OOM | VRAM 활발히 모니터링 |
| 안전성 프로필 | 안전성 행에서 Gemma보다 뒤처짐 | 더 위험한 자율 작업 | 사람의 검토 필요 |
| 양자화 | ~1% 품질 편차 | 사소한 예외적 차이 | 중요한 작업에서 테스트 |
Meta는 Muse Glimmer가 되돌릴 수 없는 조치를 취하기 전에 명시적으로 사람의 검토를 촉구합니다. 모델은 뇌일 뿐입니다. 하니스가 도구, 권한 및 행동에 대한 최종 결정을 소유합니다. 감독 게이트(oversight gates) 없이 파괴적인 작업에 대한 자율 액세스를 부여하지 마십시오.
Muse Glimmer는 텍스트와 이미지만 처리합니다. 오디오 입력 및 출력 기능이 없습니다. 인지 인코더는 대화와 인터리브된 스크린샷, 차트 및 문서를 읽을 수 있어 에이전트가 자신의 화면을 볼 수 있지만, 오디오 워크플로우에는 외부 툴링이 필요합니다.
자주 묻는 질문
Q: Muse Glimmer는 다른 로컬 AI 모델과 어떻게 다른가요?
Muse Glimmer는 일반 대화가 아닌 에이전트 행동을 위해 특별히 훈련되었습니다. 로짓 증류를 사용하여 Meta의 더 큰 Muse Spark 모델에서 증류되었으며, 그 후 에이전트 중심 데이터로 중간 훈련을 거치고 강화 학습으로 사후 훈련을 받았습니다. 이는 일반 채팅 모델에는 없는 정밀한 툴 호출, 실패를 견디는 다단계 계획, 복구 행동을 생성합니다.
Q: Muse Glimmer의 성능이 클라우드 기반 에이전트 모델과 일치할 수 있나요?
MCP Atlas와 같은 에이전트 툴 사용 벤치마크에서 Muse Glimmer는 75.5점을 기록하여 동급 경쟁 모델을 능가합니다. 그러나 OSWorld, Terminal-Bench 및 GDPval에서는 일부 모델보다 뒤처집니다. 주요 이점은 소비자용 하드웨어에서 경쟁력 있는 에이전트 기능을 유지하면서 토큰당 비용, 지연 시간 및 데이터 노출을 제거하는 것입니다.
Q: 로컬에서 Muse Glimmer를 실행하려면 어떤 하드웨어가 필요한가요?
주요 대상은 RTX 4090 또는 RTX 5090과 같은 24GB VRAM GPU입니다. 17GB K-Quant 빌드는 KV 캐시, 인지 인코더 및 DFlash 드래프트와 함께 해당 공간에 맞습니다. 충분한 통합 메모리를 갖춘 Apple Silicon Mac도 Ollama를 통해 작동합니다. AMD Radeon AI Pro 및 Ryzen AI Max 칩은 각각 53 및 24 토큰/초의 측정된 속도로 지원됩니다.
Q: DFlash 추적 디코딩은 어떻게 작동하나요?
DFlash는 한 번에 하나의 토큰을 생성하는 대신 전체 토큰 블록을 제안하는 작은 동반 모델입니다. 그런 다음 기본 Muse Glimmer 모델이 이 제안을 병렬로 검증합니다. 승인된 토큰은 품질 손실 없이 일반 디코딩 출력과 동일합니다. RTX 5090에서 이는 초당 최대 233 토큰을 달성하여 표준 디코딩보다 3.1배 더 빠릅니다.
Q: Muse Glimmer는 자율 에이전트 작업에 안전한가요?
Meta는 되돌릴 수 없는 조치를 취하기 전에 사람의 검토를 촉구합니다. Glimmer는 일부 경쟁사보다 더 자주 메모리 제약 조건을 위반하며, Meta의 자체 안전성 행은 Gemma를 선호합니다. 모델은 뇌일 뿐입니다. 하니스는 도구, 권한 및 행동에 대한 최종 결정에 대한 제어권을 유지합니다. 파괴적인 작업에 대해서는 항상 감독 게이트를 구현하십시오.