Muse Glimmer: 설정 가이드 및 로컬 에이전트 성능 - 비전

Muse Glimmer: 설정 가이드 및 로컬 에이전트 성능

로컬 AI 에이전트를 위한 Muse Glimmer 30B 모델 설정, 구성 및 최적화 방법을 알아보세요. 하드웨어 사양 및 벤치마크 비교도 포함되어 있습니다.

2026-08-11
muse glimmer 위키 팀
빠른 가이드
  • Muse Glimmer는 1.8B 비전 인코더가 포함된 29.6B 매개변수의 밀집 언어 모델입니다.
  • 로컬 배포는 4비트 양자화를 통해 24GB VRAM을 목표로 하는 소비자 하드웨어에 맞게 최적화되었습니다.
  • DFlash 드래프터는 패스당 16개의 토큰 블록을 제안하여 토큰 생성 속도를 최대 3.1배 가속화합니다.
  • Apache 2.0 라이선스는 제한적인 사용자 한도 없이 상업적 사용을 허용합니다.
  • 에이전트 벤치마크는 강력한 도구 호출 성능을 보여주며, 코딩 작업에서도 경쟁력을 유지합니다.

Muse Glimmer 개요 및 아키텍처

Muse Glimmer는 2026년 8월 10일 Meta가 공개한 오픈 소스 에이전트 AI 모델입니다. 상시 켜져 있는 로컬 에이전트를 위해 특별히 설계되었으며, 클라우드 API에 의존하지 않고 깊은 개인 컨텍스트 처리를 강조합니다. 커뮤니티 라이선스 대안에서 종종 발견되는 상업적 제한을 제거한, 진정으로 관대한 Apache 2.0 라이선스로 제공됩니다.

비디오 하이라이트:

  • 296억 개 매개변수의 밀집 모델 (전문가 혼합 아님)
  • 멀티모달 입력을 위한 18억 개 매개변수의 비전 인코더
  • 확장된 대화를 위한 131,000 토큰 컨텍스트 창
  • Meta의 더 큰 Muse Spark 모델로부터의 로짓 증류를 통해 학습됨
  • DFlash 블록 확산 드래프터는 순방향 패스당 16개의 토큰을 제안함

이 아키텍처는 밀집 구조를 선호하여 전문가 혼합(Mixture-of-Experts)을 피하며, 이는 배포를 단순화하지만 메모리 관리에 주의가 필요합니다. 첨부된 비전 인코더를 통해 모델은 텍스트와 함께 이미지를 처리할 수 있어 화면 읽기 에이전트 및 파일 정리 작업에 적합합니다.

디자인 철학

핵심 디자인 목표는 소비자가 이미 소유하고 있는 하드웨어에 유능한 에이전트를 탑재하는 것이었습니다. 24GB VRAM 한도를 목표로 함으로써, Meta는 기업급 인프라 없이도 로컬 에이전트 AI를 접근 가능하게 만들었습니다.

핵심 사양

사양비고
매개변수29.6B (밀집형)전문가 혼합 라우팅 없음
비전 인코더1.8B이미지 및 텍스트 처리
컨텍스트 창131,000 토큰확장된 에이전트 루프 지원
라이선스Apache 2.0진정으로 관대함, 사용자 한도 없음
양자화~4-bit모델 크기를 20GB 미만으로 축소

학습 파이프라인

이 모델은 각 단계의 이전 기능을 기반으로 구축되는 세 가지 뚜렷한 단계로 학습되었습니다.

단계방법중점 분야
사전 학습Muse Spark로부터의 로짓 증류전체 출력 분포 일치
중간 학습에이전트 중심의 데이터 보강더 긴 컨텍스트, 더 풍부한 추적 추론
사후 학습SFT + 온폴리시 증류 + RL정렬 및 지시 따르기

하드웨어 요구 사항 및 양자화

소비자 하드웨어에서 30B 매개변수 모델을 실행하는 것은 중대한 엔지니어링 과제를 안겨줍니다. 전체 정밀도(BF16)에서 이 모델은 55GB 이상의 VRAM을 필요로 하며, 이는 2026년에 사용 가능한 단일 소비자용 그래픽 카드의 용량을 초과하는 수치입니다.

메모리 예산

전체 정밀도에서 Muse Glimmer는 55GB 이상이 필요합니다. Meta의 4비트 양자화는 언어 모델을 20GB 미만으로 줄여주어, 24GB 할당량 내에서 KV 캐시, 비전 인코더 및 DFlash 드래프터를 위한 중요한 여유 공간을 남겨둡니다.

Meta의 솔루션에는 약 4비트로의 공격적인 양자화가 포함되며, 이는 언어 모델의 풋프린트를 20GB 미만으로 줄입니다. 이를 통해 24GB VRAM 예산 내에서 동시에 상주해야 하는 세 가지 구성 요소(KV 캐시, 비전 인코더 및 DFlash 드래프터 네트워크)를 위해 약 4GB의 여유 공간이 남게 됩니다.

양자화 트레이드오프

구성VRAM 사용량성능 저하대상 하드웨어
전체 정밀도 (BF16)55GB+없음 (기준선)멀티 GPU / 엔터프라이즈
4비트 양자화20GB 미만15개 벤치마크 평균 ~1%RTX 5090 / 24GB 카드
GGUF (Unsloth)~17GB (Q_K)최소, 포맷에 따라 다름24GB 소비자 카드
GGUF 동적~22GB (Q_K_D)최소, 포맷에 따라 다름32GB 소비자 카드
성능 저하 세부 정보

Meta는 4비트 양자화를 사용할 때 15개 벤치마크를 평균하여 1%의 성능 저하를 측정했습니다. 이는 VRAM 요구 사항을 절반 이상 줄이면서도 매우 적은 트레이드오프입니다.

사용 가능한 가중치 산출물

Meta는 별도의 DFlash 드래프터 가중치와 함께 meta-llama 조직 아래 Hugging Face에 세 가지 주요 산출물을 게시했습니다.

산출물형식주요 사용 사례
전체 정밀도BF16파인튜닝 및 연구
4비트 빌드 (표준)양자화됨24GB VRAM 배포
4비트 빌드 (동적)양자화됨32GB VRAM 배포
DFlash 드래프터별도블록 확산 가속

DFlash 드래프터 및 추론 속도

Muse Glimmer에서 기술적으로 가장 흥미로운 최적화는 추론 중에 토큰이 생성되는 방식을 근본적으로 변화시키는 5계층 블록 확산 네트워크인 DFlash 드래프터입니다.

타협 없는 속도

DFlash 검증은 정확하기 때문에 출력 결과는 토큰 단위 디코딩이 생성하는 것과 동일합니다. 답변 품질을 변경하지 않고도 최대 3.1배의 속도 향상을 얻을 수 있습니다.

일반적으로 언어 모델은 순방향 패스당 하나의 토큰을 내보내므로 긴 추론 체인이 느리게 느껴집니다. DFlash 드래프터는 단일 패스에서 16개의 토큰 블록 전체를 제안합니다. 그런 다음 기본 모델은 16개의 토큰을 모두 병렬로 검증하고, 동의하는 토큰을 유지하며, 동의하지 않는 첫 번째 토큰을 수정합니다.

측정된 처리량 향상

하드웨어기준선 (tok/s)DFlash 적용시 (tok/s)속도 향상
RTX 509074.9233.43.1x
M5 Max기준선기준선 x1.81.8x
M4 Max기준선기준선 x1.51.5x
벤치마크 주의사항

이 수치는 공급업체에서 측정한 배치 크기 1의 탐욕적 디코딩을 나타냅니다. 도구 호출, 파일 I/O 및 다중 턴 추론이 포함된 실제 에이전트 루프에서는 이러한 정확한 수치를 달성할 수 없습니다.

단계별 로컬 설정 가이드

로컬 추론을 위해 Muse Glimmer를 설정하려면 적절한 런타임을 선택하고, 적절한 가중치를 다운로드하고, 생성 매개변수를 구성해야 합니다. 표준 로컬 배포를 위해 다음 단계를 따르세요.

1

런타임 선택

서버 배포의 경우 vLLM과 SGLang 모두 모델 경로를 직접 허용합니다. 데스크톱 사용의 경우, 출시 당시 llama.cpp, MLX 및 ExecuTorch 통합이 아직 진행 중이었으므로 사용 전 호환성을 확인하세요. Ollama와 LM Studio는 곧 지원될 예정으로 명시되어 있었습니다.

2

Hugging Face에서 가중치 다운로드

Hugging Face의 meta-llama 모델 저장소로 이동하세요. 24GB 카드는 4비트 표준 빌드(약 17GB)를 다운로드하고, 32GB 카드는 4비트 동적 빌드를 다운로드하세요. 블록 확산 가속을 원한다면 DFlash 드래프터 가중치를 별도로 다운로드하세요.

3

생성 매개변수 구성

Meta는 최적의 성능을 위해 특정 설정을 권장합니다. 온도를 1.0으로, top_p를 0.95로, top_k를 64로 설정하세요. 이 값들은 벤치마크 테스트 중에 사용되었으며 튜닝된 기준선을 나타냅니다.

4

추론 강도 설정

시스템 프롬프트에서 추론 강도를 구성하세요. 옵션은 낮음, 중간, 높음 또는 매우 높음입니다. 에이전트 및 코딩 워크로드의 경우 '높음' 또는 '매우 높음'을 사용하세요. Meta가 게시한 벤치마크 수치는 '높음' 추론 설정에서 측정되었습니다.

5

검증 및 테스트

간단한 에이전트 루프를 실행하여 KV 캐시, 비전 인코더 및 드래프터가 모두 VRAM 예산 내에 로드되는지 확인하세요. 성능이 심각하게 저하될 수 있는 시스템 RAM으로의 유출이 없는지 메모리 사용량을 모니터링하세요.

추론 강도가 중요합니다

낮은 추론 강도로 Muse Glimmer를 실행하면 벤치마크 보고서에서 읽은 모델을 실행하는 것이 아닙니다. 의도된 성능 프로필을 얻으려면 에이전트 작업에 항상 '높음' 또는 '매우 높음'을 사용하세요.

권장 생성 설정

매개변수권장 값목적
온도 (Temperature)1.0생성의 무작위성 제어
Top_p0.95핵 샘플링 임계값
Top_k64각 단계별 토큰 풀 제한
추론 강도높음 / 매우 높음추론 추적의 깊이 제어

벤치마크 분석: 강점 및 약점

Meta의 벤치마크 비교는 Muse Glimmer를 Gemma 4 31B 및 Qwen 3.6 27B와 경쟁시킵니다. 에이전트 부문에서의 승리는 진정하지만, 전체 표를 주의 깊게 읽어보면 헤드라인이 암시하는 것보다 더 미묘한 그림을 보여줍니다.

전체 표를 읽어보세요

Meta가 Qwen 3.6과 비교하여 세 모델을 모두 나열한 모든 행에서 Muse Glimmer는 12번 승리하고 10번 패배했습니다. 이는 압승이라기보다는 동전 던지기에 가깝습니다. 패배한 특정 카테고리는 주의 깊게 살펴봐야 합니다.

에이전트 벤치마크 승리

벤치마크Muse GlimmerQwen 3.6 27BGemma 4 31B
MCP Atlas (도구 호출)75.562.554.2
Gaia 2 (심층 검색 QA)승리패배패배
AIME 2026승리패배패배
지시 따르기승리패배패배

Glimmer가 부족한 카테고리

벤치마크Muse GlimmerQwen 3.6 27B격차
SWE-bench Verified76.077.2-1.2
Terminal Bench51.760.7-9.0
OSWorld Verified65.975.6-9.7
코딩 에이전트 현실 점검

Glimmer가 가장 뒤처지는 세 가지 벤치마크(SWE-bench, Terminal Bench, OSWorld)는 실제 코딩 에이전트 워크로드와 가장 유사합니다. 주요 사용 사례가 로컬 코딩 에이전트인 경우, Meta의 자체 표에 따르면 Code Llama 3.6이 여전히 매력적인 선택지입니다.

개인정보 보호 및 보안 고려 사항

런칭 보도에서 받았던 것보다 더 많은 관심을 받아야 할 수치 중 하나는 모델이 사용자를 대신하여 행동할 때 유출해서는 안 되는 정보를 새어나가게 하는지 여부를 측정하는 CI Memories 위반율입니다.

모델CI Memories 위반율
Muse Glimmer26.4%
Gemma 412.1%
Qwen 3.6명시되지 않음
개인정보 보호 위험

Muse Glimmer를 실제 받은편지함이나 민감한 파일에 연결하는 경우, 26.4%의 위반율은 심각한 관심을 받아야 합니다. 개인 또는 기밀 데이터를 처리하는 사용자에게 이 격차는 에이전트 벤치마크 승리보다 실질적으로 더 중요합니다.

배포 비교 및 권장 사항

다양한 배포 시나리오는 다양한 모델 구성을 필요로 합니다. 일반적인 사용 사례에서 Muse Glimmer가 어떻게 비교되는지는 다음과 같습니다.

로컬 에이전트 (일반)

  • 최적의 선택: Muse Glimmer
  • 강력한 도구 호출 (MCP Atlas: 75.5)
  • 4비트 양자화로 24GB VRAM에 적합
  • Apache 2.0 라이선스로 상업적 배포 가능
  • CI Memories 위반율 주의

로컬 코딩 에이전트

  • 최적의 선택: Code Llama 3.6
  • SWE-bench 및 Terminal Bench에서 더 우수
  • 코딩 분야에서 Meta 자체 표가 선호함
  • 도구 호출이 주 목적이라면 Glimmer 고려

민감한 개인정보 작업

  • 주의하여 사용
  • CI Memories 위반율 26.4%
  • 12.1%인 Gemma 4가 더 안전함
  • 개선을 위해 출시 후 패치 대기
이것은 누구를 위한 것인가요?

사용자가 보유한 하드웨어에서 계획하고, 도구를 호출하며, 실패에서 복구할 수 있고 배포를 허용하는 라이선스가 적용된 로컬 에이전트를 원한다면, Muse Glimmer는 2026년 현재까지 출시된 가장 강력한 옵션입니다.

배포 전 체크리스트:

  • GPU에 최소 24GB VRAM이 있는지 확인
  • Hugging Face에서 4비트 양자화 가중치 다운로드
  • 런타임이 모델을 지원하는지 확인 (vLLM, SGLang, llama.cpp)
  • 온도를 1.0으로, top_p를 0.95로, top_k를 64로 설정
  • 에이전트 작업을 위해 추론 강도를 높음 또는 매우 높음으로 구성
  • 사용 사례에 대한 CI Memories 개인정보 보호 영향 검토
  • 추론 가속을 위해 DFlash 드래프터를 별도로 다운로드

FAQ

Q: Muse Glimmer란 무엇이며 언제 출시되었나요?

Muse Glimmer는 18억 개 매개변수의 비전 인코더가 포함된 296억 개 매개변수의 밀집 에이전트 AI 모델로, 2026년 8월 10일 Meta에 의해 오픈 소스로 공개되었습니다. 상시 켜져 있는 로컬 에이전트를 위해 설계되었으며 Apache 2.0 라이선스로 제공됩니다.

Q: Muse Glimmer는 소비자용 GPU에서 실행될 수 있나요?

네. 4비트 양자화를 통해 언어 모델이 20GB 미만으로 맞춰지므로 RTX 5090과 같은 24GB VRAM 소비자용 카드에 배포할 수 있습니다. 남은 여유 공간에 KV 캐시, 비전 인코더 및 DFlash 드래프터가 수용됩니다.

Q: DFlash 드래프터는 추론 속도를 어떻게 향상시키나요?

DFlash 드래프터는 순방향 패스당 하나 대신 16개의 토큰을 제안하는 5계층 블록 확산 네트워크입니다. 기본 모델은 16개의 토큰을 모두 병렬로 검증하여 표준 디코딩과 동일한 출력을 생성하면서도 RTX 5090에서 최대 3.1배의 속도 향상을 달성합니다.

Q: 코딩 작업에 있어 Muse Glimmer가 Qwen 3.6보다 더 나은가요?

반드시 그렇지는 않습니다. Muse Glimmer는 도구 호출 및 에이전트 벤치마크에서 승리하지만, 실제 코딩 에이전트 워크로드와 가장 유사한 SWE-bench Verified, Terminal Bench 및 OSWorld Verified에서는 Qwen 3.6 27B에 뒤처집니다. Code Llama 3.6 역시 코딩 전용 사용 사례에서 경쟁력을 유지하고 있습니다.

Q: 어떤 개인정보 보호 우려 사항을 알아야 하나요?

Muse Glimmer는 모델이 사용자를 대신하여 행동할 때 유출해서는 안 되는 정보를 새어나가게 하는지 테스트하는 CI Memories에서 26.4%의 위반율을 기록했습니다. 이는 Gemma 4의 12.1% 위반율보다 현저히 높은 수치입니다. 모델을 실제 받은편지함이나 민감한 개인 데이터에 연결할 때는 각별히 주의해야 합니다.