- Muse Glimmer Apache 2.0: Meta Super Intelligence Labs의 30B 매개변수 오픈 가중치 에이전트 모델
- 로컬 배포: 4-bit 양자화를 사용하여 20GB 미만의 메모리로 소비자 하드웨어에서 실행
- 에이전트 우선 설계: 다단계 작업, 도구 호출 및 오류 복구를 위해 특별히 훈련됨
- 멀티모달 입력: 이미지 이해를 위한 1.8B 매개변수 비전 인코더 포함
- 깔끔한 라이선스: Apache 2.0은 맞춤형 법적 제한 없이 상업적 사용을 허용
Muse Glimmer Apache 2.0: 핵심 사양
Muse Glimmer는 Meta Super Intelligence Labs에서 진정으로 관대한 Apache 2.0 라이선스로 출시한 300억 매개변수 오픈 가중치 모델입니다. 제한적인 커뮤니티 라이선스를 가진 모델과 달리, Muse Glimmer는 전 세계 주요 인프라 프로젝트를 지원하는 것과 동일한 라이선스로 제공됩니다. 이 모델은 데이터 센터 인프라가 필요하지 않고 Mac이나 단일 GPU PC에서 실행되도록 설계된 상시 켜져 있는 로컬 에이전트 워크플로우를 대상으로 합니다.
비디오 하이라이트:
- 양자화를 통해 20GB 미만으로 실행되는 30B 매개변수 모델
- 맞춤형 사용 제한이 없는 Apache 2.0 라이선스
- 실제 코드베이스를 위한 131K 토큰 컨텍스트 창
- 최대 3.1배 빠른 생성을 제공하는 추측적 디코딩
이 아키텍처는 조밀한 인과 트랜스포머에 연결된 ViT-G14 비전 인코더를 결합합니다. 총 매개변수는 296억 개에 달하며, 지식 마감일은 2026년 1월 4일입니다. 이 모델은 100개 이상의 언어를 지원하며 전용 인식 인코더를 통해 멀티모달 입력을 받습니다.
비전 인코더는 별도의 1.8B 매개변수 모듈로 작동하므로, 이미지 이해가 필요하지 않을 때 텍스트 전용 추론이 비전 처리를 우회하여 속도를 높일 수 있습니다.
기술 사양 표
| 사양 | 값 | 비고 |
|---|---|---|
| 총 매개변수 | 29.6B | 비전 인코더 포함 |
| 비전 인코더 | 1.8B (ViT-G14) | 이미지/문서 입력 처리 |
| 컨텍스트 창 | 131,000+ 토큰 | 긴 에이전트 궤적 지원 |
| 언어 | 100+ | 다국어 지원 |
| 지식 마감일 | 2026년 1월 4일 | 훈련 데이터 경계 |
| 전체 정밀도 크기 | ~55 GB | 압축되지 않은 가중치 |
| 양자화 크기 (4-bit) | 20GB 미만 | Kquant 동적 방식 |
| 라이선스 | Apache 2.0 | 상업적 사용 가능 |
벤치마크 성능 및 평가
Muse Glimmer의 평가 프로필은 원시 챗봇 성능보다는 에이전트 기능을 목표로 합니다. 이 모델은 수학, 코딩 및 다단계 에이전트 벤치마크에서 강력한 성능을 기록하며, 다른 공급업체의 27-31B 범위 모델과 직접 경쟁합니다.
Meta의 비교 대상에는 Gemma 4 31B 및 Qwen 3.6 27B가 포함됩니다. Muse Glimmer는 에이전트 제품군을 선도하며 일반 지식 작업에서는 승패를 엇갈립니다.
벤치마크 결과 표
| 벤치마크 | 점수 | 카테고리 |
|---|---|---|
| MATH (AMC 2020) | 94.7 | 수학 |
| SWE-bench Verified | 76.0 | 코딩/에이전트 |
| MCP Atlas | 75.5 | 에이전트/도구 사용 |
| Deep Search QA | 74.6 | 에이전트/검색 |
| SWE-bench Pro | 51.2 | 코딩 (어려움) |
| Gaia 2 | 43.3 | 다단계 어시스턴트 |
에이전트 열은 주요 차별화 요소를 나타냅니다. 벤치마크의 더 어려운 오염 방지 변형인 SWE-bench Pro는 51.2점을 기록했으며, 이는 이 크기의 모델이 로컬에서 실행될 때 주목할 만한 결과입니다. 가혹한 다단계 어시스턴트 벤치마크로 설명되는 Gaia 2는 43.3점을 받았습니다.
경쟁사 비교 표
| 모델 | 크기 | 에이전트 중심 | 라이선스 | 로컬 배포 |
|---|---|---|---|---|
| Muse Glimmer | 29.6B | 특별히 제작됨 | Apache 2.0 | 20GB 미만 |
| Gemma 4 | 31B | 범용 | 맞춤형 | 다양함 |
| Qwen 3.6 | 27B | 혼합 | 맞춤형 | 다양함 |
클라우드 프론티어 모델은 여전히 원시 성능 한계에서 승리합니다. 30B 로컬 모델은 대규모 호스팅 시스템보다 더 나은 추론을 하도록 설계되지 않았습니다. 가치 제안은 고빈도, 장기 실행, 개인정보 보호에 민감한 에이전트 워크로드를 대상으로 합니다.
증류 훈련 파이프라인
Muse Glimmer는 처음부터 훈련된 모델이 아닙니다. 이는 Meta의 더 큰 교사 모델인 Muse Spark의 압축입니다. 증류 과정은 세 가지 고유한 단계로 구분되며, 각 단계는 특정 기능 차원을 목표로 합니다.
훈련 철학은 명확한 원칙을 따릅니다. 교사 모델의 품질은 유지하고, 소비자 하드웨어에서 실행되도록 합니다. 각 단계는 로컬 에이전트 배포를 위해 학생 모델을 점진적으로 다듬습니다.
훈련 단계 표
| 단계 | 중심 | 방법 | 결과 |
|---|---|---|---|
| 1단계: 사전 훈련 | 기반 | 로짓 증류 | 교사 모델의 출력 분포와 일치 |
| 2단계: 중간 훈련 | 컨텍스트/에이전트 | 긴 컨텍스트 데이터 | 추론 흐름, 다단계 작업 |
| 3단계: 사후 훈련 | 전문화 | SFT + RL | 도메인 간 정책 증류 |
1단계: 기반
- Muse Spark로부터의 로짓 증류
- 학생 모델이 전체 출력 분포 학습
- 교사 모델과 유사한 데이터 혼합
- 핵심 지식 기반 구축
2단계: 에이전트 훈련
- 확장된 컨텍스트 훈련
- 에이전트 중심의 데이터 보강
- 추론 흐름 노출
- 다단계 워크플로우 형성
3단계: 전문화
- RL을 결합한 지도 미세 조정
- 정책 증류 적용
- 추론, 코딩, 에이전트 목표
- 최종 기능 교정
로컬 배포 설정 가이드
Muse Glimmer를 로컬에 배포하려면 하드웨어와 사용 사례에 맞는 올바른 패키징 형식을 선택해야 합니다. Meta는 각각 다른 배포 시나리오를 대상으로 하는 세 가지 리포지토리 옵션을 제공합니다.
대부분의 사용자는 소비자 하드웨어에 바로 사용할 수 있는 사전 양자화 빌드가 포함된 GGUF 리포지토리로 시작해야 합니다. 미세 조정 또는 엔터프라이즈 GPU 서비스를 위해 전체 정밀도가 필요한 경우에만 기본 safetensors 리포지토리를 사용하세요.
리포지토리 선택 표
| 리포지토리 | 형식 | 용도 | 대상 하드웨어 |
|---|---|---|---|
| Base | Safetensors (전체 정밀도) | 미세 조정, 엔터프라이즈 서비스 | 멀티 GPU 서버 |
| GGUF | 사전 양자화 빌드 | 로컬 추론, 소비자 사용 | 단일 GPU, Mac |
| Executor PTE | 모바일 런타임 | 임베디드/엣지 배포 | 휴대폰, 엣지 박스 |
런타임 선택
Alma(가장 빠른 경로), llama.cpp, LM Studio, Executor, MLX, vLLM 또는 SGLang 중에서 선택하세요. Alma는 원커맨드 설정을 제공합니다. vLLM 및 SGLang은 프로덕션 서비스를 위한 OpenAI 호환 엔드포인트를 제공합니다.
양자화 모델 다운로드
GGUF 리포지토리, 특히 4-bit Kquant 동적 변형을 가져옵니다. 이는 에이전트 작업 품질을 최소한의 저하 또는 저하 없이 유지하면서 가중치를 20GB 미만으로 압축합니다.
하드웨어 요구 사항 확인
시스템에 총 24-32GB의 메모리가 있는지 확인하세요. 실행 범위에는 KV 캐시, 인코더 및 초안 모델이 포함되며, 모두 고급 소비자 머신의 용량 내에 맞습니다.
추측적 디코딩 활성화
번들로 제공되는 추측적 디코딩 드래프터인 DL Flash를 활성화합니다. 여러 토큰을 동시에 제안하고 기본 모델이 단일 패스에서 이를 확인하게 하여 상당한 속도 향상을 제공합니다.
에이전트 스택 연결
실행 중인 엔드포인트에 기존 오케스트레이션 프레임워크를 연결하세요. 이 모델은 OpenClaw 스타일 패턴과 MCP 도구 생태계를 직접 지원합니다.
추측적 디코딩은 측정 가능한 가속을 제공합니다. RTX 5090에서는 3.1배, M5 Max MacBook에서는 1.8배, M4 Max에서는 1.5배 더 빠른 생성을 제공합니다. 이는 에이전트 응답성을 대기열 같은 지연에서 실시간 도구 성능으로 변화시킵니다.
기능 및 사용 사례
Muse Glimmer는 로컬 에이전트 배포에서 일반적으로 손상되는 특정 기능을 목표로 합니다. 챗봇에 도구를 덧붙이는 대신, 훈련은 엔드투엔드 작업 완료에 명시적으로 중점을 둡니다.
이 릴리스를 돋보이게 하는 것은 소비자 하드웨어 크기의 모델에서 모든 에이전트 기능을 동시에 목표로 하고 각 기능을 증명하는 평가 제품군을 게시한다는 것입니다.
기능 매트릭스 표
| 기능 | 설명 | 실제 적용 |
|---|---|---|
| 함수 호출 | 정확한 스키마 준수 | 신뢰할 수 있는 API 통합 |
| 다단계 추론 | 긴 워크플로우에서 유지됨 | 복잡한 작업 체인 |
| 실패 복구 | 오류 진단 및 재시도 | 자가 치유 에이전트 |
| 이미지 이해 | 스크린샷 및 문서 | 시각적 데이터 처리 |
| 추론 노력 다이얼 | 요청별 속도 대 품질 | 적응형 성능 |
| 오케스트레이션 지원 | 기존 스택과 호환됨 | 드롭인 통합 |
이상적인 워크로드
- 리포지토리를 모니터링하는 코드베이스 와처
- 이메일 관리를 위한 받은편지함 분류
- UI 자동화를 위한 화면 이해
- 홈 자동화 루틴
- 대시보드 모니터링 알림
하이브리드 아키텍처
- 로컬 Glimmer가 지속적인 백그라운드 루프 처리
- 어려운 5%의 결정을 위한 프론티어 API
- 로컬 토큰당 한계 비용 제로
- 데이터가 머신을 떠나지 않음
- 연결 문제가 실패 모드가 아님
폴더를 보고, 이메일을 분류하고, 대시보드를 모니터링하는 상시 켜져 있는 에이전트는 토큰당 API 가격 책정으로는 경제적으로 실용적이지 않습니다. 로컬 배포는 한계 토큰 비용을 제거하여 연속적인 에이전트 작업을 실현 가능하게 만듭니다.
배포 체크리스트 및 FAQ
배포 전 체크리스트:
- 대상 머신에서 사용 가능한 24-32GB RAM/VRAM 확인
- Hugging Face에서 GGUF 4-bit Kquant 동적 변형 다운로드
- Alma, llama.cpp 또는 LM Studio 런타임 설치
- 속도 향상을 위해 DL Flash 추측적 디코딩 활성화
- 도구 스키마에 대한 함수 호출 테스트
- MCP 생태계 호환성 검증
- 워크로드에 맞게 추론 노력 다이얼 구성
Muse Glimmer는 로컬 인프라를 구축하기 전에 테스트하기 위해 Together, Fireworks 및 OpenRouter를 포함한 클라우드 플랫폼에서도 사용할 수 있습니다. Torch Titan은 미세 조정 워크플로우를 처리합니다.
런타임 지원 표
| 런타임 | 플랫폼 | 사용 사례 | 난이도 |
|---|---|---|---|
| Alma | 크로스 플랫폼 | 빠른 시작, 원커맨드 | 초급 |
| llama.cpp | 크로스 플랫폼 | 가벼운 로컬 추론 | 중급 |
| LM Studio | 데스크톱 GUI | 사용자 친화적 로컬 서비스 | 초급 |
| MLX | Apple Silicon | 네이티브 Mac 최적화 | 중급 |
| vLLM | Linux/서버 | 프로덕션 OpenAI 호환 API | 고급 |
| SGLang | Linux/서버 | 고성능 서비스 | 고급 |
| Executor | 모바일/엣지 | 임베디드 배포 | 고급 |
Q: Muse Glimmer Apache 2.0이 다른 오픈 가중치 모델과 다른 점은 무엇입니까?
Muse Glimmer는 30B 매개변수 패키지로 에이전트 우선 훈련, 멀티모달 입력, 131K 컨텍스트 창 및 깔끔한 Apache 2.0 라이선스를 결합합니다. 대부분의 오픈 가중치 모델은 사용 제한이 있는 맞춤형 커뮤니티 라이선스를 사용합니다. Muse Glimmer는 주요 인프라 소프트웨어와 동일한 관대한 라이선스로 제공되어 맞춤형 약관의 법적 검토 없이 상업적 배포를 허용합니다.
Q: Muse Glimmer는 소비자 하드웨어에서 완전히 실행될 수 있습니까?
네. 4-bit Kquant 동적 양자화 방식을 사용하면 모델 가중치가 20GB 미만으로 압축됩니다. KV 캐시, 인코더 및 초안 모델을 포함한 전체 실행 범위는 고급 소비자 GPU 및 Apple Silicon Mac에서 사용할 수 있는 24-32GB 메모리 범위 내에 맞습니다.
Q: 추측적 디코딩은 성능을 어떻게 향상시킵니까?
DL Flash는 모델과 번들로 제공되는 가벼운 추측적 디코딩 드래프터입니다. 여러 토큰을 동시에 제안하고 기본 모델이 단일 패스에서 이를 확인하게 합니다. 이는 RTX 5090에서 3.1배, M5 Max MacBook에서 1.8배, M4 Max에서 1.5배 더 빠른 생성을 제공하여 에이전트가 대기열에 있는 대신 반응하는 것처럼 느껴지게 합니다.
Q: 어떤 에이전트 프레임워크 및 도구 생태계가 지원됩니까?
Muse Glimmer는 OpenClaw 스타일 오케스트레이션 패턴과 MCP 도구 생태계를 직접 지원합니다. vLLM 또는 SGLang을 통해 서비스될 때 OpenAI 호환 엔드포인트를 제공하므로 기존 에이전트 스택은 수정 없이 통합할 수 있습니다.
Q: Muse Glimmer가 클라우드 프론티어 모델보다 낫습니까?
아니요. 클라우드 프론티어 모델은 여전히 원시 성능 한계에서 승리합니다. Muse Glimmer는 토큰당 API 가격 책정이 비현실적인 고빈도, 장기 실행, 개인정보 보호에 민감한 에이전트 워크로드라는 다른 사용 사례를 대상으로 합니다. 권장 아키텍처는 하이브리드 방식으로, 로컬 Glimmer는 지속적인 백그라운드 작업을 처리하고 복잡한 결정에 대해서만 프론티어 API로 에스컬레이션합니다.