- Muse Glimmer 30B는 296억 개의 매개변수를 가진 Meta의 밀집형 멀티모달 LLM입니다.
- Apache 2.0 라이선스는 상업적 및 로컬 배포 유연성을 완벽하게 허용합니다.
- 128K 컨텍스트 창은 텍스트 및 이미지 처리를 기본적으로 지원합니다.
- **전체 정밀도(Full precision)**는 64-96GB VRAM이 필요하지만, 양자화된 GGUF는 24GB GPU에 맞습니다.
- 멀티모달 비전 성능은 Gemma 4 및 Qwen 3.6과 같은 최고급 모델과 대적합니다.
Muse Glimmer 30B: 아키텍처 및 사양
Muse Glimmer 30B는 Meta가 개발하여 Apache 2.0 라이선스로 출시한 밀집형 트랜스포머 기반 대형 언어 모델입니다. 에이전트 워크플로우를 위해 설계되었으며, 신뢰할 수 있는 도구 호출, 다단계 추론 및 오류 복구를 강조합니다. 296억 6천만 개의 매개변수를 갖추고 있으며, 특히 개별 GPU 구성과 같은 대역폭이 높은 시스템에서 효율적으로 작동하도록 구축되었습니다.
이 모델은 최대 100개의 언어를 지원하며 128K 컨텍스트 길이를 특징으로 합니다. 지식 마감일은 2026년 1월 4일로, 현재 개발 워크플로우에 매우 적합합니다. 일부 경쟁사와 달리 텍스트 및 이미지 입력을 처리할 수 있지만 비디오는 처리하지 않습니다.
비디오 하이라이트:
- 쿼드 RTX 3090 설정에서 전체 정밀도 모델 테스트
- 24GB GPU 구성을 위한 GGUF 양자화 변형 사용 가능
- 여러 실제 이미지 시나리오에서 시각적 추론 테스트
- 벤치마크에 따르면 Gemma 4 31B와 Qwen 3.6 27B 사이에 위치
핵심 사양 테이블
| 사양 | 값 |
|---|---|
| 매개변수 수 | 296억 6천만 (밀집형) |
| 라이선스 | Apache 2.0 |
| 컨텍스트 길이 | 128K 토큰 |
| 지식 마감일 | 2026년 1월 4일 |
| 지원 언어 | 최대 100개 |
| 입력 모달리티 | 텍스트 및 이미지 |
| 출력 모달리티 | 텍스트 |
Mixture of Experts (MoE)가 아닌 밀집형 모델로서 Muse Glimmer 30B는 높은 메모리 대역폭 시스템의 이점을 누립니다. 빠른 상호 연결을 갖춘 개별 GPU가 이 아키텍처에 가장 좋은 추론 성능을 제공합니다.
하드웨어 요구 사항 및 양자화 옵션
Muse Glimmer 30B를 로컬에서 실행하려면 신중한 하드웨어 계획이 필요합니다. 전체 정밀도 모델은 상당한 VRAM을 요구하지만, Meta는 소비자용 하드웨어를 가진 사용자도 모델을 사용할 수 있도록 여러 양자화된 GGUF 변형을 제공했습니다.
모델 변형별 VRAM 요구 사항
| 변형 | 필요 VRAM | 참고 |
|---|---|---|
| 전체 정밀도 (FP16) | 64-96 GB | 전체 128K 컨텍스트에는 ~96GB 필요 |
| K-Quant | ~32 GB | 듀얼 16GB 또는 단일 32GB GPU에 적합 |
| KQ-Quant (소형 GGUF) | ~17-24 GB | 단일 24GB GPU에 적합, 정확도 약 1% 손실 |
보고된 추론 속도
| 하드웨어 설정 | 초당 토큰 | 정밀도 |
|---|---|---|
| RTX 5090 | 74.9 | 전체 정밀도 |
| 쿼드 RTX 3090 | 60-65 | 전체 정밀도 |
| 쿼드 RTX 3090 (로드 시) | 40-46 | 전체 정밀도 |
최대 128K 컨텍스트 창으로 전체 정밀도 모델을 실행하려면 기본 64GB가 아닌 96GB에 가까운 VRAM이 필요합니다. 확장된 에이전트 작업 중 메모리 부족 오류를 방지하려면 이에 따라 하드웨어 할당을 계획하세요.
전체 정밀도
- 64-96 GB VRAM
- 최대 정확도
- 벤치마킹에 가장 적합
- 다중 GPU 설정 필요
K-Quant GGUF
- ~32 GB VRAM
- 최소한의 정확도 손실
- 속도와 품질의 좋은 균형
- llama.cpp와 호환
KQ-Quant GGUF
- ~17-24 GB VRAM
- 단일 24GB GPU에 적합
- 보고된 정확도 손실 약 1%
- 소비자 하드웨어에 가장 적합
벤치마크 성능 및 비교
Muse Glimmer 30B는 미드 티어 오픈 소스 LLM 환경 내에서 경쟁력 있는 위치를 차지하고 있습니다. 벤치마크 결과에 따르면 대부분의 카테고리에서 Gemma 4 31B(사고 모드)와 Qwen 3.6 27B 사이에 위치하며, 에이전트 작업 처리 및 일반 추론에서 특히 강점을 보입니다.
벤치마크 결과 개요
| 벤치마크 카테고리 | Muse Glimmer 30B | Qwen 3.6 27B | 참고 |
|---|---|---|---|
| SWE-bench Pro (코딩) | 51.2 | 더 높음 | 검증된 코딩 부문에서 Qwen 리드 |
| Terminal Bench | 51.7 | 60.7 | 터미널 작업에서 Qwen이 더 강함 |
| AIME 2026 (추론) | 94.7 | 94.1 | Muse Glimmer가 근소하게 앞섬 |
| ChartVix (멀티모달) | 강함 | 약간 더 높음 | 접전 |
| MMU Pro (멀티모달) | 강함 | 약간 더 높음 | Qwen이 근소한 우위 유지 |
Qwen 3.6 27B는 곧 Qwen 3.8 27B로 대체될 예정이며, 이는 경쟁 구도를 바꿀 수 있습니다. 그러나 Muse Glimmer 30B는 일반 에이전트 작업 처리 및 AIME 2026 추론 점수에서 명확한 이점을 가지고 있습니다.
이 모델은 SWE-bench Pro에서 51.2점으로 견고한 코딩 기능을 보여주지만, 검증된 코딩 작업에서는 Qwen 3.6 27B가 더 우수한 성능을 보입니다. Muse Glimmer가 진정으로 빛을 발하는 부분은 일반 추론으로, AIME 2026에서 Qwen의 94.1점에 비해 94.7점을 기록했습니다. 멀티모달 기능은 강력하여 ChartVix 및 MMU Pro 벤치마크에서 좋은 성능을 보이지만, 두 카테고리 모두에서 Qwen 3.6 27B에 약간 뒤처집니다.
멀티모달 비전 기능
Muse Glimmer 30B의 두드러진 특징 중 하나는 시각적 이해와 추론입니다. 테스트 결과 이미지 분석, 객체 식별 및 시각적 입력에서의 맥락 추론에서 탁월한 성능을 보여줍니다. 이 모델은 복잡한 장면을 정확하게 설명하고, 객체를 세며, 환경적 맥락에 대해 교육받은 추측까지 합니다.
비전 테스트 결과
| 테스트 시나리오 | 정확도 | 평가 |
|---|---|---|
| 동물 식별 (낙타) | 탁월함 | A+ |
| 실내 장면 세부 정보 (고양이 및 케이블) | 탁월함 | A+ |
| 야외 요리 (그릴 팬 및 음식) | 탁월함 | A+ |
| 나무 종 추정 | 양호함 (정확한 추측) | A |
| 서버 하드웨어 식별 | 사소한 오류를 제외하고 양호함 | B- |
이 모델은 브랜드 이름 식별, 객체 수 세기, 텍스트 라벨 읽기 및 환경적 맥락 추론에 탁월합니다. 테스트에서 위치 프롬프트 없이도 Blackstone 그릴 팬 브랜드를 올바르게 식별하고, RJ45 포트 수를 세었으며, 배경 식생만으로 텍사스 중부 지리를 추측했습니다.
주목할 만한 비전 성과
- 브랜드 인식: 부분적인 글자만 보고 Blackstone 그릴 팬 브랜드를 정확히 식별
- 포트 계산: 패치 패널에서 RJ45 포트 번호(18-24)를 정확히 읽음
- 지리적 추론: 나무 종류와 풍경을 보고 텍사스 힐 컨트리를 추측함
- 객체 수 계산: 3개의 햄버거 패티와 6개의 2.5인치 HDD를 정확히 셈
- 재질 식별: 나무, 금속 및 콘크리트 표면을 구분함
이 모델은 하드웨어 식별에서는 약간의 약점을 보였습니다. SAS 케이블을 SATA 케이블로 혼동하고, Intel Optane 900P 드라이브를 800P U.2 모듈로 잘못 식별했으며, 이미지 가장자리에서 부분적으로 잘린 객체를 환각(할루시네이션)하는 경우가 있었습니다. 이러한 오류는 드물었으며 전반적인 성능을 크게 저해하지는 않았습니다.
로컬 배포 설정 가이드
Muse Glimmer 30B를 로컬에 배포하는 방법은 vLLM을 사용하는 공식 Docker 컨테이너와 llama.cpp를 사용하는 GGUF 형식, 두 가지 주요 방법으로 수행할 수 있습니다. 각 접근 방식은 하드웨어와 사용 사례에 따라 고유한 이점이 있습니다.
런타임 선택
전체 정밀도 추론을 위해 vLLM이 포함된 공식 Docker 컨테이너 중에서 선택하거나, VRAM이 제한되어 있는 경우 llama.cpp용 GGUF 변형을 다운로드하세요. Docker 방식은 가장 정확한 결과를 제공하지만 훨씬 더 많은 GPU 메모리가 필요합니다.
GPU 리소스 구성
GPU 메모리 활용도를 0.9로 설정하고 GPU 수에 따라 텐서 병렬성을 구성하세요. 다중 GPU 설정의 경우 컨테이너 내부에서 올바른 장치 순서를 보장하기 위해 CUDA 장치 재매핑이 필요할 수 있습니다. 추론 중 메모리 소진을 방지하려면 최대 모델 길이를 65536으로 설정하세요.
모델 파서 선택
풀 선택(pool choice)을 "muse-glimmer"로 설정하고 추론 파서(reasoning parser)를 "muse-glimmer"로 구성하세요. 이러한 설정은 모델이 서빙 프레임워크 내에서 에이전트 호출과 추론 체인을 올바르게 처리하도록 보장합니다.
로드 및 테스트
Open WebUI 또는 선호하는 프론트엔드를 통해 모델을 로드하세요. 멀티모달 기능을 확인하기 위해 간단한 이미지 설명 작업으로 시작한 다음, 다단계 추론 및 오류 복구 기능을 테스트하기 위해 에이전트 도구 호출 워크플로우로 진행하세요.
최신 테스트 기준, 공식 Docker 컨테이너 내에서는 Flash Attention이 작동하지 않습니다. Meta는 Flash Attention 활성화 시 3배의 속도 향상을 보고하지만, 이 기능은 표준 Docker 배포 외부의 추가 구성이 필요합니다.
권장 vLLM 구성
| 매개변수 | 권장 값 | 목적 |
|---|---|---|
| GPU 메모리 활용도 | 0.9 | 오버헤드를 위한 버퍼 예약 |
| 최대 모델 길이 | 65536 | 추론 중 OOM 방지 |
| 텐서 병렬 | 4 (쿼드 GPU의 경우) | GPU 전체에 부하 분산 |
| 풀 선택 | muse-glimmer | 올바른 모델 라우팅 |
| 추론 파서 | muse-glimmer | 추론 체인 파싱 |
배포 전 체크리스트:
- VRAM이 선택한 변형에 대한 최소 요구 사항을 충족하는지 확인
- Docker 및 NVIDIA Container Toolkit 설치
- 공식 리포지토리에서 모델 가중치 다운로드
- 다중 GPU 설정을 위한 CUDA 장치 순서 구성
- 샘플 이미지로 멀티모달 입력 테스트
- 토큰 생성 속도가 기대치를 충족하는지 확인
제한 사항 및 알려진 문제
Muse Glimmer 30B는 대부분의 작업에서 인상적인 성능을 보여주지만, 배포하기 전에 사용자가 이해해야 할 몇 가지 주목할 만한 제한 사항이 있습니다.
테스트된 제한 카테고리
| 카테고리 | 동작 | 영향 |
|---|---|---|
| 콘텐츠 거부 | 엄격한 안전 필터링 | 창의적인 시나리오를 거부할 수 있음 |
| SVG 생성 | 시각적 출력 품질 저하 | 고양이 그리기 테스트 실패 |
| 하드웨어 식별 | 사소한 분류 오류 | SAS/SATA 및 Optane 혼동 |
| 비디오 처리 | 지원되지 않음 | 텍스트 및 이미지만 가능 |
| Flash Attention | Docker에서 작동 중단 | 컨테이너 내 3배 속도 향상 없음 |
Meta 모델로서 Muse Glimmer 30B는 보수적인 안전 동작을 나타냅니다. 테스트 중 "비틀기가 있는 아마겟돤(Armageddon with a twist)" 창의적 시나리오를 거부하고 가상의 롤플레이에 참여하는 대신 일반적인 AI 어시스턴트 응답을 제공했습니다. 덜 제한적인 출력이 필요한 사용자는 이러한 경향을 고려해야 합니다.
SVG 생성 테스트는 특히 결과가 좋지 않았습니다. 8K 토큰 예산 내에서 울타리 위를 걷는 고양이를 만들어 달라고 요청했을 때, 이 모델은 울타리와 배경 요소에 거의 신경 쓰지 않고 왜곡된 외눈박이 형태를 생성했습니다. 이 테스트는 명백한 실패로 평가되었으며, 복잡한 벡터 그래픽 생성은 여전히 약점으로 남아 있음을 시사합니다.
긍정적인 면으로, 이 모델은 논리 퍼즐을 잘 처리했습니다. 단어 위치 퍼즐(두 번째 단어의 세 번째 글자 식별)과 임의의 배열 매핑 문제를 오류 없이 올바르게 해결하여 강력한 단계별 추론 능력을 입증했습니다.
FAQ
Q: Muse Glimmer 30B란 무엇이며 누가 개발했나요?
Muse Glimmer 30B는 Meta가 개발하여 Apache 2.0 라이선스로 출시한 296억 6천만 개의 매개변수를 가진 밀집형 멀티모달 대형 언어 모델입니다. 128K 컨텍스트 창으로 텍스트 및 이미지 입력을 지원하며 도구 호출 및 다단계 추론을 포함한 에이전트 워크플로우를 위해 설계되었습니다.
Q: 단일 24GB GPU에서 Muse Glimmer 30B를 실행할 수 있나요?
네, KQ-Quant GGUF 변형은 약 17-24GB의 VRAM이 필요하며 보고된 정확도 손실이 약 1%에 불과하여 단일 24GB GPU에 적합합니다. 멀티모달 기능을 사용하려면 포함된 mmproj 파일과 함께 llama.cpp를 사용해야 합니다.
Q: Muse Glimmer 30B는 Qwen 3.6 27B와 비교하여 어떤가요?
Muse Glimmer 30B는 AIME 2026 추론(94.7 vs 94.1)에서 더 높은 점수를 받으며 일반 에이전트 작업을 잘 처리합니다. 그러나 Qwen 3.6 27B는 검증된 코딩 작업, 터미널 벤치마크에서 더 우수한 성능을 보이며 ChartVix 및 MMU Pro와 같은 멀티모달 벤치마크에서도 근소하게 앞서 있습니다.
Q: Muse Glimmer 30B는 비디오 입력을 처리하나요?
아니요, Muse Glimmer 30B는 텍스트 및 이미지 입력만 처리합니다. 비디오 처리는 지원하지 않습니다. 이 모델은 객체 식별, 장면 설명, 계산 및 맥락 추론을 위해 정적 이미지를 높은 정확도로 분석할 수 있습니다.