Muse Glimmer 코딩 벤치마크: 성능 및 로컬 테스트 결과 - 벤치마크

Muse Glimmer 코딩 벤치마크: 성능 및 로컬 테스트 결과

경쟁 오픈 웨이트 LLM과 비교한 상세한 Muse Glimmer 코딩 벤치마크 결과, 로컬 배포 사양 및 에이전트 작업 성능.

2026-08-11
muse glimmer 위키 팀
빠른 가이드
  • Muse Glimmer는 로컬 에이전트 및 코딩 작업을 위해 설계된 Meta의 30B 매개변수 밀집 오픈 웨이트 모델입니다.
  • 벤치마크 성능은 강력한 추론 및 텍스트 생성 능력을 보여주지만, 복잡한 프론트엔드 UI 렌더링에는 어려움을 겪습니다.
  • 에이전트 기능에는 안정적인 도구 호출, 다단계 추론 및 구조화된 작업 계획이 포함됩니다.
  • 하드웨어 요구 사항은 4비트 양자화된 로컬 추론을 위해 약 20GB의 RAM이 필요합니다.
  • Apache 2.0 라이선스는 상업용 및 오픈 소스 개발 프로젝트에 매우 쉽게 접근할 수 있게 만듭니다.

Muse Glimmer 모델 아키텍처 및 사양

Muse Glimmer는 300억 개의 매개변수를 가진 밀집 모델로 등장하며 Meta의 오픈 웨이트 LLM 환경으로의 회귀를 의미합니다. 아키텍처는 비전 트랜스포머에 약 20억 개의 매개변수를 할당하며, 나머지는 텍스트 인코딩 및 디코딩을 처리합니다. 매우 관대한 Apache 2.0 라이선스로 출시된 이 모델은 로컬 에이전트, 함수 호출 시스템 및 코딩 어시스턴트를 구축하는 개발자를 대상으로 합니다.

비디오 하이라이트:

  • 비전 트랜스포머가 통합된 30B 밀집 매개변수 모델
  • Watch 증류 기법을 사용하여 Muse Spark에서 증류됨
  • 엔드투엔드 에이전트 작업 완료 및 도구 호출에 최적화됨
  • 48GB 통합 메모리를 탑재한 M5 Pro 하드웨어에서 로컬로 테스트됨

이 모델은 Muse Spark의 출력을 사용한 증류를 통해 사전 훈련되었으며, 교사 모델과 유사한 데이터 믹스를 활용했습니다. 이 접근 방식은 다단계 추론, 안정적인 도구 사용, 실패 복구 및 다중 모달 입력 처리를 위해 Muse Glimmer를 최적화합니다.

아키텍처 통찰

Muse Spark로부터의 증류는 Muse Glimmer가 로컬 배포 시나리오에 적합한 관리 가능한 매개변수 수를 유지하면서도 정교한 추론 패턴을 계승함을 의미합니다.

핵심 모델 사양

사양비고
총 매개변수300억밀집 아키텍처
비전 트랜스포머약 20억다중 모달 입력 처리
텍스트 인코더/디코더약 280억주요 언어 처리
라이선스Apache 2.0상업적 사용 허용
주요 사용 사례로컬 에이전트, 코딩, 도구 호출에이전트 워크플로우에 최적화됨
증류 소스Muse SparkWatch 증류 방식

코딩 벤치마크 결과 및 비교

Muse Glimmer의 초기 벤치마크 결과는 엇갈리지만 유망한 그림을 보여줍니다. Meta의 비교는 이 모델을 현재 AI 환경에서 비교적 확립된 모델로 간주되는 Gemma 4 31B 및 Qwen 3 0.6 27B와 경쟁하도록 배치합니다. 경쟁 격차는 특정 벤치마크 카테고리에 따라 크게 달라집니다.

벤치마크 성능 비교

벤치마크Muse Glimmer (30B)Qwen 3 0.6 (27B)Gemma 4 (31B)승자
Terminal Bench보통더 높은 점수보통Qwen 3 0.6
SWE Bench Verified보통약간 우세보통Qwen 3 0.6
일반 추론강력함강력함보통동점
텍스트 생성고품질좋음좋음Muse Glimmer
작업 계획강력함보통보통Muse Glimmer
벤치마크 맥락

Qwen 3 0.6은 Terminal Bench 및 SWE Bench Verified에서 Muse Glimmer보다 성능이 뛰어납니다. 그러나 Muse Glimmer는 매개변수 크기에 비해 우수한 작업 계획 및 기술 텍스트 생성 품질을 보여줍니다.

벤치마크 데이터는 Muse Glimmer가 Terminal Bench 및 SWE Bench Verified와 같은 중요한 코딩 전용 벤치마크에서 Qwen 3 0.6에 뒤처지지만, 300억 개 매개변수 모델에 대한 기대치를 초과하는 눈에 띄게 강력한 글쓰기 품질과 구조화된 작업 계획 기능으로 이를 보완함을 나타냅니다.

로컬 코딩 및 프론트엔드 생성 테스트

실용적인 테스트는 Muse Glimmer의 실제 코딩 기능에 대한 중요한 통찰력을 제공합니다. 이 모델은 간단한 HTML 생성부터 풀스택 애플리케이션 개발에 이르기까지 다양한 코딩 시나리오에서 평가되었습니다.

프론트엔드 생성 테스트 결과

테스트 작업생성된 토큰완료 시간품질 등급주요 문제
날씨 카드 (HTML/CSS/JS)약 8,600약 8분나쁨4개의 카드 중 3개만 렌더링됨, 시각적 품질 저하
CV 웹페이지 (HTML)약 3,300약 3.5분양호좋은 타이포그래피, 합리적인 텍스트
뉴스레터 플랫폼 (풀스택)10,000+약 10분보통좋은 코드 구조, 작동하지 않는 UI
이미지 이해 (펠리컨)해당 없음해당 없음실패올바르게 렌더링할 수 없음
프론트엔드 제한

Muse Glimmer는 시각적 프론트엔드 작업에서 상당한 어려움을 겪습니다. 날씨 카드 테스트는 시각적 품질이 떨어지는 세 개의 카드만 생성했으며, 이미지 렌더링 테스트(오토바이를 탄 펠리컨)는 완전히 실패했습니다.

코드 생성의 강점

프론트엔드 렌더링 약점에도 불구하고, Muse Glimmer는 코딩 워크플로우에서 몇 가지 주목할 만한 강점을 보여줍니다:

작업 계획

  • 구조화된 할 일 목록 생성
  • 코딩 전에 실행 단계 계획
  • 체계적으로 워크스페이스 탐색
  • 점진적으로 빌드

기술 문서 작성

  • 고품질 코드 주석
  • 전문적인 문서 스타일
  • 명확한 변수 명명
  • 합리적인 아키텍처 결정

백엔드 로직

  • 기능적인 Express.js 설정
  • 적절한 CRUD 구현
  • 깔끔한 서버 아키텍처
  • 좋은 패키지 구조

뉴스레터 플랫폼 테스트는 코드를 작성하기 전에 구조화된 개발 계획을 세우는 Muse Glimmer의 능력을 보여주었습니다. 모델은 워크스페이스 탐색, 서버 생성, 구독자 CRUD 구현 및 이메일 빌더 구축을 포함하는 할 일 목록을 생성했습니다. 이 계획 동작은 전략적 계획 없이 즉시 코드를 작성하는 더 작거나 능력이 떨어지는 모델과 차별화됩니다.

최적의 사용 사례

Muse Glimmer는 백엔드 코드 생성 및 기술 텍스트 생성에 탁월합니다. 프론트엔드 시각적 작업의 경우, 전문 UI 모델과 페어링하거나 시각 디자인을 별도로 처리하는 것을 고려하십시오.

로컬 배포 설정 가이드

Muse Glimmer를 로컬에서 실행하려면 하드웨어와 소프트웨어 환경을 신중하게 준비해야 합니다. 이 모델은 48GB의 통합 메모리를 탑재한 M5 Pro에서 성공적으로 테스트되었으며, 4비트 양자화 버전으로 초당 약 17개의 토큰 생성 속도를 달성했습니다.

1

llama.cpp 다운로드 및 컴파일

최신 llama.cpp 저장소를 복제하고 특정 하드웨어에 맞게 컴파일하십시오. Apple Silicon 사용자의 경우 최적의 추론 성능을 위해 컴파일 중에 Metal 프레임워크 지원이 활성화되어 있는지 확인하십시오.

2

양자화된 모델 획득

dynamic quant 4-K Excel 변형을 사용하여 Muse Glimmer GGUF 파일을 다운로드하십시오. Ansuel 저장소는 참조용 상세 설정 가이드와 함께 사전 양자화된 버전을 제공합니다.

3

서버 설정 구성

권장되는 추론 매개변수를 적용하십시오: 온도 1, top P 0.95, top K 64. 이 설정은 가장 안정적인 코딩 및 추론 출력을 생성합니다.

4

실행 및 연결

llama.cpp 서버를 시작하고 모델이 메모리에 완전히 로드될 때까지 기다리십시오. 서버는 일반적으로 포트 8080에서 수신 대기합니다. 이 엔드포인트에 코딩 하네스 또는 채팅 인터페이스를 연결하십시오.

5

OpenCode와 통합

OpenCode 구성에 로컬 Muse Glimmer 서버 엔드포인트를 추가하십시오. 복잡한 에이전트 작업을 할당하기 전에 간단한 프롬프트로 서버를 워밍업하십시오.

하드웨어 요구 사항 및 성능

하드웨어 등급사용 가능 RAM양자화예상 속도타당성
M5 Pro (48 GB)약 20GB 사용4-bit (Q4_K_M)약 17 tok/s테스트 및 작동 확인
M4 Max (64 GB)약 20GB 사용4-bit (Q4_K_M)약 20+ tok/s훌륭함
표준 32 GB여유 적음4-bit (Q4_K_M)약 10-15 tok/s가능함
16 GB 이하부족함권장하지 않음해당 없음불가능함
메모리 할당

4비트 양자화된 Muse Glimmer 모델은 추론 중에 약 20GB의 RAM을 소비합니다. 스와핑 없이 안정적으로 작동하려면 시스템에 사용 가능한 통합 메모리가 최소 24GB 이상 있어야 합니다.

추론 및 논리 평가

코딩 작업 외에도 Muse Glimmer는 기본 추론 및 상식 논리 시나리오에서 평가되었습니다. 이러한 테스트는 실제 문제 해결 및 물리적 추론을 처리하는 모델의 능력을 보여줍니다.

추론 테스트 결과

테스트 시나리오정답모델 응답사용된 토큰시간결과
세차 논리차 운전하기차 운전하기약 200약 12초정답
진공 낙하 테스트모두 동일하게 낙하A와 D가 함께 도착약 1,500약 90초정답
프론트엔드 시각날씨 카드 4개카드 3개, 시각적 품질 저하약 8,600약 8분실패
이미지 렌더링오토바이를 탄 펠리컨끔찍하게 잘못됨해당 없음해당 없음실패
추론 강점

Muse Glimmer는 세차 논리 퍼즐과 진공 물리 테스트를 모두 올바르게 해결했습니다. 세차 응답은 세차장까지 걸어가는 것은 건강에 좋지만 차가 세차되지는 않는다는 점을 지적하며 실용적인 상식을 보여주었습니다.

추론 테스트는 Muse Glimmer의 핵심 논리 기능이 견고함을 확인합니다. 이 모델은 진공 상태에서 질량은 무관하며 자동차가 스스로 세차를 할 수 없다는 것을 올바르게 식별했습니다. 이러한 결과는 견고한 다단계 추론 기반에 기여할 가능성이 높은 Muse Spark로부터의 모델 증류와 일치합니다.

Muse Glimmer 기능 평가:

  • 상식 논리 퍼즐 통과 (세차, 진공 테스트)
  • 코딩 전 구조화된 작업 계획 생성
  • 고품질 기술 텍스트 및 코드 주석 생성
  • 시각적 프론트엔드 렌더링 작업의 어려움
  • 4비트 로컬 추론을 위해 20GB 이상의 RAM 필요
  • Terminal Bench 및 SWE Bench Verified에서 Qwen 3 0.6에 뒤처짐

Muse Glimmer 코딩 벤치마크: 종합 평가

Muse Glimmer는 오픈 웨이트 모델 분야에서 Meta의 의미 있는 첫 번째 릴리스를 나타냅니다. 현재 전문 코딩 벤치마크에서 Qwen 3 0.6을 능가하지는 못하지만, 이 모델은 개발자 커뮤니티의 주의를 끌 만한 뚜렷한 장점을 가져옵니다.

강점 및 약점 요약

카테고리강점약점평가
추론물리 및 상식에 대한 올바른 논리복잡한 추론을 위한 느린 생성강력함
백엔드 코딩깔끔한 Express.js, 적절한 CRUD, 좋은 구조코드 품질이 탁월하지 않음좋음
프론트엔드 코딩합리적인 HTML/CSS 타이포그래피시각적 디자인 저하, 작동하지 않는 버튼약함
작업 계획할 일 목록 생성, 실행 전 계획해당 없음훌륭함
기술 문서 작성전문적인 텍스트, 명확한 문서화해당 없음훌륭함
에이전트 작업도구 호출, 다단계 추론복잡한 체인에서 멈출 수 있음유망함
모델 선택 권장 사항

백엔드 개발, 기술 문서화 및 에이전트 작업 계획을 위해 Muse Glimmer를 선택하십시오. 프론트엔드 위주의 작업이나 최고 수준의 코딩 벤치마크 점수를 원한다면 동일한 매개변수 범위에서 현재 Qwen 3 0.6이 더 나은 결과를 제공합니다.

가장 적합한 용도

  • 로컬 에이전트 개발
  • 백엔드 코드 생성
  • 기술 문서 작성
  • 작업 계획 및 구조화된 워크플로우
  • 다단계 추론 애플리케이션
  • Apache 2.0 라이선스 상업용 프로젝트

권장하지 않는 용도

  • 복잡한 프론트엔드 UI 렌더링
  • 시각적 이미지 생성 작업
  • 최고 수준의 벤치마크 추구
  • 리소스가 제한된 환경 (24GB RAM 미만)
  • 최대 코딩 정확도가 필요한 시나리오
향후 전망

llama.cpp 최적화 및 향상된 양자화 방법이 등장함에 따라 Muse Glimmer의 성능은 크게 향상될 수 있습니다. 모델의 현재 단점은 근본적인 아키텍처 제한이라기보다는 초기 단계 도구에서 비롯된 것일 수 있습니다. 또한, Muse Spark 1.2의 예상되는 오픈 웨이트 릴리스는 이 생태계를 더욱 강화할 수 있습니다.

자주 묻는 질문

Q: Qwen 3 0.6과 비교하여 Muse Glimmer 코딩 벤치마크 성능은 어떻습니까?

Muse Glimmer는 Terminal Bench 및 SWE Bench Verified를 포함한 주요 코딩 벤치마크에서 Qwen 3 0.6에 뒤처집니다. 그러나 Muse Glimmer는 비슷한 크기의 모델과 비교하여 우수한 작업 계획, 기술 텍스트 생성 품질 및 구조화된 코드 문서화를 보여줍니다.

Q: 로컬 추론을 위해 Muse Glimmer에 얼마나 많은 RAM이 필요합니까?

4비트 양자화 버전의 Muse Glimmer는 추론 중에 약 20GB의 RAM이 필요합니다. 스와핑 없이 안정적으로 작동하려면 사용 가능한 통합 메모리가 최소 24GB 이상인 시스템이 권장됩니다. 48GB의 M5 Pro에서 테스트한 결과 초당 약 17개의 토큰을 달성했습니다.

Q: Muse Glimmer가 기능적인 프론트엔드 애플리케이션을 생성할 수 있습니까?

Muse Glimmer는 프론트엔드 시각적 작업에 어려움을 겪습니다. 테스트에서는 시각적 품질이 떨어지는 요청된 날씨 카드 4개 중 3개만 생성했으며 뉴스레터 플랫폼 프론트엔드에는 작동하지 않는 버튼이 있었습니다. 백엔드 코드 품질은 프론트엔드 출력보다 훨씬 뛰어납니다.

Q: Muse Glimmer는 어떤 라이선스로 출시됩니까?

Muse Glimmer는 매우 관대한 Apache 2.0 라이선스로 출시되어 상업적 및 오픈 소스 사용이 모두 가능합니다. 이를 통해 제한적인 라이선스 우려 없이 다양한 개발 프로젝트에 접근할 수 있습니다.

Q: Muse Glimmer는 에이전트 워크플로우에 적합합니까?

예, Muse Glimmer는 엔드투엔드 에이전트 작업 완료, 안정적인 도구 호출, 다단계 추론 및 실패 복구를 위해 특별히 최적화되었습니다. 코드를 실행하기 전에 구조화된 작업 계획을 성공적으로 생성하며, 이는 에이전트 기능의 강력한 지표입니다.