사내 워크스테이션에서 단일 GPU로 로컬 모델을 구동하려는 엔지니어는 Muse Glimmer를, 클라우드 기반 100만 토큰 에이전트 도구를 시험하려는 팀은 Muse Spark 1.1을 검토할 수 있습니다.

운영 전에는 오픈 가중치 실행에 수반되는 자체 인프라 비용과 함께, 외부 벤치마크에만 등재된 Spark 1.3의 공식 미출시 상태를 명확히 파악해야 합니다. 상용 프로덕션 계획과 사전 실험 단계를 분리해야 합니다.

한 줄 결론

공개 가중치 Glimmer와 클라우드 프리뷰 Spark 1.1을 분리해 검토하며, 리더보드에서 확인한 1.3은 공식 제공 조건을 별도로 확인해야 합니다.

바뀐 점

  • Muse Glimmer 공개: Apache 2.0 라이선스 기반 30B 파라미터 오픈 가중치 모델로 공식 구성 파일의 문맥 한도는 131,072토큰입니다. 메모리 요구량은 실행 조건에 따라 달라지며 최대 출력 한도는 별도 확인되지 않았습니다.
  • Muse Spark 1.1 프리뷰: 2026년 7월 9일 발표된 Meta Model API 퍼블릭 프리뷰 모델로 1,000,000 토큰 문맥을 지원합니다.
  • Muse Spark 1.3 상태: 외부 리더보드에 벤치마크 점수가 공개되었으나, 2026년 9월 7일 현재 Meta의 공식 발표 블로그나 API 문서는 확인되지 않은 벤치마크 관측 모델입니다.

가격과 조건

모델명 제공 형태 컨텍스트 / 출력 과금 및 실행 조건
Muse Glimmer 오픈 가중치 (Apache 2.0) 131,072 / 별도 미확인 자체 인프라 및 GPU 하드웨어·전력 비용 소요
Muse Spark 1.1 Meta Model API 퍼블릭 프리뷰 1,000,000 / 미공개 공식 종량제 요율표 미발표 (프리뷰 접근)
Muse Spark 1.3 외부 리더보드 관측 모델 미공개 / 미공개 공식 제공 조건 미확인

오픈 가중치 모델인 Muse Glimmer는 무료로 가동되는 것이 아니며 GPU 전력 및 호스팅 유지 비용이 필요합니다. Muse Spark 1.3은 공식 제공 조건을 확인하지 못했으므로 리더보드 등재만으로 서비스 도입 가능 여부를 판단하지 않습니다.

공개 평가에서 읽을 것

  • Muse Glimmer: Artificial Analysis Intelligence Index(v4.2 · 2026-09-04, high) 24.38점, GPQA Diamond high 83.54%입니다.
  • Muse Spark 1.1: LiveBench(2026-06-25 release, muse-spark-1.1-xhigh) 75.30점, GPQA Diamond xhigh 89.80%입니다.
  • Muse Spark 1.3 (리더보드 관측): LiveBench(muse-spark-1.3-xhigh) 81.59점, Artificial Analysis Intelligence Index max 52.95점, xhigh 51.55점, GPQA Diamond xhigh 94.14%, max 93.84%를 나타냈습니다.

Meta AI · 공개 평가 결과. Artificial Analysis Intelligence Index · Intelligence Index v4.2

도표 크게 보기

평가 버전: v4.2 · 2026-09-04.

모델·실행 설정 공개 점수
Muse Spark 1.3 (max) 52.95
Muse Spark 1.3 (xhigh) 51.55
Muse Glimmer (high) 24.38

전체 결과와 평가 조건

같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.

도표의 공개 원문

추천하는 사용법

  • 외부 통신이 차단된 폐쇄망 환경에서는 메모리 사용량을 확인한 GPU에 Muse Glimmer를 배포하고 vLLM 엔진을 구성해 도구 연동 성능을 검증하는 실험을 권장합니다.
  • 대용량 컨텍스트 기반 에이전트 실험은 Meta Model API의 Spark 1.1 프리뷰 계정을 통해 사전 기능 테스트를 수행하고 정식 가격 발표를 대기하는 구성을 추천합니다.

같은 회사 모델도 제공 경로가 다르다

이 글에서 함께 다루는 Spark와 Glimmer는 같은 방식으로 도입하는 제품이 아닙니다. API 접근 권한을 확인하는 일과 공개 가중치를 직접 실행하는 일은 서로 다른 준비가 필요합니다. Spark의 특정 버전이 리더보드에 표시되더라도 모델 ID, 사용 권한, 공식 요금이 확인되지 않았다면 곧바로 서비스에 연결할 수 있다고 단정하지 마세요. 평가에 등장했다는 사실과 일반 제공 상태를 구분해야 합니다.

Glimmer는 로컬 배포에 앞서 가중치 정밀도와 실행 도구를 정해야 합니다. 장비에 가중치가 올라가는지뿐 아니라 실제 대화 길이에서 추가 메모리가 얼마나 필요한지도 측정하세요. 공식 구성의 문맥 한도와 예제 서버 명령에 적힌 실행 한도는 다를 수 있습니다. 예제에서 사용한 출력 길이를 모델 전체의 최대 출력이라고 해석하는 것도 피해야 합니다.

도구를 쓰는 에이전트로 평가한다면 읽기 전용 파일 검색, 계산, 문서 요약처럼 결과를 확인하기 쉬운 작업부터 시작할 수 있습니다. 모델이 선택한 도구와 실제 반환값을 함께 저장하면 잘못된 답변이 추론에서 생겼는지 도구 사용에서 생겼는지 구분하기 쉽습니다. 공개 가중치의 장점은 이런 실행 조건을 직접 조절할 수 있다는 데 있지만, 운영 책임과 비용도 함께 생깁니다.

출처