사내 데이터 보안 규정으로 인해 외부 API를 사용할 수 없거나 독자적인 모델 인프라를 운영하려는 AI 엔지니어링 팀에 적합한 오픈 모델입니다. 온프레미스 서빙 환경에 맞춤 배치할 수 있습니다.

도입 전에는 Apache 2.0 라이선스 조건과 모델 규격(31B, 26B MoE 등)에 필요한 GPU 메모리, 전력 및 인프라 운영 비용을 면밀히 계산해야 합니다. 오픈 가중치가 무료 운영을 의미하지 않는다는 점을 확인해야 합니다.

한 줄 결론

최대 256K 컨텍스트와 멀티모달을 지원하는 오픈 가중치 패밀리로, 보안 환경에 맞춘 사내 서빙 설계에 적합합니다.

바뀐 점

  • 모델 패밀리 구성: 31B Dense, 26B A4B MoE(총 26B 중 4B 활성), 12B Unified 모델과 엣지용 경량 모델(E4B, E2B)로 구성됩니다.
  • 컨텍스트 및 모달리티: 모델에 따라 128K에서 최대 262,144 토큰 컨텍스트를 지원하며 모든 크기가 텍스트·이미지 입력을 지원하고, 오디오 입력은 E2B·E4B·12B에서 지원합니다.
  • 라이선스 및 배포: Apache 2.0 라이선스에 따라 Hugging Face 및 Vertex AI 등을 통해 가중치가 공개 배포되었습니다.

가격과 조건

모델 변형 아키텍처 및 파라미터 컨텍스트 윈도우 라이선스 및 배포 조건
Gemma 4 31B Dense (31B) 262,144 토큰 오픈 가중치 (Apache 2.0 라이선스)
Gemma 4 26B A4B MoE (총 26B / 활성 4B) 262,144 토큰 오픈 가중치 (Apache 2.0 라이선스)
Gemma 4 12B Unified 262,144 토큰 오픈 가중치 (Apache 2.0 라이선스)
Gemma 4 E4B / E2B 엣지 디바이스용 128K 토큰 오픈 가중치 (Apache 2.0 라이선스)

Gemma 4는 오픈 가중치 배포 모델이므로 무료 운영을 뜻하지 않으며, 자체 하드웨어 구축, GPU 클러스터 가동, 전력 및 엔지니어링 유지보수 비용이 지속적으로 발생합니다.

공개 평가에서 읽을 것

  • GPQA Diamond (Artificial Analysis · GPQA Diamond): Gemma 4 31B (Reasoning) 모델이 85.66%, Gemma 4 26B A4B (Reasoning) 모델이 79.19%의 정답률을 기록했습니다.

Google · 공개 평가 결과. GPQA Diamond · % correct

도표 크게 보기

평가 버전: Artificial Analysis · GPQA Diamond.

모델·실행 설정 공개 점수
Gemma 4 31B (Reasoning) 85.66
Gemma 4 26B A4B (Reasoning) 79.19
Gemma 4 31B (Non-reasoning) 76.26
Gemma 4 12B (Reasoning) 75.25

전체 결과와 평가 조건

같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.

도표의 공개 원문

추천하는 사용법

  • 제한된 GPU 자원 환경에서는 활성 파라미터가 4B 수준인 26B A4B MoE 모델을 테스트하여 추론 지연 시간과 메모리 점유율을 확인하는 방식을 권장합니다.
  • 데이터 격리 파이프라인에서는 31B Dense 모델을 사내 vLLM 엔진에 올려 배치 처리량과 동시 처리 성능을 측정하는 실험을 추천합니다.

크기를 고를 때 계산할 메모리

Gemma 4의 26B A4B에서 활성 파라미터 수와 전체 가중치 크기를 혼동하지 않는 것이 중요합니다. 일부 파라미터만 연산에 참여한다는 설명이 전체 모델을 그 크기의 메모리에 넣을 수 있다는 뜻은 아닙니다. 실제로 올릴 가중치의 정밀도, 실행 도구가 쓰는 버퍼, 대화의 문맥을 저장하는 공간이 모두 필요합니다. 긴 문맥이나 동시 요청을 늘리면 추가 메모리도 커질 수 있습니다.

자체 배포를 검토한다면 먼저 사용할 크기와 입력 종류를 정하세요. 텍스트 질의만 처리할지, 이미지나 오디오도 받을지에 따라 후보가 달라집니다. 공식 모델 카드에서 해당 크기가 지원하는 입력을 확인한 뒤 짧은 요청으로 메모리 사용량과 응답 시간을 측정합니다. 그다음 실제 문서 길이와 동시 사용자 수로 부하를 늘리는 순서가 좋습니다.

Apache 2.0으로 공개된 가중치를 이용할 수 있어도 운영 비용이 없어지는 것은 아닙니다. 서버 비용, 전력, 장애 대응, 업데이트 작업을 API 비용과 같은 기간으로 맞춰 비교해야 합니다. 사용량이 적거나 매번 크게 달라지는 서비스는 직접 운영하는 고정 비용이 부담이 될 수 있습니다. 반대로 데이터 반출 제한과 일정한 사용량이 있는 조직은 자체 배포의 운영 조건을 구체적으로 계산해 볼 만합니다.

출처