영상, 오디오, PDF 등 복합 미디어를 처리하는 클라우드 서비스 개발자는 Gemini 3.8 Flash를, 보안상 자체 인프라가 필수적인 팀은 오픈 가중치 Gemma 4를 검토할 수 있습니다. 관리형 API와 자체 구축 환경의 장단점을 구분해야 합니다.

실행 전에는 Gemini 3.8 Flash의 프로모션 요금 적용 기한(2026년 12월 31일까지)을 확인해야 합니다. 또한 오픈 가중치 Gemma 4는 무료 운영이 아니라 GPU 장비, 전력, 운영 인프라 비용이 소요된다는 점을 예산에 반영해야 합니다.

한 줄 결론

클라우드 멀티모달 서비스에는 연말 프로모션 요율의 Gemini 3.8 Flash를 배치하고, 사내 데이터 격리가 필요한 환경에는 Gemma 4를 자체 호스팅하는 구성이 실용적입니다.

바뀐 점

  • Gemini 3.8 Flash 정식 출시: gemini-3.8-flash 식별자로 1,048,576 토큰 문맥과 65,536 토큰 출력을 지원합니다. 비디오, 오디오, PDF를 직접 처리하며 2026년 12월 31일까지 도입기 프로모션 단가(입력 $0.75 / 출력 $3.75)가 적용됩니다.
  • Gemma 4 오픈 가중치 공개: 31B Dense, 26B A4B MoE(4B 활성), 12B Unified 모델을 포함하며 최대 256K 컨텍스트를 지원합니다.
  • 이전 세대 유지: Gemini 3.7 Flash($0.75/$3.75)와 3.5 Flash($1.50/$9.00)가 유지되며 Gemini 3.1 Pro는 프리뷰 상태입니다.

가격과 조건

모델명 API ID / 형태 컨텍스트 최대 출력 입력 / 출력 (1M)
Gemini 3.8 Flash gemini-3.8-flash 1,048,576 65,536 $0.75 / $3.75 (프로모션)
Gemini 3.7 Flash gemini-3.7-flash 1,000,000 64,000 $0.75 / $3.75
Gemini 3.5 Flash gemini-3.5-flash 1,000,000 64,000 $1.50 / $9.00
Gemma 4 오픈 가중치 최대 262,144 미공개 자체 인프라 소요
Gemini 3.1 Pro gemini-3.1-pro-preview 1,048,576 65,536 $2 / $12 (입력 200K 이하)

Gemini 3.1 Pro Preview는 입력이 200K를 초과하면 입력 $4 / 출력 $18 요금이 적용됩니다.

Gemma 4는 오픈 가중치 배포 모델이므로 자체 실행에 하드웨어, 전력, 운영 비용이 발생합니다. Gemini 3.8 Flash의 프로모션 요금은 2026년 12월 31일까지 유지됩니다.

공개 평가에서 읽을 것

  • Gemini 3.8 Flash: LiveBench(2026-06-25 release, gemini-3.8-flash-high) 75.83점, Artificial Analysis Intelligence Index(v4.2 · 2026-09-04, high) 47.07점, GPQA Diamond high 95.25%, medium 93.54%, Terminal-Bench 4.0(mini-SWE-agent · high) 19.09%입니다.
  • Gemma 4: GPQA Diamond에서 Gemma 4 31B(Reasoning) 85.66%, Gemma 4 26B A4B(Reasoning) 79.19%를 기록했습니다.
  • Gemini 3.7 Flash: LiveBench(2026-06-25 release, high) 78.83점, GPQA Diamond high 92.42%입니다.

Google · 모델별 API 단가. 100만 토큰당 USD · 입력과 출력은 별도 과금

도표 크게 보기

모델 입력 USD / 1M 출력 USD / 1M
Gemini 3.8 Flash 0.75 3.75
Gemini 3.7 Flash 0.75 3.75
Gemini 3.5 Flash 1.5 9

단가 비교이며 성능 순위가 아닙니다. 캐시·장문·도구 과금과 제공 조건은 본문 및 원문을 확인하세요.

도표의 공개 원문

추천하는 사용법

  • 회의 녹음, 영상 요약, 다중 PDF 문서 분석에는 Gemini 3.8 Flash의 직접 입력을 활용하는 구성을 권장합니다. 컨텍스트 길이가 길다고 해서 문서 내 세부 사실의 인출 정확도가 보장되는 것은 아니므로, 샘플 테스트를 병행해야 합니다.
  • 폐쇄망 환경에서는 Gemma 4 31B 또는 26B MoE 모델을 사내 GPU 서버에 올려 서빙 지연 시간과 메모리 점유율을 실측하는 실험을 추천합니다.

요청 한 건의 비용으로 바꿔 보면

Google 제품의 요금은 입력 형식부터 맞춰 비교해야 합니다. 아래 계산은 텍스트 입력 10,000토큰과 출력 1,000토큰 한 건을 가정하며, 오디오와 영상의 실제 처리 비용을 나타내지 않습니다. 같은 길이의 텍스트 요청에서 Flash 세대별 가격 차이를 읽는 예시입니다.

모델 입력 비용 USD 출력 비용 USD 합계 USD
Gemini 3.8 Flash 0.0075 0.00375 0.01125
Gemini 3.7 Flash 0.0075 0.00375 0.01125
Gemini 3.5 Flash 0.015 0.009 0.024

Google 모델을 고를 때는 표의 금액과 함께 작업 완료율을 확인하세요. 이 표는 실측 결과가 아닌 단가 계산 예시이며, 도구 사용료와 재시도 비용은 제외했습니다. 상위 모델을 모든 요청에 적용하기 전에 어려운 작업에만 선택적으로 사용하는 구성을 비교할 수 있습니다.

출처