Gemini 3.5 Flash-Lite는 Google Gemini API에서 Stable로 제공되는 텍스트 출력 모델이다. API ID는 gemini-3.5-flash-lite이며, Google은 이 모델을 3.5 계열에서 가장 빠르고 비용 효율적인 고처리량 실행용 모델로 분류한다.

개별 모델 페이지가 제시하는 대상은 서브에이전트 작업, 문서 파싱, 대량 에이전트 워크플로, 단순 데이터 추출이다. 텍스트뿐 아니라 이미지, 영상, 오디오, PDF를 입력으로 받을 수 있고, 입력 한도는 1,048,576토큰, 최대 출력은 65,536토큰이다.

이 모델은 Gemini 3.5 Flash의 저가 요금제가 아니다. 별도 API ID와 가격표를 가진 독립 모델이다. Standard 유료 티어는 입력 100만 토큰당 $0.30, thinking 토큰을 포함한 출력은 $2.50이다. 그러나 낮은 단가만으로 복잡한 코딩이나 긴 에이전트 작업의 품질이 상위 Flash와 같다고 판단할 근거는 지정된 공식 문서에 없다.

이 글은 직접 사용기가 아니다. 사용자가 지정한 Google 공식 문서와 모델 목록에서 연결되는 Gemini 3.5 Flash-Lite 사양 페이지만으로 사양, 비교, 비용, 추천 조건을 정리한다.

먼저 답하면

  • 추천 작업: 대량 문서 파싱, 단순 추출·분류, 번역, 비용 상한이 분명한 서브에이전트 호출
  • 비추천 작업: 최신 Flash 수준의 복잡한 코딩·다단계 실행 품질을 검증 없이 전제하는 업무
  • 가격 판단: Standard는 입력 $0.30·출력 $2.50, Batch와 Flex는 입력 $0.15·출력 $1.25, Priority는 입력 $0.54·출력 $4.50이다. 모두 100만 토큰당 유료 티어 가격이다.
  • 현재 판단: 처리량과 API 비용이 우선인 반복 작업에는 명확한 후보지만, 정답 비용과 재시도 비용까지 포함한 자체 평가를 통과해야 실제 최저비용 모델인지 알 수 있다.

정확히 어떤 모델인가

항목 Google 공식 문서상 내용
공식 제품명·API ID Gemini 3.5 Flash-Lite · gemini-3.5-flash-lite
버전 상태 Stable
공식 위치 3.5 계열의 가장 빠르고 비용 효율적인 고처리량 실행용 모델
입력 형식 텍스트, 이미지, 영상, 오디오, PDF
출력 형식 텍스트
입력 한도 1,048,576토큰
최대 출력 65,536토큰
지원 기능 캐싱, 코드 실행, 파일 검색, 함수 호출, Google Maps grounding, Search grounding, 구조화 출력, thinking, URL context
프리뷰 지원 Computer Use
미지원 기능 오디오 생성, 이미지 생성, Live API
처리 방식 Standard, Batch, Flex, Priority
모델 페이지의 최신 업데이트 표기 2026년 7월

입력 범위와 도구 구성은 단순 텍스트 분류보다 넓다. 긴 문서나 여러 미디어를 읽고, 코드 실행·검색·함수 호출·구조화 출력을 조합하는 흐름까지 공식 지원 범위에 들어간다. 다만 출력은 텍스트로 제한된다. 이미지나 오디오를 직접 생성하거나 Live API 기반의 실시간 음성 대화를 처리하는 모델로 선택하면 안 된다.

Computer Use는 지원되지만 프리뷰다. 브라우저 자동화에 넣을 경우 화면 변경, 잘못된 클릭, 중단 복구를 별도로 평가해야 한다. 모델이 Stable이라는 사실과 개별 프리뷰 기능의 안정성은 구분해서 봐야 한다.

최신 모델 가이드에서 읽히는 위치

Google의 모델 목록은 Gemini 3.5 Flash-Lite를 Stable로 두고, 3.5 계열에서 가장 빠르고 비용 효율적인 고처리량 모델이라고 설명한다. 가격 페이지에서는 고용량 에이전트 작업, 번역, 단순 데이터 처리를 위한 가장 비용 효율적인 GA 모델로 소개한다. 개별 사양 페이지는 서브에이전트 작업과 문서 파싱을 추가로 명시한다.

반면 현재 최신 모델 가이드는 Gemini 3.7 Flash를 복잡한 코딩, 공간·멀티모달 추론, 다단계 에이전트 워크플로의 최신 Flash로 안내한다. 이 가이드의 이전 표에는 Gemini 3.5 Flash가 포함되지만 Gemini 3.5 Flash-Lite는 별도 이전 대상으로 적혀 있지 않다.

따라서 공식 문서만으로 Flash-Lite의 중단이나 3.7로의 강제 이전을 선언할 수 없다. 현재 확인되는 상태는 Stable이며, 역할도 품질 최우선 모델보다 처리량·지연·비용 제약이 큰 작업에 맞춰져 있다. 신규 도입에서는 두 모델을 같은 용도로 놓기보다 저비용 작업 큐와 복잡한 작업 큐를 나누어 평가하는 편이 문서상의 제품 구분에 맞다.

벤치마크에서 확인되는 위치

지정된 공식 페이지에는 Gemini 3.5 Flash-Lite와 3.5 Flash 또는 3.7 Flash를 같은 프롬프트, thinking 설정, 도구 구성으로 실행한 점수가 없다. 한국어 정확도, 실제 첫 응답 지연, 초당 토큰, 함수 호출 성공률, 문서 추출 오류율도 수치로 제시되지 않는다.

따라서 가장 빠르다는 공식 제품 설명을 특정 지역과 계정에서의 실제 지연 수치로 바꿀 수 없고, 가장 비용 효율적이라는 설명을 모든 작업의 정답 비용이 가장 낮다는 뜻으로 확장할 수도 없다. 이 글의 비교는 Stable 여부, 공식 권장 작업, 지원 기능, 공개 가격처럼 문서에서 직접 대조할 수 있는 항목으로 제한한다.

가장 가까운 대안

항목 Gemini 3.5 Flash-Lite Gemini 3.5 Flash Gemini 3.7 Flash
공식 위치 Stable, 3.5 계열 고처리량·저비용 모델 Stable, 레거시 Flash 최신 Stable Flash
공식 설명상 적합한 작업 서브에이전트, 문서 파싱, 번역, 단순 데이터 처리 일상적 고처리량 작업의 기준 성능 복잡한 코딩, 멀티모달 추론, 다단계 실행
Standard 입력·출력 $0.30 · $2.50 / 100만 토큰 $1.50 · $9.00 / 100만 토큰 2026년 말까지 $0.75 · $3.75, 2027년부터 $1.50 · $7.50
선택 기준 호출량과 단가가 우선이고 작업을 단순화할 수 있음 기존 3.5 운영 호환성이 중요함 복잡한 작업의 최신 기준선을 먼저 평가함

Flash-Lite의 Standard 입력 가격은 3.5 Flash보다 $1.20 낮고 출력 가격은 $6.50 낮다. 2026년 한시 가격을 적용한 3.7 Flash와 비교해도 입력은 $0.45, 출력은 $1.25 낮다. 공개 단가만 보면 대량 반복 호출을 Flash-Lite로 분리할 이유가 분명하다.

다만 이 가격 차이는 같은 정답률과 같은 재시도율을 보장하지 않는다. 단순 추출은 Flash-Lite, 복잡한 코딩과 장기 도구 실행은 3.7 Flash처럼 작업을 나눈 뒤, 실패한 Lite 요청을 상위 모델로 승격하는 비용까지 기록해야 한다. 모든 요청을 가장 싼 모델에 넣고 재시도가 늘면 토큰 단가의 이점이 줄어들 수 있다.

가격과 실제 운영비

Gemini 3.5 Flash-Lite 유료 티어의 100만 토큰당 가격은 다음과 같다. 출력 가격에는 thinking 토큰이 포함된다.

처리 방식 입력 출력 캐시 입력
Standard $0.30 $2.50 $0.03
Batch $0.15 $1.25 $0.02
Flex $0.15 $1.25 $0.02
Priority $0.54 $4.50 $0.05

캐시 저장료는 100만 토큰을 1시간 보관할 때 $1.00이다. 가격표의 무료 티어에는 입력과 출력이 무료로 표시되지만, 실제 제공 범위와 호출 한도는 계정에서 확인해야 한다.

캐시와 grounding 비용을 제외하고 한 달에 입력 1,000만 토큰, 출력 200만 토큰을 쓴다고 가정하면 계산은 다음과 같다.

처리 방식 계산 토큰 비용
Standard 10 × $0.30 + 2 × $2.50 $8.00
Batch 또는 Flex 10 × $0.15 + 2 × $1.25 $4.00
Priority 10 × $0.54 + 2 × $4.50 $14.40

즉시 응답이 필요 없는 문서 파싱, 야간 분류, 대량 번역은 Batch나 Flex로 분리하면 이 가정에서 Standard 토큰 비용의 절반이 된다. 사용자 대면 요청은 Standard로 두고, 지연 비용이 큰 일부 요청만 Priority로 보내면 처리 우선순위와 원가를 함께 설명하기 쉽다.

Grounding 요금은 모델의 토큰 사용량에 합산되는 항목이 아니다. 유료 티어에서 Search와 Maps는 Gemini 3 계열 전체가 공유하는 월 5,000회 무료 한도를 소진한 뒤 검색 쿼리 1,000건당 $14로 계산된다. 단일 사용자 요청에서도 Google Search 쿼리가 여러 건 생성되어 각각 청구될 수 있으므로, 에이전트 운영에서는 토큰 예산과 별개로 grounding 쿼리 예산과 중복 검색 제한을 관리해야 한다.

비용을 줄이기 위한 운영 방식

작업 권장 처리 확인할 지표
정형 문서 추출·분류 Flash-Lite Batch 또는 Flex부터 평가 필드 누락률, JSON 유효성, 재시도율
사용자 대면 번역·요약 Flash-Lite Standard로 지연 측정 첫 응답 지연, 수정 요청률, 출력 토큰
복잡한 코딩·장기 에이전트 3.7 Flash를 기준선으로 함께 평가 작업 완료율, 도구 호출 수, 총비용
검색이 잦은 리서치 토큰과 grounding 예산을 분리 검색 쿼리 수, 중복 검색, 근거 누락
화면 조작 자동화 Computer Use 프리뷰로 제한 평가 오클릭, 중단 복구, 화면 변경 내성

라우팅 기준은 프롬프트 길이만으로 만들기보다 작업 실패 비용을 함께 반영해야 한다. 정형 스키마로 답할 수 있고 잘못된 결과를 자동 검출할 수 있는 요청은 Flash-Lite에 적합하다. 반대로 오답을 자동으로 찾기 어렵거나 한 번의 실패가 큰 손실로 이어지는 요청은 상위 모델과의 비교가 먼저다.

추천 대상 / 비추천 대상

추천

  • 대량 문서 파싱, 단순 데이터 추출·분류, 번역을 반복하는 팀
  • 저비용 서브에이전트를 여러 번 호출하되 결과를 자동 검증할 수 있는 서비스
  • 텍스트·이미지·영상·오디오·PDF 입력을 한 모델에서 읽어야 하는 파이프라인
  • 즉시성이 낮은 작업을 Batch나 Flex로 분리할 수 있는 운영팀
  • 토큰 예산과 Search·Maps grounding 예산을 별도로 관리할 수 있는 제품

비추천

  • 최신 Flash 수준의 복잡한 코딩·다단계 에이전트 품질을 검증 없이 요구하는 프로젝트
  • 이미지나 오디오를 직접 생성해야 하는 제품
  • Live API 기반의 실시간 음성 대화를 한 모델에서 처리하려는 제품
  • Computer Use 프리뷰를 별도 안전장치 없이 운영 자동화에 넣으려는 팀
  • 공식 동일 조건 점수 없이 한국어 정확도나 실제 지연 우위를 보장해야 하는 구매 절차

판단

Gemini 3.5 Flash-Lite는 Stable이며, 100만 토큰급 입력과 긴 텍스트 출력, 멀티모달 입력, 검색·코드 실행·함수 호출·구조화 출력까지 지원한다. Google은 이 모델을 서브에이전트, 문서 파싱, 번역, 단순 데이터 처리처럼 호출량과 비용 제약이 큰 작업에 배치한다.

공개 단가에서도 역할이 선명하다. 입력 1,000만 토큰과 출력 200만 토큰의 예시에서 Standard 토큰 비용은 $8.00, Batch나 Flex는 $4.00이다. 같은 사용량의 3.5 Flash Standard 비용 $33.00보다 낮다. 반복 작업을 별도 큐로 분리할 수 있다면 비용 절감 후보로 먼저 시험할 만하다.

다만 공식 문서는 같은 조건의 품질·지연 점수를 제공하지 않는다. 신규 도입에서는 대표 작업 세트를 정해 필드 누락률, 함수 호출 성공률, 재시도율, 출력 토큰, 완료 시간을 함께 측정해야 한다. Flash-Lite에서 실패한 요청을 3.7 Flash로 승격했을 때의 총비용까지 더한 뒤에야 실제 운영 모델을 결정할 수 있다.

아직 공식 문서에서 확인되지 않은 부분

  • Flash-Lite와 다른 Flash 모델의 동일 조건 벤치마크 점수와 평가 하네스
  • 한국어 작업 정확도와 지역·계정별 실제 첫 응답 지연
  • 작업 유형별 출력 토큰 사용량, 함수 호출 성공률, 재시도율
  • 무료 티어와 유료 티어의 계정·지역별 실제 처리량 및 호출 한도
  • Computer Use 프리뷰의 장기 작업 성공률과 화면 변경 복구 성능
  • Flash-Lite에 대한 별도 이전 일정이나 직접 지정된 후속 모델

함께 읽을 글

근거와 출처

  • Gemini 최신 모델 가이드 — 3.7 Flash의 현재 위치, 3.5 Flash의 이전 관계와 시점별 가격. Google AI for Developers, 확인일 2026-08-26
  • Gemini Developer API 가격 — Gemini 3.5 Flash-Lite의 Standard·Batch·Flex·Priority 토큰 단가, 캐시 저장료와 Search·Maps grounding 가격. Google AI for Developers, 확인일 2026-08-26
  • Gemini 모델 목록 — Gemini 3.5 Flash-Lite의 Stable 지위, 공식 제품 설명과 API ID. Google AI for Developers, 확인일 2026-08-26
  • Gemini 3.5 Flash-Lite 모델 사양 — 입출력 형식, 토큰 한도, 지원·미지원 기능, 처리 방식과 업데이트 표기. Google AI for Developers, 확인일 2026-08-26

게시: 2026-08-26 04:04 KST 작성 방식: 직접 사용기가 아닌 Google 공식 문서 분석