Gemini 3.8 Live 모델 선택과 작업 완료 신호 비교

공식 문서의 기능·상태 신호를 정리한 비교 도식입니다. 모델 내부 구조나 실측 성능 차트를 나타내지 않습니다.

구글이 2026년 9월 15일 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking을 발표했습니다. 두 모델은 음성 대화 중 외부 작업을 수행하는 에이전트를 겨냥합니다. 구글은 Live에서 규모 확장과 비용 효율을, Extended Thinking에서 복잡한 작업과 다단계 추론을 강조합니다. 이 글은 공식 발표와 개발 문서를 대조한 브리핑입니다. 모델을 직접 호출해 한국어 대화 품질이나 지연 시간을 측정한 사용기는 아닙니다. 공식 발표

먼저 볼 차이는 도구 호출의 유무가 아닙니다. 기본 Live도 비동기 호출을 지원합니다. 선택할 때는 질문의 복잡도, 필요한 추론 깊이, 그리고 앱이 작업 완료를 추적하는 방식을 함께 봐야 합니다. 빠른 문답이 중심이라면 Live부터, 여러 결과를 모아 판단하는 음성 업무라면 Extended Thinking부터 검증할 만합니다. 이는 문서에 따른 도입 판단이며 성능을 직접 비교한 순위는 아닙니다.

두 모델의 공통 사양과 선택 기준

공식 모델 문서의 안정 버전 ID는 각각 gemini-3.8-livegemini-3.8-live-extended-thinking입니다. 두 모델 모두 입력 한도는 131,072 토큰, 출력 한도는 65,536 토큰입니다. 입력 유형에는 텍스트·이미지·오디오·비디오가 포함됩니다. 입력 토큰 수를 대화 가능한 시간으로 바로 환산할 수는 없습니다. 서비스가 어떤 정보를 얼마나 보내는지까지 확인해야 실제 세션의 여유를 판단할 수 있습니다. Live 사양, Extended Thinking 사양

선택 항목 Gemini 3.8 Live Gemini 3.8 Live Extended Thinking
주된 용도 빠른 음성 문답과 직접적인 작업 여러 단계의 판단과 배경 추론
추론 설정 thinking_level 미지원 low, medium, high 지원
도구 실행 비동기 기본값, 동기 방식도 지원 비동기 방식만 지원
완료 판단 일반적인 턴 완료 흐름 발화 완료와 전체 작업 완료 구분 필요

이 비교는 공식 문서가 설명하는 선택 기준입니다. 추론 설정이 없다는 말은 Live에 추론 능력이 없다는 뜻이 아닙니다. Live 문서는 interleaved reasoning을 지원한다고 명시합니다. 또한 두 모델을 앞뒤로 연결하거나 질문에 따라 자동 전환한다는 내부 구조는 발표 자료에서 확인되지 않았습니다. 위 도식은 모델 선택을 위한 기능 비교로 읽어야 합니다. Live 모델 문서

말이 끝난 것과 작업이 끝난 것은 다릅니다

Extended Thinking의 실무적인 변화는 클라이언트의 상태 처리입니다. 공식 문서는 turnComplete: true를 받은 뒤에도 배경 추론이나 도구 호출이 이어질 수 있다고 안내합니다. 앱은 다음 서버 메시지를 계속 받아야 하며, interaction_statusIDLE일 때 전체 작업이 끝났다고 판단합니다. IN_PROGRESS는 아직 처리 중이라는 뜻입니다. 발화가 잠시 끝났다는 이유만으로 연결을 닫거나 작업을 완료 처리하는 앱이라면 이 부분부터 점검해야 합니다. Extended Thinking 통합 안내

예를 들어 사용자가 가능한 예약 시간을 묻는다고 가정해 보겠습니다. 진행 상황을 말하는 음성과 예약 서비스의 조회 결과는 서로 다른 시점에 도착할 수 있습니다. 화면에 완료 표시를 먼저 띄우면 사용자는 아직 확인하지 않은 결과를 확정된 답으로 받아들일 수 있습니다. 이 예시는 공식 API의 상태 구분이 왜 필요한지 설명하기 위한 상황이며, 이 사이트가 예약 기능을 시험했다는 뜻은 아닙니다.

구글의 Live API 가이드는 Extended Thinking이 도구를 기다리는 동안 중간 음성 안내를 제공하는 흐름을 설명합니다. 따라서 비교할 것은 첫 소리가 얼마나 빨리 나오는지 하나만이 아닙니다. 실제 답이 완성되는 시간, 안내가 사용자 질문과 맞는지, 도구 실패 뒤 잘못된 완료 안내가 나오는지도 함께 봐야 합니다. 중간 반응이 자연스러워도 최종 결과가 늦거나 틀리면 업무에는 도움이 되지 않기 때문입니다. Live API의 Thinking 안내

기존 음성 앱에서 바꿔야 할 부분

Gemini 3.1 Flash Live에서 기본 Live로 옮기는 경우 공식 문서는 모델 문자열 변경과 함께 기존 thinking_level 또는 thinking_config 제거를 안내합니다. 비동기 도구 호출이 기본 방식이지만 BLOCKING 설정도 지원합니다. 반면 Extended Thinking은 NON_BLOCKING 선언을 요구하며 동기 도구는 오류가 납니다. 같은 음성 인터페이스를 사용하더라도 설정을 그대로 복사해 모델 이름만 바꾸는 접근은 충분하지 않습니다. Live 이전 안내, Extended Thinking 이전 안내

도입 검증에서는 정상 응답 외에 느린 도구, 실패한 도구, 사용자가 말을 다시 시작하는 상황을 포함하는 편이 좋겠습니다. 이는 편집팀의 검증 제안입니다. 특히 외부 시스템을 수정하는 작업이라면 진행 안내와 실제 실행 결과를 구별해 기록해야 합니다. 음성이 자연스럽다는 이유로 조회나 저장의 성공 여부까지 추정해서는 안 됩니다. 기존 앱이 안정적으로 쓰이고 있다면 동일한 대화 사례를 두 모델에 적용해 결과와 상태 변화를 비교하는 것이 먼저입니다.

배포 범위와 발표 수치

공식 발표는 개발자용 Gemini API·AI Studio와 기업용 Gemini Enterprise 비공개 미리보기를 안내합니다. Live는 Search Live에, Extended Thinking은 Gemini Live와 Workspace 기능에 순차 적용됩니다. Docs는 Google AI Pro·Ultra, Gmail과 Keep은 Google AI 구독자를 대상으로 안내됐습니다. 이 글에서는 개별 계정에 로그인해 해당 기능의 활성화를 확인하지 않았습니다. 공식 배포 안내

구글 발표가 제시한 Extended Thinking 수치는 Speech to Speech Quality Index 82.6, τ-Voice 68.6%, Sierra τ-Voice-banking 35.1%, Big Bench Audio 97.7%입니다. 여기서는 이를 구글 발표 수치로 인용하며, 각 평가의 원본 리더보드와 실행 조건까지 독립 검증하지 않았습니다. 서로 다른 평가의 점수를 한 종류의 정확도로 묶거나, 한국어 상담 성공률로 바꿔 읽을 근거는 없습니다. 수치의 출처

추천 대상과 아직 유보할 판단

문서 기준으로 Live는 짧은 응답과 빠른 차례 교환이 중요한 음성 앱에서 먼저 검토할 후보입니다. Extended Thinking은 여러 자료를 비교하거나 도구 응답을 기다리는 동안 진행 상황을 전달해야 하는 작업에서 검토 가치가 있습니다. 단순 문답만 필요한 서비스가 더 깊은 추론을 이유로 무조건 Extended Thinking으로 옮길 필요는 없습니다. 반대로 복합 작업의 문제를 더 빠른 첫 응답만으로 해결하려 해도 요구사항을 놓칠 수 있습니다. 공식 모델 선택 가이드

가격 대비 효용과 경쟁 모델 대비 우열은 이번 자료만으로 결론내리지 않았습니다. 동일한 한국어 과제, 호출 조건, 실제 사용량을 맞춘 비용 비교를 수행하지 않았기 때문입니다. 검증을 시작한다면 대화 한 건의 총비용, 최종 과제 성공 여부, 끼어들기 이후의 맥락 유지, 실패 복구를 함께 기록할 것을 권합니다. 예산이나 응답 시간에 엄격한 조건이 있다면 그 기준을 통과하기 전에는 전면 전환을 결정하기 어렵습니다.

이번 공개에서 개발자가 주목할 변화는 음성과 배경 작업을 함께 다루는 API 동작입니다. 도입의 성패는 발표 점수만으로 정해지지 않습니다. 사용자가 듣는 진행 안내와 외부 도구의 실제 결과가 일치하는지, 앱이 아직 진행 중인 작업을 완료로 처리하지 않는지부터 검증할 필요가 있습니다. 두 모델의 차이를 이 수준에서 확인해야 서비스 목적에 맞는 선택을 할 수 있습니다.

출처