Live Avatar 도입 검토 흐름

공식 발표의 기능과 기업이 별도로 검증할 항목을 연결한 설명 모식도입니다. 내부 구현도를 뜻하지 않습니다.

구글은 2026년 9월 24일 공식 블로그에서 Gemini 3.8 Live에 실시간 영상 아바타를 결합한 ‘Gemini 3.8 Live with Live Avatar’를 발표했다. 발표문은 당일부터 Gemini Enterprise에서 사용할 수 있다고 밝혔다. 다음 날인 9월 25일 Google Cloud 블로그도 기업용 일반 제공(GA)을 확인했다. 기존 Gemini 3.8 Live의 음성 대화에 얼굴 표정과 입모양이 맞는 영상 출력을 더한 것이 이번 소식의 핵심이다.

한 줄 판단은 분명하다. 이미 음성 상담이나 안내 에이전트를 운영하며 화면 속 인물의 반응까지 필요한 조직에는 시험할 이유가 있다. 반면 지연 시간, 언어별 품질, 실제 비용을 독립적으로 측정한 자료는 이 두 발표문에 없다. 도입 판단은 홍보 영상보다 자사 환경의 시범 운영 결과에 따라야 한다.

무엇이 추가됐나

Google은 아바타가 실시간 음성 대화에 맞춰 립싱크와 표정을 생성하고, 사용자의 끼어들기에도 대화를 이어가도록 설계했다고 설명한다. Keyword 발표문은 대화 도중 언어를 바꿀 수 있고 97개 언어를 다룬다고 적는다. 이는 공급사의 기능 설명이며, 각 언어에서 같은 품질이나 지연 시간이 보장된다는 뜻은 아니다. 한국어 상담에 쓰려면 발음, 화자 전환, 끼어들기와 장시간 연결을 따로 시험해야 한다.

대화 중 외부 시스템을 조회하는 도구 호출도 강조한다. Cloud 설명에 따르면 모델은 도구나 API 작업이 끝나기를 기다리는 동안 사용자와의 대화를 계속할 수 있다. 재고나 예약 정보를 불러오는 상담 흐름에서 유용할 수 있지만, 실제 업무 시스템과 연결했을 때 응답의 정확성·재시도·권한 처리는 도입 조직이 검증해야 한다.

기존 구성과 비교하면

음성 인식, 대화 모델, 음성 합성, 아바타 렌더링을 별도 서비스로 연결하는 구성에서는 각 단계의 연결과 동기화가 운영 과제다. 이번 발표는 음성 대화와 영상 아바타를 함께 제공하고, 도구 호출을 대화와 병행한다는 점에서 통합 선택지를 제시한다. 다만 구글은 발표문에서 기존 구성 대비 지연 시간이 몇 밀리초 줄었는지, 전체 구축 비용이 얼마나 낮아지는지 측정값을 제시하지 않았다.

영상에는 구글의 SynthID 워터마크가 적용된다고 두 공식 발표문은 설명한다. 이것은 생성물 식별을 돕는 표시다. 신원 도용이나 편집 후 위변조를 자동으로 차단한다는 보증으로 해석해서는 안 된다. 사용자 동의, 아바타 사용 권리, 저장·삭제 정책과 별도의 운영 통제가 필요하다.

누가 시험해 볼 만한가

Google Cloud 블로그는 고객 지원과 대화형 키오스크를 사용 사례로 들고 있다. 이미 음성 에이전트의 답변 품질을 관리하면서 화면 속 응답이 실제 서비스 경험을 개선하는지 측정할 수 있는 조직이 우선 대상이다. 텍스트나 음성만으로 충분한 서비스라면 영상 스트리밍 비용과 운영 복잡도를 추가할 이유가 있는지 먼저 확인해야 한다.

사전에 준비된 아바타를 사용할 수 있지만, 고유 인물이나 브랜드를 반영한 커스텀 아바타는 기업 허용 목록 대상에게만 제공된다. 직접 만들 수 있다고 가정하고 출시 일정을 잡으면 안 된다. 제작 권리와 초상권 확인, 승인 소요 시간도 도입 계획에 포함해야 한다.

접근, 지역, 비용에서 확인할 것

9월 15일 갱신된 기존 Gemini 3.8 Live 모델 문서는 텍스트와 오디오 출력을 설명한다. 그러나 그 문서가 새 아바타 발표보다 먼저 작성됐다는 사실만으로 API가 없다고 결론 내릴 수는 없다. 9월 25일 Cloud 글은 API로 개발을 시작할 수 있다고 명시한다. 실제 계정에서 사용할 수 있는 모델, 아바타 기능과 허용 목록 조건을 제품 문서와 콘솔에서 확인해야 한다.

Cloud 글은 미국과 유럽 엔드포인트 및 프로비저닝 처리량을 안내한다. 다른 지역을 제공하지 않는다고 단정할 근거는 이 글만으로 부족하다. 한국에서 사용할 계획이라면 계정의 실제 리전 선택지, 데이터 위치 요구, 왕복 지연 시간을 확인해야 한다. 공식 가격 페이지와 계약 조건을 대조하고, 영상 송출 시간·동시 접속·도구 호출까지 포함한 파일럿 비용을 계산해야 가격값을 판단할 수 있다.

도입 전 파일럿에서 볼 지표

첫째, 같은 상담 시나리오를 현재의 텍스트·음성 채널과 Live Avatar 양쪽에서 수행해야 한다. 질문을 끝낸 시각부터 첫 음성 응답과 첫 영상 프레임까지 걸리는 시간, 립싱크가 어긋나는 구간, 30분 이상 연결했을 때의 끊김을 각각 측정한다. 공식 발표는 저지연을 설명하지만 실제 수치와 측정 환경을 제공하지 않으므로, 공급사 데모만으로 자사 네트워크의 성능을 추정할 수 없다.

둘째, 한국어 대화에서 말 끊기와 재질문을 시험한다. 고객이 답변 도중 말을 바꾸거나 영어 고유명사를 섞을 때, 아바타의 표정과 음성이 현재 발화에 맞는지, 정보가 확실하지 않을 때 적절히 되묻는지 확인한다. 97개 언어 지원은 언어 목록에 대한 발표이지 한국어 상담 정확도에 대한 독립 평가가 아니다. 서비스가 쓰는 도메인 용어와 억양으로 표본을 따로 만들어야 한다.

셋째, 도구 호출에 실패하는 경우도 넣는다. 예약 시스템이 시간 초과를 반환하거나 고객 정보 접근 권한이 거절되면, 아바타가 확인되지 않은 결과를 확정적으로 말하지 않는지 살펴본다. 영상이 자연스럽게 이어지는 것과 답변이 사실에 맞는 것은 별개다. 대화 기록, 접근 로그, 재시도 규칙을 기존 업무 시스템의 승인 절차에 맞춰 검토할 필요가 있다.

넷째, 개인정보와 인물 권리의 책임을 정리한다. 고객 얼굴이나 음성을 받는다면 수집·저장 기간과 삭제 경로를 확인하고, 커스텀 아바타를 쓴다면 원본 인물의 동의와 사용 범위를 문서화한다. SynthID 표시가 있더라도 운영자가 모든 오남용을 사전에 막아 주지는 않는다. 사용자가 AI 아바타와 대화 중이라는 안내도 별도로 설계해야 한다.

마지막으로 영상이 실제 성과를 개선하는지 판단한다. 상담 완료율이나 안내 재질문 횟수가 음성 채널과 비슷하다면 영상 송출과 운영 비용을 더 낼 이유가 약해진다. 반대로 복잡한 절차를 화면에서 설명하는 키오스크처럼 시각적 반응이 필요한 곳은 효과를 시험할 만하다. 커스텀 아바타 허용 목록, 동시 접속, 지역별 지연을 확인하고 가격표와 계약 견적을 함께 비교해야 한다.

결론

Live Avatar는 ‘더 사람 같은 화면’ 자체보다 음성 대화, 영상 반응, 업무 도구 호출을 한 서비스로 운영할 수 있는지가 관건이다. 구글의 97개 언어와 실시간 반응 주장은 시험 출발점이다. 한국어 품질, 실제 지연, 사용자 동의, 커스텀 아바타 권리, 사용량별 비용을 확인한 뒤에야 기존 음성 전용 방식보다 나은지 결정할 수 있다. 이 글은 공식 발표 자료 검토이며 제품을 직접 사용하거나 독립 성능 시험을 수행한 결과가 아니다.

출처