Gemini 3.8 Live 완전 분석—실시간 음성 AI가 작업하는 에이전트로 바뀐 이유

2026-09-23 · AI · 쥬곰 편집부

#Gemini 3.8 Live#음성 AI#AI 에이전트#Live API#SynthID

음성 파형과 카메라 장면, 여러 도구가 실시간 AI 에이전트 중심에서 연결되는 편집 이미지

Google이 2026년 9월 15일 공개한 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking은 음성 챗봇을 더 자연스럽게 만드는 업데이트만은 아니다. 사용자가 말하는 동안 화면과 카메라를 이해하고, 대화를 끊지 않은 채 외부 도구를 호출하며, 복잡한 작업은 배경에서 계속 추론하는 구조가 핵심이다. 음성 AI가 질문에 답하는 인터페이스에서 실제 작업을 진행하는 에이전트로 이동하고 있는 셈이다.

세 줄 요약

  1. Gemini 3.8 Live는 짧은 지연과 자연스러운 실시간 대화, Extended Thinking은 배경 추론과 다단계 작업에 초점을 맞춘다.
  2. 텍스트·이미지·음성·영상을 입력받고 함수 호출과 검색을 사용할 수 있지만, 파일 검색·코드 실행·구조화 출력 등은 표준 모델에서 지원되지 않는다.
  3. 한국 이용자는 제품별 순차 제공과 요금제 차이를 확인해야 하며, 음성 기록·카메라 프레임·외부 도구 권한이 어디에서 처리되는지 살펴야 한다.

두 모델은 무엇이 다른가

Gemini 3.8 Live와 Extended Thinking의 용도와 제한을 비교한 정보 카드

두 모델은 무엇이 다른가: 항목, Gemini 3.8 Live, Live Extended Thinking, 선택 기준

표준 Gemini 3.8 Live의 모델 코드는 gemini-3.8-live다. 공식 개발자 문서는 131,072토큰 입력과 65,536토큰 출력을 명시하고, 텍스트·이미지·오디오·비디오 입력과 텍스트·오디오 출력을 지원한다고 설명한다. 함수 호출과 Google 검색 기반 정보 연결은 지원하지만 캐싱, 코드 실행, 파일 검색, 이미지 생성, 구조화 출력은 지원하지 않는 것으로 표시돼 있다.

Extended Thinking은 실시간 음성 세션 중 배경에서 추론하고 도구를 호출한다. 모델이 긴 침묵에 빠지는 대신 작업을 확인하고 있다는 짧은 음성 안내를 제공하며, 서버는 작업 중과 완료 상태를 구분해 전달한다. 사용자는 대화가 계속된다고 느끼지만 실제 서비스는 한 요청 안에서 여러 번 응답할 수 있으므로 개발자는 완료 상태를 정확히 처리해야 한다.

비동기 도구 호출이 바꾸는 대화 구조

사용자의 음성 요청이 인식, 추론, 외부 도구, 확인과 결과 전달로 이어지는 실시간 에이전트 흐름

기존 음성 비서는 한 문장을 듣고 답한 다음 대화를 끝내는 경우가 많았다. Gemini 3.8 Live는 도구를 비동기로 호출하는 동안에도 사용자의 추가 말을 듣거나 진행 상태를 알려줄 수 있다. 예를 들어 항공편을 찾고 일정표와 비교한 뒤 예약 후보를 정리하는 작업에서 검색과 캘린더 호출이 뒤에서 진행되는 동안 대화가 완전히 멈추지 않는다.

이 구조는 자연스럽지만 구현 난도도 높인다.

Google 문서가 표준 Live 모델에서 NON_BLOCKING 비동기 실행을 기본으로 둔 것은 이런 대화형 작업을 중심에 놓았다는 의미다. 이전 Live 프리뷰에서 이전하는 개발자는 모델 문자열뿐 아니라 thinking_level 설정과 함수 호출 동작도 다시 확인해야 한다. 표준 3.8 Live는 세션 설정에서 기존 방식의 thinking_level을 받지 않는다.

97개 언어 자동 전환과 한국어

Google은 Gemini 3.8 Live가 지원되는 97개 언어를 대화 중 자동 감지하고 자연스럽게 전환한다고 설명한다. 한국어 공식 발표도 별도로 게시됐고, 개발자는 Gemini API와 Google AI Studio에서 모델을 사용할 수 있다. 일반 이용자에게는 Search Live와 Gemini Live, 일부 Google Workspace 기능을 통해 순차적으로 제공된다.

하지만 ‘97개 언어 지원’과 ‘모든 언어에서 같은 품질’은 다르다. 한국어 평가에서는 다음을 따로 봐야 한다.

제품별 제공 범위도 같다. API에서 가능한 기능이 Gemini 앱이나 Gmail에 동시에 제공된다고 볼 수 없다. Google은 순차 제공, 구독 요금제, 기업용 비공개 프리뷰를 구분하고 있으므로 사용자 화면에 나타나는 기능을 기준으로 확인해야 한다.

음성과 카메라가 들어오면 개인정보 범위도 넓어진다

실시간 음성·영상 데이터가 권한 확인, 로컬 처리, 클라우드 추론과 기록 보관을 통과하는 장면

실시간 음성 에이전트는 텍스트 챗봇보다 더 많은 주변 정보를 받을 수 있다. 마이크에는 사용자의 말뿐 아니라 다른 사람의 대화와 배경음이 들어가고, 카메라에는 문서·얼굴·위치·업무 화면이 포함될 수 있다. 외부 도구를 연결하면 캘린더, 이메일, 고객정보와 예약 기록도 처리 대상이 된다.

서비스를 도입할 때는 다음을 문서화해야 한다.

Google은 AI 제품에서 생성된 오디오에 사람이 듣기 어려운 SynthID 워터마크를 적용한다고 설명한다. 워터마크는 생성 오디오의 출처 확인을 돕지만, 답변의 사실성이나 사용 권한을 자동으로 보증하지는 않는다. 사용자가 실제 사람의 음성으로 오인할 가능성을 줄이는 표시와 서비스 내 고지도 함께 필요하다.

벤치마크와 실제 품질을 구분해야 한다

Google은 Extended Thinking이 음성 품질·에이전트 작업·오디오 추론 관련 여러 벤치마크에서 높은 점수를 기록했다고 발표했다. 그러나 공급자가 선택한 조건과 평가 세트는 실제 콜센터, 교실, 차량, 게임 음성 채팅의 소음과 예외 상황을 모두 대표하지 않는다.

실제 평가는 정확도 하나가 아니라 다음을 함께 측정해야 한다.

빠르게 말하지만 틀린 에이전트와 조금 느리지만 확인을 거치는 에이전트 중 무엇이 나은지는 업무에 따라 다르다. 길 안내나 게임 NPC는 즉시성이 중요하지만, 예약·결제·의료·금융 안내는 정확성과 확인 단계가 우선이다.

누구에게 적합한가

Gemini 3.8 Live는 실시간 고객 지원, 교육용 튜터, 게임 NPC, 통역, 차량과 스마트 안경 인터페이스처럼 대화를 끊지 않아야 하는 서비스에 적합하다. Extended Thinking은 여러 조건을 비교하고 도구를 순서대로 호출하는 예약, 업무 지원, 복합 상담에 더 어울린다.

반대로 단순 문서 요약, 대규모 배치 처리, 정확한 JSON 출력, 장기 파일 검색이 핵심이면 다른 모델이나 별도 파이프라인이 더 단순할 수 있다. 음성이라는 이유만으로 모든 업무를 Live API로 옮길 필요는 없다.

Gemini 3.8 Live의 변화는 AI가 더 사람처럼 말한다는 데 그치지 않는다. 음성 대화가 진행되는 동안 도구를 호출하고 상태를 관리하며 실제 업무를 이어간다는 점이 중요하다. 이제 평가 기준도 목소리의 자연스러움에서 권한, 취소, 검증, 기록과 실패 복구로 이동해야 한다.

출처와 이용 고지

본문은 Google 공식 발표와 개발자 문서의 수치·지원 범위를 자체 문장으로 분석했다. 공식 표·그래프·제품 화면은 복제하지 않았으며 공급자가 제시한 벤치마크를 독립 검증 결과로 확대하지 않았다.

출처: Google · 직접 캡처/제작 이미지 포함

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.