Gemini 3.8 Live 완전 분석—실시간 음성 AI가 작업하는 에이전트로 바뀐 이유

Google이 2026년 9월 15일 공개한 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking은 음성 챗봇을 더 자연스럽게 만드는 업데이트만은 아니다. 사용자가 말하는 동안 화면과 카메라를 이해하고, 대화를 끊지 않은 채 외부 도구를 호출하며, 복잡한 작업은 배경에서 계속 추론하는 구조가 핵심이다. 음성 AI가 질문에 답하는 인터페이스에서 실제 작업을 진행하는 에이전트로 이동하고 있는 셈이다.
세 줄 요약
- Gemini 3.8 Live는 짧은 지연과 자연스러운 실시간 대화, Extended Thinking은 배경 추론과 다단계 작업에 초점을 맞춘다.
- 텍스트·이미지·음성·영상을 입력받고 함수 호출과 검색을 사용할 수 있지만, 파일 검색·코드 실행·구조화 출력 등은 표준 모델에서 지원되지 않는다.
- 한국 이용자는 제품별 순차 제공과 요금제 차이를 확인해야 하며, 음성 기록·카메라 프레임·외부 도구 권한이 어디에서 처리되는지 살펴야 한다.
두 모델은 무엇이 다른가


표준 Gemini 3.8 Live의 모델 코드는 gemini-3.8-live다. 공식 개발자 문서는 131,072토큰 입력과 65,536토큰 출력을 명시하고, 텍스트·이미지·오디오·비디오 입력과 텍스트·오디오 출력을 지원한다고 설명한다. 함수 호출과 Google 검색 기반 정보 연결은 지원하지만 캐싱, 코드 실행, 파일 검색, 이미지 생성, 구조화 출력은 지원하지 않는 것으로 표시돼 있다.
Extended Thinking은 실시간 음성 세션 중 배경에서 추론하고 도구를 호출한다. 모델이 긴 침묵에 빠지는 대신 작업을 확인하고 있다는 짧은 음성 안내를 제공하며, 서버는 작업 중과 완료 상태를 구분해 전달한다. 사용자는 대화가 계속된다고 느끼지만 실제 서비스는 한 요청 안에서 여러 번 응답할 수 있으므로 개발자는 완료 상태를 정확히 처리해야 한다.
비동기 도구 호출이 바꾸는 대화 구조

기존 음성 비서는 한 문장을 듣고 답한 다음 대화를 끝내는 경우가 많았다. Gemini 3.8 Live는 도구를 비동기로 호출하는 동안에도 사용자의 추가 말을 듣거나 진행 상태를 알려줄 수 있다. 예를 들어 항공편을 찾고 일정표와 비교한 뒤 예약 후보를 정리하는 작업에서 검색과 캘린더 호출이 뒤에서 진행되는 동안 대화가 완전히 멈추지 않는다.
이 구조는 자연스럽지만 구현 난도도 높인다.
- 사용자가 중간에 조건을 바꾸면 진행 중인 도구 호출을 취소하거나 수정해야 한다.
- 같은 요청이 두 번 실행되지 않도록 작업 ID와 상태를 관리해야 한다.
- 결제·예약·메시지 전송 전에 최종 확인을 받아야 한다.
- 도구가 실패했을 때 모델이 성공했다고 말하지 않도록 실제 반환값을 검증해야 한다.
- 음성 응답이 끝났더라도 백그라운드 작업이 완료됐는지 별도로 확인해야 한다.
Google 문서가 표준 Live 모델에서 NON_BLOCKING 비동기 실행을 기본으로 둔 것은 이런 대화형 작업을 중심에 놓았다는 의미다. 이전 Live 프리뷰에서 이전하는 개발자는 모델 문자열뿐 아니라 thinking_level 설정과 함수 호출 동작도 다시 확인해야 한다. 표준 3.8 Live는 세션 설정에서 기존 방식의 thinking_level을 받지 않는다.
97개 언어 자동 전환과 한국어
Google은 Gemini 3.8 Live가 지원되는 97개 언어를 대화 중 자동 감지하고 자연스럽게 전환한다고 설명한다. 한국어 공식 발표도 별도로 게시됐고, 개발자는 Gemini API와 Google AI Studio에서 모델을 사용할 수 있다. 일반 이용자에게는 Search Live와 Gemini Live, 일부 Google Workspace 기능을 통해 순차적으로 제공된다.
하지만 ‘97개 언어 지원’과 ‘모든 언어에서 같은 품질’은 다르다. 한국어 평가에서는 다음을 따로 봐야 한다.
- 존댓말과 반말 전환이 문맥에 맞는가
- 사람 이름·지명·제품명을 정확히 인식하는가
- 한국어와 영어가 섞인 문장을 자연스럽게 처리하는가
- 숫자·날짜·주소를 잘못 듣지 않는가
- 소음이 있는 환경에서 화자를 구분하는가
- 한국의 지도·검색·업무 서비스와 연결되는가
제품별 제공 범위도 같다. API에서 가능한 기능이 Gemini 앱이나 Gmail에 동시에 제공된다고 볼 수 없다. Google은 순차 제공, 구독 요금제, 기업용 비공개 프리뷰를 구분하고 있으므로 사용자 화면에 나타나는 기능을 기준으로 확인해야 한다.
음성과 카메라가 들어오면 개인정보 범위도 넓어진다

실시간 음성 에이전트는 텍스트 챗봇보다 더 많은 주변 정보를 받을 수 있다. 마이크에는 사용자의 말뿐 아니라 다른 사람의 대화와 배경음이 들어가고, 카메라에는 문서·얼굴·위치·업무 화면이 포함될 수 있다. 외부 도구를 연결하면 캘린더, 이메일, 고객정보와 예약 기록도 처리 대상이 된다.
서비스를 도입할 때는 다음을 문서화해야 한다.
- 원본 음성과 영상 프레임을 저장하는가
- 전송 중·저장 중 암호화는 어떻게 적용되는가
- 세션 종료 뒤 기록이 얼마나 남는가
- 모델 개선에 데이터가 사용되는가
- 사람이 검토할 수 있는 로그는 무엇인가
- 외부 도구별 최소 권한과 철회 방법은 무엇인가
- 민감정보가 감지됐을 때 전송을 차단할 수 있는가
Google은 AI 제품에서 생성된 오디오에 사람이 듣기 어려운 SynthID 워터마크를 적용한다고 설명한다. 워터마크는 생성 오디오의 출처 확인을 돕지만, 답변의 사실성이나 사용 권한을 자동으로 보증하지는 않는다. 사용자가 실제 사람의 음성으로 오인할 가능성을 줄이는 표시와 서비스 내 고지도 함께 필요하다.
벤치마크와 실제 품질을 구분해야 한다
Google은 Extended Thinking이 음성 품질·에이전트 작업·오디오 추론 관련 여러 벤치마크에서 높은 점수를 기록했다고 발표했다. 그러나 공급자가 선택한 조건과 평가 세트는 실제 콜센터, 교실, 차량, 게임 음성 채팅의 소음과 예외 상황을 모두 대표하지 않는다.
실제 평가는 정확도 하나가 아니라 다음을 함께 측정해야 한다.
- 첫 음성 응답이 나오기까지의 시간
- 사용자가 말을 끊었을 때 즉시 멈추는지
- 도구 호출이 끝날 때까지 걸린 전체 시간
- 잘못된 실행과 중복 실행 비율
- 사람이 결과를 수정한 비율
- 네트워크가 불안정할 때 복구하는 방식
- 한국어 억양과 코드 스위칭에서의 오류율
빠르게 말하지만 틀린 에이전트와 조금 느리지만 확인을 거치는 에이전트 중 무엇이 나은지는 업무에 따라 다르다. 길 안내나 게임 NPC는 즉시성이 중요하지만, 예약·결제·의료·금융 안내는 정확성과 확인 단계가 우선이다.
누구에게 적합한가
Gemini 3.8 Live는 실시간 고객 지원, 교육용 튜터, 게임 NPC, 통역, 차량과 스마트 안경 인터페이스처럼 대화를 끊지 않아야 하는 서비스에 적합하다. Extended Thinking은 여러 조건을 비교하고 도구를 순서대로 호출하는 예약, 업무 지원, 복합 상담에 더 어울린다.
반대로 단순 문서 요약, 대규모 배치 처리, 정확한 JSON 출력, 장기 파일 검색이 핵심이면 다른 모델이나 별도 파이프라인이 더 단순할 수 있다. 음성이라는 이유만으로 모든 업무를 Live API로 옮길 필요는 없다.
Gemini 3.8 Live의 변화는 AI가 더 사람처럼 말한다는 데 그치지 않는다. 음성 대화가 진행되는 동안 도구를 호출하고 상태를 관리하며 실제 업무를 이어간다는 점이 중요하다. 이제 평가 기준도 목소리의 자연스러움에서 권한, 취소, 검증, 기록과 실패 복구로 이동해야 한다.
출처와 이용 고지
- Google, Gemini 3.8 Live와 Extended Thinking 공식 발표
- Google Korea 한국어 공식 발표
- Gemini API 모델 문서
- Gemini Live API 시작 안내
- Google DeepMind 모델 카드 목록
본문은 Google 공식 발표와 개발자 문서의 수치·지원 범위를 자체 문장으로 분석했다. 공식 표·그래프·제품 화면은 복제하지 않았으며 공급자가 제시한 벤치마크를 독립 검증 결과로 확대하지 않았다.



