Gemini 3.8 Live: 외부 평가로 본 두 모델 차이와 사용 경로

Gemini 3.8 Live는 말로 대화하면서 화면 속 정보를 참고하고, 연결된 도구로 작업을 처리하는 Google의 음성 AI 모델입니다. 기본형과 Extended Thinking은 용도가 다릅니다. 짧게 대화할 때와 여러 조건을 따져야 할 때 필요한 모델이 다를 수 있습니다.

확인일: 2026년 9월 21일. 공식 문서와 외부 평가·구현 사례를 정리했습니다. Core Insight의 AI Studio 테스트는 연결 오류로 응답을 받지 못했으며, 아래 성능 수치는 외부 평가 결과입니다.

Gemini 3.8 Live의 빠른 대화와 Extended Thinking의 복합 작업을 구분한 Core Insight 안내도
모델의 역할을 설명하기 위해 Core Insight가 만든 도식입니다. 제품 화면이나 실제 생성 결과가 아닙니다.

Gemini 3.8 Live에서 무엇이 달라졌나요?

Google이 9월 15일 발표한 두 모델은 도구가 일을 처리하는 동안에도 음성 대화를 이어가는 데 초점을 맞췄습니다. 기본형은 낮은 지연과 비용 효율을, Extended Thinking은 복잡한 요청을 푸는 추론을 강조합니다. Google 발표 원문에서 두 모델을 구분해 설명합니다.

콘텐츠를 만드는 사람이라면 촬영 장면을 보여주며 설명을 구하거나, 말로 아이디어를 정리하는 용도를 생각해 볼 수 있습니다. 이는 활용 제안입니다. 이 글에서는 완성 영상 편집이나 게시 자동화를 검증하지 않았습니다.

외부 리뷰에서는 어떤 차이가 나왔나요?

Artificial Analysis의 평가 원자료를 직접 열어 보면, 추론형이 모든 항목에서 앞서지는 않습니다. 아래 숫자는 해당 기관의 측정값이며 Core Insight의 테스트 결과가 아닙니다.

측정 항목 3.8 Live Extended Thinking (High)
Speech to Speech Index 76.0 82.6
대화 처리 평가 96.1% 91.9%
도구를 쓰는 고객지원 과제 (τ-Voice) 30.1% 68.6%
첫 음성이 나오기까지 1.18초 1.35초

첫 음성 지연은 Big Bench Audio 기준입니다. 대화 처리 평가는 말을 끊거나 순서를 주고받는 상황 등을 다루고, τ-Voice는 도구와 정책을 제공한 고객지원 시나리오를 평가합니다. 표의 백분율을 한국어 대화 정확도나 내 업무의 성공률로 읽으면 안 됩니다. 평가 표와 측정 방식

이 결과를 바탕으로, 가벼운 대화를 먼저 시험할 때는 기본형을, 여러 조건을 맞춰야 하는 작업에는 Extended Thinking을 비교 후보로 두는 편이 맞습니다. 실제 선택은 자신의 언어와 작업에서 다시 확인해야 합니다.

실제로 만든 사례는 있나요?

Android 개발자 Akshay Nandwana는 카메라를 비추며 음성으로 질문하는 Live Lens 구현 사례를 공개했습니다. 제작자는 실제 Android 기기에서 종이 틱택토를 보여주고 대화하는 시연을 설명합니다. 우리는 설명과 연결된 저장소를 대조했으며, 앱을 직접 설치해 재현하지는 않았습니다.

카메라 연결 방식을 보면 구현 범위가 분명해집니다. 데모 브랜치의 README에 따르면 음성 세션은 Gemini Live와 Agora가 맡고, 카메라 화면은 주기적으로 캡처해 별도 Gemini Vision 분석을 거친 뒤 대화에 전달합니다. 연속 영상을 Live 모델 하나에 그대로 넣는 구조로 소개하면 부정확합니다.

Live Lens의 음성 세션과 카메라 스냅샷 분석이 맥락 전달로 연결되는 구현 구조
제작자의 README를 바탕으로 다시 그린 개념도입니다. 사진 분석과 음성 대화가 나뉘어 있습니다.

따라서 이 사례는 설치 버튼 하나로 끝나는 일반 사용자 앱이 아닙니다. Android 개발 환경과 Python 서버, Agora 계정, Gemini API 키가 필요합니다. 코딩이 익숙하지 않다면 아래 AI Studio 체험 경로부터 확인하는 편이 수월합니다.

어디에서 어떻게 써볼 수 있나요?

Google은 개발자에게 Gemini API와 AI Studio를 안내합니다. 일반 사용자 경로로는 기본형의 Search Live, Extended Thinking의 Gemini Live를 명시했습니다. 발표는 순차 적용을 전제로 하므로, 한국의 모든 계정에서 같은 날 같은 기능이 보인다고 단정할 수 없습니다.

  1. Google AI Studio Live를 엽니다.
  2. 모델 선택 패널에서 Live 분류를 열고 Gemini 3.8 Live 또는 Gemini 3.8 Live Extended Thinking을 확인합니다.
  3. 개인정보가 없는 짧은 요청으로 시작합니다. 말하기 전에 먼저 텍스트 요청으로 연결 상태를 확인할 수 있습니다.

Core Insight는 이 화면에서 gemini-3.8-live를 선택한 뒤 “동네 카페의 신메뉴 레몬차를 소개하는 15초 영상 대본”을 요청했습니다. 결과는 Connection failed였습니다. 모델 응답을 받지 못했으므로 한국어 음질이나 대본 품질은 평가하지 않았습니다. 오류의 원인도 확인하지 못했습니다.

무료 체험과 API 요금은 어떻게 구분하나요?

AI Studio의 무료 이용 안내와, 내 서비스에서 API를 호출할 때의 요금은 구분해야 합니다. 공식 가격표의 무료 안내를 API 무제한 무료라는 뜻으로 받아들이면 안 됩니다. Gemini 앱의 구독 상품도 별도입니다.

Google 개발자 발표는 두 Live 모델의 오디오 입력을 100만 토큰당 3달러, 출력을 12달러로 설명합니다. 함께 제시한 분당 약 0.005달러·0.018달러는 환산 추정치입니다. 실제 청구액은 처리한 입력과 출력, 다른 모달리티와 사용 경로에 따라 달라지며, 여기서는 비용을 실측하지 않았습니다.

기존 방식과 뭐가 다른가요?

작업을 요청한 뒤 완료될 때까지 대화가 멈추는 흐름과 달리, 이 모델은 도구 호출을 백그라운드에서 처리하며 대화를 계속하도록 설계됐습니다. 다만 모델의 기능이 실제 앱에 연결되려면 도구 설정과 서비스 구현이 필요합니다. Live Lens처럼 별도 서버가 여러 기능을 연결하는 경우도 있습니다.

주의할 점

벤치마크 점수는 내 계정의 연결 성공이나 한국어 응답 품질을 보장하지 않습니다. 화면을 공유할 때는 계정 정보나 다른 사람의 개인정보가 포함되지 않았는지 먼저 확인하세요. Live Lens 사례를 따라 개발한다면 README가 안내한 대로 API 키를 Android 앱에 넣지 않고 서버에서 관리해야 합니다.

자주 묻는 질문

Extended Thinking이 항상 더 좋은가요?

Artificial Analysis 표에서는 복합 작업 성적이 더 높지만 기본형의 첫 응답이 더 빠르고 대화 처리 점수도 높았습니다. 목적에 따라 선택해야 합니다.

이 모델로 쇼츠를 바로 완성할 수 있나요?

이 글이 확인한 범위는 음성 대화와 연결된 도구·시각 맥락 처리입니다. 완성 영상 편집·업로드 기능을 검증한 글은 아닙니다.

한국어 성능도 직접 확인했나요?

아니요. AI Studio 요청은 연결 오류로 끝났습니다. 외부 평가를 한국어 실측처럼 제시하지 않았습니다.

처음 시작한다면 AI Studio에서 짧은 요청으로 연결을 확인하세요. 앱을 만들 계획이라면 공식 Live API 가이드와 Live Lens의 구성 차이를 먼저 비교해 보세요.

댓글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다