토큰 최대 88% 절감. 비용 최대 66% 절감. 그런데 정확도는 최대 7% 상승.
셋 중 하나만 해도 발표거리인데 셋이 한 문장에 들어 있습니다. 구글이 9월 1일 공개한 재미나이의 새 기능, 에이전틱 비디오 이해입니다. 딥마인드의 로한 도시와 마리오 루치치가 공식 블로그에 올렸고, Google AI Studio 계정이 데모 영상과 함께 알렸어요.
발표 문구가 과장인지 구조를 뜯어봤습니다. 결론부터 말하면, 깎은 방식이 재미있습니다. 더 싼 하드웨어가 아니라 더 영리한 시청법으로 깎았어요.
지금까지의 영상 이해는 무식했습니다
기존 방식의 이름은 정적 처리입니다. 영상을 초당 1프레임씩 잘라 전부 컨텍스트에 밀어넣습니다. 질문이 뭐든, 영상 전체를 씹어 삼키고 시작해요.
비용이 여기서 나옵니다. 구글 문서 기준으로 기본 해상도에서 영상 1초당 약 100토큰. 고해상도면 약 300토큰입니다. 1시간 강의를 물어보면 약 108만 토큰이 컨텍스트에 들어갑니다. "23분 지점에서 강사가 뭐라고 했지?" 같은 질문 하나에도 나머지 59분을 전부 계산한 값을 치르는 구조였어요.
새 방식은 영상을 '봅니다'
에이전틱 모드의 발상은 사람의 시청법입니다. 사람은 2시간 녹화에서 한 장면을 찾을 때 처음부터 끝까지 보지 않죠. 넘겨 보고, 배속을 올리고, 자막을 훑습니다.
재미나이가 이제 그걸 합니다. 뭘 볼지, 어떤 속도로 볼지, 프레임·오디오·자막 중 어떤 경로로 볼지를 모델이 질문에 맞춰 스스로 정합니다. 내부 도구를 호출해 영상 파일의 필요한 구간만 로드하고, 필요한 순간과 신호만 가져와요.
효과는 문서의 예시 하나로 정리됩니다. 정적 모드로 약 108만 토큰이 들던 1시간 강의가, 에이전틱 모드에선 프롬프트에 따라 약 10.8만 토큰. 구글이 표준 벤치마크에서 보고한 상한이 토큰 88% 절감, 비용 66% 절감, 정확도 7% 상승입니다.
용도도 문서에 구체적으로 박혀 있습니다. 초 단위 순간 검색, 긴 영상에서 바늘찾기, 특정 구간만 프레임을 촘촘히 다시 뽑는 이상 감지, 동작·사물 세기.
켜는 법은 한 줄입니다
API 요청의 비디오 파트에 processing: "agentic" 한 줄. 이게 전부입니다.
추가 기능 요금은 없습니다. 표준 재미나이 API 토큰 과금 그대로예요. 토큰을 덜 쓰게 만들었으니 청구서가 그만큼 가벼워지는 구조입니다. 지원 모델은 재미나이 3.7 플래시, 3.6 플래시, 3.5 플래시 라이트. 오늘 기준 재미나이 API와 AI 스튜디오, 엔터프라이즈 에이전트 플랫폼에서 쓸 수 있습니다.
로드맵도 흥미롭습니다. 재미나이 앱 전체 사용자에게 곧 풀리고, 몇 달 안에 유튜브의 'Ask YouTube' 기능에도 이 엔진이 들어간다고 예고했어요.
깨알 조건들
호들갑을 잠깐 멈추고 조건을 적습니다.
수치 셋은 전부 '최대'치입니다. 모든 영상에서 88%가 나오는 게 아니라, 긴 영상일수록 절감 폭이 커지는 구조예요. 5분 미만 짧은 클립은 오히려 탐색 과정 때문에 첫 토큰 응답이 느려질 수 있다고 구글 스스로 적어뒀습니다. 짧은 클립은 정적 모드가 낫다는 게 공식 가이드입니다.
기본값도 여전히 정적 처리입니다. 켜야 작동해요. 지원 모델도 플래시 계열 셋뿐이고, 프로 계열은 이번 범위 밖입니다. 엔터프라이즈 쪽은 아직 v1beta1 프리뷰고요.
남는 생각
저는 이 출시를 영상 AI의 관문 요금이 무너지는 순간으로 읽습니다.
지금까지 긴 영상은 API 사용자에게 사치재였습니다. 1시간에 백만 토큰이라는 입장료가 붙어 있었으니까요. 그 요금이 10분의 1 수준으로 내려가면 던지는 질문의 종류가 바뀝니다. 회의 녹화 전체, 90분 강의, 몇 시간짜리 CCTV. 요약이 아니라 검색과 감시와 집계의 대상이 돼요.
모델을 키워서 이긴 게 아니라 보는 법을 고쳐서 이겼다는 점이 제일 마음에 듭니다. 에이전트 시대의 최적화는 이런 모양일 겁니다. 더 큰 입이 아니라, 어디를 볼지 아는 눈.
원문·소스
- Google AI Studio 발표 트윗: https://x.com/GoogleAIStudio/status/2094841307935957304
- 공식 블로그 (The Keyword): https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
- Gemini API 영상 이해 문서: https://ai.google.dev/gemini-api/docs/video-understanding
FAQ
자주 묻는 질문
- 어떻게 토큰을 깎나요?
- 영상을 초당 1프레임씩 전부 넣지 않습니다. 모델이 질문 맞춰 구간·속도·신호 경로를 골라 필요한 부분만 로드해요.
- 켜는 법과 추가 요금은요?
- 비디오 파트에 processing agentic 한 줄입니다. 추가 기능 요금은 없고 표준 토큰 과금 그대로예요.
- 짧은 클립에도 켜야 하나요?
- 5분 미만은 탐색 때문에 첫 토큰이 느려질 수 있어 정적 모드가 낫다고 구글이 적어 뒀습니다. 수치 셋은 전부 최댓값이에요.