본문으로 건너뛰기

Gemini의 에이전틱 영상 이해

Gemini가 필요한 영상 구간만 찾아 분석해 토큰과 비용을 줄입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Google DeepMind가 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 영상 구간을 능동적으로 찾아 읽는 agentic video understanding을 적용했습니다. 모델은 고정된 1 FPS로 영상 전체를 처리하는 대신 질문에 필요한 프레임·오디오·Transcript를 내부 도구로 조회해 토큰 사용량을 최대 88%, 비용을 최대 66% 줄이고 정확도를 최대 7% 높입니다. 이 방식은 1초 미만의 장면 검색, 긴 영상 속 특정 정보 찾기, 이상 탐지, 빠른 동작과 객체의 반복 횟수 세기에 쓰입니다. Gemini API에서 processing을 "agentic"으로 설정하면 추가 기능 요금 없이 Google AI Studio와 Gemini Enterprise Agent Platform에서 사용할 수 있습니다.

섹션별 상세

01
기존 영상 분석은 기본 1 FPS처럼 고정된 프레임 속도로 영상 전체를 읽기 때문에 긴 영상에서 정확도를 높이려면 토큰 비용이 커지고, 비용을 줄이면 중요한 세부 장면을 버려야 하는 문제가 있었습니다. agentic video understanding은 Gemini의 추론 기능과 native video tools를 결합해 질문과 관련된 시간 구간을 먼저 찾습니다. 표준 영상 분석 벤치마크에서 토큰 사용량은 최대 88%, 비용은 최대 66% 줄었고 정확도는 최대 7% 높아져 긴 영상 처리의 비용과 세부성 사이의 절충을 완화합니다.
02
Gemini는 영상 스트림을 일정한 속도로 소비하지 않고 무엇을 볼지, 어느 속도로 다시 볼지, 프레임·오디오·Transcript 중 어떤 신호를 사용할지 질의에 따라 결정합니다. 내부 도구가 필요한 영상 파일 구간을 불러오고, 모델은 관찰과 추론을 반복하는 agentic loop 안에서 추가 정보를 요청한 뒤 텍스트 출력을 만듭니다. 개발자가 구간 검색과 재샘플링 로직을 별도로 구성하지 않아도 되므로 영상 분석 애플리케이션의 구현 부담이 줄어듭니다.
영상과 질문이 입력된 뒤 Gemini가 프레임·오디오·Transcript를 선택적으로 관찰하고 텍스트 출력을 만드는 순환 처리 구조입니다.
Diagram다이어그램은 Query에서 Gemini로 입력이 들어가고 Output으로 텍스트가 나오는 기본 흐름 아래에 Think와 Observation이 반복되는 점선 순환을 배치합니다. Observation 단계에서 get_transcript, get_frames(start, end, fps), get_audio(start, end) 도구를 사용해 필요한 신호와 시간 구간만 가져오므로, 고정 FPS로 전체 영상을 읽는 정적 처리와 차이가 납니다. 이는 모델이 무엇을 볼지와 어떤 양식을 조회할지를 능동적으로 정한 뒤 추가 관찰을 거쳐 답을 생성한다는 글의 agentic loop 설명과 직접 연결됩니다.
03
이 구조는 짧은 상태 변화와 컷 경계를 찾는 sub-second moment retrieval, 수 시간 영상에서 특정 정보를 찾는 장편 영상 검색, 빠른 움직임을 높은 FPS로 재검사하는 anomaly detection, 시간에 따른 동작과 객체의 counting에 적용됩니다. 예를 들어 빠른 동작 카운팅에서는 처음부터 모든 프레임을 고해상도로 읽지 않고 관심 시간 창을 여러 FPS로 다시 확인합니다. 따라서 자동 영상 편집이나 강의·사용법 영상·다시간 녹화물의 질의응답처럼 중요한 장면이 짧게 나타나는 작업에 적합합니다.
04
Gemini 3.7 Flash는 agentic video understanding을 사용할 때 지원되는 세 모델 가운데 전반적인 품질과 품질 대비 비용 조합에서 가장 높은 위치를 차지합니다. 글의 LongVideoBench 비교는 정적 처리보다 토큰 수가 크게 줄면서 정확도가 개선되는 양상을 제시하며, 1H-VideoQA와 LVBench 비교 이미지에서는 각각 47.7K에서 300.3K 토큰을 쓰던 정적 처리와 비교해 36.0K 토큰으로 감소한 사례가 표시됩니다. Gemini API에서는 영상 URI와 질문을 함께 넣고 processing을 "agentic"으로 지정하면 동일한 표준 Gemini API 토큰 가격으로 기능을 켤 수 있습니다.
python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
 model="gemini-3.7-flash",
 input=[
   {
     "type": "video",
     "uri": "https://youtu.be/7Z5Vy9JBANs",
     "processing": "agentic"
   },
   {
     "type": "text",
     "text": "What are the 3 most important announcements in this keynote?",
   },
 ],
)
print(interaction.output_text)

Gemini API에서 YouTube 영상과 질문을 입력하고 processing 값을 "agentic"으로 설정해 영상 속 주요 발표 세 가지를 질의하는 예제입니다.

Gemini 3.7 Flash의 정적 영상 처리와 agentic video understanding을 토큰 수와 정확도로 비교한 막대그래프입니다.
Chart이미지는 Minerva, 1H-VideoQA, LVBench에서 agentic 처리가 정적 처리보다 토큰 사용량을 크게 줄이는 동시에 정확도를 높이는 결과를 나란히 표시합니다. 1H-VideoQA에서는 토큰 수가 300.3K에서 47.7K로, LVBench에서는 300.3K에서 36.0K로 감소한 값이 보이며, 정확도는 각각 87.5%에서 88.5%, 85.1%에서 88.6%로 상승합니다. 하단에는 정적 처리의 방법론으로 높은 thinking level, 낮은 미디어 해상도, 1 FPS가 기재되어 있어 비교 조건도 함께 확인할 수 있습니다.
1H-VideoQA에서 모델별 영상 분석 비용과 정확도를 비교한 산점도입니다.
Chart가로축은 쿼리당 비용, 세로축은 정확도이며, Gemini 3.7 Flash와 agentic 처리를 적용한 Gemini 3.7 Flash가 각각 비교 지점으로 표시됩니다. agentic 처리를 적용한 지점은 약 90% 정확도와 더 낮은 비용 영역에 있어, 글에서 말한 정확도·비용 파레토 프런티어의 근거로 연결됩니다. 그래프에는 GPT 5.6 Sol, GPT 5.6 Terra, Claude Opus 5.0, Grok 4.6도 함께 표시되어 테스트 모델 간 비용 대비 정확도 위치를 비교하게 합니다.
05
이 기능은 영상 업로드와 YouTube 영상에 대해 Google AI Studio와 Gemini Enterprise Agent Platform에서 즉시 제공되며 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite를 지원합니다. Google은 추가 기능 요금 없이 표준 Gemini API 가격을 적용하고, 향후 Gemini 앱의 Flash·Flash-Lite 모델과 YouTube 시청 페이지의 ‘Ask YouTube’에도 효율성과 품질 개선을 확대할 계획입니다. 이를 통해 개발자용 영상 질의뿐 아니라 시각 정보에 근거한 소비자용 영상 답변에도 동적 검색 구조가 쓰이게 됩니다.

용어 해설

에이전틱 비디오 이해(Agentic Video Understanding)
영상 전체를 고정된 프레임 속도로 처리하지 않고, 모델이 질의에 필요한 구간과 입력 양식을 능동적으로 선택하는 영상 분석 방식입니다. Gemini가 영상 프레임·오디오·Transcript를 도구로 조회하며 필요한 정보만 가져오기 때문에 긴 영상의 토큰 사용량과 분석 비용을 줄이면서 세밀한 검색과 판별을 수행할 수 있습니다.
동적 FPS(Dynamic FPS)
영상의 모든 구간을 동일한 초당 프레임 수로 읽는 대신, 분석이 필요한 시간 창을 더 높은 FPS로 다시 샘플링하는 처리 방식입니다. 빠른 움직임이나 짧은 상태 변화처럼 기본 1 FPS 처리에서 놓치기 쉬운 장면을 집중적으로 확인해 순간 검색, 이상 탐지, 동작 카운팅의 정확도를 높이는 데 쓰입니다.
파레토 프런티어(Pareto Frontier)
두 평가 기준을 동시에 개선하기 어려운 상황에서, 어느 한 기준을 더 높이려면 다른 기준을 포기해야 하는 경계선입니다. 이 글에서는 영상 분석의 정확도와 쿼리당 비용을 함께 비교하며, Gemini 3.7 Flash가 테스트 모델 가운데 품질과 비용의 균형이 가장 좋은 지점에 놓였다는 의미로 사용됩니다.
장편 영상 내 희소 정보 검색(Needle-in-a-Haystack Search)
수십 분에서 수 시간에 이르는 영상에서 질문과 관련된 짧은 장면을 찾아 답을 구성하는 검색 과제입니다. 정적 처리에서는 영상 전체의 프레임과 신호를 대량으로 입력해야 하지만, 에이전틱 방식은 관련 구간을 순차적으로 조회해 수백만 토큰을 쓰지 않고도 복합 질의에 대응합니다.

기술

  • Gemini 3.7 Flash
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash-Lite
  • Gemini API
  • Google AI Studio
  • Gemini Enterprise Agent Platform
  • native video tools

활용 사례

  • sub-second moment retrieval을 활용한 자동 영상 편집
  • 다시간 영상의 장편 정보 검색과 질의응답
  • 빠른 움직임과 미세한 시각 이상 탐지
  • 반복 동작과 개별 객체의 시간 단위 카운팅
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.