본문으로 건너뛰기

Gemini 3 Flash의 Agentic Vision: 이미지 분석을 위한 AI 에이전트 활용법

Gemini 3 Flash의 Agentic Vision은 시각적 추론과 파이썬 코드 실행을 결합하여 이미지를 능동적으로 조사하고 분석하는 에이전트 기능을 제공한다.

챕터별 상세

00:00

Agentic Vision의 개념과 작동 원리

Agentic Vision은 Gemini 3 Flash에 도입된 새로운 기능으로, 시각적 작업을 에이전트 작업으로 변환한다. 모델은 파이썬 코드를 실행하여 이미지를 줌인, 팬, 회전, 변환하는 과정을 스스로 계획하고 수행한다. Think-Act-Observe 루프를 통해 이미지를 깊이 있게 이해하며, OfficeQA 등 다양한 비전 벤치마크에서 기존 모델 대비 월등한 성능 향상을 입증했다.

기존 비전 모델이 이미지를 한 번에 보고 판단했다면, Agentic Vision은 돋보기를 들고 이미지를 구석구석 살펴보는 에이전트와 같다.

04:07

Google AI Studio에서의 실전 데모

Google AI Studio에서 Gemini 3 Flash Preview 모델을 선택하고 Code Execution 기능을 활성화하여 Agentic Vision을 테스트했다. 6개의 손가락이 있는 이모지 이미지 분석 시, 모델은 파이썬 Pillow 라이브러리를 사용해 각 손가락에 바운딩 박스를 치고 번호를 매겨 정확히 6개임을 확인했다. 또한 압력계 이미지에서 특정 수치를 읽기 위해 게이지 영역을 자동으로 줌인하고 크롭하여 64도 화씨라는 정확한 값을 도출했다.

AI Studio에서 이 기능을 사용하려면 반드시 설정에서 Code Execution 토글을 켜야 한다.

05:30

Python SDK를 이용한 Agentic Vision 구현

google-generativeai 라이브러리를 사용하여 파이썬 환경에서 Agentic Vision을 통합하는 방법을 시연했다. 모델 생성 설정 시 tools 매개변수에 code_execution을 추가하여 모델이 필요 시 코드를 작성하고 실행할 수 있도록 권한을 부여했다. 오르간 페달의 개수를 세는 복잡한 이미지 작업에서 모델이 스스로 줌인 코드를 실행하고 36개의 페달을 정확히 카운팅하는 전체 워크플로우를 코드로 확인했다.

Vertex AI보다 접근이 쉬운 Gemini AI Studio API를 사용하여 빠르게 프로토타입을 제작할 수 있다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 01. 28.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.