이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
Google의 최신 AI 모델들은 멀티모달 기능과 에이전트 워크플로를 지원하며, AI Studio와 같은 도구를 통해 개발자가 복잡한 인프라 없이도 실시간 AI 앱을 쉽게 구축할 수 있다.
배경
Google DeepMind 팀이 최신 AI 모델과 도구를 활용하여 실제 애플리케이션을 구축하고 배포하는 방법을 소개하는 발표 세션이다.
대상 독자
AI 애플리케이션 개발자 및 엔지니어
의미 / 영향
Google의 최신 모델들이 개발자 도구와 긴밀하게 통합되면서, 복잡한 AI 앱 개발의 진입장벽이 크게 낮아졌다. 특히 온디바이스 AI와 에이전트 워크플로의 결합은 클라우드 의존도를 줄이고 개인화된 AI 서비스 구현을 가속화할 것이다.
챕터별 상세
00:00
소개 및 발표자
발표 세션의 시작으로 Paige Bailey와 Guillaume Vernade가 Google DeepMind의 최신 기술과 이번 세션에서 다룰 내용을 소개한다.
00:15
Paige Bailey: 대화형 에이전트 구축
대화형 에이전트 구축과 AI 기반 앱 배포의 중요성을 강조한다.
07:55
AI Studio 데모: 책장 스캔 앱
AI Studio의 Build 기능을 사용하여 Google 로그인과 Firestore를 연동한 책장 스캔 앱을 구축하는 과정을 시연한다.
09:20
Google 최신 모델 개요
Gemini 3.1 Flash-Lite, Nano-Banana 2, Veo 3.1 등 최근 출시된 모델들의 특징과 활용 사례를 설명한다.
11:18
Gemini의 멀티모달 기능
Gemini 모델이 텍스트, 이미지, 오디오, 비디오를 동시에 이해하고 생성할 수 있는 네이티브 멀티모달 아키텍처를 설명한다.
12:05
AI Studio 플레이그라운드 데모
AI Studio 플레이그라운드에서 다양한 모델을 선택하고 프롬프트를 테스트하는 방법을 보여준다.
13:40
Gemini 3.1 Flash-Lite 비디오 분석
Gemini 3.1 Flash-Lite를 사용하여 공룡 비디오를 프레임 단위로 분석하고 정보를 추출하는 과정을 시연한다.
17:23
코드 실행 및 함수 호출
AI Studio에서 코드 실행과 함수 호출 기능을 활용하여 복잡한 작업을 자동화하는 방법을 설명한다.
21:05
AI Studio Build: 데이터베이스 및 인증
AI Studio Build 기능으로 앱에 데이터베이스와 인증을 추가하는 방법을 시연한다.
23:55
Gemini Live 데모
Gemini Live를 통해 모델과 실시간으로 대화하고 비디오 피드를 공유하는 기능을 시연한다.
29:05
Genie 3: 월드 모델 데모
Genie 3를 사용하여 픽셀 단위로 상호작용 가능한 월드 모델을 생성하고 시뮬레이션하는 과정을 보여준다.
34:44
Guillaume Vernade: 생성형 미디어
이미지, 비디오, 음악 생성 모델을 활용한 생성형 미디어 기술을 소개한다.
44:40
Gemini 입출력 구조
Gemini 모델의 다양한 입력과 출력 모달리티를 설명한다.
47:26
Nano-Banana 2 업데이트
Nano-Banana 2의 새로운 기능인 이미지 그라운딩과 다양한 종횡비 지원을 설명한다.
48:58
Veo 3.1 업데이트
Veo 3.1 Lite 모델의 효율성과 비디오 생성 기능을 소개한다.
49:27
Lyria 3 음악 생성
Lyria 3 모델을 활용한 음악 생성 기능과 API 활용 방법을 설명한다.
50:05
Lyria RealTime
실시간으로 음악을 생성하고 수정할 수 있는 Lyria RealTime 모델을 소개한다.
51:25
Nano-Banana로 책 삽화 생성
Nano-Banana와 생성형 미디어 모델을 활용하여 책의 내용을 삽화로 생성하는 실습을 진행한다.
54:15
Gemma 4 온디바이스 데모
Gemma 4 모델을 온디바이스 환경에서 실행하고 에이전트 워크플로를 구현하는 방법을 시연한다.
56:55
Gemma 4 Cloud Run 배포
Gemma 4 모델을 Cloud Run에 배포하여 클라우드 환경에서 실행하는 방법을 설명한다.
60:55
Open Code: 스펙 기반 게임 개발
Open Code 도구를 사용하여 스펙 문서로부터 게임을 개발하고 디버깅하는 과정을 시연한다.
용어 해설
- Generative Media
- — 텍스트, 이미지, 영상, 음악 등 다양한 형태의 콘텐츠를 AI 모델이 직접 생성하는 기술 분야. 본 영상에서는 Gemini, Nano-Banana, Veo, Lyria 모델을 활용해 책의 삽화, 애니메이션, 배경음악을 생성하는 과정을 다룬다.
- World Model
- — 물리적 세계의 법칙과 상호작용을 학습하여 시뮬레이션하는 AI 모델. Genie 3는 픽셀 단위의 상호작용을 통해 플레이 가능한 환경을 실시간으로 생성하며, 물리 법칙을 반영한 시뮬레이션을 제공한다.
- On-device AI
- — 클라우드 서버를 거치지 않고 기기 자체에서 AI 모델을 실행하는 기술. Gemma 4와 같은 경량화된 모델을 사용하여 개인정보 보호와 지연 시간 단축을 달성하며, 모바일 기기나 로컬 환경에서 에이전트 워크플로를 구현한다.
코드 예제
python
client.files.upload = is_used to upload the file so that Gemini can easily access it.Gemini가 파일에 접근할 수 있도록 파일을 업로드하는 코드 예시
python
class Prompt(BaseModel): name: str prompt: str구조화된 출력을 위해 Pydantic 모델을 정의하는 코드
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 23.수집 2026. 05. 24.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.