TL;DR
Gemini 3.5 Flash는 이전에 별도 모델로 제공되던 computer use 기능을 메인 모델에 통합해 브라우저·모바일·데스크탑 전반에서 화면을 보고 조작하는 능력을 기본으로 제공한다. 이 통합으로 개발자는 하나의 모델을 통해 시각적 입력 해석과 함수 호출을 결합한 에이전트형 워크플로를 구축할 수 있으며, 연속적인 소프트웨어 테스트와 전문 응용 프로그램 전반의 지식 작업 같은 장기 자동화 작업에서 성능 이점을 얻을 수 있다.
작동 방식 측면에서 3.5 Flash는 화면과 문서를 분석해 기능 목록을 분류하거나 문서 접근성 문제를 점검하는 등 실제 앱을 이해하고 결과를 구조화해 반환한다. 실환경에서의 프롬프트 주입 위험을 줄이기 위해 targeted adversarial training을 적용했으며, 기업용으로는 명시적 사용자 확인 요구와 간접적 프롬프트 주입을 감지할 경우 작업을 자동 중단하는 두 가지 선택형 보호 시스템을 제공한다. 이러한 안전 장치는 샌드박스, 인간 검토, 제한된 권한과 결합해 방어 심층 전략을 권장한다.
도입과 검증 경로는 Gemini API와 Gemini Enterprise Agent Platform을 통한 접근, 데모 환경인 Browserbase에서의 실험, 그리고 레퍼런스 구현과 문서화를 통한 시작으로 구성된다. 이로 인해 엔터프라이즈 환경에서 직접 실행 가능한 에이전트를 빠르게 시도할 수 있으며, 그러나 실환경 조작에 따르는 보안·권한 관리와 인간 감독 요구가 여전히 남아 있다.
섹션별 상세
- Computer use가 별도 모델이던 Gemini 2.5에서 메인 모델인 Gemini 3.5 Flash에 기본 통합되었다. — 첫 문단 및 도입부 설명
- 엔터프라이즈용으로 민감 동작에 대해 명시적 사용자 확인을 요구하거나 간접적 프롬프트 주입을 식별하면 작업을 자동 중단하는 두 가지 선택형 보호 시스템이 제공된다. — Making computer use safe in 3.5 Flash 섹션
용어 해설
- 컴퓨터 유즈(Computer Use)
- — 모델이 브라우저·데스크탑·모바일 환경에서 화면과 상호작용하고 조작을 수행하는 기능으로, 입력으로 화면·요청을 받아 내부 도구 호출과 UI 상호작용을 통해 작업을 완료한다. 에이전트형 애플리케이션에서 긴 시나리오와 다단계 자동화를 수행할 때 외부 환경을 직접 조작할 수 있어 실무 자동화와 테스트에 중요하다.
- 함수 호출(Function Calling)
- — 모델이 텍스트 출력 대신 미리 정의된 API나 함수 시그니처를 선택하여 구조화된 호출을 생성하는 메커니즘으로, 입력(프롬프트)을 해석해 적절한 함수와 인자를 구성하고 이를 실행해 외부 시스템과 연동하는 방식이다. 도구 접속과 결과 통합을 통해 일관된 응답과 자동화된 워크플로를 보장한다.
- 적대적 훈련(Adversarial Training)
- — 모델을 공격성 입력이나 프롬프트 주입 같은 위협을 모사한 적대적 예제로 추가 학습시켜 악의적 입력에 대한 반응을 견고하게 만드는 방법으로, 입력을 변형한 공격 샘플을 학습에 포함해 잘못된 행동을 억제하는 규칙성·로버스트성을 높인다. 에이전트가 실환경에서 실행될 때 안전성 확보에 직접적으로 기여한다.
기술
- Gemini API
- Gemini Enterprise Agent Platform
- Browserbase
활용 사례
- 연속 소프트웨어 테스트 자동화
- 전문 애플리케이션 전반의 지식 작업 자동화
- 문서 접근성 감사 및 앱 기능 분류
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
