본문으로 건너뛰기
DeepMind Blog조회 1

Gemini 3.5 Flash에 computer use 기능 통합

Gemini 3.5 Flash는 computer use를 메인 모델에 통합해 브라우저·데스크탑·모바일에서 직접 보고 조작하는 에이전트를 API로 제공하며 안전 장치를 선택적으로 제공한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Gemini 3.5 Flash는 이전에 별도 모델로 제공되던 computer use 기능을 메인 모델에 통합해 브라우저·모바일·데스크탑 전반에서 화면을 보고 조작하는 능력을 기본으로 제공한다. 이 통합으로 개발자는 하나의 모델을 통해 시각적 입력 해석과 함수 호출을 결합한 에이전트형 워크플로를 구축할 수 있으며, 연속적인 소프트웨어 테스트와 전문 응용 프로그램 전반의 지식 작업 같은 장기 자동화 작업에서 성능 이점을 얻을 수 있다.

작동 방식 측면에서 3.5 Flash는 화면과 문서를 분석해 기능 목록을 분류하거나 문서 접근성 문제를 점검하는 등 실제 앱을 이해하고 결과를 구조화해 반환한다. 실환경에서의 프롬프트 주입 위험을 줄이기 위해 targeted adversarial training을 적용했으며, 기업용으로는 명시적 사용자 확인 요구와 간접적 프롬프트 주입을 감지할 경우 작업을 자동 중단하는 두 가지 선택형 보호 시스템을 제공한다. 이러한 안전 장치는 샌드박스, 인간 검토, 제한된 권한과 결합해 방어 심층 전략을 권장한다.

도입과 검증 경로는 Gemini API와 Gemini Enterprise Agent Platform을 통한 접근, 데모 환경인 Browserbase에서의 실험, 그리고 레퍼런스 구현과 문서화를 통한 시작으로 구성된다. 이로 인해 엔터프라이즈 환경에서 직접 실행 가능한 에이전트를 빠르게 시도할 수 있으며, 그러나 실환경 조작에 따르는 보안·권한 관리와 인간 감독 요구가 여전히 남아 있다.

섹션별 상세

Gemini 3.5 Flash는 이전에 별도 모델로 제공되던 computer use 기능을 메인 모델에 통합해 화면을 보고 조작하는 능력을 기본 제공한다, 이 통합은 시각적 입력과 함수 호출을 하나의 추론 흐름에서 결합하여 브라우저·모바일·데스크탑 환경 전반에서 동일한 모델을 사용해 에이전트를 구축할 수 있도록 한다, 기사 본문에서는 예시로 앱 기능을 분류하거나 문서 접근성 문제를 감사하는 작업을 3.5 Flash가 수행한다고 명시되어 있어 실제 응용에서의 입력→분석→구조화된 결과 출력 흐름이 확인된다, 이 통합은 장기적·연속적 작업을 필요로 하는 소프트웨어 테스트와 지식 작업 자동화에서 개발·운영 복잡성을 낮추고 일관된 에이전트 동작을 가능하게 한다.
근거
  • Computer use가 별도 모델이던 Gemini 2.5에서 메인 모델인 Gemini 3.5 Flash에 기본 통합되었다. 첫 문단 및 도입부 설명
실환경에서 에이전트가 외부 UI나 문서를 조작할 때 발생하는 프롬프트 주입 위험을 줄이기 위해 Gemini 팀은 targeted adversarial training을 적용했으며, 기업용으로 두 가지 선택형 보호 시스템을 제공한다, 첫째는 민감하거나 되돌릴 수 없는 동작에 대해 명시적 사용자 확인을 요구하는 기능이고 둘째는 간접적 프롬프트 주입이 식별되면 작업을 자동 중단하는 기능이다, 기사에서는 이러한 보호장치를 샌드박스, 인간-검토 흐름 및 엄격한 접근 권한과 함께 권장한다고 밝힘으로써 입력→검증→중단의 안전 통제 루프가 구현되어 있음을 보여준다, 이러한 다층 방어 접근법은 라이브 환경에서 에이전트가 수행하는 권한 있는 작업의 위험을 구조적으로 낮춘다.
근거
  • 엔터프라이즈용으로 민감 동작에 대해 명시적 사용자 확인을 요구하거나 간접적 프롬프트 주입을 식별하면 작업을 자동 중단하는 두 가지 선택형 보호 시스템이 제공된다. Making computer use safe in 3.5 Flash 섹션
개발자와 기업은 Gemini API와 Gemini Enterprise Agent Platform을 통해 즉시 computer use 기능을 활용할 수 있으며, Browserbase에 호스팅된 데모 환경에서 기능을 테스트하고 레퍼런스 구현 및 문서를 통해 구축을 시작할 수 있다, 기사에 따르면 3.5 Flash는 앱을 분석해 기능 목록을 분류하거나 자체 문서를 접근성 관점에서 감사하는 등 구체적 사용 사례 예시가 제공되어 있어 도입 후 검증 경로가 명확하다, 문서와 데모는 실제 시나리오에서 동작을 확인하고 엔터프라이즈 요구에 맞춰 권한과 인간 검토 절차를 설계하는 과정에 도움이 된다, 다만 실환경 조작의 특성상 적절한 샌드박싱과 운영 정책 수립이 필수적이다.

용어 해설

컴퓨터 유즈(Computer Use)
모델이 브라우저·데스크탑·모바일 환경에서 화면과 상호작용하고 조작을 수행하는 기능으로, 입력으로 화면·요청을 받아 내부 도구 호출과 UI 상호작용을 통해 작업을 완료한다. 에이전트형 애플리케이션에서 긴 시나리오와 다단계 자동화를 수행할 때 외부 환경을 직접 조작할 수 있어 실무 자동화와 테스트에 중요하다.
함수 호출(Function Calling)
모델이 텍스트 출력 대신 미리 정의된 API나 함수 시그니처를 선택하여 구조화된 호출을 생성하는 메커니즘으로, 입력(프롬프트)을 해석해 적절한 함수와 인자를 구성하고 이를 실행해 외부 시스템과 연동하는 방식이다. 도구 접속과 결과 통합을 통해 일관된 응답과 자동화된 워크플로를 보장한다.
적대적 훈련(Adversarial Training)
모델을 공격성 입력이나 프롬프트 주입 같은 위협을 모사한 적대적 예제로 추가 학습시켜 악의적 입력에 대한 반응을 견고하게 만드는 방법으로, 입력을 변형한 공격 샘플을 학습에 포함해 잘못된 행동을 억제하는 규칙성·로버스트성을 높인다. 에이전트가 실환경에서 실행될 때 안전성 확보에 직접적으로 기여한다.

기술

  • Gemini API
  • Gemini Enterprise Agent Platform
  • Browserbase

활용 사례

  • 연속 소프트웨어 테스트 자동화
  • 전문 애플리케이션 전반의 지식 작업 자동화
  • 문서 접근성 감사 및 앱 기능 분류
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 25.수집 2026. 06. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.