본문으로 건너뛰기

구글 딥마인드: LLM 간 행동 차이를 자동으로 찾아내는 'Diffing Agents' 연구

Google DeepMind 연구팀이 두 LLM 모델 간의 체계적인 행동 차이를 자동으로 발견하고 검증하는 'Diffing Agents' 방법론을 제시함.

섹션별 상세

기존의 정적 평가 방식은 알려진 위험만 측정하는 한계가 존재하며, 이를 보완하기 위해 모델 간 행동 차이를 비교하는 'Diffing Agents' 접근법이 도입되었다. 에이전트는 두 모델에 동일한 프롬프트를 입력하고 응답을 분석하여 체계적이고 일반화 가능한 행동 차이를 가설로 설정하고 검증한다.
Diffing Agent의 작동 흐름을 나타내는 다이어그램.
Diagram시드 프롬프트에서 시작하여 에이전트가 계획을 세우고, 두 모델(A, B)에 메시지를 보내 응답을 비교한 뒤, 차이가 발견될 때까지 반복하는 과정을 보여준다. 모델 간 행동 차이를 발견하기 위한 자동화된 루프 구조를 시각화한다.
Diffing Agents는 모델 간의 미세한 차이를 포착하는 데 탁월한 성능을 보인다. 실험에서 Fibonacci 알고리즘 선택, 이모지 사용 여부, 안전 필터 작동 방식 등 모델 간의 구체적인 행동 차이가 성공적으로 식별되었다.
다양한 Gemini 모델 버전별 Diffing Agent의 위양성률(False Positive Rate) 차트.
Chart동일한 모델을 비교할 때 에이전트가 잘못된 차이를 발견하는 비율을 나타낸다. 대부분의 모델에서 낮은 위양성률을 보이며, 이는 에이전트가 모델 간의 실제 차이를 신뢰성 있게 식별함을 의미한다.
트리거와 행동 유형에 따른 Diffing Agent의 탐지 점수 히트맵.
Chart다양한 행동(프랑스어 응답, e 사용 금지 등)과 트리거(영어 프롬프트, 단어 수 등) 조합에서 에이전트가 얼마나 정확하게 차이를 찾아냈는지 보여준다. 특정 트리거와 행동 조합에서 높은 탐지 점수를 기록했다.
단일 모델 감사 에이전트와 비교했을 때, Diffing Agents는 LaTeX 사용 규칙, 코드 들여쓰기 스타일, 응답 상세도 등 미세한 행동 변화를 감지하는 데 더 높은 정확도를 기록했다. 이는 모델 간 비교가 단일 모델 분석보다 행동 차이 식별에 더 효과적임을 시사한다.
Diffing Pipeline과 단일 모델 감사 방식 간의 성능 차이(Delta) 히트맵.
ChartDiffing 방식이 단일 모델 감사 방식보다 미세한 행동 차이를 얼마나 더 잘 포착하는지 보여준다. 대부분의 지표에서 Diffing 방식이 더 높은 성능을 보이며, 특히 들여쓰기 스타일이나 상세도 같은 미세한 행동 감지에서 우위를 점한다.
모델 오가니즘(model organisms)을 대상으로 한 실험에서, Diffing Agents는 의도된 행동뿐만 아니라 모델 학습 과정에서 발생한 의도치 않은 부작용(예: 특정 형식 고착화)까지 포착했다. 이는 모델 정렬 과정에서 발생하는 일반화 효과와 부작용을 이해하는 데 유용하다.

기술

  • Gemini 2.0 Flash
  • Gemini 2.5 Flash
  • Gemini 2.5 Pro
  • Gemini 3 Pro
  • Gemini 3.1 Pro
  • Gemma-2-9b

활용 사례

  • 모델 간 행동 차이 자동 식별
  • 모델 정렬 부작용 탐지
  • 학습 데이터셋 일반화 효과 분석
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 13.수집 2026. 06. 13.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.