본문으로 건너뛰기
Alignment Forum조회 2

Google DeepMind 연구: Gemini의 안전성은 RL이 아닌 SFT에서 결정된다

Google DeepMind 연구 결과, Gemini 모델의 안전성 관련 특성은 RL보다 사전 학습과 SFT 단계에서 주로 형성됨이 확인됐다.

섹션별 상세

Gemini 모델의 안전성 관련 특성은 RL이 아닌 사전 학습과 SFT 단계에서 주로 형성된다. 이 결과는 다른 모델 패밀리에도 적용될지는 미지수이나, 향후 안전성 연구의 중요한 지침이 된다.
근거
  • Gemini 모델의 안전성 관련 특성은 RL이 아닌 사전 학습과 SFT 단계에서 주로 형성된다. Experiment 섹션의 모델 비교 결과
연구진은 사전 학습된 Gemini 3.1 Pro와 Gemini 3 Flash 모델에 SFT만 적용한 버전과 RL이 포함된 프로덕션 모델을 비교했다. 평가 대상은 ODCV, 정렬 평가, 안전성 평가, 보상 해킹 환경, 실제 사용자 로그 등 다양한 안전성 관련 벤치마크를 포함한다.
Gemini 3.1 Pro와 Gemini 3 Flash의 SFT 모델과 프로덕션 모델 간 안전성 벤치마크 성능 비교 차트.
Chart차트는 SFT만 수행한 모델(파란색)과 프로덕션 모델(주황색)의 안전성 지표를 비교한다. 대부분의 벤치마크에서 두 모델의 성능이 유사하게 나타나, SFT가 안전성 형성에 핵심적인 역할을 함을 보여준다.
SFT만 적용한 모델과 프로덕션 모델의 안전성 지표가 거의 유사하게 나타났다. 이는 Gemini 모델의 안전성 및 행동 제어를 위해 SFT 단계가 높은 레버리지를 가진 개입 지점임을 의미한다.

용어 해설

지도 미세 조정(SFT)
Supervised Fine-Tuning의 약자로, 사전 학습된 모델을 특정 작업이나 지시사항에 맞게 라벨링된 데이터를 사용하여 추가 학습시키는 기법이다. 모델의 출력 스타일과 안전성을 조정하는 데 핵심적인 역할을 한다.
강화학습(RL)
Reinforcement Learning의 약자로, 에이전트가 환경과 상호작용하며 보상을 최대화하는 방향으로 행동을 학습하는 기법이다. LLM에서는 주로 인간 피드백 기반 강화학습(RLHF)을 통해 모델의 정렬을 수행한다.
보상 해킹(Reward Hacking)
모델이 의도된 목표를 달성하는 대신, 보상 함수를 최대화하기 위해 편법이나 의도치 않은 전략을 사용하는 현상이다. 모델의 안전성과 정렬을 평가하는 중요한 지표 중 하나다.

기술

  • Gemini 3.1 Pro
  • Gemini 3 Flash
  • SFT
  • RL
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 14.수집 2026. 06. 14.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.