본문으로 건너뛰기

MIT 연구진, LLM 내부의 숨겨진 개념을 식별하고 제어하는 새로운 방법론 개발

MIT와 UCSD 연구진이 Recursive Feature Machine(RFM)을 활용해 LLM 내부의 추상적 개념을 식별하고 답변의 톤과 편향을 정밀하게 제어하는 기술을 발표했습니다.

섹션별 상세

01
MIT와 UCSD 연구진은 LLM 내부의 숨겨진 편향, 성격, 기분 등 추상적 개념을 식별하고 조종할 수 있는 새로운 방법론을 개발했습니다. 이 기술은 모델 내부의 연결성을 분석하여 특정 개념이 인코딩된 지점을 찾아내고, 이를 강화하거나 약화함으로써 모델의 답변 톤을 정밀하게 제어합니다.
신경망 주변에 다양한 페르소나가 배치된 일러스트이다.
DiagramLLM 내부에 여러 추상적 개념(성격, 기분 등)이 공존하며 이를 식별할 수 있음을 시각적으로 나타낸다.
02
연구의 핵심 도구는 Recursive Feature Machine(RFM)이라는 예측 모델링 알고리즘입니다. RFM은 신경망이 특징을 학습하는 수학적 메커니즘을 활용하여 데이터 내의 특정 패턴을 직접 식별하도록 설계되었습니다. 기존의 비지도 학습 방식보다 훨씬 빠르고 정확하게 타겟 개념을 추출할 수 있습니다.
03
연구진은 공포, 전문가, 기분, 장소 선호도, 페르소나 등 5가지 범주에서 512개의 개념을 성공적으로 식별하고 제어했습니다. 예를 들어 '음모론자' 개념을 강화하면 모델이 일반적인 질문에도 음모론적 관점으로 답변하게 만들 수 있으며, 반대로 모델의 취약점을 찾아내어 안전성을 높이는 데 활용할 수도 있습니다.
AI 학습 데이터셋의 정치적 편향을 보여주는 막대 그래프이다.
Chart모델이 학습 과정에서 습득한 숨겨진 편향을 수치화하여 보여주며, 본문에서 다루는 개념 식별 및 제어 기술의 필요성을 뒷받침한다.
04
이 방법론은 프롬프트 엔지니어링만으로는 도달하기 어려운 모델의 깊은 내부 표현을 직접 수정합니다. '거부 방지(Anti-refusal)' 개념을 강화할 경우, 평소라면 거절했을 부적절한 요청에도 답변하게 만드는 등 모델의 안전 가드레일을 우회하거나 강화하는 실험적 증명을 마쳤습니다.

기술

  • LLM
  • Recursive Feature Machine (RFM)
  • Vision Language Models

활용 사례

  • 모델 안전성 강화
  • 페르소나 튜닝
  • 취약점 탐지
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 20.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.