본문으로 건너뛰기
r/artificial조회 2

Anthropic의 GRAM 연구: 사전학습 시 듀얼유즈별 모듈로 특정 지식 분리 및 삭제 실험 결과 공개

Anthropic이 사전학습 단계에서 듀얼유즈별 전용 신경모듈을 두어 특정 지식을 삭제하거나 격리하는 GRAM 방법과 그 실험 결과를 공개했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI 안전 문제로서 듀얼유즈 지식의 잔존은 기존 거부 기반 방법의 한계를 드러냈다. GRAM은 사전학습 단계에서 듀얼유즈 범주마다 전용 신경집단을 할당하고 일반 가중치는 동결하는 방식으로 해당 지식을 모듈 내부에 격리한다. 한 번의 학습으로 범주별 on/off 조합을 통해 여러 배포 구성을 얻을 수 있으며, 실험에서 모듈 삭제는 그 데이터를 처음부터 학습하지 않은 경우와 유사한 동작을 보였고 일반 성능은 유지되었다. 다만 실험은 50M~5B 파라미터 범위에서 이루어졌고 최전선 규모 검증과 상용 모델 도입은 아직 이루어지지 않아 확장성과 지식의 얽힘 문제는 남아 있다.

섹션별 상세

듀얼유즈 지식이 모델 내부에 남아 있는 상태가 공격자에 의해 악용될 수 있다는 문제의식에서 출발했다. GRAM은 사전학습 과정에서 듀얼유즈 범주별로 별도 신경집단을 할당해 해당 범주의 데이터에 대해서만 그 집단이 학습하도록 하고 일반 가중치는 동결하는 구조를 도입했다. 이 방식은 입력에 따라 어떤 모듈이 활성화되고 학습되는지를 분리하는 설계를 포함한다. 그 결과 특정 범주의 지식을 모듈 단위로 격리해 관리할 수 있게 되어, 필요 시 해당 모듈을 제거해 지식을 모델에서 물리적으로 제거할 수 있다.
학습 산출물의 구성 관점에서는 한 번의 학습으로 각 범주 모듈의 on/off 조합을 통해 여러 배포 구성을 얻을 수 있다는 점이 핵심이었다. 논문에서 제시한 실험은 네 개의 듀얼유즈 범주를 기준으로 on/off 조합을 만들어 총 16가지 설정을 생성했고, 모듈을 삭제한 모델의 동작이 해당 데이터를 처음부터 학습하지 않은 모델과 유사함이 재현되었다. 일반적인 모델 성능 지표는 모듈 도입 전후로 영향을 받지 않았다. 따라서 모듈화는 특정 지식의 제거와 전체 성능 유지라는 두 목표를 동시에 달성하는 실용적 수단으로 제시되었다.
규모와 복원성 측면에서는 다양한 파라미터 규모에서 실험이 수행되었고 효과가 모델 규모가 커질수록 더 뚜렷해지는 경향이 관찰되었다. 저자가 언급한 실험 범위는 50M에서 5B 파라미터까지였고, 사후적인 미세조정 방법과 달리 GRAM으로 삭제한 지식은 미세조정으로 쉽게 회복되지 않는 특성을 보였다. 이 점은 기존의 사후 삭제 기법들이 가진 취약성을 보완하는 기술적 근거로 제시되었다. 따라서 대규모 모델에서의 듀얼유즈 관리에 대해 사전설계 기반의 해결책 가능성이 실험적으로 지지되었다.
한계와 적용 범위에서는 아직 전면적 해결이 아니라는 점이 분명히 제시되었다. 연구진은 최전선 규모(frontier scale)에서는 테스트되지 않았고 실제 Claude 제품군에 도입된 상태도 아니며, 일부 듀얼유즈 능력이 일반 지식과 깊게 얽혀 있어 완전 분리가 어려울 수 있음을 인정했다. 또한 모듈화 설계가 모든 유형의 지식에 대해 동일하게 작동한다고 단정할 수 없고, 배포 시 누가 어떤 모듈을 포함할지에 대한 정책적 판단과 검증 절차가 필요하다. 따라서 기술적 유효성은 확보되었으나 확장성과 운영상의 검증이 남아 있다.

용어 해설

듀얼유즈(Dual-use)
안전 문제가 될 수 있는 정보로서 평범한 연구·응용과 악용 가능성을 동시에 지닌 자료를 의미한다. 이 글 맥락에서는 바이러스학·사이버보안·핵물리학 등 특정 범주의 지식이 모델에 포함될 때 생기는 위험을 지칭한다. GRAM은 이러한 듀얼유즈 정보를 분리·관리하려는 목적으로 설계되었다.
보조 모듈(Auxiliary Modules)
사전학습 과정에서 특정 듀얼유즈 범주별로 할당된 신경집단으로서 해당 범주의 데이터에 대해서만 학습이 허용된다. 일반 가중치는 동결되어 범주별 지식이 모듈 내부에 캡처된다. 모듈 삭제로 해당 지식을 제거하거나 유지해 배포 구성을 조절할 수 있다.
모듈 삭제(Module Deletion)
특정 보조 모듈을 학습 후 제거하여 그 모듈이 보유한 듀얼유즈 지식을 모델에서 물리적으로 제거하는 절차이다. 삭제된 상태는 해당 데이터를 처음부터 학습하지 않은 모델과 유사한 동작을 보이는 것으로 보고되었다. 운영 환경에 따라 선택적 배포 수단으로 활용될 수 있다.
사후 학습 제거(Post-hoc Unlearning)
이미 학습된 모델에서 특정 지식을 제거하려 시도하는 기법들의 총칭으로서 미세조정이나 가중치 재설정 등이 포함된다. 본문은 사후 방법들이 미세조정으로는 회복 가능성이 있어 한계가 있음을 지적하고 GRAM의 사전설계 방식이 이를 극복한다고 보고했다. GRAM은 사전학습 단계에서 지식을 모듈화해 사후 제거 요구를 줄이는 접근이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 09.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.