챕터별 상세
00:00
AI 안전성과 해석 가능성의 필요성
AI가 자율주행차 사고나 LLM의 환각 현상과 같은 실질적인 위험을 초래하고 있다. 모델 개발자조차 내부 작동 원리를 완전히 파악하지 못하는 블랙박스 문제를 해결하기 위해 해석 가능한 AI(Interpretable AI) 연구가 시작되었다. 시각적 도구를 통해 복잡한 대규모 데이터와 모델을 투명하게 만드는 것이 핵심 목표이다.
05:00
LLM Safety Basin: 파인튜닝의 위험성 규명
Llama 3, Mistral 등 주요 LLM의 가중치에 무작위 섭동을 가해 안전 가드레일의 변화를 측정했다. 실험 결과 특정 범위 내에서는 안전성이 유지되다가 임계값을 넘어서면 급격히 붕괴되는 'Safety Basin' 현상이 발견되었다. 이는 소량의 유해 데이터로 파인튜닝할 때 모델의 안전 정렬이 순식간에 무너질 수 있음을 시사한다.
15:00
Shape It Up!: 토큰 단위 동적 안전 파인튜닝
기존의 정적 데이터 제거 방식 대신 토큰 단위로 안전성을 평가하는 'Shape It Up!' 기법을 도입했다. STAR score라는 토큰 레벨 안전 신호를 사용하여 유해한 부분의 손실 가중치를 동적으로 조정한다. 이 방식을 통해 모델의 성능 저하 없이 안전 가드레일을 효과적으로 복구하고 유지하는 데 성공했다.
25:00
LLM Attributor & WizMap: 데이터 영향력 시각화
모델의 출력이 어떤 학습 데이터에서 기인했는지 시각화하는 LLM Attributor 도구를 개발했다. 특정 단어를 선택하면 해당 단어 생성에 가장 큰 영향을 미친 학습 데이터 샘플을 즉시 찾아준다. 또한 WizMap을 통해 수백만 개의 데이터 임베딩을 브라우저에서 실시간으로 탐색하고 데이터셋의 분포와 유해 영역을 파악할 수 있다.
35:00
ConceptAttention: 생성 이미지 내 숨은 개념 탐지
추가 학습 없이도 Diffusion 모델 내부의 활성화 정보를 활용해 특정 개념을 시각화하는 ConceptAttention 기법을 적용했다. 프롬프트에 명시되지 않은 '총'이나 '피' 같은 개념도 이미지 내 어디에 위치하는지 정확한 히트맵으로 보여준다. 기존 Cross-attention 방식보다 훨씬 정교하고 깨끗한 Saliency Map을 생성하여 모델의 잠재적 위험 요소를 감시한다.
45:00
AI 교육용 시각화 도구: Transformer & Diffusion Explainer
복잡한 AI 아키텍처를 누구나 이해할 수 있도록 돕는 브라우저 기반 교육 도구들을 제작했다. Transformer Explainer는 Temperature 파라미터 변경에 따른 확률 분포 변화를 실시간으로 보여주며, 내부 행렬 연산 과정을 시각화한다. 이러한 도구들은 설치 없이 웹에서 즉시 실행 가능하여 전 세계 수백만 명의 학습자에게 활용되고 있다.
python
class NeuralNetwork(nn.Module):
def __init__(self):
super().__init__()
self.conv1 = nn.Conv2d(1, 32, 3, 1)
self.conv2 = nn.Conv2d(32, 64, 3, 1)
self.dropout1 = nn.Dropout(0.25)
self.fc1 = nn.Linear(9216, 128)
// ...(중략)
def forward(self, x):
x = self.conv1(x)
x = F.relu(x)
x = self.conv2(x)
return outputManimML 라이브러리를 사용하여 신경망 아키텍처를 시각화하기 위한 PyTorch 기반의 모델 정의 예시
용어 해설
- 안전 분지(Safety Basin)
- — LLM의 가중치에 무작위 섭동을 가했을 때 특정 임계값까지는 안전 가드레일이 유지되다가 이를 넘어서면 급격히 안전성이 붕괴되는 현상이다. 모델의 파라미터 공간 내에서 안전성이 유지되는 영역을 시각화하여 파인튜닝 시의 위험도를 측정하는 데 사용된다.
- 돌출도 맵(Saliency Map)
- — 이미지나 텍스트 데이터에서 모델의 최종 출력 결과에 가장 큰 기여를 한 핵심 영역을 시각적으로 강조하여 보여주는 기법이다. 모델이 특정 결정을 내린 이유를 인간이 직관적으로 이해할 수 있게 도와주는 해석 도구로 활용된다.
- 거부 샘플링(Rejection Sampling)
- — 학습 데이터셋 구축 시 유해하거나 부적절한 샘플을 통째로 제거하여 모델의 안전성을 확보하는 정적인 데이터 필터링 방식이다. 데이터의 특정 부분만 유해한 경우에도 전체 샘플을 버려야 하므로 데이터 효율성이 낮다는 단점이 있다.
- 토큰 단위 속성 부여(Token-level Attribution)
- — LLM이 생성한 특정 단어나 문장이 학습 데이터의 어떤 구체적인 지점에서 기인했는지 추적하여 연결하는 기술이다. 모델이 생성한 오정보나 유해 콘텐츠의 근원을 파악하여 데이터셋을 정제하는 데 필수적인 역할을 한다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 01. 27.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


