용어 해설
- 메커니즘적 해석 가능성(Mechanistic Interpretability)
- — 모델을 블랙박스로 보지 않고, 내부의 개별 가중치나 활성화 값이 특정 행동을 어떻게 유도하는지 인과적으로 분석하는 기법입니다. 이를 통해 모델의 오작동 원인을 파악하고 정밀한 제어가 가능해집니다.
- 어텐션 헤드(Attention Head)
- — Transformer 모델에서 입력 데이터의 서로 다른 부분 간의 관계를 병렬로 계산하는 단위입니다. 특정 헤드는 문법을, 다른 헤드는 오디오 특징을 처리하는 등 기능적으로 분화되어 작동합니다.
- 텍스트 우세(Text Dominance)
- — 멀티모달 모델이 오디오나 이미지 같은 비텍스트 입력보다 학습 시 더 많이 접한 텍스트의 통계적 패턴에 치우쳐 판단하는 현상입니다. 이로 인해 실제 소리와 다른 텍스트 위주의 오답을 낼 수 있습니다.
- 활성화 스티어링(Activation Steering)
- — 모델의 가중치를 수정하지 않고, 추론 과정에서 생성되는 중간 계산값(활성화)에 특정 방향의 벡터를 더해 모델의 출력을 원하는 방향으로 유도하는 기법입니다. 효율적인 성능 개선 수단입니다.
- 잔차 스트림(Residual Stream)
- — Transformer 레이어를 거치며 정보가 누적되는 통로로, 각 레이어의 출력이 이전 레이어의 입력에 더해지며 최종 예측에 필요한 정보가 쌓이는 공간입니다. 모델의 현재 상태를 나타내는 핵심 지표입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.