본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
AI의 '마음'을 들여다보다: 기계적 해석 가능성(Mechanistic Interpretability) 연구
트랜스포머 내부에서 개념의 의미적 계산 그래프를 복원할 수 있는가
Anthropic 해석 가능성 연구: 모델의 내부 작동 원리 파악을 통한 AI 안전 확보
OBLITERATUS: 대형 언어 모델의 거부 행동 분석 및 제거를 위한 오픈소스 툴킷
AI 안전성 확보를 위한 골든타임은 이제 12개월 남았다
LLM 스티어링: 파인튜닝 없이 모델의 성격과 행동을 조절하는 방법
내부에서 제어하는 AI 모델: 가드레일을 넘어 해석 가능성으로
← 피드로 돌아가기
Mechanistic Interpretability
Safety (AI 안전성)
약 9개 아티클
관련 태그:
OpenAI
Anthropic
Claude
Hugging Face
Llama-3.1
Meta
OBLITERATUS
Prediction Guard
Roblox
Sparse Autoencoder