본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
모델 학습 과정에 해석 가능성 기법을 도입하는 것에 대한 고찰
오픈 웨이트 모델의 프리필(Prefill) 공격에 대한 대규모 실증 연구: 50개 모델 모두 취약성 노출
개별 예시 대신 해석 가능한 벡터를 활용한 개념 데이터 기여도 분석(Concept Data Attribution)
← 피드로 돌아가기
FAR AI
Companies (AI 기업)
약 3개 아티클
관련 태그:
Alignment
Anthropic
Concept Data Attribution
DeepSeek-R1
Interpretability
Llama 3
Prefill Attack
SAE