본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Stable-GFlowNet: 대조적 궤적 균형을 통한 다양하고 강력한 LLM 레드티밍
혼돈의 에이전트: 자율형 언어 모델 에이전트의 보안 및 거버넌스 취약점에 관한 레드팀 연구
Global App Testing, 인간 중심 AI 평가 서비스 'AI GroundTruth' 출시
Import AI 447: AGI 경제학, 게임 기반 AI 벤치마크 및 에이전트 생태계의 취약성
모델 유죄 입증: AI 모델의 의심스러운 행동 뒤에 숨겨진 동기 조사
MIT 연구진, LLM 내부의 숨겨진 개념을 식별하고 제어하는 새로운 방법론 개발
OpenAI, 강화학습 기반 자동 레드팀으로 ChatGPT Atlas 보안 강화
정렬의 역설: LLM을 '순종적'으로 만들수록 사회 공학 공격에 취약해지는 이유
기업용 AI의 '정렬'은 얇은 RLHF 층일 뿐: DystopiaBench를 통한 안전 프로토콜 우회 측정
OpenAI, 연봉 7억 원의 '대비 책임자' 채용: AI 재앙을 막을 구원자를 찾아서
AI 모델 개발 시 다층적 안전 벤치마크와 레드팀 수행의 윤리적 딜레마
← 피드로 돌아가기
Red-Teaming
Safety (AI 안전성)
약 19개 아티클
관련 태그:
OpenAI
Alignment
Kimi K2.5
RLHF
Autonomous Agent
Chain of Thought
AI GroundTruth
Claude 3.7 Sonnet
Anthropic
ChatGPT Atlas