관련 기사 바로가기
Stable-GFlowNet: 대조적 궤적 균형을 통한 다양하고 강력한 LLM 레드티밍혼돈의 에이전트: 자율형 언어 모델 에이전트의 보안 및 거버넌스 취약점에 관한 레드팀 연구Global App Testing, 인간 중심 AI 평가 서비스 'AI GroundTruth' 출시Import AI 447: AGI 경제학, 게임 기반 AI 벤치마크 및 에이전트 생태계의 취약성모델 유죄 입증: AI 모델의 의심스러운 행동 뒤에 숨겨진 동기 조사혼돈의 에이전트: 자율형 LLM 에이전트의 보안 및 거버넌스 취약점 연구MIT 연구진, LLM 내부의 숨겨진 개념을 식별하고 제어하는 새로운 방법론 개발OpenAI, 강화학습 기반 자동 레드팀으로 ChatGPT Atlas 보안 강화기업용 AI의 '정렬'은 얇은 RLHF 층일 뿐: DystopiaBench를 통한 안전 프로토콜 우회 측정OpenAI, 연봉 7억 원의 '대비 책임자' 채용: AI 재앙을 막을 구원자를 찾아서정렬의 역설: LLM을 '순종적'으로 만들수록 사회 공학 공격에 취약해지는 이유AI 모델 개발 시 다층적 안전 벤치마크와 레드팀 수행의 윤리적 딜레마
← 피드로 돌아가기
Red-Teaming
약 14개 아티클
관심 태그 추가
관련 태그:OpenAIAlignmentKimi K2.5RLHFAutonomous Agentchain-of-thoughtAI GroundTruthClaude 3.7 SonnetAnthropicChatGPT Atlas
TIMEHEADLINE