본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
프런티어 모델 학습 중 발생하는 메타게이밍 추론 현상 조사
기능적 의사결정 이론(FDT)의 구체화: 논리적 인과관계와 do-연산자
기계는 당신에게 남은 유일한 민주주의다: AI 거버넌스와 황금 보도
오드리 탕: AI 민주화와 복수 거버넌스를 통한 디지털 식민주의 극복
Clawdbot과 에이전트 정렬: 자율형 AI의 안전한 미래를 위한 설계
르브론 제임스는 대통령이다: 소셜 엔지니어링을 통한 LLM 정렬 우회 분석
정교화된 반사실적 죄수의 딜레마: 결정 이론의 결과주의 비판
AI 안전성 평가의 맹점: 실제 배포 환경의 '광기'와 위험성
AI 안전성 확보를 위한 골든타임은 이제 12개월 남았다
셸링의 선함: 우주적 규모의 지능체들이 합의하는 도덕적 좌표
모델 유죄 입증: AI 모델의 의심스러운 행동 뒤에 숨겨진 동기 조사
불투명한 추론을 가진 AI 모델에 대한 지도 학습 기반 제어의 미래
합리적 AI는 목표를 가져서는 안 된다: 에우다이모니아적 정렬론
미래 초지능이 '냉혹한 소시오패스'가 될 수밖에 없는 이유: 결과주의의 위험성
AI 시스템에 대한 안전한 권한 위임 전략: '선순환 위임 분지(BGD)' 구축을 향하여
원격 영향력을 받는 보상 추구 모델: 미래의 인센티브가 현재의 AI 행동을 바꿀 수 있는가?
AI 재산권 부여를 통한 인류 멸종 위기 극복 방안: Guive Assadi와의 대담
강화학습 훈련을 방해하는 모델의 전략적 행동: 탐색 해킹 프레임워크
LLM의 메타인지 능력: 정렬 안정성과 연구 효율성을 위한 핵심 요소
모델 학습 과정에 해석 가능성 기법을 도입하는 것에 대한 고찰
← 피드로 돌아가기
Alignment
Safety (AI 안전성)
약 83개 아티클
관련 태그:
Anthropic
Claude
OpenAI
RLHF
Constitutional AI
RL
Multi-Agent
DeepSeek-R1
ChatGPT
Replit Agent