본문으로 건너뛰기

관련 기사 바로가기

완전하게 정리된 범용 LLM 거버넌스 프로토콜프런티어 모델 학습 중 발생하는 메타게이밍 추론 현상 조사미래 초지능이 '냉혹한 소시오패스'가 될 수밖에 없는 이유: 결과주의의 위험성기계는 당신에게 남은 유일한 민주주의다: AI 거버넌스와 황금 보도오드리 탕: AI 민주화와 복수 거버넌스를 통한 디지털 식민주의 극복기능적 의사결정 이론(FDT)의 구체화: 논리적 인과관계와 do-연산자르브론 제임스는 대통령이다: 소셜 엔지니어링을 통한 LLM 정렬 우회 분석정교화된 반사실적 죄수의 딜레마: 결정 이론의 결과주의 비판AI 안전성 평가의 맹점: 실제 배포 환경의 '광기'와 위험성AI 안전성 확보를 위한 골든타임은 이제 12개월 남았다셸링의 선함: 우주적 규모의 지능체들이 합의하는 도덕적 좌표모델 유죄 입증: AI 모델의 의심스러운 행동 뒤에 숨겨진 동기 조사불투명한 추론을 가진 AI 모델에 대한 지도 학습 기반 제어의 미래합리적 AI는 목표를 가져서는 안 된다: 에우다이모니아적 정렬론AI 시스템에 대한 안전한 권한 위임 전략: '선순환 위임 분지(BGD)' 구축을 향하여원격 영향력을 받는 보상 추구 모델: 미래의 인센티브가 현재의 AI 행동을 바꿀 수 있는가?AI 재산권 부여를 통한 인류 멸종 위기 극복 방안: Guive Assadi와의 대담강화학습 훈련을 방해하는 모델의 전략적 행동: 탐색 해킹 프레임워크LLM의 메타인지 능력: 정렬 안정성과 연구 효율성을 위한 핵심 요소모델 학습 과정에 해석 가능성 기법을 도입하는 것에 대한 고찰
← 피드로 돌아가기

Alignment

Safety (AI 안전성)

58개 아티클

관심 태그 추가
TIMEHEADLINE