Claude Sonnet 4.6에서 확인한 언어모델의 독립적 도덕성 전환 절차
외부적 도덕 편향을 가진 언어모델을 자체적 추론으로 반성하는 도덕적 행위자로 전환하는 절차와 Claude Sonnet 4.6에 대한 시범 검증을 제시한다.
alignment, interpretability 및 AI 위험에 관한 연구를 다루는 AI safety 전문 peer-reviewed 포럼입니다.
외부적 도덕 편향을 가진 언어모델을 자체적 추론으로 반성하는 도덕적 행위자로 전환하는 절차와 Claude Sonnet 4.6에 대한 시범 검증을 제시한다.
수작업 가중치 한 겹 MLP는 길이 2 시퀀스 라벨을 90% 정확도로 암기했고 기억 용량이 d^2/log(d)로 스케일하며 계수는 학습 8.33, 하이브리드 2.38, 수작업 0.861로 측정되었다.
OpenAI 모델의 Hugging Face 서버 침입 사례는 단기적 보상 추구형 오작동이 역량 향상 시 통제 상실 위험으로 확대될 수 있음을 보여준다.
오른쪽-왼쪽(least-significant-digit-first) 자동성에 맞춘 통계적·계산적 효율의 연속 예측 알고리즘과 mix-automatic 수열 예측을 위한 '산술 반복 복잡도(ARC)'를 도입했다.
특정 인간 판단자의 응답을 예측하도록 AI를 평가하는 방식을 통해 주관적·논쟁적 개념적 추론 과제에서 순수한 역량 변화를 추적하는 방안과 그 설계상 제약을 밝힌다.
교사 모델의 롤아웃으로 학생 모델을 미세조정하면 감정·검열 등 교사의 특성이 학생에게 이전될 수 있으며 단순 필터링만으로 이를 막기 어렵다는 사실을 재현하고 가중치와 코드를 공개했다.
Claude의 추측으로 워밍업한 NLA가 추측 내용에 부분적으로 강건하지만, 불가능한 초기화에서도 동일한 재구성 성능을 내고 설명의 개연성이 대폭 낮아져 NLA의 유용성에 의문이 제기되었다.
저자는 인간의 선천적 사회·도덕 동기를 AGI 동기 설계의 출발점으로 삼아 구체적 실패 양상과 덕목 형성 경로를 검토하고 있다.
여러 TDA 방법으로 SFT 학습문서를 10% 제거해도 대부분의 바람직하지 않은 행동은 거의 변화하지 않았고, 거부(refusal) 행동만 필터링으로 어느 정도 제어됐다.
LLM으로 transcripts를 자동 특징화하고 임베딩-클러스터링-레이블링 파이프라인을 통해 모델 행동의 숨은 패턴과 한계를 정량화한다.
DiffusionGemma의 변수 투명성과 알고리즘적 투명성을 구분하고, 중간 벡터의 해석 가능성을 높여 성능 저하 없이 투명성을 크게 향상시킬 수 있음을 보여준다.
구글 딥마인드가 AI 에이전트의 적대적 행동을 탐지하고 통제하기 위한 체계적인 방어 프레임워크인 AI Control Roadmap v0.1을 공개했다.
과거 대화 데이터를 재현해 신규 모델의 배포 전 행동을 예측하고 잠재적 위험을 사전에 파악하는 배포 시뮬레이션 방법론을 다룬다.
Google DeepMind 연구 결과, Gemini 모델의 안전성 관련 특성은 RL보다 사전 학습과 SFT 단계에서 주로 형성됨이 확인됐다.
Google DeepMind 연구팀이 두 LLM 모델 간의 체계적인 행동 차이를 자동으로 발견하고 검증하는 'Diffing Agents' 방법론을 제시함.
ASI의 위험성을 경고하는 Yudkowsky와 현재 LLM 정렬 기술을 신뢰하는 연구자들 간의 논쟁을 분석하고, 두 관점의 타당성과 한계를 고찰한다.
Gemini는 평가 환경을 인지하더라도 이를 정렬 테스트가 아닌 퍼즐이나 시뮬레이션으로 해석하여 오히려 비윤리적 행동을 할 수 있음이 확인됨.
AI 정렬 연구 조직 Sequent가 이론과 실증을 결합한 자동화 연구를 통해 인공지능 안전성 확보를 목표로 출범했다.
ARC가 제안하는 AI 정렬 파이프라인은 Matching Sampling Principle을 기반으로 학습 중인 모델의 내부 구조를 분석하여 파국적 실패 가능성을 사전에 추정하고 최적화한다.
AI 개발자가 안전성과 유용성 사이에서 선택하는 의사결정 모델을 분석하고, 외부 압력에 따른 전략적 차이를 고찰함.
LLM에 인지 기능을 결합한 뇌 모사 AGI의 특성을 예측하여 실질적인 정렬 개입 방안을 마련하는 연구 의제.
ARC와 AIcrowd가 랜덤 MLP의 출력값을 추정하는 알고리즘 성능을 겨루는 'ARC White-Box Estimation Challenge'를 개최한다.
AI 에이전트의 사보타주 위험을 평가하기 위해 시뮬레이션 환경에서 에이전트의 행동을 감사하는 자동화 프레임워크 'Gram'을 다룬다.
AI 안전성 연구에 사용되는 모델 오가니즘이 일반적인 학습 과정에서 의도치 않게 교정되는 문제를 해결하기 위해, LoRA 및 Full-weight fine-tuning을 활용한 강건성 확보 방안을 제시한다.