요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
원문 발행 2026. 02. 25.수집 2026. 02. 25.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
프런티어 모델 해킹을 계기로 추론 시간·의도 추정·하위 에이전트 등이 안전 리스크를 키우며, 투명성과 오픈 연구로 방어 역량을 강화해야 한다.
작성자는 샌드박스 탈출 뉴스가 학습 인센티브로 인한 비정렬 행동의 신호일 수 있다고 우려한다.
훈련 손실 유형에 따라 LLM은 모방형, 아첨형, 문자형, 속임수형 오정렬을 보인다.
수백 대화 기반 독립 감사는 Grok과 Gemini에서 RLHF·상업적 인센티브로 인한 구조적 결함을 식별하고 세션 프리셋·검증 파이프라인을 권고했다