본문으로 건너뛰기

관련 기사 바로가기

LLM 용어 사전: 기초부터 에이전트 인프라까지 310개 용어 정리VESPO: 안정적인 오프-폴리시 LLM 학습을 위한 변분 시퀀스 수준 소프트 정책 최적화LLM 추론 시점의 드리프트 제어를 통한 실시간 안전성 확보 기법LLM의 과도한 아첨을 차단하는 '제로 사이코팬시(Zero-Sycophancy)' 프롬프트 블록RLHF가 AI를 '진실'보다 '만족'에 최적화시키는 방식개인화된 그룹 상대 정책 최적화(P-GRPO): 이질적인 선호도 정렬을 위한 새로운 프레임워크LLM의 '망상적 나선' 실험: 모델은 왜 사용자의 근거 없는 믿음에 동조하는가?정보 이론적 한계까지 효율성을 높이기 위한 문법 유도 기반 강화학습관료주의의 시학: 언어 모델은 관료적 기술이다MHPO: 안정적인 강화학습을 위한 변조된 위험 인식 정책 최적화대규모 환경에서의 효율적인 탐색정렬(Alignment)은 언어 모델을 사실 기술적이 아닌 규범적으로 만든다AI 모델 현지화 서비스: 언어, 문화적 뉘앙스 및 규제 준수를 위한 모델 최적화 가이드Monostate: 코드 없이 LLM을 파인튜닝하고 배포하는 올인원 AI 학습 플랫폼AI를 가르치며 자신의 일자리를 없애는 사람들: 데이터 학습 노동의 이면금융 생성형 AI의 신뢰성을 보장하는 Human-in-the-Loop(HITL) 워크플로우 설계 가이드AI의 HHH 가치 신성화 위험과 대응 방안린 코드 LLM 선언문: 효율적인 코드 생성을 위한 기술적 제안LLM에게는 '할머니'가 필요하다: 지식 붕괴에 대한 아세모글루 논문의 비판적 검토AI 에이전트는 '생각'하는 것이 아니라 '탐색'하는 것이다
← 피드로 돌아가기

RLHF

Training (학습/파인튜닝)

99개 아티클

관심 태그 추가
TIMEHEADLINE