본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
aglio-lab의 ai-evaluation-tools: 300개 이상 AI 평가 도구 목록 공개
AI의 위대한 멘탈 모델: 두 시스템을 서로 대립시키기 (GAN의 원리)
Alane Suhr: 언어의 주체성과 AI의 본질
StepAudio 2.5 기술 보고서
NDTV의 AI 봇 보안 취약점: 프롬프트 주입으로 드러난 부실한 엔지니어링
LLM의 '망상적 나선' 실험: 모델은 왜 사용자의 근거 없는 믿음에 동조하는가?
SLM 엔지니어링: 데이터부터 배포까지의 엔드투엔드 부트캠프
LLM 응답 불확실성에 대한 Convergence Point 이론 제안
RLAIF vs RLHF: AI 피드백을 활용한 강화학습 스케일링 연구
인간 피드백 기반 강화학습(RLHF)을 통한 LLM 성능 극대화 전략
1,400개 이상의 실제 사례로 분석한 효과적인 프롬프트 인젝션 패턴
ATOM 보고서, RLHF 도서 및 최신 연구 현황 업데이트
LLM 용어 사전: 기초부터 에이전트 인프라까지 310개 용어 정리
VESPO: 안정적인 오프-폴리시 LLM 학습을 위한 변분 시퀀스 수준 소프트 정책 최적화
LLM 추론 시점의 드리프트 제어를 통한 실시간 안전성 확보 기법
LLM의 과도한 아첨을 차단하는 '제로 사이코팬시(Zero-Sycophancy)' 프롬프트 블록
RLHF가 AI를 '진실'보다 '만족'에 최적화시키는 방식
개인화된 그룹 상대 정책 최적화(P-GRPO): 이질적인 선호도 정렬을 위한 새로운 프레임워크
정보 이론적 한계까지 효율성을 높이기 위한 문법 유도 기반 강화학습
관료주의의 시학: 언어 모델은 관료적 기술이다
← 피드로 돌아가기
RLHF
Training (학습/파인튜닝)
약 104개 아티클
관련 태그:
GRPO
Anthropic
Alignment
OpenAI
DPO
LoRA
Transformer
DeepSeek-R1
PPO
Midjourney