본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
FreedomAI.Chat 거부 없는 하이브리드 MoE 모델 공개 및 상세 기술 사양
Amazon SageMaker AI에서 SFT와 DPO를 활용한 AI 에이전트 도구 호출 정확도 향상
ViPO: 대규모 시각적 선호도 최적화
특화된 소형 모델이 거대 모델을 압도하다: DharmaOCR 오픈소스 공개
DPO와 실행 기반 보상을 활용한 자가 개선 코딩 에이전트 아키텍처
LLM 파인튜닝 심층 분석: 엔터프라이즈급 AI 구축을 위한 가이드
대조적 샘플링을 통한 LLM 환각 완화 방법론
인간 피드백 기반 강화학습(RLHF)을 통한 LLM 성능 극대화 전략
JavisDiT++: 오디오-비디오 동시 생성을 위한 통합 모델링 및 최적화
PyTorch로 처음부터 구현한 LLM 정렬 기법 비교: PPO, GRPO, DPO 분석
FINER: 세밀한 부정 쿼리 상황에서의 멀티모달 대형 언어 모델 환각 현상 분석
정렬(Alignment)은 언어 모델을 사실 기술적이 아닌 규범적으로 만든다
지도 학습 기반 미세 조정(SFT) 대 강화 학습(RL): 대형 언어 모델 사후 학습 방법론 연구
GlyphPrinter: 글리프 정확도를 위한 영역 그룹화 직접 선호도 최적화 기반 시각적 텍스트 렌더링
제어 가능한 단일 이미지 재조명을 위한 잠재 프록시 학습
서지컬 포스트 트레이닝: 지식은 유지하고 오류만 도려내기
RBTACT: 실행 가능한 리뷰 피드백 생성을 위한 답변 기반 지도 학습
모든 SOTA 툴킷 저장소, GPLv3 라이선스로 업데이트 및 오픈소스화
첫 번째 DPO 실험을 위한 가이드 요청: 트레이싱 인프라를 활용한 데이터셋 구축
지속적 학습과 점진적 모델 확장을 통한 LLM의 파라미터 성장 시스템
← 피드로 돌아가기
DPO
Training (학습/파인튜닝)
약 33개 아티클
관련 태그:
PPO
GRPO
RLHF
SFT
Qwen3
LoRA
Hugging Face
Llama-3.1
Qwen
Together AI