본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
TurnOPD: 장기간 에이전트의 효율적 온-정책 증류를 위한 턴 단위 예산 전략
DuoMem: 이중 공간 증류를 통한 온디바이스 메모리 에이전트 역량 강화
계획은 지속되지 않는다: 컨텍스트 관리가 LLM 에이전트에서 결정적인 이유
SkillNet: AI 스킬 생성, 평가 및 연결을 위한 개방형 인프라
에이전트 비판적 학습: LLM 에이전트의 자율적 추론 및 행동 품질 평가 능력 향상을 위한 강화학습 패러다임
← 피드로 돌아가기
ALFWorld
Datasets (데이터셋)
약 5개 아티클
관련 태그:
Action Chunking Transformer
DeepSeek-R1-Distill-Llama-70B
DeepSeek-V3
Gemini 2.5 Pro
GRPO
Llama-3.1-70B
LoRA
On-Policy Distillation
Qwen3
SkillNet