Noisy Nets를 사용한 에이전트 평가, 왜 결정론적 방식이 항상 정답은 아닐까?
Rainbow DQN 학습 시 Noisy Nets의 sigma 값이 정책의 필수 요소로 작동하여, 결정론적 평가보다 확률적 평가가 실제 성능을 더 정확히 반영함을 확인했다.
강화학습(RL) 분야에 특화된 전 세계적인 로, 논문 구현 경험과 실무적인 트러블슈팅 노하우가 매우 풍부함
Rainbow DQN 학습 시 Noisy Nets의 sigma 값이 정책의 필수 요소로 작동하여, 결정론적 평가보다 확률적 평가가 실제 성능을 더 정확히 반영함을 확인했다.
Unsloth Studio와 같은 도구로 인해 AI 엔지니어링의 핵심이 코드 작성에서 모델 선택과 데이터 반복 실험으로 이동하고 있다.
Gymnasium 라이브러리의 다양한 환경에서 주요 Model-free 강화학습 알고리즘을 단일 명령어로 실행하고 실험할 수 있는 Ostrea 스크립트가 공개됐다.
PPO와 xLSTM 기반의 강화학습 에이전트 NASMU가 비트코인 백테스트에서 고수익을 달성하며, 시장 예측보다 리스크 노출 측정의 중요성을 입증했다.
AI 에이전트의 의사결정 오류와 인간의 행동 모순을 해결하기 위해 제안된 8단계 계층적 피드백 루프 구조인 ALHA 프레임워크에 대한 고찰이다.
표준 강화학습 대신 스파이킹 신경망과 소뇌 모델, 예측 부호화 기반의 생물학적 학습 메커니즘을 활용한 오픈 소스 로봇 제어 프레임워크 MH-FLOCKE를 제안한다.
Pygame으로 제작한 2D 카트 게임 환경에서 Rainbow DQN 알고리즘을 적용하여 개발자의 주행 실력을 능가하는 레이싱 에이전트를 구현한 프로젝트 사례이다.
표준 SFT에서 성능이 포화된 강한 모델에 이전 단계의 약한 모델 로짓을 섞어 학습시킴으로써 그래디언트 소실 문제를 해결하고 성능을 추가로 향상시키는 기법이다.
포켓몬 레드 게임을 클리어하기 위해 강화학습, 계획 에이전트, LLM 등 다양한 AI 접근 방식을 실시간 스트리밍으로 비교하고 경쟁하는 플랫폼이 공개됐다.
Windows 환경에서 MuJoCo 물리 엔진과 Stable Baselines3를 활용한 강화학습 개발 환경을 구축하고 첫 훈련을 실행하는 통합 가이드를 제공했다.
개발자 daeron-blackFyr가 기존의 엄격한 커스텀 라이선스를 폐기하고 SOTA 툴킷과 Qwen3-Pinion 모델 관련 모든 저장소를 GPLv3로 전환하여 커뮤니티 협업을 강화했다.
JAX 기반의 Disco103 업데이트 규칙을 PyTorch로 이식한 disco-torch 라이브러리가 공개되어 Catch 벤치마크에서 99%의 성공률을 재현했다.
LLM 에이전트의 추론 과정과 도구 호출 기록을 추적하는 프레임워크를 활용하여, 8B 모델 대상의 첫 Direct Preference Optimization(DPO) 실험을 설계하고 커뮤니티의 조언을 구하는 글이다.
Onyx는 RAG, 하이브리드 검색, 커스텀 에이전트 구축을 지원하며 모든 LLM과 연동 가능한 보안 중심의 자가 호스팅 AI 채팅 플랫폼이다.
기초적인 밴딧 문제부터 DQN, A2C 등 심화 알고리즘까지 강화학습의 핵심 원리를 외부 라이브러리 없이 직접 구현하며 배우는 교육 리소스이다.
2026년 F1 규정 변화에 대응하여 상대의 배터리 상태를 HMM으로 추론하고 DQN으로 최적의 에너지 전략을 수립하는 POSG 프레임워크를 제안한다.
강화학습에서 목표 신호를 관측값에 추가하는 정책 조건화가 평균 성능보다 꼬리 위험(CVaR)과 안정성을 비약적으로 향상시킨다는 사실을 실험으로 증명했다.
트랜스포머 아키텍처와 PPO 알고리즘을 활용해 별도의 탐색 엔진 없이도 포켓몬 쇼다운 래더 상위 25% 성능을 구현한 강화학습 프로젝트이다.
채팅 데이터의 정제 및 분석을 위한 Distill-The-Flow 툴킷과 Tree of Thought를 구조적으로 구현한 새로운 트랜스포머 Aeron을 포함한 Operation SOTA 프로젝트의 세 번째 결과물이 공개됐다.
Qwen 모델에 GRPO와 밀집 보상을 적용해 코드 실행 예측 정확도를 72%까지 끌어올렸으나, 희소 보상 전환 후 발생하는 성능 정체 현상에 대한 해결책을 모색한다.
성능과 다양성 제약이 상충할 때 인구를 전문 서브 그룹으로 분할하고 JAX를 통해 대규모 병렬 처리를 지원하는 강화학습 시스템이다.
Z3 SMT 솔버와 Lean 4를 활용하여 모델 가중치 업데이트 시 립시츠 연속성 및 에너지 불변성을 강제하는 정형 검증 시스템이다.
Hamiltonian-SMT는 다중 에이전트 강화학습에서 물리적 보존 법칙을 적용하고 Lean 4를 통해 정책 업데이트의 안정성을 수학적으로 검증하는 프레임워크이다.
MetaDrive 환경에서 TD3 모델을 훈련할 때 씬별 순차적 학습과 데이터 서브셋 선택이 성능에 미치는 영향을 실험적으로 분석하고 최적의 훈련 방식을 모색한다.