딥러닝 논문 리뷰 및 발표 (한국어)
VCRL은 강화학습 시 보상 분산이 높은 문제를 우선 선택하고 메모리 뱅크에 저장해 재학습함으로써 LLM의 수학 추론 성능을 효율적으로 향상시킨다.
60억 파라미터 비전 인코더와 LLM을 정렬하여 이미지 인식부터 멀티모달 대화까지 범용적으로 수행하는 InternVL 모델을 분석한다.
기존 Re-ID 모델의 학습 없이 특징 벡터를 신원 중심부로 중앙화하여 노이즈를 줄이고 인물 재식별 정확도를 향상하는 프레임워크이다.
RDT-1B는 대규모 로봇 데이터를 학습하여 양손 조작 작업에서 뛰어난 일반화 성능을 보이는 확산 기반 파운데이션 모델이다.
AnyGrasp는 공간 및 시간 도메인을 활용한 7-DoF 파지 인식 기술로, 노이즈가 많은 환경에서도 로봇이 안정적으로 물체를 집을 수 있게 한다.
UniPi는 텍스트와 현재 이미지를 입력받아 미래 영상을 생성하고, 이를 기반으로 로봇의 제어 행동을 추론하여 다양한 환경에서 범용적인 정책을 학습하는 모델이다.
OViP는 모델의 실시간 실패 사례를 기반으로 negative image를 생성하고 이를 DPO 학습에 활용하여 VLM의 멀티모달 환각을 효과적으로 완화한다.
프롬프트를 연속적인 벡터 대신 이산적인 양자화 값으로 표현하여 시각 언어 모델의 과적합을 방지하고 일반화 성능을 극대화하는 QPrompt 기법을 제안한다.
테스트 시점에 라벨 없는 데이터로 다수결 투표 기반 보상을 생성하여 모델의 추론 성능을 실시간으로 개선하는 TTRL 기법을 소개합니다.
시각 인식과 언어 이해를 연속적인 로봇 동작으로 통합한 이중 시스템 구조의 범용 휴머노이드 로봇 파운데이션 모델 GR00T N1의 핵심 기술을 소개합니다.
동일한 모델 파라미터를 재사용하여 병렬 연산량을 늘림으로써 파라미터 확장 대비 메모리와 지연 시간을 획기적으로 줄이면서도 성능을 개선하는 PARSCALE 기법을 제안한다.