본문으로 건너뛰기
sudoremove조회 30

AI 라이브: Qwen 3.5 출시와 NVIDIA 로보틱스 최신 연구 분석

Alibaba의 Qwen 3.5 모델군 출시 소식과 NVIDIA의 최신 로보틱스 연구 5편을 통해 소형 모델의 고성능화 및 비디오 데이터 기반 로봇 학습 트렌드를 심층 분석합니다.

챕터별 상세

00:10

Qwen 3.5 모델군 출시 및 성능 분석

Alibaba가 Qwen 3.5 모델군(0.8B, 9B, 27B, 35B 등)을 공개했다. 9B 모델이 MMLU 등 주요 벤치마크에서 기존 120B 규모의 모델보다 높은 성능을 기록하며 모델 효율성을 입증했다. 아키텍처 측면에서는 Hybrid Attention 구조와 Gated DeltaNet을 적용하여 추론 속도와 정확도를 동시에 개선했다. 특히 소형 모델에서도 강력한 Reasoning 능력을 보여주며 온디바이스 AI 적용 가능성을 높였다.

Gated DeltaNet은 시퀀스 데이터를 효율적으로 처리하기 위한 순환 신경망 구조의 일종으로, 긴 컨텍스트 처리 시 메모리 효율을 높여줍니다.

04:50

Anthropic과 OpenAI의 최신 동향 및 갈등

Anthropic이 DeepSeek 등 중국 기업들의 Claude 모델 Distillation 의혹을 제기하며 보안 및 저작권 이슈가 부각됐다. OpenAI는 GPT-5.3 Codex를 출시하며 코딩 에이전트 시장에서의 지배력을 강화하고 있다. 한편 미국 국방부(DoD)와의 협력 과정에서 Anthropic이 안전 가이드라인 준수를 이유로 계약에서 이탈하고 OpenAI가 이를 대체하는 등 기업 간의 전략적 행보가 엇갈렸다. 내부적으로는 전쟁 무기 활용에 대한 엔지니어들의 반발과 이탈 현상이 관찰됐다.

Distillation은 거대 모델의 지식을 작은 모델로 전이시키는 기법으로, 경쟁사의 모델 응답 데이터를 학습에 사용하는 행위가 논란이 되고 있습니다.

29:40

NVIDIA 로보틱스 연구: DreamDojo

NVIDIA가 4만 4천 시간 분량의 인간 1인칭(Ego-centric) 비디오를 학습한 로봇 World Model인 DreamDojo를 발표했다. 실제 로봇의 동작 데이터 없이도 비디오 프레임 간의 변화를 통해 Latent Action을 추출하여 물리적 인과관계를 학습했다. 이를 통해 로봇이 한 번도 보지 못한 환경에서도 물체 조작 결과를 예측할 수 있는 능력을 갖췄다. 결과적으로 대규모 인간 비디오 데이터가 로봇 지능 학습의 핵심 자원이 될 수 있음을 증명했다.

World Model은 로봇이 자신의 행동에 따른 미래 상태(이미지나 센서 값)를 예측할 수 있게 해주는 내부 시뮬레이터 역할을 합니다.

41:20

인간 비디오를 활용한 스케일링 법칙: EgoScale

EgoScale 연구는 2만 시간의 인간 비디오에서 손의 관절 궤적(Hand Trajectory)을 추출하여 로봇 제어에 활용하는 프레임워크이다. 인간의 행동 데이터를 로봇의 관절 값으로 매핑하는 Retargeting 기술을 적용했다. 데이터 양이 늘어날수록 로봇의 태스크 성공률이 선형적으로 증가하는 Scaling Law를 로보틱스 분야에서 확인했다. GB200 가속기를 활용해 대규모 병렬 학습을 진행하여 학습 효율을 극대화했다.

Scaling Law는 모델 크기, 데이터 양, 컴퓨팅 자원이 증가함에 따라 성능이 예측 가능한 수준으로 향상되는 법칙을 의미합니다.

56:10

비디오 액션 모델: DreamZero 및 Cosmos Policy

NVIDIA는 비디오 생성 모델인 Cosmos를 파인튜닝하여 로봇의 행동을 결정하는 DreamZero와 Cosmos Policy를 선보였다. 14B 파라미터 규모의 모델을 GB200 2대에서 7Hz 속도로 실시간 추론할 수 있도록 최적화했다. 비디오 생성 능력을 바탕으로 로봇이 수행할 다음 동작을 시각적으로 예측하고 이를 실제 제어 신호로 변환한다. 제로샷 환경에서도 신발끈 묶기나 물체 담기 등 복잡한 조작 태스크를 성공적으로 수행했다.

Video Action Model은 텍스트나 이미지를 입력받아 로봇이 수행해야 할 다음 장면을 비디오로 생성하고, 그 장면에 도달하기 위한 액션을 계산하는 모델입니다.

66:50

로봇 전신 제어 기술: GEAR-SONIC

GEAR-SONIC은 휴머노이드 로봇의 전신 제어(Whole-body Control)를 위한 기술로, 사람이 움직이는 모습을 실시간으로 따라 하는 Teleoperation 기능을 포함한다. 로봇이 중심을 잃지 않고 사람의 복잡한 동작을 모방할 수 있도록 균형 유지 알고리즘을 통합했다. 이를 통해 수집된 데이터는 다시 VLA(Vision-Language-Action) 모델 학습의 기초 자료로 활용된다. 로봇이 단순히 손만 움직이는 것이 아니라 걷기, 굽히기 등 전신 협업 동작을 자연스럽게 수행하는 결과를 보였다.

Teleoperation은 원격지에 있는 사람이 조종기나 모션 캡처 장비를 통해 로봇을 직접 조종하는 기술입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 09.수집 2026. 03. 09.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.