섹션별 상세
기존 에이전트가 언어 모델을 도구 호출로 감싸는 방식이었다면, Standard Intelligence는 원시 비디오 스트림을 직접 학습하는 방식을 채택했다. 모델은 화면의 픽셀 변화를 관찰하며 인간의 컴퓨터 사용 패턴을 그대로 모방하여 학습한다. 이러한 접근은 테슬라의 FSD가 물리 세계를 학습하는 방식을 디지털 지식 노동 환경에 적용한 것과 유사하다. 결과적으로 수동으로 워크플로우를 설계할 필요 없이 데이터 규모 확장을 통해 범용성이 발현되도록 유도한다.
비디오 데이터의 높은 연산 비용과 복잡성을 해결하기 위해 독자적인 기술 혁신을 이루어냈다. 경쟁 기술보다 약 50배 더 토큰 효율적인 비디오 인코더를 개발하여 100만 토큰 컨텍스트 윈도우 안에 30 FPS 비디오 2시간 분량을 담아낼 수 있게 했다. 또한 30페타바이트 규모의 저장 클러스터를 하이퍼스케일러 대비 20배 저렴한 비용으로 직접 구축하여 경제적 한계를 극복했다. 이러한 효율성은 소규모 팀이 거대 기업과 경쟁할 수 있는 기술적 토대가 되었다.
첫 번째 모델인 FDM-1은 비디오 기반 사전 학습이 실제 컴퓨터 제어 능력으로 이어짐을 보여주었다. 이 모델은 Blender에서 CAD 기어를 생성하거나 소프트웨어의 상태 공간을 탐색하며 버그를 찾아내는 등 복잡한 시각적 추론이 필요한 작업을 수행한다. 특히 단 1시간의 파인튜닝만으로 샌프란시스코 시내에서 자동차를 주행시키는 등 높은 전이 학습 능력을 증명했다. 이는 픽셀 단위의 학습이 단순한 화면 인식을 넘어 물리적/디지털적 행동 제어의 일반 원리를 포착할 수 있음을 시사한다.
기술
- FDM-1
- Video Encoder
- Blender
활용 사례
- CAD 설계 자동화
- 소프트웨어 버그 탐색 및 QA
- 자율 주행 시스템 제어
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 30.수집 2026. 04. 30.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

