본문으로 건너뛰기

H Company, 고처리량 컴퓨터 사용 에이전트 모델 'Holotron-12B' 공개

H Company가 NVIDIA Nemotron 기반 하이브리드 SSM 아키텍처를 채택하여 추론 효율과 컴퓨터 조작 성능을 극대화한 12B 규모의 멀티모달 에이전트 모델 Holotron-12B를 출시했다.

섹션별 상세

Holotron-12B는 NVIDIA Nemotron-Nano-12B-v2-VL-BF16을 베이스로 H Company의 독자적인 데이터셋을 활용해 사후 학습된 12B 파라미터 규모의 멀티모달 모델이다.
하이브리드 SSM(State-Space Model) 및 Attention 아키텍처를 채택하여, 토큰 길이에 따라 연산량이 급증하는 기존 Transformer의 한계를 극복하고 긴 컨텍스트에서도 높은 효율을 유지한다.
SSM 구조는 레이어당 고정된 상태값만 유지하므로 KV Cache 저장 부담이 없으며, 이는 동일 하드웨어에서 더 큰 배치 사이즈 처리를 가능하게 하여 메모리 점유율을 낮춘다.
단일 H100 GPU에서 vLLM 최적화를 적용해 테스트한 결과, Holo2-8B 모델 대비 2배 이상의 토큰 처리량인 최대 8.9k tokens/s를 기록하며 높은 동시성 환경에서의 우수성을 입증했다.
WebVoyager 벤치마크 점수가 기존 베이스 모델의 35.1%에서 80.5%로 비약적으로 상승했으며, 화면 이해 및 UI 요소 위치 파악(Grounding) 능력이 크게 강화되었다.

용어 해설

상태 공간 모델(SSM)
선형 재귀 구조를 통해 시퀀스 데이터를 처리하는 모델 아키텍처이다. Transformer의 Attention 메커니즘과 달리 시퀀스 길이에 관계없이 일정한 상태 메모리만을 유지하므로, 긴 컨텍스트 처리 시 연산 효율성과 추론 속도가 비약적으로 향상되는 특성을 가진다.
키-값 캐시(KV Cache)
Transformer 기반 모델에서 추론 시 이전 토큰들의 연산 결과를 저장해 두는 메모리 영역이다. 컨텍스트가 길어질수록 이 캐시의 크기가 기하급수적으로 커져 메모리 부족 문제를 일으키지만, SSM 구조에서는 이를 고정된 크기의 상태값으로 대체하여 효율을 높인다.
그라운딩(Grounding)
AI 모델이 텍스트로 된 명령이나 정보를 실제 물리적 세계나 디지털 화면상의 구체적인 좌표, UI 요소와 정확히 연결 짓는 능력이다. 컴퓨터 사용 에이전트가 화면의 버튼 위치를 인식하고 클릭하는 등의 동작을 수행하기 위한 핵심 기술이다.
처리량(Throughput)
단위 시간당 시스템이 성공적으로 처리할 수 있는 데이터나 작업의 양을 의미한다. LLM 추론 환경에서는 주로 초당 생성되는 토큰 수(tokens/s)로 측정하며, 처리량이 높을수록 동일한 하드웨어 자원으로 더 많은 사용자의 요청을 동시에 처리할 수 있다.

기술

  • NVIDIA Nemotron
  • vLLM
  • H100 GPU
  • SSM
  • WebVoyager

활용 사례

  • 자율 컴퓨터 조작 에이전트
  • 데이터 자동 레이블링 및 주석
  • 온라인 강화학습 워크로드
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 17.수집 2026. 03. 17.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.