본문으로 건너뛰기

Hierarchos 232M: 반복적 메모리 보강 어시스턴트 모델 예비 기술보고서 (2026-07-02)

Hierarchos는 232M 매개변수의 RWKV 기반 반복-메모리 하이브리드로 훈련·검증되었으며 상태 재시딩·메모리 쓰기 불일치·채널 클램프 해결로 단기 지시 응답과 붕괴 회피를 입증했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Hierarchos는 232M 매개변수 규모의 실험적 비-Transformer 하이브리드 모델로, RWKV 기반 반복 백본에 ROSA 접미사 매처, DeepEmbed 변조, 슬롯형 장기 기억, 매니저-워커 계층을 결합하여 파라미터 효율을 노렸다. 훈련 과정에서 TBPTT 경계와 실시간 추론 루프의 상태 재시딩 불일치, 훈련 전용 LTM 업데이트, 그리고 ReLU-squared 채널 믹스에서의 발산 같은 수치적·상태 계약 버그를 고치며 실사용 가능한 단기 지시 응답성과 붕괴 회피를 확보했다. 로컬 제한된 벤치마크에서 ARC Easy 0.36, HellaSwag 0.34, TruthfulQA 0.22 같은 점수를 기록하여 GPT-2 시대 수준의 일관성을 보였으나 장기 문맥·산술·사실 회복에서는 약점을 드러냈고 작성진은 ablation과 동등조건 Transformer·RWKV 베이스라인 실험 및 스케일업 계획을 제시했다.

실용적 조언

  • 훈련/추론 일치성 확보를 위해 TBPTT 경계와 실시간 스트리밍 루프의 상태 재시딩 방식을 동일하게 맞출 것, 즉 추론에서도 경계 단위로만 상태를 reseed하도록 코드 경로를 정비해야 한다는 구체적 조치가 제시되었다. 장기 메모리의 경우 훈련 단계에서 'read-only' 모드를 적용하여 훈련 시의 감독적 빠른 쓰기 신호를 제거하면 추론 시의 의존성을 줄일 수 있으며 작성진은 --ltm-training-mode read-only 플래그로 이를 구현했다. 채널 발산 문제는 특정 키 클램프 값과 DeepEmbed 게이트의 weight decay 제외로 완화했으므로 유사 아키텍처에서도 동일한 수치적 안전장치를 우선 적용할 것을 권고한다.

섹션별 상세

01
Hierarchos의 설계 목표는 Transformer가 아닌 반복 상태와 명시적 기억, 계층적 반복 연산으로 파라미터 효율성을 확보하는 것이었다. 입력 토큰은 ROSA 접미사 매처와 DeepEmbed 변조기를 통해 전처리된 뒤 LTM의 Top-k 조회, 매니저-워커 반복 셀, RWKV 백본을 순차 통과하며 다음 토큰 로그잇을 생성한다. 문서에는 ROSA, DeepEmbed, LTM, Manager/Worker 루프와 RWKV 기반 채널 믹스의 조합이라는 구체적 구성 요소가 명시되어 있어 아키텍처 작동 흐름을 재현 가능하게 보여준다. 이 접근은 작은 모델에서 반복적 정제를 통해 단기 지시 응답성을 확보하려는 목적을 드러냈다.

용어 해설

RWKV
순환 구조를 유지하면서 Transformer의 self-attention을 피하는 시퀀스 처리 백본으로, 토큰별 상태를 누적하여 긴 컨텍스트를 저비용으로 처리하는 방식이 핵심이며 본 글에서는 Hierarchos의 핵심 시퀀스 처리 역할을 수행한다.
ROSA(접미사 자동자)(ROSA (Suffix Automaton))
결정적 접미사 자동자 기반의 연속 예측 경로로, 입력 토큰열에서 정확히 반복된 접미사 패턴을 찾아 다음 토큰 확률을 보정하는 기법이며 모델의 토큰 효율성을 높이는 보조 경로로 사용되었다.
장기 기억 슬롯(LTM)(LTM (Long-Term Memory))
학습 가능한 느린 키/값 메커니즘과 빠른 작업 기억 값을 결합하는 구조로, 훈련과 추론 시 지속적 정보 보존을 목표로 하며 훈련 전용 쓰기 신호를 제거해 추론과의 행동 격차를 해소했다.
계층적 추론(HRM)(Hierarchical Reasoning (HRM))
매니저-워커 형태의 다수준 반복 모듈로 동작 계획을 상위 수준에서 생성하고 하위 수준에서 토큰 단위 상태를 세밀하게 갱신하는 구조로, 반복적 정제 과정으로 문맥 일관성을 높이는 역할을 수행한다.
Truncated Backpropagation Through Time(TBPTT)
시간축이 긴 순환 계산에서 기울기 전파를 청크 단위로 잘라 수행하는 기법으로, 본 사례에서는 훈련 시 상태 재시딩이 발생하는 경계로 작용해 추론과의 상태 불일치 원인이 되었다.

언급된 도구

ROG Ally중립

로컬 CPU 기반 소규모 평가 하드웨어로서 한정된 eval 샘플(--eval-limit 100)로 smoke test를 수행하는 데 사용되었다.

Hugging Face dataset netcat420/Experiment_0.1중립링크

Alpaca 포맷의 훈련 데이터셋으로 모델 미세조정에 사용된 데이터 원천이다.

GitHub repository (necat101/Hierarchos)추천링크

아키텍처 구현과 체크포인트, 스크립트, 로그를 제공하는 코드 저장소로 재현가능성을 위한 핵심 리소스이다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 03.수집 2026. 07. 03.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.