본문으로 건너뛰기

BDH, 토큰 밖에서 이어지는 추론

BDH-CQ는 긴 추론 토큰 대신 잠재 상태를 반복 갱신해 ARC-AGI-1에서 29.2% pass@2를 과제당 0.0007달러에 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Transformer 기반 모델은 긴 Chain-of-Thought와 고정된 Context Window, 증가하는 KV-cache 때문에 장기 추론과 추론 비용 측면에서 부담이 커집니다. Pathway의 BDH는 뉴런 간 희소·국소 상호작용과 지속적인 내부 상태를 사용해 순서를 상호작용 그래프의 동역학으로 바꾸고, BDH-CQ는 이 구조 위에서 잠재 상태를 반복 계산하며 최종 답만 출력합니다. 일반적으로 뉴런의 5%만 활성화하는 구조와 선형 Attention은 긴 문맥의 계산량을 낮추며, 상태와 시냅스 연결의 대응 관계는 추론 과정의 관찰 가능성을 높입니다. Amazon SageMaker HyperPod, EFA, NVIDIA H200 기반 EC2 UltraCluster에서 학습한 BDH-CQ는 ARC-AGI-1에서 29.2% pass@2를 과제당 0.0007달러에 기록해 비용·정확도 균형의 개선 가능성을 제시합니다.

섹션별 상세

01
Transformer는 긴 Chain-of-Thought를 토큰으로 계속 생성하고 이를 다음 계산에 다시 넣는 방식 때문에 추론 단계마다 Context Window와 KV-cache가 커지며 지연과 메모리 사용이 누적됩니다. 학습 측면에서도 전체 파라미터에 대한 역전파와 조밀한 활성화가 모델 규모와 함께 계산 부담을 키우고, 새 지식을 반영하려면 Fine-tuning이나 재학습이 필요한 문제가 남습니다. Pathway는 이러한 제약이 구현 세부보다 아키텍처 선택에서 비롯된다고 보고, 추론 작업을 외부 텍스트 흔적이 아닌 내부 상태 갱신으로 옮기는 대안을 구축했습니다.
02
BDH는 순서 모델링을 상호작용하는 뉴런 입자 네트워크의 국소 그래프 동역학으로 재구성하고, 뉴런 사이의 희소한 연결에 기억과 추론 기능을 담습니다. Hebbian Learning 원리를 이용해 함께 활성화되는 뉴런의 연결을 Attention처럼 활용하며, 일반적으로 뉴런의 5%만 활성화해 각 추론 단계의 계산량을 낮춥니다. 고정된 고차원 상태에서 작동하는 선형 Attention은 긴 문맥에서 Transformer처럼 복잡도가 급증하지 않도록 설계됐고, 상태와 시냅스 연결의 대응 관계는 모델 판단을 추적할 단서를 제공합니다.
03
BDH-CQ는 BDH 위에 In-context Learning과 잠재 공간의 반복 추론을 결합한 시각 문제 해결 시스템입니다. 입력 예시를 처리하는 동안 순환 잠재 상태 안에서 여러 후보 해를 갱신하므로 긴 언어 형태의 Chain-of-Thought를 생성하지 않고도 문제를 풀며, 추론 결과로 후보 답만 복호화합니다. 이 방식은 시연 예시의 수가 늘어도 고정된 메모리 비용으로 처리할 수 있도록 설계돼 장기 작업과 실시간 제약이 있는 응용에서 비용과 응답성을 개선할 여지를 만듭니다.
04
Pathway는 BDH 학습을 Amazon SageMaker HyperPod의 분산 GPU 환경에서 수행해 아키텍처 실험에 필요한 확장성과 관찰 가능성을 확보했습니다. Amazon Managed Service for Prometheus와 Amazon Managed Grafana를 연계해 GPU 사용률, 메모리 패턴, 노드 간 통신 효율을 확인하고, EFA와 NVIDIA NCCL을 통해 데이터·가중치·활성값을 GPU 사이에 전달했습니다. 학습에는 인스턴스당 최대 3200Gbps 네트워크 성능을 제공하는 Amazon EC2 p5en.48xlarge와 NVIDIA H200 GPU가 사용됐으며, EC2 UltraCluster가 GPU 간 네트워크 거리를 줄였습니다.
05
BDH-CQ는 ARC-AGI-1에서 29.2% pass@2와 과제당 0.0007달러의 비용을 기록했습니다. ARC-AGI-1은 소수의 입력·출력 격자 예시에서 시각 규칙을 추론하고 새로운 격자에 적용하도록 요구하므로, 단순한 다음 토큰 예측보다 예시 기반 규칙 습득과 변화하는 제약에 대한 추론을 측정하는 데 초점을 둡니다. 이 결과는 BDH의 잠재 반복 계산이 사이버 보안 조사, 교통망 조정, 실시간 산업 운영, 장기 실행 Agent 같은 작업에서 토큰 생성량과 추론 비용을 줄일 가능성을 보여줍니다.

용어 해설

잠재 공간 추론(Latent Reasoning)
중간 추론 과정을 문장 토큰으로 생성하지 않고 모델 내부의 연속적인 잠재 상태에서 반복 계산하는 방식입니다. BDH-CQ는 후보 답을 내부 상태에서 갱신한 뒤 최종 답만 출력해 긴 Chain-of-Thought 생성에 필요한 지연과 메모리 사용을 줄입니다.
Hebbian Learning
함께 활성화되는 뉴런 사이의 연결이 강화된다는 생물학적 학습 원리입니다. BDH는 이 원리를 뉴런 간 연결과 Attention 구현에 적용해 입력에 따라 내부 상태와 기억 연결을 조정하며, 전체 모델을 다시 학습하지 않고도 문맥에 적응하는 구조를 구축합니다.
희소 활성화(Sparse Activation)
전체 뉴런을 동시에 계산하지 않고 특정 시점에 일부 뉴런만 활성화하는 방식입니다. BDH는 일반적으로 뉴런의 5%만 활성화해 추론 단계의 연산량과 메모리 대역폭 사용을 낮추고, 대규모 GPU 환경에서 필요한 계산 자원을 줄입니다.
순환 잠재 상태(Recurrent Latent State)
이전 계산 결과를 내부 상태로 유지하면서 같은 상태를 반복 갱신하는 계산 구조입니다. BDH-CQ는 시각 문제의 여러 후보 해를 잠재 상태 안에서 병렬적으로 탐색하고, 긴 텍스트 추론 흔적을 생성하지 않은 채 최종 후보 답을 복호화합니다.
ARC-AGI-1
적은 수의 입력·출력 격자 예시에서 보이지 않는 시각 규칙을 추론한 뒤 새로운 격자에 적용하는 벤치마크입니다. 기사에서는 BDH-CQ가 이 과제에서 29.2% pass@2와 과제당 0.0007달러의 비용을 기록한 결과를 근거로 활용합니다.

기술

  • BDH
  • BDH-CQ
  • PyTorch
  • Amazon SageMaker HyperPod
  • Amazon Managed Service for Prometheus
  • Amazon Managed Grafana
  • Amazon Elastic Fabric Adapter
  • NVIDIA CUDA
  • NVIDIA Collective Communications Library
  • Amazon EC2 p5en.48xlarge
  • NVIDIA H200
  • Amazon EC2 UltraCluster

활용 사례

  • 장기 실행 Agent의 내부 상태 기반 추론
  • 사이버 보안 사고 조사
  • 교통 네트워크 조정
  • 실시간 산업 운영
  • 시각 규칙 추론
  • 대규모 분산 모델 학습
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.