TL;DR
Transformer 기반 모델은 긴 Chain-of-Thought와 고정된 Context Window, 증가하는 KV-cache 때문에 장기 추론과 추론 비용 측면에서 부담이 커집니다. Pathway의 BDH는 뉴런 간 희소·국소 상호작용과 지속적인 내부 상태를 사용해 순서를 상호작용 그래프의 동역학으로 바꾸고, BDH-CQ는 이 구조 위에서 잠재 상태를 반복 계산하며 최종 답만 출력합니다. 일반적으로 뉴런의 5%만 활성화하는 구조와 선형 Attention은 긴 문맥의 계산량을 낮추며, 상태와 시냅스 연결의 대응 관계는 추론 과정의 관찰 가능성을 높입니다. Amazon SageMaker HyperPod, EFA, NVIDIA H200 기반 EC2 UltraCluster에서 학습한 BDH-CQ는 ARC-AGI-1에서 29.2% pass@2를 과제당 0.0007달러에 기록해 비용·정확도 균형의 개선 가능성을 제시합니다.
섹션별 상세
용어 해설
- 잠재 공간 추론(Latent Reasoning)
- — 중간 추론 과정을 문장 토큰으로 생성하지 않고 모델 내부의 연속적인 잠재 상태에서 반복 계산하는 방식입니다. BDH-CQ는 후보 답을 내부 상태에서 갱신한 뒤 최종 답만 출력해 긴 Chain-of-Thought 생성에 필요한 지연과 메모리 사용을 줄입니다.
- Hebbian Learning
- — 함께 활성화되는 뉴런 사이의 연결이 강화된다는 생물학적 학습 원리입니다. BDH는 이 원리를 뉴런 간 연결과 Attention 구현에 적용해 입력에 따라 내부 상태와 기억 연결을 조정하며, 전체 모델을 다시 학습하지 않고도 문맥에 적응하는 구조를 구축합니다.
- 희소 활성화(Sparse Activation)
- — 전체 뉴런을 동시에 계산하지 않고 특정 시점에 일부 뉴런만 활성화하는 방식입니다. BDH는 일반적으로 뉴런의 5%만 활성화해 추론 단계의 연산량과 메모리 대역폭 사용을 낮추고, 대규모 GPU 환경에서 필요한 계산 자원을 줄입니다.
- 순환 잠재 상태(Recurrent Latent State)
- — 이전 계산 결과를 내부 상태로 유지하면서 같은 상태를 반복 갱신하는 계산 구조입니다. BDH-CQ는 시각 문제의 여러 후보 해를 잠재 상태 안에서 병렬적으로 탐색하고, 긴 텍스트 추론 흔적을 생성하지 않은 채 최종 후보 답을 복호화합니다.
- ARC-AGI-1
- — 적은 수의 입력·출력 격자 예시에서 보이지 않는 시각 규칙을 추론한 뒤 새로운 격자에 적용하는 벤치마크입니다. 기사에서는 BDH-CQ가 이 과제에서 29.2% pass@2와 과제당 0.0007달러의 비용을 기록한 결과를 근거로 활용합니다.
기술
- BDH
- BDH-CQ
- PyTorch
- Amazon SageMaker HyperPod
- Amazon Managed Service for Prometheus
- Amazon Managed Grafana
- Amazon Elastic Fabric Adapter
- NVIDIA CUDA
- NVIDIA Collective Communications Library
- Amazon EC2 p5en.48xlarge
- NVIDIA H200
- Amazon EC2 UltraCluster
활용 사례
- 장기 실행 Agent의 내부 상태 기반 추론
- 사이버 보안 사고 조사
- 교통 네트워크 조정
- 실시간 산업 운영
- 시각 규칙 추론
- 대규모 분산 모델 학습
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.