본문으로 건너뛰기
HF Daily Papers조회 2

BDH-CQ: 반복 잠재 추론을 활용한 문맥 내 학습

BDH-CQ는 시연을 recurrent memory에 저장하고 자연어 토큰 없이 latent space에서 반복 추론해 ARC-AGI-1 29.5% pass@2를 작업당 0.00070달러에 달성합니다.

왜 중요한가

BDH-CQ는 시연 예시로 새 시각 변환을 습득하는 In-Context Learning과 자연어 중간 추론 없이 잠재 상태를 반복 갱신하는 추론을 하나의 구조로 결합합니다. 150M 파라미터 모델이 ARC-AGI-1에서 작업당 0.00070달러로 29.5% pass@2를 기록해, 정확도와 비용을 함께 고려한 기존 파레토 프론티어를 넘어섰다는 점에서 의미가 있습니다. 동시에 어떤 변환은 안정적으로 일반화하고 어떤 변환은 시연 범위와 구성 방식에 민감한지 세부적으로 확인할 수 있습니다.

핵심 기여

반복 메모리와 잠재 추론의 결합

BDH-CQ는 시연 쌍을 순차 처리해 recurrent memory에 작업별 연관성을 누적합니다. 이후 질의는 자연어 chain-of-thought를 생성하지 않고 고차원 latent workspace에서 반복 계산을 거칩니다. 이를 통해 추론 시 파라미터를 갱신하지 않으면서도 시연에 따른 새 변환을 적용합니다.

ARC-AGI-1 비용 효율 기록

150M 파라미터 구성은 ARC-AGI-1 공개 평가 400개 작업에서 29.5% pass@2를 기록합니다. 작업당 약 0.85 H200 GPU-seconds와 0.00070달러의 계산 비용을 사용합니다. 이 조합은 당시 비교된 비용·정확도 파레토 프론티어를 넘어섰습니다.

개념별 능력과 실패 경계 측정

ConceptARC 16개 변환군에서 작업 단위 정확도와 개별 test-pair 정확도를 분리해 규칙의 일관성을 측정합니다. 경계 전파와 복사는 테스트 범위 전체에서 안정적이지만 ordering과 nesting은 복잡도가 커질 때 급격히 하락합니다. 시연에 목표 복잡도를 포함하면 일부 실패가 회복되어 문맥 범위의 중요성이 확인됩니다.

문맥 기반 조합 능력 검증

색상 매핑, relocation, reflection, rotation, color swap을 독립 연산과 조합 연산으로 나누어 평가합니다. 2개에서 8개까지의 색상 대응은 96개 held-out 출력 모두에서 처리됩니다. 반면 rotation과 relocation의 조합은 72/72였지만 reflection 조합은 47/72, color swap 조합은 0/72였습니다.

핵심 아이디어 이해하기

일반적인 Chain-of-Thought는 시연 예시가 규칙을 지정하고, 모델이 생성한 중간 토큰이 계산용 작업 공간 역할을 합니다. 그러나 각 중간 상태를 vocabulary의 토큰으로 직렬화한 뒤 다시 입력으로 읽어야 하므로 추론 단계가 늘수록 토큰 수와 지연 시간, 계산량이 함께 증가합니다. BDH-CQ는 이 중간 결과를 언어로 내보내지 않고 연속적인 hidden state 안에 유지하는 방향을 택합니다.

BDH-CQ는 먼저 시연 쌍 Dt=(xt,yt)D_t=(x_t,y_t)를 하나씩 읽으며 recurrent memory를 갱신합니다. 메모리 업데이트는 St=Uθ(St1,Dt)S_t=U_\theta(S_{t-1},D_t)로 표현되며, StS_t는 이전 메모리와 t번째 시연의 내용으로 계산되고 파라미터 θ\theta는 추론 중 고정됩니다. 예를 들어 세 번째 시연을 처리할 때의 상태는 첫 번째와 두 번째 시연에서 축적한 연관성까지 포함하므로, 마지막 시연만 보는 단일 task vector와 다른 방식으로 규칙을 보존합니다.

시연을 모두 읽은 뒤 질의는 H0=Eθ(x,SK)H_0=E_\theta(x^\star,S_K)로 잠재 작업 공간에 들어갑니다. 이어서 Hr+1=Fθ(Hr,SK)H_{r+1}=F_\theta(H_r,S_K)를 r=0부터 R−1까지 반복하고, 최종 상태를 y^=Gθ(HR)\hat{y}=G_\theta(H_R)로 디코딩합니다. 즉 입력과 시연 메모리가 초기 상태를 만들고, 반복 변환이 부분 가설을 갱신하며, 마지막 디코더가 정확한 출력 grid를 생성합니다.

이 구조에서 S는 여러 시연이 지정한 작업 규칙을 저장하고 H는 현재 질의를 풀기 위한 진행 중인 계산을 저장합니다. ARC의 색상·위치·대칭 같은 변환은 시연에서 메모리에 결합되고, 질의의 새 grid는 반복 latent 연산을 거쳐 출력으로 변환됩니다. 따라서 성능은 단일한 추론 능력보다 시연이 변환을 얼마나 충분히 덮었는지, 여러 연산을 어떤 표현으로 조합하는지, 출력 전체를 구성할 수 있는지에 좌우됩니다.

방법론

모델은 ARC 형식의 작업을 시연 쌍 K개와 테스트 입력 Q개로 받으며, 학습 중 앞선 예시를 recurrent context에 반영한 뒤 정확한 target grid를 예측하도록 훈련됩니다. 150M 파라미터 모델은 ARC-AGI-1 학습 데이터와 RE-ARC, ConceptARC, ARC-Heavy, ARC-GEN100K의 ARC-style 데이터를 결합한 혼합물에 추가 augmentation을 적용해 학습합니다. 내부 학습 recipe와 정확한 update rule은 공개되지 않았습니다.

평가는 ARC-AGI-1 공개 evaluation split의 400개 작업에서 수행하며, 기본 설정은 최대 두 개의 순위 후보 중 하나가 맞으면 성공하는 pass@2입니다. 비용은 leaderboard가 제공한 API 가격을 그대로 쓰지 않고 측정한 H200 실행 시간을 비용으로 환산하며, 0.85 H200 GPU-seconds에 H200 시간당 3달러를 적용해 작업당 0.00070달러를 계산합니다. 별도 black-box audit에서는 가중치 접근 없이 배포 시스템의 29.5% pass@2를 재현했습니다.

능력 분석에는 16개 개념군을 가진 ConceptARC를 사용하고, 모든 세 test input을 맞힌 경우를 strict task success로 계산합니다. 개별 입력의 test-pair accuracy도 함께 산출해 규칙을 한 번 맞힌 것과 작업 전체에 일관되게 적용한 것을 구분합니다. 모델을 고정한 뒤에는 전파 거리, 복사 위치 수, 정렬할 막대 수, 중첩 깊이만 바꾼 새 ARC-like 작업을 생성해 일반화 경계를 측정합니다.

추가 실험은 색상 대응 수를 2개에서 8개로 늘리는 dense mapping, relocation과 reflection·rotation·color swap의 조합, semantic ID를 opaque ID로 교체한 복제 평가를 포함합니다. 또 테스트 복잡도보다 짧은 시연과 목표 복잡도를 직접 포함한 supported 시연을 같은 입력에 적용해 실패 원인이 실행 용량인지 외삽인지 분리합니다. LOW, MEDIUM, HIGH latent reasoning effort도 비교해 계산량 증가가 pass@2에 미치는 영향을 측정합니다.

관련 Figure

전파, 복사, 정렬, 중첩 변환의 입력과 oracle 출력 예시
Diagram

네 가지 ARC-like 통제 과제에서 입력 grid와 정답 oracle output을 나란히 배치합니다. 변환은 seed를 경계까지 전파하기, 회색 anchor마다 motif 복사하기, 막대 높이 순서화하기, 중첩 frame 안쪽 셀만 재색칠하기로 구성됩니다. 이 예시들은 모델이 단순한 국소 연산뿐 아니라 복수 객체의 순서와 여러 containment 관계까지 처리해야 한다는 실험 설계를 구체화합니다.

전파, 복사, 정렬, 중첩 변환의 입력과 oracle 출력 예시

relocation, rotation, relocation과 rotation 조합의 입출력 예시
Diagram

입력의 색상 motif와 회색 anchor를 기준으로 motif를 이동하거나 회전한 출력, 두 연산을 함께 적용한 출력을 비교합니다. relocation은 motif를 anchor 위치로 옮기고 rotation은 motif 내부의 공간 배치를 바꾸며, 조합 조건은 두 연산을 순차적으로 실행해야 합니다. 논문의 결과에서 rotation과 relocation 조합은 72/72였지만 다른 연산 조합은 색상 배치에 따라 성능이 낮아져 연산 조합의 표현 의존성을 확인하게 합니다.

relocation, rotation, relocation과 rotation 조합의 입출력 예시

주요 결과

ARC-AGI-1에서 BDH-CQ는 29.5% pass@2를 작업당 0.00070달러에 달성했으며, 이는 약 0.85 H200 GPU-seconds에 해당합니다. GPT 5.6 Luna (Low)의 34.2%와 0.040달러를 기준으로 하면 ARC Prize의 2026년 7월 비용 자료에서는 약 57배 저렴하고, 7월 30일 OpenAI의 80% 공개 API 가격 인하를 반영하면 약 11배 저렴합니다. ConceptARC에서는 semantic ID 기준 160개 작업 중 95개가 pass@2였고, 480개 test pair 중 374개가 정답이었습니다.

ConceptARC의 능력은 변환군마다 크게 달랐습니다. opaque ID 복제에서 FilledNotFilled, TopBottom2D, ExtendToBoundary는 각각 9/10 pass@2였지만 Copy와 Order는 각각 2/10이었습니다. 전파는 거리 2에서 8까지 48/48 held-out 출력, 복사는 목표 위치 1개에서 4개까지 48/48을 유지했으며, ordering은 길이 6에서 29/36, 길이 7에서 8/24, 길이 8에서 1/24로 감소했고 nesting은 깊이 5에서 29/36으로 하락했습니다.

실패 형태도 변환마다 달랐습니다. ordering 길이 8에서는 24개 중 3개만 출력 크기가 정확했지만, nesting 깊이 5에서는 36개 모두 크기가 맞고 평균 최선 후보 cell accuracy가 99.9%를 넘었으며 오류가 대체로 하나의 containment 판단에 국한됐습니다. 목표 복잡도를 포함한 supported 시연은 nesting을 19/24에서 24/24로, ordering을 0/24에서 13/24로 높여 시연 범위가 외삽 성능을 좌우함을 나타냈습니다.

색상 대응은 2개에서 8개까지 96개 held-out 출력 모두를 rank one에서 맞췄습니다. relocation·reflection·rotation은 각각 72/72의 단독 성능을 냈고, relocation과의 조합에서는 rotation 72/72, reflection 47/72, color swap 0/72를 기록했습니다. latent reasoning effort를 LOW에서 MEDIUM, HIGH로 높일 때 pass@2는 21%, 27%, 29.5%로 상승했고, 비용 절감률은 각각 22%, 11%, 0%였습니다.

관련 Figure

ARC-AGI-1 pass@2와 작업당 비용의 로그 스케일 비교
Chart

그래프의 가로축은 작업당 비용, 세로축은 ARC-AGI-1 pass@2이며 BDH-CQ의 Low·Medium·High 점이 왼쪽 하단에 배치됩니다. BDH-CQ High는 29.5%와 0.00070달러 지점에 있고, GPT-5.6 Luna (Low)는 34.2%와 0.040달러로 더 높은 점수지만 훨씬 높은 비용을 사용합니다. 점선으로 표시된 기존 Pareto frontier와 비교하면 BDH-CQ 점은 낮은 비용에서 기존 경계를 넘어서는 위치를 차지합니다.

ARC-AGI-1 pass@2와 작업당 비용의 로그 스케일 비교

ConceptARC 개념군별 semantic ID와 opaque ID 성능 비교
Chart

왼쪽 패널은 semantic-ID accuracy와 test-pair accuracy를, 오른쪽 패널은 strict-task pass@2를 semantic ID와 opaque ID 조건으로 비교합니다. FilledNotFilled, TopBottom2D, ExtendToBoundary는 높은 성능을 보이는 반면 Copy와 Order는 낮은 수준에 머물며, 개별 test-pair와 전체 작업 정확도 사이의 간격도 나타납니다. opaque identifier와 semantic identifier의 aggregate 결과가 비슷해 요청에 포함된 식별자와 batch 구성만으로 전체 성능을 설명하기 어렵습니다.

ConceptARC 개념군별 semantic ID와 opaque ID 성능 비교

latent reasoning effort별 pass@2와 비용 절감률
Chart

LOW, MEDIUM, HIGH 세 reasoning effort 지점에서 pass@2가 각각 21%, 27%, 29.5%로 상승하는 추세를 선 그래프로 나타냅니다. x축은 HIGH 대비 비용 변화이며 LOW는 22%, MEDIUM은 11% 비용을 줄이고 HIGH는 기준 비용을 사용합니다. 반복 latent 계산을 더 많이 할수록 정확도는 높아지지만 비용 절감 폭은 줄어드는 교환 관계가 나타납니다.

latent reasoning effort별 pass@2와 비용 절감률

기술 상세

BDH의 기본 구조는 고차원 positive activation, low-rank communication, recurrent associative state를 사용하며 BDH layer는 ReLU-low-rank 변환과 large feature space의 linear attention을 결합합니다. BDH-CQ는 이 계열 위에 시각 입력 변환, candidate construction, ranking, inference pipeline을 추가합니다. 논문은 고수준 인터페이스를 공개하지만 차원과 정확한 내부 update rule은 proprietary로 남겨 둡니다.

시연 메모리와 질의 작업 공간은 서로 다른 상태입니다. St=Uθ(St1,Dt)S_t=U_\theta(S_{t-1},D_t)에서 DtD_t는 t번째 입력·출력 시연이고 StS_t는 그때까지의 누적 연관성입니다. 선형 보정의 단순한 특수 사례는 St=St1+Uθ(Dt)S_t=S_{t-1}+U_\theta(D_t)이며, 입력 시연이 순차적으로 더해져 이후 질의가 참조할 task-specific state를 만듭니다.

질의 계산은 H0=Eθ(x,SK)H_0=E_\theta(x^\star,S_K)로 시작하고 Hr+1=Fθ(Hr,SK)H_{r+1}=F_\theta(H_r,S_K)를 R회 반복한 뒤 y^=Gθ(HR)\hat{y}=G_\theta(H_R)를 산출합니다. 여기서 xx^\star는 질의 입력, SKS_K는 K개 시연을 처리한 메모리, HrH_r는 r번째 latent reasoning 상태, EE·FF·GG는 각각 인코딩·반복 변환·출력 디코딩 함수입니다. 입력과 메모리가 H0를 만들고 F가 상태를 반복 변환한 뒤 G가 최종 grid를 출력하므로 중간 reasoning state를 discrete vocabulary로 직렬화하지 않습니다.

정확도 집계는 작업 단위와 test-pair 단위를 구분합니다. ConceptARC semantic ID 조건에서 pass@2는 160개 작업 중 95개인 59.38%였지만 test-pair 기준으로는 480개 중 374개인 77.92%였습니다. 160개 작업 가운데 52개는 세 입력 중 한두 개만 맞혔으므로, 개별 출력 생성 능력과 하나의 규칙을 모든 입력에 유지하는 능력 사이에 18.5 percentage-point gap이 생겼습니다.

통제 실험에서 propagation은 시연 거리 1–3에서 학습한 규칙을 held-out 거리 2–8까지 확장했고 48/48 출력을 맞혔습니다. ordering은 공간적으로 분리된 막대 8개의 높이를 순서화해야 하므로 길이 8에서 출력 크기 자체가 맞는 결과가 3/24에 그쳤고, nesting은 깊이 5에서 대부분 구조를 유지한 채 containment 한 곳을 잘못 선택했습니다. supported 시연이 목표 복잡도를 직접 포함하면 nesting은 24/24, ordering은 13/24 pass@2로 회복되어 표현된 연산의 실행과 미표현 복잡도의 외삽이 서로 다른 병목임을 구분합니다.

추론 effort는 학습 중 서로 다른 latent reasoning 수준을 노출한 모델에서 선택합니다. LOW는 pass@2 21%와 비용 22% 절감, MEDIUM은 27%와 11% 절감, HIGH는 29.5%와 0% 절감을 기록했습니다. 따라서 반복 latent 계산을 늘리면 정확도가 상승하지만, 이 평가에서는 높은 effort가 계산 비용 절감을 유지하지 못합니다.

한계점

논문은 BDH-CQ의 내부 차원과 정확한 recurrent update rule을 공개하지 않으며, 완전한 내부 training recipe도 proprietary로 남겨 둡니다. ConceptARC 평가에는 학습 또는 checkpoint 선택 과정에서의 노출 가능성을 배제할 수 없고, semantic ID와 batch composition을 동시에 바꾼 복제라 두 요인의 효과를 factorial하게 분리하지 못합니다. 또한 개념군마다 작업이 10개뿐이어서 9/10과 2/10의 Wilson 95% 구간이 넓게 겹치며, 일부 능력 순위의 통계적 신뢰도가 제한됩니다.

실무 활용

이 시스템은 작은 시각 변환 작업을 시연 예시만으로 습득하는 모델의 비용과 일반화 특성을 평가하는 데 활용할 수 있습니다. ARC-like task를 생성하고 정답 oracle과 비교하면 전파, 복사, 정렬, 중첩 같은 연산별 실패 지점을 분리할 수 있습니다. 공개된 task-generation 저장소와 논문의 평가 수치를 함께 사용하면 재현 가능한 benchmark 실험의 출발점으로 삼을 수 있습니다.

  • ARC-AGI-1 또는 ARC-like 시각 추론 모델의 비용·정확도 비교에 활용할 수 있습니다. 모델의 pass@1, pass@2와 실제 H200 실행 시간을 함께 측정하면 단순 정확도보다 운영 효율을 비교할 수 있습니다. 동일한 작업에 latent reasoning effort를 바꾸어 정확도와 비용의 교환 관계도 측정할 수 있습니다.
  • 새로운 ARC-style 일반화 테스트를 만들 때 활용할 수 있습니다. GitHub 저장소의 arc-task-gen을 바탕으로 변환 거리, 복사 위치 수, 정렬 길이, 중첩 깊이를 통제한 입력과 oracle 출력을 구성할 수 있습니다. 고정된 모델에 short와 supported 시연을 각각 제공하면 실패가 실행 부족인지 시연 범위 외삽 부족인지 구분할 수 있습니다.
  • 시각 변환 연산의 조합 능력을 점검하는 데 활용할 수 있습니다. relocation, reflection, rotation, color swap을 단독 조건과 조합 조건으로 나누고 3 × 3 motif의 색상 배치를 바꾸어 평가할 수 있습니다. 이 절차는 모델이 연산 자체를 습득했는지와 서로 다른 연산을 안정적으로 연결하는지를 별도로 측정합니다.

코드 공개 여부: 공개

코드 저장소 보기

키워드

BDH-CQ문맥 내 학습반복 잠재 추론고차원 잠재 공간ARC-AGI-1비용·정확도 파레토 프론티어ConceptARC

용어 해설

문맥 내 학습(In-Context Learning)
추론 시점에 제공된 입력 예시에서 새로운 작업 규칙을 파라미터 업데이트 없이 습득하는 방식입니다. BDH-CQ에서는 시연 입력과 출력이 반복 메모리에 순차적으로 누적되어 이후 질의의 변환 규칙을 결정합니다.
반복 잠재 추론(Recurrent Latent Reasoning)
중간 추론 결과를 자연어 토큰으로 출력하지 않고 연속적인 hidden state를 여러 차례 갱신하는 방식입니다. 질의 표현은 잠재 공간에서 반복 연산을 거친 뒤 마지막 상태만 출력으로 변환되어 토큰 생성 비용을 줄입니다.
잠재 작업 공간(Latent Workspace)
모델이 질의의 부분 가설과 변환 후보를 유지하며 반복 계산을 수행하는 고차원 연속 상태 공간입니다. BDH-CQ의 작업 공간 H는 시연을 저장하는 메모리 S와 분리되어 현재 질의의 계산 과정만 담당합니다.
두 후보 성공률(pass@2)
모델이 최대 두 개의 순위화된 후보 출력을 만들고 그중 하나라도 정답이면 성공으로 계산하는 평가 지표입니다. ARC-AGI-1에서는 두 후보 중 하나가 정확한 grid를 출력한 작업의 비율로 점수를 산출합니다.
비용·정확도 파레토 프론티어(Cost–Accuracy Pareto Frontier)
추론 비용을 더 낮추면서 동시에 정확도를 유지하거나 높일 수 없는 시스템들의 경계입니다. BDH-CQ는 작업당 계산 비용 0.00070달러와 29.5% pass@2 조합으로 기존에 보고된 비용·정확도 경계를 넘어섰습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 10.수집 2026. 08. 12.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.