TL;DR
AQuA의 Appendix B는 미래 거래량이 들어간 종일 분모를 사용한 Feature가 경제적으로 그럴듯한 설명 덕분에 LLM Reviewer를 통과했지만, 평가 구간을 재분할하자 비정상적으로 높던 홀드아웃 Information Coefficient가 사라진 사례를 기록합니다. 작성 에이전트와 검토 에이전트가 같은 실패 모드를 공유하면 자연어 검토는 누수를 구조적으로 막지 못합니다. AQuA는 에이전트가 자유롭게 Feature 코드를 쓰는 대신 현재 시점의 trailing window나 단면 데이터만 읽는 Causal Operator Registry를 조합하게 해 종일 정규화 같은 연산을 사양 공간에서 표현할 수 없게 만들었습니다. 다만 이 제약이 모든 정보 누수를 막지는 않으므로 tracing과 평가를 병행할 필요가 남습니다.
섹션별 상세
이미지 분석

이미지는 종일 거래량 분모가 미래 정보를 포함해 비정상적으로 높은 홀드아웃 Information Coefficient를 만들었고, 평가 구간을 재분할하자 문제가 드러났다는 사례를 담고 있습니다. 이어 AQuA가 각 time-series operator와 cross-sectional operator의 데이터 접근 범위를 현재 시점 주변으로 제한해 해당 정규화를 사양 공간에서 표현할 수 없게 만든 과정을 설명합니다. 자연어 Reviewer의 누수 탐지에서 누수 연산 자체를 작성 불가능하게 만드는 방향으로 보장이 이동한다는 점이 핵심입니다.
AQuA의 정보 누수 사례와 Causal Operator Registry 설계를 설명하는 논문 본문 발췌입니다.

이미지는 Reviewer가 Feature의 경제적 의미는 파악했지만 구현이 실제로 읽은 Bar 범위는 놓칠 수 있다는 문제를 설명합니다. 고정된 연산자 Registry에서는 time-series 입력이 현재 timestamp에서 끝나는 trailing window로 제한되고, cross-sectional 입력은 현재 timestamp로 제한됩니다. 이 제약은 특정 미래 정보 누수를 사후 검토가 아니라 코드 생성 단계에서 차단하려는 설계적 접근을 보여줍니다.
AQuA 논문의 동일한 본문 발췌로, 정보 누수 사례와 제한된 인과 연산자 설계를 담고 있습니다.
용어 해설
- 인과 연산자(Causal Operator)
- — 현재 시점 이전의 제한된 시간 창이나 현재 시점의 단면 데이터만 읽도록 정의된 연산자입니다. 여러 연산자를 조합해도 미래 정보가 입력되는 구성을 사양 단계에서 배제하는 역할을 합니다.
- 정보 누수(Information Leakage)
- — 모델이나 Feature가 예측 시점 이후의 데이터를 계산에 포함하는 오류입니다. 이 글에서는 미래 거래량이 포함된 종일 분모가 성능을 부풀리고 재분할 평가에서 사라지는 원인으로 제시됩니다.
- 연산자 언어(Operator Language)
- — 에이전트가 Feature나 Factor 코드를 자유롭게 작성하는 대신 허용된 연산자만 조합하도록 제한하는 사양 공간입니다. 표현력을 줄이는 대신 일부 잘못된 연산 자체를 생성할 수 없게 만듭니다.
- 홀드아웃 정보계수(Held-out Information Coefficient)
- — 학습이나 개발에 사용하지 않은 평가 구간에서 Feature와 목표값의 연관성을 측정하는 지표입니다. 비교 가능한 price-volume Feature보다 비정상적으로 높고 재분할 뒤 유지되지 않으면 누수 가능성을 점검해야 합니다.
- 시간적 데이터 접근 범위(Temporal Footprint)
- — 연산이 실제로 읽은 시점과 데이터 구간의 흔적을 뜻합니다. 경제적 의미가 과거 거래량 비율처럼 보여도 구현이 종일 데이터를 읽었다면 설명만으로는 잘못된 시간 범위를 잡아내기 어렵습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.