본문으로 건너뛰기

그라운딩된 LLM의 시간 잠금 주가 예측 실험 결과와 보정성 문제 공유

Gemini 2.5 Flash를 검색 그라운딩해 90일간 10거래일 주가 예측을 실행한 결과 전반적 ECE가 0.217로 측정되었고 고신뢰 구간에서 정확도가 급락하는 현상이 관찰되었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Gemini 2.5 Flash를 Google Search로 그라운딩해 매일 10거래일 주가 방향·감성·신뢰도·추론흔적을 출력하는 파이프라인을 2026-02-17부터 2026-05-19까지 90일 이상 운용했고 결과와 데이터는 공개했다. 전체 Expected Calibration Error는 0.217로 계산되었고 특히 0.8–0.9 신뢰도 구간에서 정확도가 약 28%로 급락하는 패턴이 관찰되어 신뢰도 구간 기반 보정 필요성이 드러났다. 하향 리스크를 유도하는 프롬프트를 적용하면 모델이 과도하게 하향 예측을 내는 경향이 관찰되었고 'phantom pivot' 탐지기는 고거래량 종목에서 약 50%의 상한을 보였기에 프롬프트 유도 편향과 모델 고유 성향을 분리하는 추가 실험이 필요하다.

섹션별 상세

01
프로젝트는 외부 검색으로 그라운딩된 LLM에게 매일 10거래일간의 주가 방향·감성·신뢰도·추론흔적을 출력하도록 구성된 파이프라인으로 운영되었다. 구체적 구성은 Gemini 2.5 Flash 모델을 Google Search로 그라운딩하고 temperature를 0.2로 설정해 예측을 생성하는 방식이며 예측 결과는 시간 잠금(falsifiable, time-locked) 테스트로 저장되었다. 이 파이프라인은 2026-02-17부터 2026-05-19까지 90일 이상 연속 운용되었고 결과와 대시보드, 방법론은 공개 링크를 통해 접근 가능하다.
02
주요 관측은 모델이 자신감이 높을 때 오히려 오류를 더 많이 범하는 경향이었으며 전체 Expected Calibration Error가 0.217로 측정되었다는 점이다. 기술적으로는 예측 확률을 신뢰도 구간으로 나눈 후 각 구간의 실제 정확도를 비교해 ECE를 산출했고 0.8–0.9 신뢰도 구간에서 정확도가 약 28%로 급락하는 현상이 나타났다. 해당 구간의 표본 수가 작아 통계적 확증은 약하다고 명시되었지만 반복 관찰되는 패턴으로 주목할 만하다고 판단되었다.
03
프롬프트 설계가 모델 예측 성향에 미치는 영향을 확인하기 위해 하향 리스크 프레이밍을 명시적으로 적용한 실험이 병행되었고 그 결과 모델이 과도하게 하향 예측을 출력하는 쪽으로 치우쳤다. 구체적 관측치는 'Down' 예측이 약 400회였고 실제 하향 레이블은 약 300회였으며 이 차이가 프롬프트 유도 편향인지 모델의 본성인지를 아직 분리하지 못한 상태이다. 작성자는 이 원인 분리를 위해 방법론 공유를 요청했고 프롬프트/모델 성향 분리를 위한 추가 실험이 필요하다고 결론지었다.
04
추가적으로 'phantom pivot' 탐지기가 도입되어 모델이 가정한 추세 전환이 발생하지 않았을 때 이를 플래그하도록 설계되었는데 고거래량 종목에서 이 탐지기가 약 50% 상한을 보이는 현상이 관찰되었다. 이 값이 모델 행동의 고유한 한계인지 탐지 임계값 설정의 아티팩트인지는 아직 불명이며, 개별 티커별 표본 수 불균형과 추적 중단이 전역 지표에 영향을 미친다고 작성자가 명시해 결과 해석 시 주의가 필요하다. 따라서 현상 재현과 임계값 민감도 분석이 다음 단계 과제로 남아 있다.

용어 해설

기대 보정 오차(Expected Calibration Error (ECE))
모델의 예측 확률과 실제 정답 비율 간 차이를 수치화한 지표이다. 입력을 여러 신뢰도 구간으로 나누어 각 구간의 평균 예측 신뢰도와 실제 정확도 차이를 가중평균해 계산하며 낮을수록 예측 확률이 실제 성공률과 일치함을 뜻한다. 확률적 판단의 신뢰도를 평가해 신뢰도 기반 의사결정에서 유용하다.
검색 기반 그라운딩(Search grounding)
실시간 검색 결과를 모델 입력에 포함해 모델 출력이 최신 정보에 기반하도록 하는 방식이다. 질의에 대해 외부 웹 검색을 수행해 관련 문서·요약을 컨텍스트로 주입하고 이를 토대로 응답을 생성하거나 예측을 수행한다. 시시각각 변하는 도메인에서 모델의 사실성 유지와 시간 잠금 예측 평가에 중요하다.
프롬프트 유도 편향(Prompt-induced bias)
프롬프트의 문구·프레이밍이 모델 출력의 성향을 체계적으로 왜곡하는 현상이다. 동일 입력 데이터라도 위험회피·낙관·부정적 프레이밍에 따라 예측 방향이나 확률 분포가 치우치며, 모델 고유 성향과 구분하기 위해 대조 실험이 필요하다. 예측 기반 어플리케이션에서 의사결정 신뢰도에 직접적 영향을 미친다.
신뢰도 구간화(Confidence binning)
예측 확률을 여러 구간으로 나누어 각 구간 내 실제 정확도를 계산하는 방법이다. 구간별 정확도와 평균 예측 신뢰도의 차이를 통해 보정 필요성을 확인하며 ECE 산출의 기초가 된다. 모델의 과신·과소신 영역을 식별해 후속 보정이나 의사결정 정책 설계에 활용된다.

코드 예제

text
null

null

언급된 도구

Gemini 2.5 Flash중립

검색 그라운딩을 적용한 원격 추론을 통해 일별·시간 잠금된 주가 예측을 생성하는 데 사용된 모델 및 추론 인터페이스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 15.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.