TL;DR
작성자는 Gemini 2.5 Flash를 Google Search로 그라운딩해 매일 10거래일 주가 방향·감성·신뢰도·추론흔적을 출력하는 파이프라인을 2026-02-17부터 2026-05-19까지 90일 이상 운용했고 결과와 데이터는 공개했다. 전체 Expected Calibration Error는 0.217로 계산되었고 특히 0.8–0.9 신뢰도 구간에서 정확도가 약 28%로 급락하는 패턴이 관찰되어 신뢰도 구간 기반 보정 필요성이 드러났다. 하향 리스크를 유도하는 프롬프트를 적용하면 모델이 과도하게 하향 예측을 내는 경향이 관찰되었고 'phantom pivot' 탐지기는 고거래량 종목에서 약 50%의 상한을 보였기에 프롬프트 유도 편향과 모델 고유 성향을 분리하는 추가 실험이 필요하다.
주요 논점
시간 잠금된 예측을 통해 모델의 암기 기반 성능과 일반화 성능을 분리할 수 있으며 이는 모델 신뢰도 평가에 실용적이라는 주장으로, 장기간 연속 운용과 공개 데이터셋 제공을 근거로 제시되었다.
프롬프트 유도와 모델 고유 성향의 영향이 혼재되어 있어 단일 실험만으로 원인을 확정할 수 없다는 입장으로, 작성자는 현재까지의 수치(예: 'Down' 400회 vs 실제 300회)를 근거로 더 정교한 분리 방법을 요청하고 있다.
합의점 vs 논쟁점
합의점
- 실험은 Gemini 2.5 Flash를 검색 그라운딩해 운영했고 결과와 데이터셋을 공개했다.
- 모델 신뢰도와 실제 정확도 사이에 눈에 띄는 불일치가 존재하며 보정 또는 추가 검증이 필요하다는 점에는 동의가 이뤄지고 있다.
논쟁점
- 고신뢰 구간에서 정확도가 급락하는 현상이 샘플 수 부족에 기인한 통계적 변동인지 모델의 구조적 문제인지에 대한 해석이 분분하다.
- 프롬프트를 통한 하향 리스크 유도와 모델 자체의 낙관성 중 어느 쪽이 예측 편향의 주원인인지에 대한 의견이 갈린다.
섹션별 상세
용어 해설
- Expected Calibration Error (ECE)
- — 모델의 예측 확률과 실제 정답 비율 간 차이를 수치화한 지표이다. 입력을 여러 신뢰도 구간으로 나누어 각 구간의 평균 예측 신뢰도와 실제 정확도 차이를 가중평균해 계산하며 낮을수록 예측 확률이 실제 성공률과 일치함을 뜻한다. 확률적 판단의 신뢰도를 평가해 신뢰도 기반 의사결정에서 유용하다.
- Search grounding
- — 실시간 검색 결과를 모델 입력에 포함해 모델 출력이 최신 정보에 기반하도록 하는 방식이다. 질의에 대해 외부 웹 검색을 수행해 관련 문서·요약을 컨텍스트로 주입하고 이를 토대로 응답을 생성하거나 예측을 수행한다. 시시각각 변하는 도메인에서 모델의 사실성 유지와 시간 잠금 예측 평가에 중요하다.
- Prompt-induced bias
- — 프롬프트의 문구·프레이밍이 모델 출력의 성향을 체계적으로 왜곡하는 현상이다. 동일 입력 데이터라도 위험회피·낙관·부정적 프레이밍에 따라 예측 방향이나 확률 분포가 치우치며, 모델 고유 성향과 구분하기 위해 대조 실험이 필요하다. 예측 기반 어플리케이션에서 의사결정 신뢰도에 직접적 영향을 미친다.
- Confidence binning
- — 예측 확률을 여러 구간으로 나누어 각 구간 내 실제 정확도를 계산하는 방법이다. 구간별 정확도와 평균 예측 신뢰도의 차이를 통해 보정 필요성을 확인하며 ECE 산출의 기초가 된다. 모델의 과신·과소신 영역을 식별해 후속 보정이나 의사결정 정책 설계에 활용된다.
코드 예제
nullnull
언급된 도구
검색 그라운딩을 적용한 원격 추론을 통해 일별·시간 잠금된 주가 예측을 생성하는 데 사용된 모델 및 추론 인터페이스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.