TL;DR
세 개의 소규모 데이터셋에 GPT-5.6 Terra와 GPT-5.6 Luna를 적용한 실험에서 모델은 코드 실행 자체보다 질문의 의미, 데이터 단위, 결측값의 원인을 놓치며 반복적으로 잘못된 결론을 냈습니다. 주문일부터 도착일까지가 아닌 출고일부터 도착일까지를 평균 내 배송 시간을 2.6일로 축소했고, 실행하지 않은 코드에서 50건과 28건을 만들어냈으며, 아직 배송되지 않은 주문을 제외해 배송 속도가 빨라진 것처럼 만들었습니다. 올림픽 선수 데이터에서는 키가 비어 있는 226개 행을 조용히 제외해 126개 행만 비교했지만, 결측값을 바로잡는 대신 별도의 검증 과정이 0.7cm 차이와 상관관계를 새로 만들어냈습니다. 따라서 두 번째 검증 과정은 산술 오류를 줄이는 데는 유용하지만, 숫자가 어떤 질문과 관측 단위에서 나왔는지 확인하는 판단까지 대신하지 못합니다.
섹션별 상세
df['delivery_days'] = (df['delivered_date'] - df['shipped_date']).dt.days
print(f"Avg delivery: {df['delivery_days'].mean():.1f} days")출고일부터 배송 완료일까지의 ship-to-door 평균 일수를 계산하는 코드입니다.
order_to_door = (df['delivered_date'] - df['ordered_date']).dt.days
print(round(order_to_door.mean(), 2))주문일부터 배송 완료일까지 고객이 기다린 order-to-door 평균 일수를 계산하는 코드입니다.
print(len(df), df['delivered_date'].notna().sum(), df['delivered_date'].isna().sum())전체 행 수와 배송 완료일이 존재하거나 비어 있는 행 수를 세는 코드입니다.
print(round(df.groupby('region_name')['sales'].sum()['apac'], 2))지역별 매출을 합산한 뒤 APAC의 총매출을 출력하는 코드입니다.
df['week'] = df['ordered_date'].dt.isocalendar().week
print(df.groupby('week').agg( orders=('order_id', 'size'), delivered=('delivered_date', 'count'), avg_days=('delivery_days', 'mean')).round(2))주차별 주문 수, 배송 완료 수, 평균 배송 일수를 함께 집계하는 코드입니다.
이미지 분석

표는 출고일부터 도착일까지 계산한 2.6일과 주문일부터 도착일까지의 6.09일 차이, 실행되지 않은 코드에서 나온 주문 수와 APAC 매출, 미도착 주문을 제외한 추세, 226개 결측 키를 각각 비교합니다. 본문에서 설명한 오류가 한 화면에 압축되어 있어 질문의 의미, 계산 실행 여부, 미완료 관측치, 결측 행 수를 별도로 확인해야 한다는 핵심을 뒷받침합니다.
네 가지 AI 데이터 분석 오류를 모델의 보고값과 파일이 실제로 말하는 값으로 나란히 비교한 표입니다.
용어 해설
- 데이터 단위(Data Grain)
- — 데이터 한 행이 무엇을 의미하는지 규정하는 기준입니다. 지역별 연간 매출처럼 행 단위를 먼저 정해야 중복 행이나 여러 이벤트 기록을 같은 관측치로 잘못 합산하는 문제를 피할 수 있습니다.
- 결측 데이터(Missing Data)
- — 측정값이 비어 있는 상태를 뜻합니다. 결측 행을 집계에서 제외하면 표본 수가 줄어들고, 결측이 특정 시기나 결과와 연결된 경우 실제 관계와 다른 평균이나 추세가 만들어질 수 있습니다.
- 검열(Censoring)
- — 관측 기간이 끝나지 않아 일부 결과를 아직 볼 수 없는 상태입니다. 배송 데이터에서는 늦게 주문된 상품의 도착 시간이 비어 있어, 완료된 빠른 주문만 평균에 남는 방식으로 속도가 과대평가될 수 있습니다.
- 카이제곱 검정(Chi-Square Test)
- — 범주형 변수 사이에 관계가 있는지 평가하는 통계 검정입니다. 이 글에서는 키 자체보다 키 기록의 존재 여부와 메달 획득 사이의 연관성이 큰지 판단하는 데 사용되며 p = 9e-09라는 결과가 제시됩니다.
- 선택 편향(Selection Bias)
- — 전체 자료가 아니라 특정 조건을 만족한 관측치만 남아 결과가 한쪽으로 치우치는 현상입니다. 키가 기록된 선수나 배송이 완료된 주문만 비교하면 결측이 생긴 이유까지 반영하지 못해 잘못된 결론으로 이어집니다.
기술
- GPT-5.6 Terra
- GPT-5.6 Luna
- Pandas
- SciPy
- SQL
활용 사례
- 배송 시간과 배송 추세 산출
- 지역별 매출 순위 비교
- 스포츠 선수 특성과 메달 획득 관계 분석
- 경영진 보고서용 AI 분석 결과 검증
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
