본문으로 건너뛰기
KDNugget조회 1

ChatGPT가 데이터 분석에서 반복한 오류

세 데이터셋 실험에서 AI는 결측값과 질문의 의미를 놓쳐 맞는 숫자로 틀린 결론을 만들었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

세 개의 소규모 데이터셋에 GPT-5.6 Terra와 GPT-5.6 Luna를 적용한 실험에서 모델은 코드 실행 자체보다 질문의 의미, 데이터 단위, 결측값의 원인을 놓치며 반복적으로 잘못된 결론을 냈습니다. 주문일부터 도착일까지가 아닌 출고일부터 도착일까지를 평균 내 배송 시간을 2.6일로 축소했고, 실행하지 않은 코드에서 50건과 28건을 만들어냈으며, 아직 배송되지 않은 주문을 제외해 배송 속도가 빨라진 것처럼 만들었습니다. 올림픽 선수 데이터에서는 키가 비어 있는 226개 행을 조용히 제외해 126개 행만 비교했지만, 결측값을 바로잡는 대신 별도의 검증 과정이 0.7cm 차이와 상관관계를 새로 만들어냈습니다. 따라서 두 번째 검증 과정은 산술 오류를 줄이는 데는 유용하지만, 숫자가 어떤 질문과 관측 단위에서 나왔는지 확인하는 판단까지 대신하지 못합니다.

섹션별 상세

01
배송 시간을 묻는 질문에 모델은 shipped_date와 delivered_date의 차이를 계산해 평균 2.6일을 냈지만, 고객이 실제로 기다린 시간은 ordered_date부터 delivered_date까지인 6.09일입니다. 두 계산 모두 Pandas에서 오류 없이 실행되므로 잘못된 날짜 열을 선택했다는 문제는 예외나 자료형 검사로 잡히지 않습니다. 창고 처리 시간을 묻는지 고객의 주문 후 대기 시간을 묻는지 먼저 구분하고 계산식의 열 이름을 대조해야 숫자의 의미가 뒤바뀌지 않습니다.
python
df['delivery_days'] = (df['delivered_date'] - df['shipped_date']).dt.days
print(f"Avg delivery: {df['delivery_days'].mean():.1f} days")

출고일부터 배송 완료일까지의 ship-to-door 평균 일수를 계산하는 코드입니다.

python
order_to_door = (df['delivered_date'] - df['ordered_date']).dt.days
print(round(order_to_door.mean(), 2))

주문일부터 배송 완료일까지 고객이 기다린 order-to-door 평균 일수를 계산하는 코드입니다.

02
shipment_tracking의 배송 완료 건수 22건은 코드 출력과 일치했지만, 모델은 파일에 없는 50건의 주문과 28건의 미배송 건수를 함께 적었습니다. 50에서 22를 빼면 28이 되기 때문에 문장 안의 산술은 맞아 보였지만, 실제 파일은 40행이고 미배송 행은 18개였습니다. regional_sales에서도 실행하지 않은 코드 아래에 APAC 매출을 3.68M달러와 전체 매출의 32%로 적었으나, 실제 합계는 단위가 없는 3675.49이고 비중은 30.4%였으며, 지역별 행 중복과 연도 수 차이까지 확인해야 순위를 해석할 수 있습니다.
python
print(len(df), df['delivered_date'].notna().sum(), df['delivered_date'].isna().sum())

전체 행 수와 배송 완료일이 존재하거나 비어 있는 행 수를 세는 코드입니다.

python
print(round(df.groupby('region_name')['sales'].sum()['apac'], 2))

지역별 매출을 합산한 뒤 APAC의 총매출을 출력하는 코드입니다.

03
배송 추세를 비교할 때 모델은 1주차 평균 3.17일과 3주차 평균 1.00일을 근거로 처리 속도가 빨라졌다고 판단했습니다. 그러나 파일이 1월 21일에 끝나 3주차 주문에는 약 3일밖에 관측 시간이 없었고, 3주차 주문 10건 중 7건은 아직 배송 완료일이 비어 있었습니다. 미해결 주문 비율이 20%에서 70%로 늘어나는 동안 완료된 빠른 주문만 평균에 남았으므로, 결측값이 무엇을 뜻하는지 확인하지 않으면 미완료 사례가 만든 검열을 개선 추세로 오인하게 됩니다.
python
df['week'] = df['ordered_date'].dt.isocalendar().week
print(df.groupby('week').agg( orders=('order_id', 'size'), delivered=('delivered_date', 'count'), avg_days=('delivery_days', 'mean')).round(2))

주차별 주문 수, 배송 완료 수, 평균 배송 일수를 함께 집계하는 코드입니다.

04
olympics_athletes_events에서 메달리스트와 비메달리스트의 평균 키는 각각 176.5cm와 176.2cm였지만, 이 비교에는 전체 352행 중 키가 기록된 126행만 들어갔습니다. 나머지 226개 결측 행은 Pandas의 평균 계산에서 자동으로 빠졌고, 키가 기록된 선수의 메달 획득률은 54%, 기록이 없는 선수는 23%였으며 카이제곱 검정 p값은 9e-09였습니다. 2016년 이후 50행은 모두 키가 있지만 2016년 이전 302행 중 키가 있는 행은 76개뿐이므로, 이 파일만으로 키 자체가 메달 획득을 돕는다고 결론 내릴 수 없습니다.
05
자체 검증 과정은 배송 데이터의 50을 40으로, 28을 18로 고쳤지만 출고 후 배송 시간과 주문 후 대기 시간을 혼동한 오류와 미완료 주문으로 만든 추세는 그대로 승인했습니다. 올림픽 데이터에서는 별도의 행 단위 오류를 35.4%로 바로잡았지만, 226개 결측 키를 놓친 채 서로 다른 집계 방식을 섞어 176.4cm와 175.5cm라는 비교값을 만들고 결론을 반대로 바꾸었습니다. 네 번의 오류는 화면에 출력된 숫자만으로는 잡기 어려웠으며, 두 번째 검증은 산술 확인에는 쓸 수 있어도 질문의 의미와 누락된 관측치가 결과에 미치는 판단까지 대신하지 못합니다.

이미지 분석

네 가지 AI 데이터 분석 오류를 모델의 보고값과 파일이 실제로 말하는 값으로 나란히 비교한 표입니다.
Infographic

표는 출고일부터 도착일까지 계산한 2.6일과 주문일부터 도착일까지의 6.09일 차이, 실행되지 않은 코드에서 나온 주문 수와 APAC 매출, 미도착 주문을 제외한 추세, 226개 결측 키를 각각 비교합니다. 본문에서 설명한 오류가 한 화면에 압축되어 있어 질문의 의미, 계산 실행 여부, 미완료 관측치, 결측 행 수를 별도로 확인해야 한다는 핵심을 뒷받침합니다.

네 가지 AI 데이터 분석 오류를 모델의 보고값과 파일이 실제로 말하는 값으로 나란히 비교한 표입니다.

용어 해설

데이터 단위(Data Grain)
데이터 한 행이 무엇을 의미하는지 규정하는 기준입니다. 지역별 연간 매출처럼 행 단위를 먼저 정해야 중복 행이나 여러 이벤트 기록을 같은 관측치로 잘못 합산하는 문제를 피할 수 있습니다.
결측 데이터(Missing Data)
측정값이 비어 있는 상태를 뜻합니다. 결측 행을 집계에서 제외하면 표본 수가 줄어들고, 결측이 특정 시기나 결과와 연결된 경우 실제 관계와 다른 평균이나 추세가 만들어질 수 있습니다.
검열(Censoring)
관측 기간이 끝나지 않아 일부 결과를 아직 볼 수 없는 상태입니다. 배송 데이터에서는 늦게 주문된 상품의 도착 시간이 비어 있어, 완료된 빠른 주문만 평균에 남는 방식으로 속도가 과대평가될 수 있습니다.
카이제곱 검정(Chi-Square Test)
범주형 변수 사이에 관계가 있는지 평가하는 통계 검정입니다. 이 글에서는 키 자체보다 키 기록의 존재 여부와 메달 획득 사이의 연관성이 큰지 판단하는 데 사용되며 p = 9e-09라는 결과가 제시됩니다.
선택 편향(Selection Bias)
전체 자료가 아니라 특정 조건을 만족한 관측치만 남아 결과가 한쪽으로 치우치는 현상입니다. 키가 기록된 선수나 배송이 완료된 주문만 비교하면 결측이 생긴 이유까지 반영하지 못해 잘못된 결론으로 이어집니다.

기술

  • GPT-5.6 Terra
  • GPT-5.6 Luna
  • Pandas
  • SciPy
  • SQL

활용 사례

  • 배송 시간과 배송 추세 산출
  • 지역별 매출 순위 비교
  • 스포츠 선수 특성과 메달 획득 관계 분석
  • 경영진 보고서용 AI 분석 결과 검증
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.