본문으로 건너뛰기

더 나은 답안, 더 폭넓은 사고

ChatGPT는 답안의 품질과 논리성을, 인과 추론 훈련은 아이디어의 다양성과 독창성을 높였으며 두 효과는 함께 나타났습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

보코니대학교와 OpenAI Economic Research는 학부 1학년생 1,000여 명을 네 그룹으로 무작위 배정해 ChatGPT(GPT‑4o) 사용과 인과 추론 훈련의 효과를 비교했습니다. ChatGPT는 5점 평가에서 거의 1점 높은 점수와 더 많은 아이디어, 명확한 논리, 전문가 답안과의 높은 유사성을 이끌었습니다. 인과 추론 훈련은 평가 기준표 점수를 높이지 않았지만 아이디어의 폭과 독창성, 아이디어가 성공하거나 실패할 조건에 대한 설명을 넓혔습니다. 두 가지를 함께 적용한 집단은 답안 품질과 아이디어 수, 다양성, 논리적 일관성 등 가장 폭넓은 항목에서 이점을 얻어 최종 답안만으로 학습을 평가하기 어려워지는 교육 현장의 과제를 드러냈습니다.

빠른 이해

새로운 점

ChatGPT 사용은 답안 품질을 높이고 인과 추론 훈련은 아이디어의 폭과 독창성을 넓히는 등 서로 다른 효과가 무작위 실험에서 분리됐습니다.

핵심 메커니즘

학생들을 네 그룹으로 무작위 배정한 뒤 실제 마케팅 과제를 수행하게 하고, ChatGPT 사용과 인과 추론 훈련을 각각 또는 함께 적용했습니다. 이후 5점 평가 기준표와 자동화된 텍스트 분석으로 답안 품질, 아이디어 수·다양성, 논리적 일관성, 인과 추론 흔적, 전문가 답안과의 유사성을 비교했습니다.

핵심 수치

  • 참여 학생 수: 1,000여 명- 보코니대학교 학부 1학년생
  • 답안 평가: 5점 척도에서 ChatGPT 사용 집단이 거의 1점 높음- 훈련된 평가자가 평가 기준표로 채점
  • 비교 집단 수: 4개 집단- ChatGPT 사용, 인과 추론 훈련, 두 가지 모두, 둘 다 없음
  • 전문가 답안 비교: 전문가 3명의 제출물과 유사성 측정- 자동화된 텍스트 분석 사용

섹션별 상세

01

ChatGPT와 인과 추론의 실험 설계

보코니대학교 학부 1학년생 1,000여 명은 대학 기념품 매장의 마케팅 방안을 만드는 실제 비즈니스 사례 과제를 수행했습니다. 연구진은 수업 시간대별로 학생들을 ChatGPT(GPT‑4o) 사용, 인과 추론 훈련, 두 가지 모두, 아무것도 제공하지 않는 네 그룹에 무작위 배정했습니다. 인과 추론 훈련은 AI 사용법이 아니라 게임·사례·질문·피드백으로 원인과 결과, 해결책의 성공 및 실패 조건을 익히는 활동으로 구성했습니다. 훈련 평가자는 5점 기준표로 결과물을 채점했고, 자동화된 텍스트 분석은 아이디어 수와 다양성, 인과 추론 흔적, 전문가 3명 답안과의 유사성을 별도로 측정했습니다.
02

ChatGPT가 높인 답안 품질

ChatGPT를 사용할 수 있었던 학생들은 5점 척도에서 그렇지 않은 학생들보다 거의 1점 높은 평가를 받았습니다. ChatGPT는 학생이 질문을 정하고 답변을 평가한 뒤 최종 내용으로 선택하는 과정에 활용되었으며, 결과물에는 더 많은 아이디어와 명확한 논리가 담겼습니다. 학생 답안은 전문가 3명이 작성한 마케팅 방안과도 더 유사해져 초보자의 결과물이 전문적으로 보이는 방향으로 이동했습니다. 따라서 효과의 근거는 단순한 대필이 아니라 질문·평가·선택을 거쳐 출력물을 과제에 맞게 조합한 사용 과정에서 확인됐습니다.
03

인과 추론 훈련이 넓힌 아이디어

인과 추론 활동을 마친 학생들은 자신의 아이디어가 효과를 낼 이유와 실패할 상황을 더 분명하게 설명했습니다. 다만 대학 매장의 인지도와 이용률을 높이는 두 가지 표준 마케팅 목표만 채점한 기준표에서는 더 높은 점수를 얻지 못했습니다. 자동화된 텍스트 분석으로 범위를 넓혀 보자 활동 집단은 전체적으로 더 폭넓은 아이디어를 냈고, 다른 학생들의 아이디어와 겹치지 않는 정도도 높았습니다. 이는 완성도와 체계성에 초점을 둔 기준표가 독창적인 접근의 차이를 놓칠 수 있음을 뜻합니다.
04

두 개입의 상호 보완 효과

ChatGPT 사용과 인과 추론 활동을 함께 받은 학생들은 두 집단의 강점을 동시에 나타냈습니다. 이들의 아이디어 다양성은 인과 추론 활동만 받은 학생들과 비슷했고, 평가 점수와 아이디어 수는 ChatGPT만 사용한 학생들과 비슷했습니다. 동시에 논리적 일관성이 더 높았으며, 설명을 찾고 전제에 의문을 제기한 흔적도 더 많이 나타났습니다. 무작위 배정으로 개별 개입과 결합 개입을 비교한 결과, AI 활용은 답안의 완성도와 구조를 보강하고 추론 훈련은 사고의 폭과 독창성을 넓히는 방식으로 서로 보완했습니다.
05

최종 답안 중심 평가의 한계

AI를 활용해 완성도 높고 전문가 수준에 가까운 답안을 만들 수 있으면 최종 결과물만으로 학생의 실제 이해도를 판단하기 어려워집니다. 이번 실험에서 기준표 점수와 텍스트 분석 결과가 달랐던 이유는 전자가 목표 충족과 체계성을 중심으로 평가하고 후자가 아이디어의 수와 차별성까지 측정했기 때문입니다. 연구 결과는 학교가 전형적인 정답과 완성도뿐 아니라 독창성, 추론, 여러 접근 방식을 고려한 흔적에도 가치를 부여해야 함을 시사합니다. ChatGPT 활용 능력과 스스로 사고하는 능력을 양자택일로 나누기보다 두 역량을 함께 기르는 평가 구성이 필요하다는 결론으로 이어집니다.

용어 해설

인과 추론(Causal Reasoning)
인과 추론은 어떤 현상의 원인과 결과를 연결하고, 특정 해결책이 효과를 내거나 실패할 조건을 따지는 사고 방식입니다. 이 실험에서는 게임·사례·질문·피드백을 활용한 활동으로 학생들이 아이디어의 작동 이유와 실패 상황을 함께 생각하도록 했습니다.
무작위 실험(Randomized Experiment)
무작위 실험은 참여자를 우연에 따라 여러 집단에 배정해 특정 개입의 효과를 비교하는 연구 설계입니다. 이 연구에서는 수업 시간대별로 학생들을 네 그룹에 나누어 ChatGPT 사용과 인과 추론 훈련의 개별 효과 및 결합 효과를 구분했습니다.
자동화된 텍스트 분석(Automated Text Analysis)
자동화된 텍스트 분석은 제출물에 포함된 언어적 특징을 컴퓨터로 측정하는 방법입니다. 연구진은 이를 사용해 아이디어의 수와 다양성, 인과 추론의 흔적, 전문가 3명의 결과물과 학생 답안 사이의 유사성을 비교했습니다.
평가 기준표(Evaluation Rubric)
평가 기준표는 결과물을 미리 정한 항목과 점수 범위에 따라 일관되게 평가하는 도구입니다. 이 실험에서는 5점 척도를 사용했지만, 답안의 완성도와 목표 충족 정도는 포착한 반면 다른 학생과 구별되는 독창성은 충분히 포착하지 못했습니다.
논리적 일관성(Logical Consistency)
논리적 일관성은 아이디어와 근거, 결론이 서로 충돌하지 않고 하나의 흐름으로 연결되는 정도입니다. 연구에서 ChatGPT를 사용한 학생들의 답안은 더 많은 아이디어를 포함하면서도 논리 전개가 명확해졌고, 인과 추론 훈련과 결합했을 때 전제에 의문을 제기하는 흔적도 늘었습니다.

기술

  • ChatGPT
  • GPT‑4o
  • 자동화된 텍스트 분석

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 02.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.