본문으로 건너뛰기

AI가 교과서를 더 잘 쓰려면 얼마나 걸릴까?

LLM은 지식을 많이 알지만 장문 교과서로 엮는 능력은 아직 인간의 통찰에 크게 의존합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

저자는 LLM이 수학과 코드처럼 검증 가능한 작업에서는 빠르게 발전했지만, 장문 논픽션 글쓰기에서는 개별 문장을 넘어 지식을 일관된 구조로 조직하는 능력이 정체되어 있다고 평가합니다. Reinforcement Learning from Human Feedback 교과서를 집필하며 GPT 5.5 Pro와 Claude Code를 교정, 형식 정리, 원고 동기화에 활용했지만, 핵심 구성과 연구의 의미를 만드는 부분은 인간의 통찰과 감각에 의존했습니다. 현재 AI가 절약하는 노력은 10~20% 수준이며, 2~5년 뒤에도 최고의 교과서는 인간이 주도적으로 제작할 가능성이 큽니다. 모델이 장문을 더 잘 쓰려면 충분한 계획과 반복 검토, 평가 모델의 피드백을 거쳐야 하지만, 이런 절차만으로 열린 문제의 구조화 능력까지 해결되지는 않습니다.

섹션별 상세

저자는 창의적이고 개성이 강한 글쓰기와 달리 논픽션 글쓰기가 LLM의 발전으로 빠르게 해결될 영역이라고 예상했지만, 장문 기술 글쓰기의 품질은 기대만큼 나아지지 않았다고 말합니다. 현재 모델은 개별 문장, 수식, 그림처럼 검증 가능한 단위를 만들거나 고치는 데 강하지만, 여러 단위를 하나의 일관된 장으로 묶을 때 혼란스러운 표현과 개념 오류를 낳습니다. 지식의 배열은 통찰을 만들기 위한 압축 과정인데, 장문 논픽션에서 모델이 오히려 정보의 엔트로피를 높인다는 것이 저자의 핵심 판단입니다. 이 한계는 모델이 폭넓은 과학 문제를 자율적으로 해결하려면 먼저 이미 확립된 지식부터 일관되게 조직해야 한다는 점에서 중요합니다.
근거
  • 현재 LLM은 장문 기술 글쓰기에서 개별 문장보다 전체 장의 구성과 개념 연결에 더 큰 어려움을 겪습니다. 본문의 장문 기술 글쓰기 평가 문단과 문장·수식·그림 단위 처리에 관한 비교
저자는 Reinforcement Learning from Human Feedback 교과서를 집필하면서 LLM을 LaTeX 수식의 형식 정리, 광범위한 교정, TikZ와 Python을 이용한 도식 제작에 활용했습니다. GPT 5.5 Pro는 200~300쪽에 이르는 원고에서 사람이 놓치기 쉬운 세부 오탈자를 찾는 데 유용했고, Claude models는 작업의 의도를 파악해 더 나은 편집 제안을 내놓았습니다. 반면 장 전체를 생성하게 하면 문장마다 작은 오류가 쌓이면서 구성과 개념 연결이 흐려졌습니다. 저자는 이런 도구 활용으로 실질적인 순가치를 얻었지만, 책의 핵심 주장과 서론·실험·결론처럼 연구의 의미를 만드는 부분은 직접 작성해야 했다고 봅니다.
근거
  • GPT 5.5 Pro는 200~300쪽 원고에서 세부 오탈자를 찾는 데 유용했고, Claude models는 편집자로서 더 나은 감각과 제안을 제공했습니다. 교과서 원고를 GPT 5.5 Pro와 Claude models로 교정한 경험을 서술한 문단
현재 모델이 잘하는 일과 장문 생성이 어려운 일의 차이는 검증 가능성과 문맥 범위에서 뚜렷하게 나타납니다. 버그 찾기, 특정 수학 문제 풀이, 문장 교정처럼 입력과 출력의 범위가 좁고 결과를 확인할 수 있는 작업에서는 모델의 능력이 강하지만, 열린 조건에서 전체 글의 목적과 구조를 정한 뒤 내용을 생성하는 작업에서는 약합니다. 저자는 수학과 코드에서 RLVR이 누적 오류를 줄인 것처럼, 글쓰기에도 강력한 검증 신호가 필요하지만 현재는 그런 학습 데이터와 평가 체계가 부족하다고 봅니다. 더 큰 모델이 세계 지식을 많이 보유하면 작은 오류는 줄어들겠지만, 그 지식을 장문 구조로 활용하는 능력까지 같은 속도로 발전한다고 기대하기는 어렵습니다.
저자는 AI가 비전문가의 글을 완전히 대체하기보다 전문가가 지식을 더 많이 공유하도록 돕는 편집·변환 도구로 자리 잡을 가능성이 크다고 전망합니다. AI는 배경 자료, 반복적인 관련 연구 문단, 강의 슬라이드 초안처럼 이미 정해진 지식을 다른 형식으로 바꾸는 작업에서 효율을 내지만, 새로운 지식의 뼈대와 서사를 만드는 초기 구성 단계에서는 인간의 통찰과 감각이 필요합니다. 현재 AI가 절약하는 노력은 전체의 10~20% 수준이며, 저자는 2~5년 뒤에도 최고의 교과서는 인간이 강하게 개입한 형태로 남을 것으로 예상합니다. 동시에 사람들이 평균적으로 논픽션 글쓰기에 쓰는 노력이 줄어들면 양질의 자료를 만드는 사람이 감소할 수 있다는 사회적 위험도 지적합니다.
근거
  • AI 모델은 현재 논픽션 글쓰기 작업의 10~20% 정도를 절약할 수 있지만, 전체 노력의 대부분을 대체하지는 못합니다. 기술 글쓰기의 미래를 전망하는 대목에서 AI 활용으로 절약 가능한 노력의 비율을 언급한 문장
  • 저자는 2~5년 뒤에도 최고의 교과서가 인간의 손으로 상당 부분 제작될 것으로 예상합니다. 기술 글쓰기의 미래에 관한 전망 문단의 기간 예측
  • 모델은 검증 가능한 영역이나 많은 문맥이 주어진 작은 수정 작업에서 강하고, 열린 조건의 장문 산문 생성에서는 약합니다. 본문 결론부의 두 가지 강점과 열린 문제의 장문 생성 한계에 관한 정리
저자는 글쓰기 성능을 높이려면 모델에 짧은 지시만 내리고 즉시 결과를 받는 대신, 충분한 계획과 작업 시간을 주고 여러 평가 모델의 의견을 거치게 해야 한다고 봅니다. Claude Fable 5에 금붕어 시를 요청했을 때 모델은 최소한의 계획만 세운 뒤 자기회귀 방식으로 곧바로 시를 생성했으며, 초안을 반복 수정하는 별도의 작업 공간을 사용하지 않았습니다. 따라서 긴 글에서는 모델이 먼저 구조를 만들고, 각 단위를 검토하고, 전체 문맥을 다시 연결하는 절차가 필요합니다. 다만 이런 프롬프트와 실행 환경 개선만으로 장문 글쓰기 능력이 곱셈처럼 커지지는 않을 것이라는 판단도 함께 제시됩니다.

용어 해설

장문 논픽션 글쓰기(Long-form Non-fiction Writing)
사실과 지식을 긴 문맥 안에서 구조화하고 독자가 따라갈 수 있는 흐름으로 엮는 글쓰기입니다. 문장 단위의 정확성뿐 아니라 개념 간 연결, 전체 구성, 핵심 통찰의 전달까지 요구하므로 LLM의 지식 보유량만으로 해결하기 어렵습니다.
추론 시간 확장(Inference-time Scaling)
모델이 답변을 내놓기 전에 더 많은 추론 토큰과 검증 단계를 사용하도록 계산량을 늘리는 방식입니다. 글쓰기에서는 초안 작성, 자기 검토, 다른 평가 모델의 피드백을 반복해 결과를 개선하는 접근을 뜻하지만, 저자는 현재 효과가 제한적이라고 봅니다.
RLVR
결과를 외부 검증기로 판정할 수 있는 환경에서 강화학습을 수행하는 방법입니다. 수학이나 코드처럼 정답 확인이 쉬운 영역에서는 누적 오류를 줄이는 데 효과적이지만, 장문 글쓰기처럼 품질을 단일 기준으로 검증하기 어려운 작업에는 같은 방식의 보상이 적용되기 어렵습니다.
자기회귀 생성(Autoregressive Generation)
모델이 지금까지 생성한 토큰을 바탕으로 다음 토큰을 하나씩 예측하는 생성 방식입니다. 글 전체를 먼저 구성하고 반복적으로 고치는 대신 짧은 계획 뒤에 문장을 순차적으로 이어 가면, 장문에서 구조적 오류와 개념적 오류가 누적될 수 있습니다.

기술

  • LLM
  • GPT-3
  • GPT 4.5
  • Kimi K2
  • GPT 5.5 Pro
  • Claude Code
  • Claude Fable 5
  • RLVR
  • LaTeX
  • TikZ
  • Python
  • Markdown

활용 사례

  • LaTeX 수식과 문서 형식 정리
  • 기술 원고의 오탈자와 세부 오류 점검
  • 관련 연구와 배경 문단의 초안 작성
  • Markdown과 LaTeX 원고 동기화
  • 프로그래밍 언어용 도식 제작
  • 문장·문단을 강의 슬라이드 등 다른 형식으로 변환
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 12.수집 2026. 08. 12.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.