TL;DR
LLM이 'strawberry'의 철자를 틀리는 이유는 텍스트를 글자 단위가 아닌 토큰 단위로 처리하기 때문이다. 모델은 텍스트를 토큰으로 압축하여 학습된 통계적 기억에 의존하므로, 개별 글자를 시각적으로 인식하지 못한다. 글자 사이에 공백을 삽입하여 각 글자를 별도 토큰으로 처리하게 만들면 모델이 철자를 정확히 셀 수 있다.
챕터별 상세
AI의 철자 오류 현상
토큰화 메커니즘
토큰화(Tokenization)는 텍스트 데이터를 모델이 이해할 수 있는 숫자 단위인 토큰으로 변환하는 과정이다.
통계적 기억에 의존하는 철자 처리
공백 삽입을 통한 문제 해결
용어 해설
- 토큰화(Tokenization)
- — 텍스트를 모델이 처리할 수 있는 최소 단위인 토큰으로 분할하는 과정이다. LLM은 이 토큰들의 통계적 패턴을 학습하므로 개별 글자 정보를 직접 인식하지 못한다.
- 거대언어모델(LLM)
- — 방대한 텍스트 데이터를 학습하여 자연어를 이해하고 생성하는 인공지능 모델이다. 텍스트를 토큰 단위로 처리하는 아키텍처를 기반으로 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



