TL;DR
이 게시물은 LLM이 사람이 읽는 단어와 동일한 단위로 텍스트를 처리하지 않는다는 점을 연결된 글과 도식으로 전달합니다. 이미지의 문장 Artificial intelligence is amazing.은 Art, ifi, cial, int, elli, gence, is, am, az, ing, .처럼 여러 Token으로 분할된 뒤 모델 입력이 됩니다. 따라서 단어 수와 Token 수는 일치하지 않으며, LLM의 입력 길이와 처리 방식을 이해하려면 Tokenization을 기준으로 봐야 합니다.
섹션별 상세
이미지 분석

이미지는 문장을 Artificial intelligence is amazing.이라는 원문 형태에서 Art, ifi, cial, int, elli, gence, is, am, az, ing, .처럼 세분화된 Token열로 바꾸는 예시를 담고 있습니다. 오른쪽의 모델 아이콘은 이 Token열이 LLM 입력으로 사용되는 처리 단계를 연결합니다. 따라서 이 이미지는 단어 수와 Token 수가 다를 수 있다는 게시물의 기술적 핵심을 직접 뒷받침합니다.
단어와 Token이 다르다는 제목 아래 Artificial intelligence is amazing.이라는 문장이 여러 Token 조각으로 분리된 뒤 모델로 전달되는 흐름을 나타낸 도식입니다.
용어 해설
- 토큰(Token)
- — LLM이 입력 텍스트를 처리할 때 사용하는 분할 단위입니다. 하나의 단어가 통째로 대응하지 않고 단어의 일부, 문자 조각, 구두점처럼 더 작은 단위로 나뉠 수 있으며, 모델은 이렇게 변환된 토큰열을 입력으로 받습니다.
- 토큰화(Tokenization)
- — 문장을 LLM이 처리할 수 있는 토큰들의 배열로 쪼개는 과정입니다. 이미지의 예시에서는 Artificial intelligence is amazing.이라는 문장이 Art, ifi, cial, int, elli, gence, is, am, az, ing, .처럼 여러 조각으로 분리되어 모델 입력으로 전달됩니다.
- 대규모 언어 모델(Large Language Model)
- — 텍스트를 단어의 의미 단위로 직접 읽기보다 토큰으로 변환된 입력을 바탕으로 다음 토큰을 처리하고 생성하는 모델입니다. 이미지의 흐름은 문장이 토큰열로 바뀐 뒤 모델에 들어가는 입력 전처리 구조를 나타냅니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.