본문으로 건너뛰기
r/deeplearning조회 1

LLM은 단어가 아닌 토큰으로 텍스트를 처리

문장은 단어가 아니라 여러 토큰으로 쪼개져 LLM에 입력됩니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 게시물은 LLM이 사람이 읽는 단어와 동일한 단위로 텍스트를 처리하지 않는다는 점을 연결된 글과 도식으로 전달합니다. 이미지의 문장 Artificial intelligence is amazing.은 Art, ifi, cial, int, elli, gence, is, am, az, ing, .처럼 여러 Token으로 분할된 뒤 모델 입력이 됩니다. 따라서 단어 수와 Token 수는 일치하지 않으며, LLM의 입력 길이와 처리 방식을 이해하려면 Tokenization을 기준으로 봐야 합니다.

섹션별 상세

01
게시물은 LLM이 사람이 인식하는 단어 단위로 텍스트를 읽는다는 직관과 실제 입력 형식이 다르다는 점을 핵심으로 둡니다. 이미지 속 Artificial intelligence is amazing.은 단어 목록으로 모델에 들어가지 않고 Art, ifi, cial, int, elli, gence, is, am, az, ing, .으로 쪼개집니다. 이 변환 때문에 단어 수와 Token 수를 같은 값으로 취급하면 입력 길이와 모델의 텍스트 처리 방식을 잘못 계산하게 됩니다.
02
이미지는 문장, 토큰열, 모델로 이어지는 처리 흐름을 한 장에 배치합니다. 먼저 문장을 Token 단위로 분할하고, 분할 결과를 모델 입력으로 넘기는 구조입니다. 구체적인 Tokenizer 구현이나 비용 수치는 제공하지 않지만, 단어와 Token이 서로 다른 단위라는 점을 예시 문자열로 확인하게 합니다.

이미지 분석

단어와 Token이 다르다는 제목 아래 Artificial intelligence is amazing.이라는 문장이 여러 Token 조각으로 분리된 뒤 모델로 전달되는 흐름을 나타낸 도식입니다.
Diagram

이미지는 문장을 Artificial intelligence is amazing.이라는 원문 형태에서 Art, ifi, cial, int, elli, gence, is, am, az, ing, .처럼 세분화된 Token열로 바꾸는 예시를 담고 있습니다. 오른쪽의 모델 아이콘은 이 Token열이 LLM 입력으로 사용되는 처리 단계를 연결합니다. 따라서 이 이미지는 단어 수와 Token 수가 다를 수 있다는 게시물의 기술적 핵심을 직접 뒷받침합니다.

단어와 Token이 다르다는 제목 아래 Artificial intelligence is amazing.이라는 문장이 여러 Token 조각으로 분리된 뒤 모델로 전달되는 흐름을 나타낸 도식입니다.

용어 해설

토큰(Token)
LLM이 입력 텍스트를 처리할 때 사용하는 분할 단위입니다. 하나의 단어가 통째로 대응하지 않고 단어의 일부, 문자 조각, 구두점처럼 더 작은 단위로 나뉠 수 있으며, 모델은 이렇게 변환된 토큰열을 입력으로 받습니다.
토큰화(Tokenization)
문장을 LLM이 처리할 수 있는 토큰들의 배열로 쪼개는 과정입니다. 이미지의 예시에서는 Artificial intelligence is amazing.이라는 문장이 Art, ifi, cial, int, elli, gence, is, am, az, ing, .처럼 여러 조각으로 분리되어 모델 입력으로 전달됩니다.
대규모 언어 모델(Large Language Model)
텍스트를 단어의 의미 단위로 직접 읽기보다 토큰으로 변환된 입력을 바탕으로 다음 토큰을 처리하고 생성하는 모델입니다. 이미지의 흐름은 문장이 토큰열로 바뀐 뒤 모델에 들어가는 입력 전처리 구조를 나타냅니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 04.수집 2026. 09. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.