한 문장에서 숫자 배열까지: AI는 Token을 어떻게 만들까?
요약
Tokenizer가 텍스트를 Token으로 나누고 ID로 매핑해 모델에 입력한 뒤, 답변을 하나씩 생성하는 전체 과정을 언어 차이와 컨텍스트 제한까지 설명합니다.
사용자가 입력한 문장을 AI는 글자로 보지 않는다
AI 사용은 매우 단순해 보입니다. 다음과 같이 입력합니다.
“고객에게 보낼 영문 이메일을 써 줘.”
AI는 이렇게 답합니다.
“Dear Customer...”
사람이 말하면 AI가 이해하고 대답하는 것처럼 보입니다. 하지만 내부에서는 복잡한 변환이 진행됩니다. AI는 사람처럼 글을 직접 읽지 않습니다. 내용이 대규모 언어 모델에 들어가기 전에 다음 과정을 거칩니다.
텍스트 → Token → 숫자 → 모델 계산
Token은 인간의 언어와 AI 모델을 잇는 다리입니다.
1. 사람은 글자를 보고, AI는 숫자를 받는다
사람은 왜 문장을 이해할 수 있을까?
예를 들어:
“사과는 맛있다.”
사람은 사과가 먹을 수 있는 과일이고, “맛있다”가 평가이며, 문장 전체가 경험을 표현한다는 사실을 자연스럽게 이해합니다. 이는 뇌가 오랫동안 축적한 지식과 경험 덕분입니다.
컴퓨터는 다릅니다. 기본 능력은 숫자를 처리하는 것이며, “사과”가 본래 과일을 뜻한다고 알지 못합니다. 대규모 언어 모델은 인간의 언어를 기계가 계산할 수 있는 정보로 먼저 변환해야 합니다.
인간의 언어
↓
Token
↓
숫자 표현
↓
AI 모델 계산
↓
답변 생성
Token은 이 과정의 중간 단위입니다.
2. 첫 번째 단계: AI가 텍스트를 받는다
다음 중국어 문장을 AI에 입력한다고 가정해 봅시다.
“人工智能正在改变世界。”(인공지능이 세상을 바꾸고 있다)
사람에게는 완전한 문장이지만, AI가 처음 받는 것은 문자들의 나열입니다.
人 / 工 / 智 / 能 / 正 / 在 / 改 / 变 / 世 / 界 / 。
컴퓨터는 각 문자가 무엇인지 먼저 식별한 뒤 다음 처리를 진행합니다.
3. 두 번째 단계: Tokenizer가 텍스트를 Token으로 나눈다
Tokenizer
텍스트를 나누는 도구를 Tokenizer라고 합니다. AI가 글을 읽기 전에 사용하는 “절단 도구”처럼 연속된 텍스트를 모델이 처리할 수 있는 작은 단위로 분리합니다.
마트가 재고를 “상품 한 카트”라고만 부르지 않고 사과 10개, 우유 5상자, 빵 3개로 나누는 것과 비슷합니다. 그래야 수량을 세고, 재고를 관리하고, 가격을 계산할 수 있습니다.
Tokenizer도 긴 텍스트를 세고 처리할 수 있는 단위로 나눕니다.
예를 들어:
我喜欢人工智能
은 다음처럼 나뉠 수 있습니다.
我 / 喜欢 / 人工 / 智能
또는:
我 / 喜 / 欢 / 人 / 工 / 智 / 能
모델마다 분할 방식이 다를 수 있습니다.
4. 같은 문장도 AI마다 Token 수가 다른 이유
같은 문장이 AI 시스템마다 다른 Token 수를 가질 수 있는 이유는 모델이 서로 다른 Tokenizer를 사용하기 때문입니다.
예를 들어:
“Artificial intelligence is changing the world.”
한 모델은 다음처럼 나눌 수 있습니다.
Artificial / intelligence / is / changing / the / world
다른 모델은:
Art / ificial / intelligence / is / changing / the / world
의미는 같지만 Token 수는 다릅니다.
같은 물건을 한 창고는 큰 상자에, 다른 창고는 작은 상자에 보관하는 것과 같습니다. 내용물은 같아도 상자 수는 달라집니다.
5. 세 번째 단계: Token을 숫자로 변환한다
대규모 언어 모델은 문자를 그대로 계산할 수 없으므로 숫자가 필요합니다.
중국어 人工智能이 Tokenizer를 거쳐 人工과 智能 두 Token으로 나뉘었다면, 각 Token에는 숫자 ID가 연결됩니다.
人工 → 52341
智能 → 81726
이 숫자는 이해를 돕기 위한 예입니다. 실제 ID는 모델의 어휘집에 따라 결정됩니다.
Token과 Token ID
Token은 상품명, Token ID는 상품 바코드라고 생각할 수 있습니다. 마트 시스템은 “사과”라는 이름보다 상품 번호로 재고를 계산합니다. AI도 Token ID를 사용해 이후 계산을 진행합니다.
6. 네 번째 단계: 숫자가 모델에 들어가 계산된다
텍스트가 숫자로 바뀌면 그 숫자가 대규모 언어 모델에 입력됩니다. 모델은 다음을 판단합니다.
- 현재 Token이 앞의 문맥과 어떤 관계인지
- 어떤 정보가 중요한지
- 다음에 어떤 내용이 나올 가능성이 높은지
사용자가 다음과 같이 입력한다고 해 봅시다.
“중국의 수도는…”
모델은 훈련 중 배운 언어 패턴과 지식 관계를 바탕으로 다음에 “베이징”이 나올 가능성이 높다고 판단합니다.
이는 AI가 사람처럼 데이터베이스를 검색한다는 뜻이 아닙니다. 책을 열고 답을 찾아 복사하는 것이 아니라, 학습한 언어 규칙과 지식 관계를 이용해 가장 합리적인 다음 내용을 예측합니다.
7. 다섯 번째 단계: AI도 Token을 하나씩 출력한다
AI가 내부에서 답을 완성한 뒤 한 번에 보여 준다고 생각하기 쉽습니다. 실제로 대규모 언어 모델은 보통 내용을 단계적으로 생성합니다.
예를 들어:
“인공지능을 설명해 줘.”
모델은 답을 다음처럼 늘려 갈 수 있습니다.
인공지능
인공지능은
인공지능은 컴퓨터가
인공지능은 컴퓨터가 인간의 능력을 모방하게 하는 기술
이 과정을 거쳐 완전한 답변이 만들어집니다.
AI 입력: 텍스트 → Token
AI 출력: Token → 텍스트
전체 과정의 중심에 Token이 있습니다.
8. Token과 대규모 언어 모델의 능력은 어떤 관계일까?
Token이 많다고 AI가 더 똑똑한 것은 아닙니다. Token은 정보 처리 단위일 뿐입니다. 자동차가 연료를 많이 쓴다고 반드시 성능이 더 좋은 것은 아닌 것과 같습니다.
1. 모델 구조
모델 구조는 AI의 설계 방식이며, 내부에서 정보가 어떻게 흐르고 계산되는지를 결정합니다.
2. 훈련 데이터
훈련 데이터는 AI가 무엇을 학습했는지를 결정하며, 사용할 수 있는 지식과 언어 패턴에 영향을 줍니다.
3. 파라미터 규모
파라미터는 모델 내부에서 학습한 정보 관계로 볼 수 있습니다. 규모는 모델 능력에 영향을 주는 요소 중 하나지만 유일한 요소는 아닙니다.
4. 추론 능력
추론 능력은 복잡한 문제를 분석하고 해결하는 능력입니다.
Token은 지능 점수라기보다 AI가 일할 때 처리하는 “재료 단위”에 가깝습니다.
9. Token 생성 방식이 사용 경험에 영향을 주는 이유
Token이 만들어지는 과정을 이해하면 여러 현실적인 제한을 설명할 수 있습니다.
1. 중국어와 영어의 Token 사용량은 왜 다를까?
언어 구조가 다르기 때문입니다. 영어의 흔한 단어는 하나의 Token이 될 수 있지만, 중국어는 문자와 단어 구조가 달라 다른 방식으로 나뉠 수 있습니다.
따라서 눈에 보이는 길이가 비슷해도 언어에 따라 Token 수가 달라질 수 있습니다.
2. 긴 파일은 왜 제한을 넘기 쉬울까?
파일이 길수록 변환되는 Token도 보통 많아집니다. 사람에게는 “책 한 권”이지만 AI에게는 수십만 Token일 수 있습니다.
3. AI에는 왜 컨텍스트 제한이 있을까?
모델이 한 번에 처리할 수 있는 Token 수에는 한계가 있습니다. 이를 컨텍스트 윈도우라고 합니다.
AI가 한 번에 자료를 올려놓을 수 있는 책상 크기로 생각할 수 있습니다. 책상이 클수록 더 많은 자료를 동시에 볼 수 있습니다.
10. 텍스트에서 Token으로, 다시 텍스트로
전체 흐름은 다음과 같습니다.
사용자가 텍스트 입력
↓
Tokenizer가 텍스트 분할
↓
Token 생성
↓
Token을 숫자로 변환
↓
대규모 언어 모델에서 계산
↓
새 Token 생성
↓
사람이 읽는 텍스트로 변환
↓
답변 표시
간단히 말하면:
Token은 인간의 언어가 AI 세계로 들어가는 입구이며, AI가 답을 만들 때 사용하는 기본 단위이기도 하다.
11. 다음 글: Token은 왜 과금 대상일까?
AI가 답변할 때마다 텍스트 변환, Token 처리, 모델 계산, 새 Token 생성이 일어납니다.
그렇다면 다음 질문이 생깁니다.
AI 회사는 왜 Token 단위로 비용을 청구할까?
입력과 출력에 모두 비용이 붙는 이유는 무엇일까요? 긴 파일은 왜 더 비싸고, 모델 가격은 왜 크게 다를까요?
다음 글에서는 사용자가 가장 궁금해하는 내용을 다룹니다. Token 가격은 어떻게 정해지고, 한 번의 AI 대화에는 실제로 얼마가 들까?

편집팀
Product Team @ WebCal
WebCal 공식 제품팀입니다. 우리는 고성능 컴퓨팅 인프라와 탈중앙화 클라우드 솔루션을 구축합니다.



