從一句話到一串數字:AI 是如何產生 Token 的?
內容摘要
完整拆解文字如何被 Tokenizer 切分為 Token、映射成 Token ID、進入大模型計算,再逐 Token 生成回答,並解釋語言差異、文件限制和上下文視窗。
你輸入的一句話,AI 看到的其實不是文字
我們每天使用 AI 時,通常認為過程非常簡單。我們輸入:
「幫我寫一封給客戶的英文郵件。」
AI 隨後回覆:
“Dear Customer...”
看起來就像人說話、AI 聽懂、AI 回答。但在背後,輸入內容經歷了一個複雜的轉換過程。AI 並不是像人類一樣直接閱讀文字,在內容進入大模型之前,需要經過:
文字 → Token → 數字 → 模型計算
Token 正是連接人類語言和 AI 模型的重要橋樑。
一、人類看到的是文字,AI 接收到的是數字
人類為什麼可以理解一句話?
例如:
「蘋果很好吃。」
人類會自動理解蘋果是一種可食用的水果,「好吃」是一種評價,整句話表達的是一種體驗。這來自大腦長期累積的知識和經驗。
電腦不同。它最基礎的能力是處理數字,並不知道「蘋果」天然代表一種水果。大模型必須先把人類語言轉換成機器能夠計算的資訊。
人類語言
↓
Token
↓
數字表示
↓
AI 模型計算
↓
生成回答
Token 就是這個過程中的中間單位。
二、第一步:AI 收到你的文字
假設你向 AI 輸入:
「人工智慧正在改變世界。」
對我們來說,這是一句完整的話;對 AI 來說,它首先收到的是一串字元:
人 / 工 / 智 / 慧 / 正 / 在 / 改 / 變 / 世 / 界 / 。
電腦先要識別每一個字元是什麼,然後才能繼續處理。
三、第二步:Tokenizer 把文字切成 Token
Tokenizer(斷詞器)
負責切分文字的工具叫 Tokenizer。你可以把它理解成 AI 閱讀文字之前使用的「切割工具」,它把連續文字拆分成模型能夠處理的小單位。
這就像超市不會只說「一整車商品」,而是把它拆成蘋果 10 個、牛奶 5 箱、麵包 3 個,才能統計數量、管理庫存和計算價格。
Tokenizer 做的事情類似:把一大段文字拆成可以統計和處理的單位。
例如:
我喜歡人工智慧
可能被拆成:
我 / 喜歡 / 人工 / 智慧
也可能被拆成:
我 / 喜 / 歡 / 人 / 工 / 智 / 慧
不同模型可能採用不同的切分方式。
四、為什麼不同 AI 的 Token 數量可能不同?
同一句話在不同 AI 中,Token 數量可能不一樣,因為不同模型使用的 Tokenizer 不同。
例如:
“Artificial intelligence is changing the world.”
一個模型可能拆成:
Artificial / intelligence / is / changing / the / world
另一個模型可能拆成:
Art / ificial / intelligence / is / changing / the / world
兩種方式表達的最終意思相同,但 Token 數量不同。
這就像同一批貨物,一家倉庫按「大箱」分類,另一家按「小箱」分類。儲存的是同樣的東西,箱子數量卻不同。
五、第三步:Token 會被轉換成數字
大模型無法直接計算文字,它需要數字。
例如,「人工智慧」經過 Tokenizer 後,可能變成 人工 和 智慧 兩個 Token。隨後,每個 Token 會對應一個數字編號:
人工 → 52341
智慧 → 81726
這些數字只是幫助理解的例子,真實模型中的編號由其詞彙表決定。
Token 和 Token ID
可以把 Token 理解為商品名稱,把 Token ID 理解為商品條碼。超市系統不會依靠「蘋果」這個名字計算庫存,而會使用商品編號;AI 也使用 Token ID 進行後續計算。
六、第四步:數字進入大模型進行計算
文字變成數字後,這些數字會進入大模型。模型開始判斷:
- 當前 Token 和前文有什麼關係;
- 哪些資訊更重要;
- 下一步最可能生成什麼內容。
例如,使用者輸入:
「中國的首都是……」
模型會根據訓練過程中學到的大量語言規律和知識關係,判斷後面最可能出現「北京」。
需要注意,AI 並不是像人一樣「查資料庫」。它不是打開一本書、找到答案再複製出來,而是根據學到的語言規律和知識關係,預測最合理的下一步內容。
七、第五步:AI 也會一個 Token 一個 Token 地輸出
很多人以為 AI 會先在內部寫完整答案,再一次顯示。實際上,大型語言模型通常逐步生成內容。
如果你問:
「介紹一下人工智慧。」
模型可能依次生成:
人工智慧
人工智慧是一種
人工智慧是一種讓電腦
人工智慧是一種讓電腦模擬人類能力的技術
最終才形成完整回答。
因此:
AI 輸入:文字 → Token
AI 輸出:Token → 文字
整個過程都圍繞 Token 進行。
八、Token 和「大模型能力」有什麼關係?
Token 越多,並不代表 AI 越聰明。Token 只是資訊處理單位,就像汽車使用多少公升汽油並不直接代表汽車效能更強。
1. 模型結構
模型結構是 AI 的設計方式,決定資訊如何在模型內部流動和計算。
2. 訓練資料
訓練資料決定 AI 學習過什麼,也影響它掌握的知識和語言規律。
3. 參數規模
參數可以理解為模型內部學到的資訊關係。參數規模是影響模型能力的因素之一,但不是唯一因素。
4. 推理能力
推理能力指模型面對複雜問題時分析和解決問題的能力。
Token 更像 AI 工作時處理資訊的「材料單位」,而不是智力分數。
九、Token 的產生過程為什麼會影響使用體驗?
理解 Token 如何產生,就能解釋很多現實問題。
1. 為什麼中文和英文消耗的 Token 不一樣?
不同語言的結構不同。英文中的常見單字可能整體成為一個 Token,中文由於字元和詞語結構不同,切分方式也可能不同。
因此,同樣長度的內容在不同語言中可能消耗不同數量的 Token。
2. 為什麼長文件容易超過限制?
文件越長,轉換後的 Token 通常越多。人類看到「一本書」,AI 看到的可能是幾十萬個 Token。
3. 為什麼 AI 有上下文限制?
模型一次能夠處理的 Token 數量有限,這個上限叫上下文視窗(Context Window)。
可以把它理解為 AI 一次能夠放在桌面上的資料數量。桌子越大,能夠同時查看的資料越多。
十、Token 的產生過程總結
整個流程可以總結為:
使用者輸入文字
↓
Tokenizer 分割文字
↓
生成 Token
↓
Token 轉換為數字
↓
進入大模型計算
↓
生成新的 Token
↓
轉換成人類文字
↓
顯示回答
簡單來說:
Token 是人類語言進入 AI 世界的入口,也是 AI 輸出答案時使用的基本單位。
十一、下一篇:Token 為什麼需要收費?
AI 每一次回答問題,背後都會經歷文字轉換、Token 處理、模型計算和新 Token 生成。
那麼新的問題來了:
AI 公司為什麼要按照 Token 收費?
為什麼輸入和輸出都收費?為什麼長文件更貴?為什麼不同模型的價格差距巨大?
下一篇文章將進入普通使用者最關心的部分:Token 是怎麼計價的?一次 AI 對話到底多少錢?

官方團隊
Product Team @ WebCal
WebCal 官方產品團隊。我們致力於構建高效能運算基礎設施與去中心化雲解決方案。



