从一句话到一串数字:AI 是如何产生 Token 的?
内容摘要
完整拆解文字如何被 Tokenizer 切分为 Token、映射成 Token ID、进入大模型计算,再逐 Token 生成回答,并解释语言差异、文件限制和上下文窗口。
你输入的一句话,AI 看到的其实不是文字
我们每天使用 AI 时,通常认为过程非常简单。我们输入:
“帮我写一封给客户的英文邮件。”
AI 随后回复:
“Dear Customer...”
看起来就像人说话、AI 听懂、AI 回答。但在背后,输入内容经历了一个复杂的转换过程。AI 并不是像人类一样直接阅读文字,在内容进入大模型之前,需要经过:
文字 → Token → 数字 → 模型计算
Token 正是连接人类语言和 AI 模型的重要桥梁。
一、人类看到的是文字,AI 接收到的是数字
人类为什么可以理解一句话?
例如:
“苹果很好吃。”
人类会自动理解苹果是一种可食用的水果,“好吃”是一种评价,整句话表达的是一种体验。这来自大脑长期积累的知识和经验。
计算机不同。它最基础的能力是处理数字,并不知道“苹果”天然代表一种水果。大模型必须先把人类语言转换成机器能够计算的信息。
人类语言
↓
Token
↓
数字表示
↓
AI 模型计算
↓
生成回答
Token 就是这个过程中的中间单位。
二、第一步:AI 收到你的文字
假设你向 AI 输入:
“人工智能正在改变世界。”
对我们来说,这是一句完整的话;对 AI 来说,它首先收到的是一串字符:
人 / 工 / 智 / 能 / 正 / 在 / 改 / 变 / 世 / 界 / 。
计算机先要识别每一个字符是什么,然后才能继续处理。
三、第二步:Tokenizer 把文字切成 Token
Tokenizer(分词器)
负责切分文字的工具叫 Tokenizer。你可以把它理解成 AI 阅读文字之前使用的“切割工具”,它把连续文字拆分成模型能够处理的小单位。
这就像超市不会只说“一整车商品”,而是把它拆成苹果 10 个、牛奶 5 箱、面包 3 个,才能统计数量、管理库存和计算价格。
Tokenizer 做的事情类似:把一大段文字拆成可以统计和处理的单位。
例如:
我喜欢人工智能
可能被拆成:
我 / 喜欢 / 人工 / 智能
也可能被拆成:
我 / 喜 / 欢 / 人 / 工 / 智 / 能
不同模型可能采用不同的切分方式。
四、为什么不同 AI 的 Token 数量可能不同?
同一句话在不同 AI 中,Token 数量可能不一样,因为不同模型使用的 Tokenizer 不同。
例如:
“Artificial intelligence is changing the world.”
一个模型可能拆成:
Artificial / intelligence / is / changing / the / world
另一个模型可能拆成:
Art / ificial / intelligence / is / changing / the / world
两种方式表达的最终意思相同,但 Token 数量不同。
这就像同一批货物,一家仓库按“大箱”分类,另一家按“小箱”分类。存储的是同样的东西,箱子数量却不同。
五、第三步:Token 会被转换成数字
大模型无法直接计算文字,它需要数字。
例如,“人工智能”经过 Tokenizer 后,可能变成 人工 和 智能 两个 Token。随后,每个 Token 会对应一个数字编号:
人工 → 52341
智能 → 81726
这些数字只是帮助理解的示例,真实模型中的编号由其词表决定。
Token 和 Token ID
可以把 Token 理解为商品名称,把 Token ID 理解为商品条形码。超市系统不会依靠“苹果”这个名字计算库存,而会使用商品编号;AI 也使用 Token ID 进行后续计算。
六、第四步:数字进入大模型进行计算
文字变成数字后,这些数字会进入大模型。模型开始判断:
- 当前 Token 和前文有什么关系;
- 哪些信息更重要;
- 下一步最可能生成什么内容。
例如,用户输入:
“中国的首都是……”
模型会根据训练过程中学到的大量语言规律和知识关系,判断后面最可能出现“北京”。
需要注意,AI 并不是像人一样“查数据库”。它不是打开一本书、找到答案再复制出来,而是根据学习到的语言规律和知识关系,预测最合理的下一步内容。
七、第五步:AI 也会一个 Token 一个 Token 地输出
很多人以为 AI 会先在内部写完整答案,再一次性显示。实际上,大语言模型通常逐步生成内容。
如果你问:
“介绍一下人工智能。”
模型可能依次生成:
人工智能
人工智能是一种
人工智能是一种让计算机
人工智能是一种让计算机模拟人类能力的技术
最终才形成完整回答。
因此:
AI 输入:文字 → Token
AI 输出:Token → 文字
整个过程都围绕 Token 进行。
八、Token 和“大模型能力”有什么关系?
Token 越多,并不代表 AI 越聪明。Token 只是信息处理单位,就像汽车使用多少升汽油并不直接代表汽车性能更强。
1. 模型结构
模型结构是 AI 的设计方式,决定信息如何在模型内部流动和计算。
2. 训练数据
训练数据决定 AI 学习过什么,也影响它掌握的知识和语言规律。
3. 参数规模
参数可以理解为模型内部学到的信息关系。参数规模是影响模型能力的因素之一,但不是唯一因素。
4. 推理能力
推理能力指模型面对复杂问题时分析和解决问题的能力。
Token 更像 AI 工作时处理信息的“材料单位”,而不是智力分数。
九、Token 的产生过程为什么会影响使用体验?
理解 Token 如何产生,就能解释很多现实问题。
1. 为什么中文和英文消耗的 Token 不一样?
不同语言的结构不同。英文中的常见词可能整体成为一个 Token,中文由于字符和词语结构不同,切分方式也可能不同。
因此,同样长度的内容在不同语言中可能消耗不同数量的 Token。
2. 为什么长文件容易超过限制?
文件越长,转换后的 Token 通常越多。人类看到“一本书”,AI 看到的可能是几十万个 Token。
3. 为什么 AI 有上下文限制?
模型一次能够处理的 Token 数量有限,这个上限叫上下文窗口(Context Window)。
可以把它理解为 AI 一次能够放在桌面上的资料数量。桌子越大,能够同时查看的资料越多。
十、Token 的产生过程总结
整个流程可以总结为:
用户输入文字
↓
Tokenizer 分割文字
↓
生成 Token
↓
Token 转换为数字
↓
进入大模型计算
↓
生成新的 Token
↓
转换成人类文字
↓
显示回答
简单来说:
Token 是人类语言进入 AI 世界的入口,也是 AI 输出答案时使用的基本单位。
十一、下一篇:Token 为什么需要收费?
AI 每一次回答问题,背后都会经历文字转换、Token 处理、模型计算和新 Token 生成。
那么新的问题来了:
AI 公司为什么要按照 Token 收费?
为什么输入和输出都收费?为什么长文件更贵?为什么不同模型的价格差距巨大?
下一篇文章将进入普通用户最关心的部分:Token 是怎么计价的?一次 AI 对话到底多少钱?

官方团队
Product Team @ WebCal
WebCal 官方产品团队。我们致力于构建高性能计算基础设施与去中心化云解决方案。



