一つの文から数字の列へ:AIはどのようにTokenを作るのか?
要約
Tokenizerが文章をTokenへ分割し、Token IDへ変換してモデルへ入力し、回答を一つずつ生成するまでを、言語差やコンテキスト制限とともに解説します。
入力した一文を、AIは文字として見ていない
AIの利用はとても単純に見えます。たとえば次のように入力します。
「顧客向けの英語メールを書いてください。」
するとAIは次のように返します。
“Dear Customer...”
人が話し、AIが理解して答えているように見えます。しかし、その裏では複雑な変換が行われています。AIは人間のように文字を直接読むのではなく、内容が大規模言語モデルへ入る前に次の経路を通ります。
文字 → Token → 数字 → モデルによる計算
Tokenは、人間の言語とAIモデルをつなぐ橋です。
1. 人間が見るのは文字、AIが受け取るのは数字
人間はなぜ文を理解できるのか
たとえば:
「りんごはおいしい。」
人間は、りんごが食べられる果物であり、「おいしい」が評価を表し、文全体が体験を伝えていると自然に理解します。これは脳が長年蓄積した知識と経験によるものです。
コンピューターは異なります。基本的な能力は数字の処理であり、「りんご」が果物だと最初から知っているわけではありません。大規模言語モデルは、人間の言葉を計算可能な情報へ変換する必要があります。
人間の言語
↓
Token
↓
数値表現
↓
AIモデルによる計算
↓
回答の生成
Tokenはこの過程の中間単位です。
2. ステップ1:AIが文字を受け取る
次の中国語をAIへ入力したとします。
“人工智能正在改变世界。”(人工知能が世界を変えている)
人間には一つの文ですが、AIが最初に受け取るのは文字の並びです。
人 / 工 / 智 / 能 / 正 / 在 / 改 / 变 / 世 / 界 / 。
コンピューターは各文字を識別してから、次の処理へ進みます。
3. ステップ2:Tokenizerが文字をTokenへ分割する
Tokenizer(トークナイザー)
文字を分割する道具をTokenizerと呼びます。AIが文章を読む前に使う「切断工具」のようなもので、連続した文字をモデルが処理できる小さな単位に分けます。
スーパーマーケットが在庫を「商品一台分」とだけ数えず、りんご10個、牛乳5ケース、パン3個に分けるのと似ています。分けることで数量の集計、在庫管理、価格計算ができます。
Tokenizerも長い文章を、数えて処理できる単位へ分けます。
たとえば:
我喜欢人工智能
は次のように分割されるかもしれません。
我 / 喜欢 / 人工 / 智能
あるいは:
我 / 喜 / 欢 / 人 / 工 / 智 / 能
モデルによって分割方法は異なります。
4. 同じ文でもAIによってToken数が違う理由
同じ文のToken数がAIごとに異なるのは、モデルが別々のTokenizerを使うためです。
たとえば:
“Artificial intelligence is changing the world.”
あるモデルは次のように分けます。
Artificial / intelligence / is / changing / the / world
別のモデルは:
Art / ificial / intelligence / is / changing / the / world
意味は同じでもToken数は違います。
同じ商品を、ある倉庫は大きな箱、別の倉庫は小さな箱で保管するようなものです。中身は同じでも、箱の数は変わります。
5. ステップ3:Tokenが数字へ変換される
大規模言語モデルは文字をそのまま計算できないため、数字を使います。
中国語の人工智能がTokenizerによって人工と智能に分かれた場合、それぞれのTokenに数値IDが割り当てられます。
人工 → 52341
智能 → 81726
これは説明用の数字です。実際のIDはモデルの語彙表によって決まります。
TokenとToken ID
Tokenを商品名、Token IDをバーコードと考えられます。スーパーのシステムは「りんご」という名前ではなく商品番号で在庫を計算します。AIもToken IDを使って後続の計算を行います。
6. ステップ4:数字がモデルへ入り、計算される
文字が数字へ変わると、その数字が大規模言語モデルへ入力されます。モデルは次の点を判断します。
- 現在のTokenと前の文脈との関係
- どの情報が重要か
- 次に何を生成する可能性が高いか
ユーザーが次のように入力したとします。
「中国の首都は……」
モデルは学習で身につけた言語パターンと知識の関係から、続きに「北京」が現れる可能性が高いと判断します。
これはAIが人間のようにデータベースを検索しているという意味ではありません。本を開いて答えを探し、コピーするのではなく、学習した言語パターンと知識の関係から、最も妥当な次の内容を予測します。
7. ステップ5:AIもTokenを一つずつ出力する
AIが内部で完成した答えを書き、まとめて表示すると考える人もいます。実際の大規模言語モデルは、通常は内容を段階的に生成します。
たとえば:
「人工知能について説明してください。」
モデルは次のように答えを伸ばしていきます。
人工知能
人工知能とは
人工知能とはコンピューターに
人工知能とはコンピューターに人間の能力を模倣させる技術
こうして完全な回答になります。
AIへの入力:文字 → Token
AIからの出力:Token → 文字
全工程の中心にTokenがあります。
8. Tokenと「大規模言語モデルの能力」の関係
Tokenが多いほどAIが賢いわけではありません。Tokenは情報処理の単位です。車が多くの燃料を使うからといって、必ず性能が高いとは限らないのと同じです。
1. モデル構造
モデル構造はAIの設計方式で、内部で情報がどのように流れ、計算されるかを決めます。
2. 学習データ
学習データはAIが何を学んだかを決め、利用できる知識と言語パターンに影響します。
3. パラメータ規模
パラメータはモデル内部で学習した情報の関係と考えられます。規模は能力を左右する要因の一つですが、唯一の要因ではありません。
4. 推論能力
推論能力は、複雑な問題を分析して解決する力です。
Tokenは知能の点数ではなく、AIが作業中に処理する「材料の単位」に近いものです。
9. Tokenの作られ方が使用体験に影響する理由
Tokenの生成過程を理解すると、多くの実用上の制限を説明できます。
1. 中国語と英語でToken消費量が違うのはなぜか
言語ごとに構造が異なります。英語の一般的な単語は一つのTokenになることがありますが、中国語は文字と単語の構造が異なるため、別の方法で分割される場合があります。
そのため、見た目が同じ長さでも言語によってToken数が変わります。
2. 長いファイルが上限を超えやすいのはなぜか
ファイルが長いほど、変換後のTokenも通常は増えます。人間には「1冊の本」でも、AIには数十万Tokenかもしれません。
3. AIにコンテキスト制限があるのはなぜか
モデルが一度に処理できるToken数には上限があります。これをコンテキストウィンドウと呼びます。
AIが一度に資料を置ける机の大きさと考えられます。机が大きいほど、同時に参照できる資料が増えます。
10. 文字からToken、そして文字へ戻るまで
全体の流れは次のとおりです。
ユーザーが文字を入力
↓
Tokenizerが文字を分割
↓
Tokenを生成
↓
Tokenを数字へ変換
↓
大規模言語モデルで計算
↓
新しいTokenを生成
↓
人間が読める文字へ変換
↓
回答を表示
要するに:
Tokenは人間の言語がAIの世界へ入る入口であり、AIが回答を出すときに使う基本単位でもある。
11. 次回:Tokenはなぜ課金されるのか
AIが回答するたびに、文字変換、Token処理、モデル計算、新しいTokenの生成が行われます。
そこで次の疑問が生まれます。
AI企業はなぜToken単位で料金を請求するのか?
入力と出力の両方が課金されるのはなぜか。長いファイルが高くなるのはなぜか。モデルによって価格が大きく違うのはなぜか。
次の記事では、ユーザーが最も気になるテーマを扱います。Tokenはどう価格付けされ、1回のAI会話はいくらかかるのか?

編集チーム
Product Team @ WebCal
WebCalを支える公式プロダクトチームです。私たちは、高性能なコンピューティングインフラと分散型クラウドソリューションを構築しています。



