トークン(LLM)とは
トークンとは、大規模言語モデル(LLM)が文章を読み書きするときに使う、文字列を細かく区切った処理の最小単位です。
人間は文章を「文字」や「単語」で数えますが、LLMは文章をそのまま扱うのではなく、まずトークンという部品に分解してから処理します。英語では1単語が1トークン前後になることが多く、日本語ではひらがな、漢字、記号の組み合わせによって1文字が1トークンになったり、複数文字で1トークンになったりします。
「トークン」という言葉は情報セキュリティの認証トークンなど別の意味でも使われますが、生成AIの文脈では「LLMが数える文章の単位」を指します。
仕組み・ポイント
文章をトークンに分ける処理を「トークナイズ(トークン化)」と呼び、分け方のルールを持つ仕組みを「トークナイザー」と呼びます。トークナイザーはモデルごとに異なるため、同じ文章でもモデルによってトークン数が変わります。
トークン数が重要になるのは、主に次の3つの場面です。
| 場面 | トークンとの関係 | 実務への影響 |
|---|---|---|
| API利用料 | 入力トークンと出力トークンの数で課金されるのが一般的 | 長いプロンプトや長い回答ほど費用が増える |
| コンテキストウィンドウ | 一度に扱えるトークン数の上限がある | 大量の文書は一度に渡せず、分割や検索が必要になる |
| 応答速度 | 出力トークンが多いほど生成に時間がかかる | 画面で待たせる時間、レイテンシに影響する |
また、入力トークンと出力トークンで単価が異なるモデルが多く、出力の方が高く設定されている傾向があります。具体的な単価はモデルや時期によって変わるため、各サービスの公式情報で確認してください。
実務での使い方・具体例
システム開発でトークンを意識する代表的な場面は、費用の見積もりです。生成AIを組み込んだシステムの月々の利用料は、おおむね次の式で考えます。
- 1回の処理で送る入力トークン数(指示文+参照資料+利用者の入力)を見積もる
- 1回の処理で返ってくる出力トークン数を見積もる
- それぞれにモデルの単価を掛けて、1回あたりの費用を出す
- 1日あたりの利用回数と稼働日数を掛けて、月の費用を試算する
たとえば架空の社内問い合わせボットで、毎回、長い社内規程を丸ごと入力に含める設計にすると、質問が短くても入力トークンが膨らみ、費用がかさみます。関連する部分だけを検索して渡す設計(RAG)に変える、共通部分にプロンプトキャッシュを使う、回答の長さを指示で制限する、といった工夫でトークン数を抑えられます。
開発時には、実際の業務データで試し、ログからトークン数を計測して試算を更新していくのが確実です。見積もりの全体像は「生成AIを組み込んだシステム開発の費用とAPI利用料の見積もり方」で詳しく解説しています。
費用試算とあわせて、トークン数は運用時の監視指標にもなります。本番稼働後は、次のような項目をログに残しておくと、想定外の費用増や品質低下に早く気づけます。
- 1回の処理あたりの入力・出力トークン数の推移
- 利用者ごと、機能ごとのトークン消費量
- 上限に達して回答が途中で切れた件数
- 処理時間とトークン数の関係
あるとき急に費用が増えた場合、多くは「参照資料を渡しすぎている」「会話履歴が際限なく積み上がっている」「回答が冗長になっている」のいずれかが原因です。ログがあれば、どこを削ればよいかを数字で判断できます。また、利用者一人あたり、または1日あたりのトークン消費に上限を設けておくと、誤った使い方や想定外のアクセスによる費用の急増を防げます。
なお、画像や音声を入力できるモデルでは、それらもトークンに換算されて課金されるのが一般的です。文章以外を扱う場合は、その分も試算に含めておきます。
よくある誤解と注意点
- 「トークン数=文字数」ではない:日本語は英語に比べてトークン数が多くなりやすい傾向があります。見積もりは実際の文章で計測します。
- 見えない入力も数えられる:システムプロンプト、会話履歴、参照資料など、利用者からは見えない部分もすべて入力トークンになります。
- 会話が長くなると費用が増える:チャット形式では過去のやり取りを毎回送る設計が多く、会話が続くほど1回あたりの入力が増えます。
- モデルを変えると数え方が変わる:モデル切り替え時は費用試算をやり直します。
関連用語
- コンテキストウィンドウ:一度に扱えるトークン数の上限
- プロンプトキャッシュ:繰り返し送る入力を再利用し、費用や時間を抑える仕組み
- チャンク(チャンク分割):長い文書をトークン上限に収まるよう分割すること
- レイテンシ:応答までの待ち時間
- ChatGPT:トークン単位で処理する代表的な生成AI
Otsumuに相談できること
「生成AIを組み込みたいが、月々の利用料がどれくらいになるか読めない」「試作では動いたが、本番の利用量で費用が見合うか不安」といった相談は、業務の利用パターンを整理し、実データでトークン数を測ると見通しが立ちます。Otsumuは生成AIシステム開発において、費用対効果を踏まえた設計から運用改善まで支援しています。
30分の無料相談でお気軽にご相談ください。
執筆:Otsumu株式会社 / 編集日 2026.10.01