レイテンシとは
レイテンシとは、ある処理を依頼してから、その応答が返ってくる(または返り始める)までにかかる待ち時間のことです。
平易に言えば、「ボタンを押してから反応があるまでの待ち時間」です。英語の latency は「潜伏」「遅れ」を意味し、通信やシステムの分野では、データを送ってから届くまでの遅延を指す言葉として使われてきました。
生成AIを組み込んだシステムでは、レイテンシが利用者の体験を大きく左右します。生成AIは文章を一語ずつ順に作っていくため、通常のWebシステムよりも応答に時間がかかりやすいからです。特に、チャットや電話の自動応答のように会話のテンポが求められる場面では、数秒の差が使いやすさを大きく変えます。
仕組み・ポイント
生成AIの応答時間は、いくつかの段階に分けて考えると、どこを改善すべきかが見えてきます。
| 段階 | 内容 | 時間が延びる主な要因 |
|---|---|---|
| 前処理 | 資料の検索、入力のチェックなど | 検索対象が大きい、チェックが多い |
| 最初の一語まで | AIが入力を読み込み、出力を始めるまで | 入力が長い、モデルが大きい、混雑している |
| 生成中 | 一語ずつ出力を作り続ける時間 | 出力が長い、モデルが大きい |
| 後処理 | 出力のチェック、データの保存など | 検証の処理が重い |
生成AIでは、特に「最初の一語が出るまでの時間」(TTFT:Time To First Token)と、「全体の生成が終わるまでの時間」を分けて測ることが一般的です。利用者が感じる待ち時間は、前者に大きく左右されます。
レイテンシを短くする代表的な方法は次のとおりです。
- ストリーミング表示:生成された部分から順に画面に表示し、待ち時間を短く感じさせる
- モデルの使い分け:分類などの簡単な処理は小型で速いモデルに任せる
- 入力を絞る:渡す資料や会話履歴を必要な分だけにする
- 出力を短くする:必要な情報だけを答えるよう指示する
- キャッシュの活用:同じ前提部分の処理結果を再利用する
- 並列化:互いに依存しない処理を同時に行う
実務での使い方・具体例
ある会社が、社内規程に答えるAIチャットボットを公開したところ、「回答が遅い」という声が多く寄せられたとします(架空の例)。開発チームは、処理の各段階の時間を記録して原因を調べました。
- 時間を測ると、資料の検索と、AIが出力を始めるまでの時間が長いことが分かった
- 検索で取り出す資料の数が多すぎたため、関連度の高いものに絞った
- 毎回同じ内容を渡していた長いシステムプロンプトに、キャッシュを適用した
- 回答をストリーミングで表示し、生成された部分から読めるようにした
- 質問の種類の判定には小型のモデルを使い、回答の作成だけ高性能なモデルを使う構成にした
その結果、回答の品質を保ったまま、利用者が待たされていると感じる時間を短くできました。
改善に取りかかる前に、次の点を確認しておきましょう。
- どの段階に時間がかかっているかを、記録で確かめているか
- 利用者が求める速さはどれくらいか(チャット、電話、夜間の一括処理で異なる)
- 平均だけでなく、遅いときの時間も見ているか
- 速さのために、品質をどこまで下げてよいか
よくある誤解と注意点
速いモデルに替えれば解決する、とは限りません。 実際には、検索や入力の長さなど、モデル以外の部分に時間がかかっていることも多くあります。まず計測して原因を特定することが先決です。
平均だけを見ると見落としが生じます。 平均は速くても、一部の利用者が長く待たされていることがあります。遅い方の値も確認しましょう。
すべての処理を速くする必要はありません。 夜間にまとめて行う集計や文書の要約など、利用者が画面の前で待たない処理では、速さよりも費用や品質を優先する方が合理的です。
提供元の混雑の影響も受けます。 APIの応答時間は時間帯や混雑で変わるため、遅くなったときの表示やタイムアウトの扱いを決めておくと安心です。
待ち時間の見せ方も体験を左右します。 処理中であることを示す表示や、何をしているかの簡単な説明があるだけで、同じ待ち時間でも利用者の感じ方は変わります。速さの改善と合わせて、待っている間の画面の設計も検討しましょう。
関連用語
- レスポンスタイム(応答時間):システム全体の応答にかかる時間。レイテンシと近い意味で使われる
- プロンプトキャッシュ:同じ入力部分の処理結果を再利用し、応答を速くする仕組み
- SLM(小規模言語モデル):軽量で速く動くモデル
- トークン(LLM):生成AIが文章を処理する単位。量が多いほど時間がかかる
- ボイスボット:電話の自動応答。レイテンシが体験を特に左右する
- 実践記事:生成AIを組み込んだシステム開発の費用とAPI利用料の見積もり方
Otsumuに相談できること
生成AIのシステムで応答が遅いと、どれほど回答の質が高くても使われなくなってしまいます。Otsumuでは、処理の各段階の時間を計測して原因を特定し、品質と速さ、費用の釣り合いを取った構成で生成AIシステム開発を進めています。
既存のAI機能の遅さに悩んでいる段階でもご相談ください。30分の無料相談でお気軽にお声がけください。
執筆:Otsumu株式会社 / 編集日 2026.10.01