推論(インファレンス)とは学習済みAIが回答を作る処理と速度・費用の関係
推論(インファレンス)は、学習済みのモデルに入力を与えて出力を得る処理です。学習との違い、LLMが1トークンずつ生成する流れ、応答速度・費用を左右する要因、高速化の工夫、クラウドとローカルでの違いを整理します。
公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて
推論とは
AIの処理は、大きく学習と推論(inference)に分けられます。学習は、大量のデータでモデルのパラメータを調整する工程、推論は、学習済みのモデルに入力を与えて、出力(回答)を得る工程です。私たちが対話型AIに質問して回答が返ってくるまでの処理は、すべて推論です(大規模言語モデル(LLM)とは)。
学習と推論の違い
| 項目 | 学習 | 推論 |
|---|---|---|
| 目的 | モデルの能力を獲得する | 学習済みモデルで出力を作る |
| 頻度 | 一度に大規模に行う(時々更新) | 利用のたびに行う |
| 計算の規模 | 非常に大きい | 1回あたりは小さいが、利用回数が膨大 |
| パラメータ | 更新される | 固定されたまま使う |
| 利用者から見えるか | 見えない | 日々の利用そのもの |
LLMの推論の流れ
LLMは、次のような流れで回答を生成します。
| 段階 | 内容 |
|---|---|
| ① プリフィル(入力の処理) | 入力全体(プロンプトや履歴)を一度に処理し、内部状態を作る |
| ② デコード(トークンの生成) | 次のトークンを1つずつ予測・選択して出力する |
| ③ 繰り返し | 選んだトークンを文脈に加え、②を終了条件まで繰り返す |
回答が「少しずつ表示される」のは、トークンを1つずつ生成しているためです(ストリーミング出力)。出力が長いほど、時間がかかります。
速度と費用を左右する要因
| 要因 | 内容 |
|---|---|
| 入力の長さ | 長いほど、プリフィルに時間と費用がかかる(コンテキストウィンドウ) |
| 出力の長さ | 長いほど、生成に時間がかかる |
| モデルの規模 | 大きいほど計算量が増え、遅く、高価になりやすい(パラメータ数とモデルサイズ) |
| 同時利用の混雑 | 利用が集中すると、待ち時間が増えることがある |
| 推論モデルの思考 | 内部で考える分、トークンと時間が増える(推論モデル(思考するAI)) |
| ハードウェア | GPUなどの性能 |
APIの料金は、入力トークン数と出力トークン数に応じて決まるのが一般的です(トークン料金の計算)。
高速化・効率化の工夫
| 工夫 | 内容 |
|---|---|
| キャッシュ(KVキャッシュ) | 過去のトークンの計算結果を再利用して、無駄な計算を省く |
| プロンプトキャッシュ | 繰り返し使う入力部分の処理結果を再利用して、費用と時間を抑える(プロンプトキャッシュ) |
| バッチ処理 | まとめて処理して、コストを下げる(バッチ処理) |
| 量子化 | モデルの数値の精度を下げて、メモリと計算を削減する(量子化) |
| 小さなモデルの活用 | 簡単な課題には、軽量なモデルを使い分ける |
| ストリーミング | 生成中の出力を順次表示して、体感の待ち時間を減らす(ストリーミング出力) |
| 効率的な配信の仕組み | サーバー側で、複数の要求を効率よく処理する実装(PagedAttentionなど) |
クラウドとローカルでの推論
| 項目 | クラウドAPI/サービス | ローカル(自分のPC) |
|---|---|---|
| 環境 | 不要 | GPUなどの準備が必要(GPUとVRAMの選び方) |
| 費用 | 利用量に応じた課金 | 機器と電気代 |
| 性能 | 大規模なモデルを利用可能 | 動かせるモデルの規模に制約 |
| データ | 提供元に送信 | 手元で完結できる(ローカルLLMとは) |
推論の具体例
同じ質問でも、「長い資料をつけて、詳しい回答を求める」場合と、「短い質問で、簡潔な回答を求める」場合では、処理量と費用が大きく異なります。業務で大量に処理するときは、入力を必要な部分に絞る、出力の長さを指定する、軽量なモデルを使い分けるといった工夫で、費用と時間を大きく減らせます。
推論のFAQ(よくある質問)
Q. 推論とは、AIが「考えること」ですか?
A. 一般的な用語としては、学習済みモデルを動かして出力を得る処理を指します。「推論モデル」と呼ばれる、段階的に考えるモデルとは別の意味合いで使われることがあるので注意してください(推論モデル(思考するAI))。
Q. なぜ回答が遅いことがありますか?
A. 入力や出力が長い、利用が混雑している、大きなモデルを使っているなどの要因があります。
Q. 推論の費用を減らすには?
A. 入力の絞り込み、キャッシュの活用、軽量なモデルの使い分け、バッチ処理などが有効です。
筆者の見解(推論)
AIを実際のサービスに組み込むと、費用と速度の大部分を決めるのは「学習」ではなく「推論」だと実感します。「高性能なモデルを常に使う」のではなく、「課題に見合ったモデルと入力量を選ぶ」ことが、継続的に運用するうえでの大切な設計ポイントです。
推論の関連項目
- トークン料金の計算
- プロンプトキャッシュ
- 量子化
- 推論モデル(思考するAI)
出典(一次情報)
本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。