プロンプト技術

プロンプトの評価方法良し悪しを客観的に比べるテストデータと採点の考え方

プロンプトの良し悪しを「なんとなく」で判断すると、改善が進まず退行にも気づけません。評価用データの作り方、採点基準(ルーブリック)、手動評価と自動評価、LLMによる採点の注意点、比較の進め方を具体例で整理します。

公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて

プロンプトの評価方法とは

プロンプトを改善していると、「前のほうが良かった気がする」「この入力ではうまくいくが、他は?」と迷うことがあります。評価(evaluation)とは、プロンプトやモデルの出力の品質を、決まった基準とデータで測り、客観的に比べることです。評価の仕組みがあれば、改善の効果を確認でき、変更による悪化にも気づけます(プロンプトの改善サイクル、LLMアプリの評価)。

評価の基本要素

要素 内容
評価用データ 代表的な入力と、期待される出力(正解・基準)のセット
採点基準 何をもって「良い」とするか(正確さ、形式、トーン、網羅性など)
採点の方法 人間による採点、自動判定(ルール・計算)、LLMによる採点
比較のルール 同じデータ・同じ条件で、複数のプロンプトやモデルを比べる

評価用データの作り方

手順 内容
① 実際の入力を集める 普段の業務で使う、実際の入力(個人情報は除く)
② 種類を散らす 典型的な入力、短い/長い入力、例外的な入力、判断が難しい入力
③ 期待する出力を書く 正解の答え、または、合格基準(「〇〇に言及している」など)
④ 件数を決める 最初は10〜30件程度から。重要度に応じて増やす
⑤ 更新する 失敗した例を追加して、育てる

失敗した事例を、評価データに追加していくと、同じ失敗を繰り返さなくなります。

採点基準(ルーブリック)の例

「顧客への返信メールの下書き」の評価基準の例です。

観点 基準 配点
事実の正確さ 日時・金額が、受信メールと一致している 3点
要点の網羅 質問すべてに回答している 3点
トーン 丁寧で、失礼な表現がない 2点
形式 200字程度で、宛名と署名がある 2点

具体的な基準ほど、採点のぶれが小さくなります。「良い/悪い」ではなく、「満たす/満たさない」で判断できる項目に分解するのがコツです。

採点の方法

方法 内容 向く場面
自動判定(ルール) 出力が、特定の形式か、必要な語を含むか、数値が一致するかをプログラムで確認 形式・数値・分類の正誤
人間による採点 人が読んで、基準で採点 文章の質、トーン、妥当性
LLMによる採点 別のLLMに、基準を渡して採点させる 大量の評価、文章の質
組み合わせ 自動判定+LLM採点+人間の抜き取り確認 実務では一般的

LLMによる採点の注意

LLMを採点者として使うと、大量の出力を効率的に評価できますが、次の点に注意が必要です。

注意点 内容
採点者の偏り 長い回答や、自分(同じモデル)の出力を高く評価する傾向が、研究で報告されている
基準の明確化 採点基準を具体的に書く。「理由→点数」の順に出力させる
人間による検証 人間の採点との一致度を、サンプルで確認する
採点の安定性 設定を調整して、採点のぶれを減らす(temperature(温度)とサンプリング)

LLMの採点は、人間の採点を完全に置き換えるものではなく、補助と位置づけます。

比較の進め方

  1. 評価用データで、現在のプロンプト(基準)を実行し、採点する。
  2. プロンプトを1か所変更し、同じデータで実行・採点する。
  3. 点数を表で比較する。
  4. 改善していれば採用、悪化した項目があれば、原因を確認する。
  5. モデルを変更した場合も、同じ手順で比較する。
版 正確さ 網羅 トーン 形式 合計
v1 2.1 2.0 1.8 1.5 7.4
v2(形式を指定) 2.2 2.0 1.8 1.9 7.9
v3(例を追加) 2.5 2.4 1.9 1.9 8.7

(数値は例)

運用での活用

場面 内容
モデル更新時 新しいモデルで、品質が維持されるかを確認する
プロンプト変更時 他の入力で悪化していないかを確認する
本番運用 実際の出力を抜き取り確認し、品質を監視する(LLMアプリのログ・監視)
チームでの共有 評価結果を、共通の基準として使う(チームで使うルール作り)

プロンプトの評価方法の具体例

社内FAQの回答アシスタントを改善するとき、過去の問い合わせ30件と模範回答を用意し、変更のたびに全件で試して、「事実の正確さ」「資料外の回答をしていないか」を採点します。ある変更で、一部の質問が改善した一方、別の質問が悪化していた、といった状況を、数字で把握できます。

プロンプトの評価方法のFAQ(よくある質問)

Q. 評価用データは、何件必要ですか?
A. 最初は10〜30件で十分です。重要度に応じて、増やしてください。

Q. 完全な正解がない課題は、どう評価しますか?
A. 「必要な要素を含むか」「禁止事項に触れていないか」など、基準で判断できる項目に分解します。

Q. 評価にも、機密情報を含めてよいですか?
A. 個人情報・機密情報は、匿名化・除外し、サービスの規約を確認してください。

筆者の見解(プロンプトの評価方法)

評価は、「改善が、本当に改善かを確かめる、体温計」のようなものだと考えます。感覚で調整していると、「あちらを直すと、こちらが壊れる」という状況に気づけません。少数のデータでも、評価の仕組みを持つことが、AI活用を、一度きりの試行から、継続的な改善に変える第一歩だと感じます。

プロンプトの評価方法の関連項目

出典(一次情報)

本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。