プロンプトの評価方法良し悪しを客観的に比べるテストデータと採点の考え方
プロンプトの良し悪しを「なんとなく」で判断すると、改善が進まず退行にも気づけません。評価用データの作り方、採点基準(ルーブリック)、手動評価と自動評価、LLMによる採点の注意点、比較の進め方を具体例で整理します。
公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて
プロンプトの評価方法とは
プロンプトを改善していると、「前のほうが良かった気がする」「この入力ではうまくいくが、他は?」と迷うことがあります。評価(evaluation)とは、プロンプトやモデルの出力の品質を、決まった基準とデータで測り、客観的に比べることです。評価の仕組みがあれば、改善の効果を確認でき、変更による悪化にも気づけます(プロンプトの改善サイクル、LLMアプリの評価)。
評価の基本要素
| 要素 | 内容 |
|---|---|
| 評価用データ | 代表的な入力と、期待される出力(正解・基準)のセット |
| 採点基準 | 何をもって「良い」とするか(正確さ、形式、トーン、網羅性など) |
| 採点の方法 | 人間による採点、自動判定(ルール・計算)、LLMによる採点 |
| 比較のルール | 同じデータ・同じ条件で、複数のプロンプトやモデルを比べる |
評価用データの作り方
| 手順 | 内容 |
|---|---|
| ① 実際の入力を集める | 普段の業務で使う、実際の入力(個人情報は除く) |
| ② 種類を散らす | 典型的な入力、短い/長い入力、例外的な入力、判断が難しい入力 |
| ③ 期待する出力を書く | 正解の答え、または、合格基準(「〇〇に言及している」など) |
| ④ 件数を決める | 最初は10〜30件程度から。重要度に応じて増やす |
| ⑤ 更新する | 失敗した例を追加して、育てる |
失敗した事例を、評価データに追加していくと、同じ失敗を繰り返さなくなります。
採点基準(ルーブリック)の例
「顧客への返信メールの下書き」の評価基準の例です。
| 観点 | 基準 | 配点 |
|---|---|---|
| 事実の正確さ | 日時・金額が、受信メールと一致している | 3点 |
| 要点の網羅 | 質問すべてに回答している | 3点 |
| トーン | 丁寧で、失礼な表現がない | 2点 |
| 形式 | 200字程度で、宛名と署名がある | 2点 |
具体的な基準ほど、採点のぶれが小さくなります。「良い/悪い」ではなく、「満たす/満たさない」で判断できる項目に分解するのがコツです。
採点の方法
| 方法 | 内容 | 向く場面 |
|---|---|---|
| 自動判定(ルール) | 出力が、特定の形式か、必要な語を含むか、数値が一致するかをプログラムで確認 | 形式・数値・分類の正誤 |
| 人間による採点 | 人が読んで、基準で採点 | 文章の質、トーン、妥当性 |
| LLMによる採点 | 別のLLMに、基準を渡して採点させる | 大量の評価、文章の質 |
| 組み合わせ | 自動判定+LLM採点+人間の抜き取り確認 | 実務では一般的 |
LLMによる採点の注意
LLMを採点者として使うと、大量の出力を効率的に評価できますが、次の点に注意が必要です。
| 注意点 | 内容 |
|---|---|
| 採点者の偏り | 長い回答や、自分(同じモデル)の出力を高く評価する傾向が、研究で報告されている |
| 基準の明確化 | 採点基準を具体的に書く。「理由→点数」の順に出力させる |
| 人間による検証 | 人間の採点との一致度を、サンプルで確認する |
| 採点の安定性 | 設定を調整して、採点のぶれを減らす(temperature(温度)とサンプリング) |
LLMの採点は、人間の採点を完全に置き換えるものではなく、補助と位置づけます。
比較の進め方
- 評価用データで、現在のプロンプト(基準)を実行し、採点する。
- プロンプトを1か所変更し、同じデータで実行・採点する。
- 点数を表で比較する。
- 改善していれば採用、悪化した項目があれば、原因を確認する。
- モデルを変更した場合も、同じ手順で比較する。
| 版 | 正確さ | 網羅 | トーン | 形式 | 合計 |
|---|---|---|---|---|---|
| v1 | 2.1 | 2.0 | 1.8 | 1.5 | 7.4 |
| v2(形式を指定) | 2.2 | 2.0 | 1.8 | 1.9 | 7.9 |
| v3(例を追加) | 2.5 | 2.4 | 1.9 | 1.9 | 8.7 |
(数値は例)
運用での活用
| 場面 | 内容 |
|---|---|
| モデル更新時 | 新しいモデルで、品質が維持されるかを確認する |
| プロンプト変更時 | 他の入力で悪化していないかを確認する |
| 本番運用 | 実際の出力を抜き取り確認し、品質を監視する(LLMアプリのログ・監視) |
| チームでの共有 | 評価結果を、共通の基準として使う(チームで使うルール作り) |
プロンプトの評価方法の具体例
社内FAQの回答アシスタントを改善するとき、過去の問い合わせ30件と模範回答を用意し、変更のたびに全件で試して、「事実の正確さ」「資料外の回答をしていないか」を採点します。ある変更で、一部の質問が改善した一方、別の質問が悪化していた、といった状況を、数字で把握できます。
プロンプトの評価方法のFAQ(よくある質問)
Q. 評価用データは、何件必要ですか?
A. 最初は10〜30件で十分です。重要度に応じて、増やしてください。
Q. 完全な正解がない課題は、どう評価しますか?
A. 「必要な要素を含むか」「禁止事項に触れていないか」など、基準で判断できる項目に分解します。
Q. 評価にも、機密情報を含めてよいですか?
A. 個人情報・機密情報は、匿名化・除外し、サービスの規約を確認してください。
筆者の見解(プロンプトの評価方法)
評価は、「改善が、本当に改善かを確かめる、体温計」のようなものだと考えます。感覚で調整していると、「あちらを直すと、こちらが壊れる」という状況に気づけません。少数のデータでも、評価の仕組みを持つことが、AI活用を、一度きりの試行から、継続的な改善に変える第一歩だと感じます。
プロンプトの評価方法の関連項目
- LLMアプリの評価
- プロンプトの改善サイクル
- LLMアプリのテスト
- LLMアプリのログ・監視
出典(一次情報)
本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。