RLHF(人間のフィードバックによる強化学習)とはAIを人に役立つ回答へ導く調整手法
RLHFは、人間の評価をもとにLLMの回答を好ましい方向へ調整する手法です。報酬モデル・強化学習の流れ、指示追従や安全性への効果、課題(評価者の偏り・迎合)、関連する手法(AIフィードバック・DPOなど)を整理します。
公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて
RLHFとは
RLHF(Reinforcement Learning from Human Feedback、人間のフィードバックによる強化学習)は、人間が回答の良し悪しを評価した結果を使って、LLMの回答を、人にとってより有用で安全な方向へ調整する手法です。事前学習だけを終えたモデルは「文章の続きを書く」ことは得意でも、指示に沿った回答や安全な振る舞いを保証しません。RLHFを含む調整によって、対話型AIが指示に従い、丁寧に応答できるようになりました(事前学習)。
なぜ必要なのか
次のトークンを予測する事前学習の目標は、「人間にとって役立つ回答をすること」とは一致しません。インターネット上の文章を忠実に模倣すれば、不適切な表現や不正確な内容も含まれます。そこで、「人間が望む回答」を、評価というかたちでモデルに伝える工程が必要になります。
基本的な流れ
| 段階 | 内容 |
|---|---|
| ① 指示チューニング | 指示と望ましい回答の例で追加学習し、基本的な指示追従を身につける(ファインチューニングの考え方) |
| ② 比較データの収集 | 同じ指示に対する複数の回答を人間が見比べ、どちらが良いかを評価する |
| ③ 報酬モデルの学習 | 人間の評価を予測する「報酬モデル」を学習する(良い回答に高いスコアを付ける) |
| ④ 強化学習 | LLMが回答を生成し、報酬モデルのスコアが高くなるように調整する |
人間の比較評価から学ぶ考え方自体はそれ以前から研究されていましたが(Christiano et al., 2017 など)、2022年に発表されたInstructGPTの論文(Ouyang et al.)が、LLMに適用するこの流れを広く知らしめました。
何が改善されるのか
| 観点 | 内容 |
|---|---|
| 指示への従順さ | 質問の意図を汲み、的確に答える |
| 有用性 | 役に立つ形式・丁寧さ・詳しさ |
| 安全性 | 有害な依頼への適切な拒否 |
| 誠実さ | 分からないことは分からないと答える(改善の途上) |
課題と限界
| 課題 | 内容 |
|---|---|
| 評価者の偏り | 評価する人の価値観・文化・好みが反映される |
| 迎合(sycophancy) | ユーザーの意見に同調したり、望まれていそうな答えを優先したりする傾向が出ることがある |
| 報酬の悪用 | 報酬モデルの欠陥を突いて、スコアだけ高い回答を作ってしまう |
| コスト | 大量の人間の評価が必要で、手間と費用がかかる |
| 誤りの完全な防止にはならない | ハルシネーションをなくすわけではない(ハルシネーション) |
関連する手法
人間の評価の負担を減らしたり、手順を簡略化したりする手法が研究・利用されています。
| 手法 | 概要 |
|---|---|
| AIフィードバックによる学習(RLAIF など) | 人間の代わりに、原則(憲法)に基づくAIが評価を行う。AnthropicのConstitutional AIの考え方が知られている |
| DPO(直接選好最適化) | 報酬モデルや強化学習を使わず、比較データから直接モデルを調整する |
| 検証可能な報酬による強化学習 | 数学やコードのように、正誤が自動で判定できる課題で強化学習を行い、推論能力を伸ばす(推論モデル(思考するAI)) |
各社の具体的な調整手法の詳細は、公開されている論文・技術報告で確認できる範囲に限られます。
利用者として知っておくこと
- 対話型AIの丁寧さや安全性は、こうした調整の成果であり、事実の正確さを保証するものではない。
- 迎合の傾向があるため、意見や評価を求めるときは「批判的な観点も挙げて」などと指定すると、偏りを減らせることがある(プロンプトの基本)。
- 提供元ごとに調整の方針が異なり、同じ質問でも回答の傾向が違うことがある。
RLHFのFAQ(よくある質問)
Q. RLHFとファインチューニングは違いますか?
A. RLHFは、人間の評価を使った強化学習による調整手法の一つで、広い意味では調整(ファインチューニング)の仲間です。
Q. AIは人間の価値観を学習していますか?
A. 評価者の好みや提供元が定めた基準が反映されます。万人の価値観を代表するわけではありません。
Q. 自分でRLHFを行えますか?
A. 大規模には資源が必要です。小規模なモデルでは、公開されたツールで実験することは可能です。
迎合を減らす指示の例
AIが同調的な答えに偏る傾向を和らげるには、次のように頼むと有効な場合があります。
- 「私の案の弱点やリスクを3つ挙げてください。」
- 「反対の立場から、この意見に反論してください。」
- 「根拠が不十分な点があれば、遠慮なく指摘してください。」
調整によって「協力的な答え」が身についたAIに対しても、批判的な視点を明示的に依頼することで、より客観的な検討ができます。
筆者の見解(RLHF)
RLHFは、AIを「文章を続ける機械」から「頼みごとを聞いてくれるアシスタント」へ変えた重要な工程だと思います。同時に、「人が好む答え」と「正しい答え」は必ずしも一致しないという課題も示しています。AIが丁寧に自信を持って答えているときほど、根拠を確認する習慣が大切です。
RLHFの関連項目
出典(一次情報)
本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。