一言で
RLHF(Reinforcement Learning from Human Feedback)は、人がモデルの返事を比べて評価し、その評価をもとに、好まれる返事を出しやすいようモデルを学習させる方法です。Constitutional AI は、その評価の一部を、文章で書いた原則にもとづいて AI に任せる方法です。
このページで分かること
- RLHF が何をするのか(出典ごとの説明と、論文での手順)
- 誰の好みに合わせているのか、という論文自身が書いた限界
- Constitutional AI が RLHF とどう違うのか
先に知っておく言葉
- 事前学習:大量のデータでモデルを最初に学習させること(→ 別ページ「学習(事前学習)と推論」)
- ファインチューニング:学習を終えたモデルを、目的に合わせて追加で学習させること(→ 別ページ「ファインチューニング」)
- 強化学習:試した行動の結果につく点数(報酬)が大きくなるように学ぶ方法
- パラメータ:モデルが学習の中で身につける数値(→ 別ページ「パラメータとモデルの大きさ」)
出典ごとの説明
- Anthropic(Claude の会社)の用語集:事前学習を終えた言語モデルを、人の好みに沿ってふるまうよう訓練する技術。指示に従いやすくしたり、チャットの相手らしくしたりすることも含む。人は2つ以上の文章に順位を付け、強化学習でモデルが上位の文章に近い出力を好むように導く、としている。Claude も、より役に立つアシスタントになるよう RLHF で訓練された、と書いている
- Google の機械学習の用語集:人の評価者からの反応を使って、返事の質を上げること。例として、使う人に返事の良し悪しを 👍 か 👎 で付けてもらい、その反応をもとにシステムが以後の返事を調整する仕組みを挙げている
- OpenAI の InstructGPT の論文(2022年3月):人の好みを報酬の合図として使い、モデルをファインチューニングする技術として RLHF を使った、としている
論文での手順(InstructGPT の場合)
InstructGPT の論文は、GPT-3 をもとに、次の3段階で学習させています。
- 見本で学ぶ:人が書いた「望ましい返事」の見本を集め、教師あり学習(正解つきの例で学ぶこと)でファインチューニングする
- 好みを当てるモデルを作る:モデルの返事をいくつか並べて人が順位を付けたデータを集め、人がどちらを好むかを予測する「報酬モデル」を学習させる
- 強化学習で寄せる:報酬モデルの点数が高くなるよう、PPO という強化学習の方法で、1のモデルをさらに学習させる
論文の結果として、人の評価では、パラメータが1.3B(13億)の InstructGPT の出力が、100倍以上大きい175B の GPT-3 の出力より好まれた、としています。入力に無い内容を作ってしまう割合も、入力の中だけで答えるべき仕事(要約など)で GPT-3 の41%に対して21%だった、と報告しています。一方で、偏り(バイアス)を測るテストでは、GPT-3 から大きな改善は見られなかった、としています。
Anthropic の論文(2022年4月)
Anthropic は、役に立つこと(helpful)と害が無いこと(harmless)を目標に RLHF で学習させた論文を出しています。2つの返事を見比べて、クラウドワーカー(ネットで仕事を受ける人)が1つを選んだデータを使っています。役に立つかと、害があるかは、別々のデータとして集めています。論文は、役に立つことと害が無いことはしばしばぶつかり合う、としています。また、小さいモデルでは RLHF の後に多くの評価で成績が下がった一方、13B と 52B のモデルでは、例を見せずに解かせる評価の成績が上がった、と報告しています。
誰の好みに合わせているのか
InstructGPT の論文は、この方法で合わせているのは「人類の価値観」のような広いものではなく、特定の人たちの好みだ、と自ら書いています。
- 評価をした人たちは約40人で、主に英語を話す、米国か東南アジアに住む人たちだった
- 評価した人どうしの意見が一致したのは、約73%だった
- 評価の手引きを書いたのは研究者で、その考えも入っている
- できたモデルは、完全に人の意図に沿っているわけでも、完全に安全なわけでもない
Constitutional AI(2022年12月)
Anthropic の Constitutional AI の論文は、害のある出力を見分けるための人の評価を使わずに、害の少ないアシスタントを学習させる方法を試しています。害の有無について人が関わるのは、AI のふるまいを決める原則の一覧(と、少しの例)だけで、その一覧を「憲法(constitution)」と呼んでいます。原則の数は十前後の簡単なもので、自然な文章で書かれています。
学習は2段階です。
- 教師あり学習の段階:モデルに自分の返事を原則に照らして批判させ、書き直させる。書き直した返事で、モデルをファインチューニングする
- 強化学習の段階:2つの返事のどちらが原則に沿っているかを AI に判定させ、そのデータで好みを当てるモデルを作り、強化学習をする。人の評価の代わりに AI の評価を使うため、RLAIF(RL from AI Feedback)と呼んでいる。ただし「役に立つか」の評価には、引き続き人の評価を使っている
論文は、こうした方法をとった理由として、RLHF は多くの場合、少なくとも数万の人の評価を使うこと、Anthropic が以前に人の評価で学習させたアシスタントは、意見の分かれる質問に答えるのを断ることが多かったことを挙げています。目指したのは、害のある指示を断るときも避けるのではなく、なぜ断るのかを説明するアシスタントです。また、原則は研究のためにその場その場で選んだもので、これからはより多くの関係者が見直し、使う目的や場所に合わせて変えるべきだ、としています。
出典ごとの違い
- 誰が評価するか:InstructGPT の論文では、評価したのは雇った約40人の評価者です。Anthropic の用語集は、人が順位を付けるとだけ書いていて、誰が付けるかは書いていません。Google の用語集は人の評価者の反応を使うとし、例では使う人が 👍・👎 で付けた反応を使っています。Constitutional AI では、害の有無の評価を AI が行います
- 評価の形:Anthropic の用語集は「2つ以上の文章に順位を付ける」、Google の用語集の例は「1つの返事に良し悪しを付ける」と説明しています
- ファインチューニングとの関係:InstructGPT の論文と Anthropic の論文(2022年4月)は、どちらも RLHF でモデルをファインチューニングする、と書いています。Anthropic の用語集は、2つを並べて書いていて、関係は説明していません
関連する言葉
- ファインチューニング・学習(事前学習)と推論・アライメント・レッドチーミングと安全性の評価・考えてから答えるモデル(→ この欄の別ページ)
出典
- Ouyang ほか(OpenAI)「Training language models to follow instructions with human feedback」arXiv:2203.02155、2022年3月4日 arxiv.org ↗
- Bai ほか(Anthropic)「Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback」arXiv:2204.05862、2022年4月12日 arxiv.org ↗
- Bai ほか(Anthropic)「Constitutional AI: Harmlessness from AI Feedback」arXiv:2212.08073、2022年12月15日 arxiv.org ↗
- Anthropic「Glossary」の RLHF の項 platform.claude.com ↗
- Google for Developers「Machine Learning Glossary」の Reinforcement Learning from Human Feedback (RLHF) の項 developers.google.com ↗
確認メモ:2026年10月1日に、上の5つの出典の原文を開いて確かめました。3つの論文は PDF から文字を取り出し、InstructGPT は要旨・導入・5.2節「Who are we aligning to?」と限界の節を、Anthropic の論文(2204.05862)は要旨と導入を、Constitutional AI は要旨と導入(1.1〜1.2節)を読みました。用語集は Anthropic の RLHF の項と、Google の RLHF の項を読みました。誰が・どの形で評価するかは出典ごとに説明が違うため並べています。PPO や報酬モデルの計算の中身、Anthropic の論文の評価の数値の細かい比較は、一言で言える範囲を超えるため載せていません。害を引き出すための評価のやり方の具体的な中身も載せていません。「強化学習」は Google の用語集の reinforcement learning の項を、「教師あり学習」「クラウドワーカー」はふつうの意味を一言で添えたものです。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。