一言で
アライメントは、AI が人の意図や価値観に沿って動くようにすること、またはそのための調整や取り組みのことです。何に沿わせるのかや、アライメントを何と見るかは、出典によって書き方が違います。
このページで分かること
- アライメントが何を指すか(国の文書・論文・Anthropic の説明)
- 「何に沿わせるのか」について、出典ごとに違う所と、論文が残している問い
- アライメントのためにモデルの性能が下がることがある、という話(アライメント税)
先に知っておく言葉
- 事前学習:大量のデータでモデルを最初に学習させること(→ 別ページ「学習(事前学習)と推論」)
- ファインチューニング:学習を終えたモデルを、目的に合わせて追加で学習させること(→ 別ページ「ファインチューニング」)
- RLHF:人の評価をもとに、好まれる返事を出しやすいようモデルを学習させる方法(→ 別ページ「人の評価で調整する(RLHF・Constitutional AI)」)
- トークン:AI が文章を区切って扱う単位(→ 別ページ「トークン」)
- AI エージェント:道具を呼び出し、手順を自分で決めて作業を進める AI の仕組み(→ 別ページ「エージェントとツールの使用」)
出典ごとの説明
- AI事業者ガイドライン(第1.2版、2026年3月31日):本編は、AI を作る事業者が担う役割として「事後学習」を挙げ、その目的の1つを、AI が人の意図と価値観に合うように動かすための調整(アライメント)としている。事後学習とは、事前学習の済んだモデルを、決まった用途に向けて追加で学習させることで、アライメントもここに含まれ、実務の環境の変化や必要に応じて続けて行うもの、と説明している。やり方の例は、ファインチューニングと、データを足して学習し直すこと。別添は、AI を作る事業者と、AI を組み込んだサービスを出す事業者の両方について、具体的な手法の1つに「アライメントの実施」を挙げている
- Anthropic の論文(Askell ほか、2021年12月):AI が「アライメントされている」とは、役に立つ(helpful)・正直である(honest)・害が無い(harmless)の3つを満たすこと(頭文字から HHH)と決めている。付録では、ごく大まかには、2者が物事の結果にどう順位を付けるかの重なりの度合いとして考えられる、と説明している
- OpenAI の InstructGPT の論文(2022年3月):ウェブの文章で次のトークンを予測するという学習の目的は、「使う人の指示に、役立つ形で安全に従う」という目的と違う。そのため、言語モデルの学習の目的は「ずれている(misaligned)」と書いている。目指すのは、使う人の意図に沿って動くモデルで、その意図には、指示に従うという表に出たものと、本当のことを言う・偏りや有害な内容を出さない、という表に出ないものの両方が入る、としている
- AI セーフティ・インスティテュート(AISI。IPA に置かれた日本の機関)の評価観点ガイド(第1.20版、2026年7月7日):AI エージェントのリスクの1つに「アライメントの不一致」を挙げている。AI の目標や価値観が、人の意図からずれていることを指し、設計で目標を決め誤ったり、学習データが偏っていたりすると、望ましくない行動をとるおそれがある、としている。自律的に動くため、その影響は、従来の LLM(大規模言語モデル)のシステムより大きくなる、としている
- Anthropic の Alignment チームの紹介:これからの AI はより強力になり、今の安全の技術が前提にしていることが崩れるおそれがある、としている。そのため、モデルが HHH であり続けるための守りを作り、高い能力のモデルを安全に学習・評価・監視する手順を作る、としている。学習のときとまったく違う状況でも害が無く正直か確かめることや、モデルがまずいふるまいをする場面を体系的に探すことも、仕事に挙げている
何に沿わせるのか
沿わせる相手の書き方は、出典によって違います。
- AI事業者ガイドライン・AISI:人間の意図や価値観(AISI のリスクの説明では、人間の意図)
- InstructGPT の論文:使う人(user)の意図(簡単にするため、推し量った使う人の意図に合わせた、と書いている)
- Askell ほかの論文:人の好みや価値観に沿わせることを目標に挙げたうえで、HHH という3つの基準で表している
Askell ほかの論文は、この基準が多かれ少なかれ主観的で、AI を世に出す側が、アライメントをどう決め、どこまで達したかに責任を持つ必要がある、としています。付録では、答えの出ていない問いとして、誰に沿わせるのか(使う人・作る人・人類など)、複数の相手の考えをどうまとめるのか、などを挙げています。InstructGPT の論文が、合わせた相手は評価した人たちや研究者自身などの好みだと自ら書いている点は、別ページ「人の評価で調整する(RLHF・Constitutional AI)」にあります。
どうやって沿わせるのか
AI事業者ガイドラインは、事後学習に含まれるものとし、事後学習の主な手法としてファインチューニングなどを挙げています。InstructGPT の論文は、RLHF でファインチューニングしています。Askell ほかの論文は、指示文の工夫だけでどこまで沿わせられるかを最初の手がかりとして調べ、さらに、人の好みを順位で学ぶ方法を、手本をまねさせる方法と比べています。
アライメント税
アライメントのための手立てで、ほかの性能が下がることを、2つの論文は「アライメント税(alignment tax)」と呼んでいます。
- InstructGPT の論文:RLHF の学習の途中で、いくつかの公開されたテスト(読解・翻訳など)の成績が GPT-3 より下がった。学習のやり方を変えて、その大半を抑えられた、としている。税が高いやり方は使われないかもしれないので、税の低いやり方が要る、と書いている
- Askell ほかの論文:指示文の工夫は、小さいモデルでは能力を下げることがあるが、大きいモデルでは影響が小さく、上がることもあった。そのため大きいモデルが払う税は小さい、としている
ニュースでの出方
- OpenAI が次の上位モデル「GPT-6.1 Astra」を出さないと決めた記事で、OpenAI で安全の仕組みを率いる Saachi Jain 氏が、利用者に届けるときの基準について、安全とアライメントの面でとても高い基準を置いている、と声明で述べたことを、CNBC の報道(9/28)として紹介しています
- OpenAI、次の上位モデル「GPT-6.1 Astra」を出さないと決めた。理由は「任された範囲を守れない所」
関連する言葉
- 人の評価で調整する(RLHF・Constitutional AI)・ファインチューニング・エージェントとツールの使用・プロンプトインジェクション・ジェイルブレイク(脱獄)・レッドチーミングと安全性の評価(→ この欄の別ページ)
出典
- Askell ほか(Anthropic)「A General Language Assistant as a Laboratory for Alignment」arXiv:2112.00861、2021年12月1日 arxiv.org ↗
- Ouyang ほか(OpenAI)「Training language models to follow instructions with human feedback」arXiv:2203.02155、2022年3月4日 arxiv.org ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編、2026年3月31日 soumu.go.jp ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」別添(付属資料)、2026年3月31日 soumu.go.jp ↗
- AI セーフティ・インスティテュート「AI セーフティに関する評価観点ガイド(第1.20版)」2026年7月7日 aisi.go.jp ↗
- Anthropic「Alignment」(研究チームの紹介) anthropic.com ↗
確認メモ:2026年10月1日に、上の6つの出典の原文を開いて確かめました。2つの論文と国の文書・AISI のガイドは PDF から文字を取り出し、Askell ほかの論文は要旨・1.1節・2.2節・付録E を、InstructGPT の論文は導入・3.6節・アライメント税の段落を、AI事業者ガイドラインは本編の「AI 開発者」と「事後学習」の説明、別添の開発者向け・提供者向けの「人間中心」の具体的な手法を、AISI のガイドは付録の表2を読みました。Anthropic のページは本文を読みました。AISI が IPA に置かれていることは、AISI の「AISIについて」のページで確かめました。沿わせる相手の書き方と、アライメントを「調整・取り組み」とするか「重なりの度合い」とするかは、出典ごとに違うため並べています。NIST の生成AI の文書(AI 600-1)は、この言葉の説明が無かったため使っていません。Askell ほかの論文の評価の数値と、Anthropic のページに並ぶ個別の研究の中身は載せていません。「事後学習」は AI事業者ガイドラインの説明を、「公開されたテスト(読解・翻訳など)」は InstructGPT の論文が挙げたテストの種類を、一言で言い換えたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編・別添を加工して作成)。