AI Log

AIの基本 / 安全と社会

アライメント:AI のふるまいを、人の意図や価値観に沿うようにすること

出典を確かめた日 2026年10月1日(木) / 約8分で読めます

一言で

アライメントは、AI が人の意図や価値観に沿って動くようにすること、またはそのための調整や取り組みのことです。何に沿わせるのかや、アライメントを何と見るかは、出典によって書き方が違います。

このページで分かること

先に知っておく言葉

出典ごとの説明

  1. AI事業者ガイドライン(第1.2版、2026年3月31日):本編は、AI を作る事業者が担う役割として「事後学習」を挙げ、その目的の1つを、AI が人の意図と価値観に合うように動かすための調整(アライメント)としている。事後学習とは、事前学習の済んだモデルを、決まった用途に向けて追加で学習させることで、アライメントもここに含まれ、実務の環境の変化や必要に応じて続けて行うもの、と説明している。やり方の例は、ファインチューニングと、データを足して学習し直すこと。別添は、AI を作る事業者と、AI を組み込んだサービスを出す事業者の両方について、具体的な手法の1つに「アライメントの実施」を挙げている
  2. Anthropic の論文(Askell ほか、2021年12月):AI が「アライメントされている」とは、役に立つ(helpful)・正直である(honest)・害が無い(harmless)の3つを満たすこと(頭文字から HHH)と決めている。付録では、ごく大まかには、2者が物事の結果にどう順位を付けるかの重なりの度合いとして考えられる、と説明している
  3. OpenAI の InstructGPT の論文(2022年3月):ウェブの文章で次のトークンを予測するという学習の目的は、「使う人の指示に、役立つ形で安全に従う」という目的と違う。そのため、言語モデルの学習の目的は「ずれている(misaligned)」と書いている。目指すのは、使う人の意図に沿って動くモデルで、その意図には、指示に従うという表に出たものと、本当のことを言う・偏りや有害な内容を出さない、という表に出ないものの両方が入る、としている
  4. AI セーフティ・インスティテュート(AISI。IPA に置かれた日本の機関)の評価観点ガイド(第1.20版、2026年7月7日):AI エージェントのリスクの1つに「アライメントの不一致」を挙げている。AI の目標や価値観が、人の意図からずれていることを指し、設計で目標を決め誤ったり、学習データが偏っていたりすると、望ましくない行動をとるおそれがある、としている。自律的に動くため、その影響は、従来の LLM(大規模言語モデル)のシステムより大きくなる、としている
  5. Anthropic の Alignment チームの紹介:これからの AI はより強力になり、今の安全の技術が前提にしていることが崩れるおそれがある、としている。そのため、モデルが HHH であり続けるための守りを作り、高い能力のモデルを安全に学習・評価・監視する手順を作る、としている。学習のときとまったく違う状況でも害が無く正直か確かめることや、モデルがまずいふるまいをする場面を体系的に探すことも、仕事に挙げている

何に沿わせるのか

沿わせる相手の書き方は、出典によって違います。

Askell ほかの論文は、この基準が多かれ少なかれ主観的で、AI を世に出す側が、アライメントをどう決め、どこまで達したかに責任を持つ必要がある、としています。付録では、答えの出ていない問いとして、誰に沿わせるのか(使う人・作る人・人類など)、複数の相手の考えをどうまとめるのか、などを挙げています。InstructGPT の論文が、合わせた相手は評価した人たちや研究者自身などの好みだと自ら書いている点は、別ページ「人の評価で調整する(RLHF・Constitutional AI)」にあります。

どうやって沿わせるのか

AI事業者ガイドラインは、事後学習に含まれるものとし、事後学習の主な手法としてファインチューニングなどを挙げています。InstructGPT の論文は、RLHF でファインチューニングしています。Askell ほかの論文は、指示文の工夫だけでどこまで沿わせられるかを最初の手がかりとして調べ、さらに、人の好みを順位で学ぶ方法を、手本をまねさせる方法と比べています。

アライメント税

アライメントのための手立てで、ほかの性能が下がることを、2つの論文は「アライメント税(alignment tax)」と呼んでいます。

ニュースでの出方

関連する言葉

出典

  1. Askell ほか(Anthropic)「A General Language Assistant as a Laboratory for Alignment」arXiv:2112.00861、2021年12月1日 arxiv.org ↗
  2. Ouyang ほか(OpenAI)「Training language models to follow instructions with human feedback」arXiv:2203.02155、2022年3月4日 arxiv.org ↗
  3. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編、2026年3月31日 soumu.go.jp ↗
  4. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」別添(付属資料)、2026年3月31日 soumu.go.jp ↗
  5. AI セーフティ・インスティテュート「AI セーフティに関する評価観点ガイド(第1.20版)」2026年7月7日 aisi.go.jp ↗
  6. Anthropic「Alignment」(研究チームの紹介) anthropic.com ↗

確認メモ:2026年10月1日に、上の6つの出典の原文を開いて確かめました。2つの論文と国の文書・AISI のガイドは PDF から文字を取り出し、Askell ほかの論文は要旨・1.1節・2.2節・付録E を、InstructGPT の論文は導入・3.6節・アライメント税の段落を、AI事業者ガイドラインは本編の「AI 開発者」と「事後学習」の説明、別添の開発者向け・提供者向けの「人間中心」の具体的な手法を、AISI のガイドは付録の表2を読みました。Anthropic のページは本文を読みました。AISI が IPA に置かれていることは、AISI の「AISIについて」のページで確かめました。沿わせる相手の書き方と、アライメントを「調整・取り組み」とするか「重なりの度合い」とするかは、出典ごとに違うため並べています。NIST の生成AI の文書(AI 600-1)は、この言葉の説明が無かったため使っていません。Askell ほかの論文の評価の数値と、Anthropic のページに並ぶ個別の研究の中身は載せていません。「事後学習」は AI事業者ガイドラインの説明を、「公開されたテスト(読解・翻訳など)」は InstructGPT の論文が挙げたテストの種類を、一言で言い換えたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編・別添を加工して作成)。