AI Log

AIの基本 / 大規模言語モデルの仕組み

ファインチューニング:学習を終えたモデルを、目的に合わせて追加で学習させること

出典を確かめた日 2026年10月1日(木) / 約7分で読めます

一言で

ファインチューニング(fine-tuning)は、大量のデータでひととおり学習を終えたモデルに、特定の仕事や分野に合わせたデータを使って、もう一段の学習をさせることです。

このページで分かること

先に知っておく言葉

出典ごとの説明

  1. Anthropic(Claude の会社)の用語集:事前学習を終えた言語モデルを、追加のデータでさらに訓練すること。モデルは、追加に使ったデータの特徴や傾向を表し、まねるようになる。特定の分野・仕事・文体に合わせたいときに役に立ちうる、としている
  2. Google の機械学習の用語集:事前学習を終えたモデルに対して、特定の使い道に向けてパラメータを調整する、仕事ごとの2回目の学習。例として、一部の大規模言語モデルでは、幅広い大量の文章で事前学習したあと、医療の質問に答える仕事に向けて学習させる、という流れを挙げている。使う例の数は、多くの場合その仕事に絞った数百〜数千、としている
  3. Google の機械学習の入門講座(Machine Learning Crash Course):土台になる大規模言語モデルを、アプリの目的に合う形にするための追加の学習。その仕事についての予測は、多くの場合ファインチューニングした後のほうが良くなる、としている。数百〜数千の例で済む場合もある、と書いている

モデルの中で何が変わるか

Google の用語集は、ファインチューニングのやり方として、次の組み合わせを挙げています。

一部だけを変えるやり方について、用語集は「パラメータ効率のよいチューニング(parameter-efficient tuning)」の項を示しています。これは、すべてを変えるより効率よくファインチューニングする方法をまとめた呼び名です。Google の用語集によると、変えるパラメータは多くの場合すべてを変えるときよりずっと少なく、それでもできあがるモデルの性能は、たいていほぼ同じかそれに近いとされます。その一例の LoRA は、もとのパラメータを固定し、小さな学習用の部分を足して学習させる方法です。

Google の入門講座は、ふつうのファインチューニングは、学習の繰り返しのたびにすべてのパラメータを更新するため、例の数が少なくても計算の負担が大きくなりがちだ、と説明しています。また、ファインチューニングしてもパラメータの数は変わらない、としています(もとが100億のパラメータなら、ファインチューニング後も100億)。

プロンプトでの工夫との違い

Google の入門講座によると、プロンプトに例や指示を書いて出力を合わせる工夫(プロンプトエンジニアリング)は、モデルのパラメータを変えません。一方、ファインチューニングは、その仕事の例でモデルを学習させるものです。

Anthropic の用語集は、事前学習を終えただけのモデルは、質問に答えることや指示に従うことがもともと得意ではない、としています。そのため、ファインチューニングと RLHF(人の評価をもとにした学習 → 別ページ)でモデルを磨く、と説明しています。Claude もすでに、役に立つアシスタントになるようファインチューニングされている、と書いています。なお同じ用語集は、Claude の API では今のところファインチューニングを提供していない、としています。

何に気をつけるとされているか

出典ごとの違い

  1. 使う例の数:Google の用語集は「多くの場合、数百〜数千」、入門講座は「数百〜数千で済む場合もある」と書いています。Anthropic の用語集には数が書かれていません
  2. RLHF との関係:Anthropic の用語集は、ファインチューニングと RLHF を並べて書いていて、2つの関係は説明していません。OpenAI の InstructGPT の論文(2022年)は、RLHF を使ってモデルをファインチューニングした、と書いています

関連する言葉

出典

  1. Anthropic「Glossary」の Fine-tuning・Pretraining の項 platform.claude.com ↗
  2. Google for Developers「Machine Learning Glossary」の fine-tuning・parameter-efficient tuning・Low-Rank Adaptability (LoRA) の項 developers.google.com ↗
  3. Google for Developers「Machine Learning Crash Course:LLMs: Fine-tuning, distillation, and prompt engineering」 developers.google.com ↗
  4. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日、第2部「共通の指針」安全性の「適正学習」と脚注33 soumu.go.jp ↗
  5. NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月、2.5節と MP-4.1-007・MS-2.7-008 nvlpubs.nist.gov ↗
  6. Ouyang ほか「Training language models to follow instructions with human feedback」arXiv:2203.02155、2022年3月4日 arxiv.org ↗

確認メモ:2026年10月1日に、上の6つの出典の原文を開いて確かめました。Anthropic と Google の用語集は Fine-tuning・fine-tuning・parameter-efficient tuning・LoRA などの項を、Google の入門講座は Fine-tuning とプロンプトエンジニアリングの部分を読みました。AI事業者ガイドラインは脚注33、NIST の文書は環境への影響の節と、ファインチューニングに触れた取り組みの例を読み、InstructGPT の論文は要旨と導入で RLHF の扱いを確かめました。使う例の数と RLHF との関係は、出典ごとに書き方が違うため並べています。LoRA の仕組みの細かい説明(足す部分の作り方)は、一言で言える範囲を超えるため載せていません。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。「層」は、モデルの中の計算の段を指すふつうの言い方を添えたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。