一言で
評価は、AI のモデルの出来の良し悪しを測ったり、複数のモデルを比べたりすることです。ベンチマークは、評価に使われる共通の試験の材料で、出典では、モデルを比べるのに広く使われるテストデータ(SuperGLUE など)が例に挙がっています。
このページで分かること
- 「評価」「evals」「ベンチマーク」が、教材でどう説明されているか
- 機械で採点する評価と、人が採点する評価の違い
- 公的機関の文書が挙げる、ベンチマークの使い道と限界
先に知っておく言葉
- モデル:入力を受け取って、予測などの出力を返す仕組み
- 大規模言語モデル:大量の文章で学習した、文章を読み書きするモデル(→ 別ページ「大規模言語モデル(LLM)とは」)
- 学習:データを使って、モデルの中の数値を決めたり良くしたりすること(→ 別ページ「学習(事前学習)と推論」)
- 生成AI:文章や画像などを作り出す AI(→ 別ページ「生成AI とは」)
- ファインチューニング:学習済みのモデルを、目的に合わせて追加で学習させること(→ 別ページ「ファインチューニング」)
- RAG:外の情報を探してから答えさせる仕組み(→ 別ページ「RAG(検索拡張生成)」)
評価とは何か(出典ごとの説明)
- Google の機械学習の用語集:評価(evaluation)を、モデルの質を測ること、またはモデル同士を比べること、としている。正解の付いたデータで学ぶモデル(教師あり学習)なら、学習用とは分けておいた「検証データ」と「テストデータ」で確かめるのがふつうで、大規模言語モデルの評価は、質に加えて安全の面まで広く見るのがふつう、と書き分けている。「evals」は多くの場合 LLM の評価の略で、広くは評価全般の略でもある、としている
- 同じ用語集の「LLM の評価」の項:大規模言語モデルの働きを確かめるための物差しとベンチマークの組み合わせ、と説明している。役目として、直すべき所を研究者が見つける・仕事に合ったモデルを選び比べる・安全で倫理にかなった使い方を確かめる、の3つを挙げている
- AI事業者ガイドライン(第1.2版、2026年3月31日):学習の定義の中で、モデルを作ったり評価したりするのに使うデータは、訓練データ・検証データ・テストデータの3つに分かれる、と書いている
採点のしかた:機械か、人か
Google の用語集には、誰が採点するかで分けた3つの項があります。
- 自動の評価:ソフトウェアが出力を採点する。答えが単純なら、プログラムが「よい答え」として用意した答えと突き合わせる。翻訳や要約では、用意した答えとどれだけ重なるかを数える物差し(ROUGE・BLEU)が役立つことが多い
- 人による評価:人が出力の質を判断する。例は、2つの言葉ができる人が機械翻訳の出来を判断すること。正しい答えが1つに決まらない出力に特に向く、としている
- 両方を合わせた評価:人が採点した結果で学ばせた別のモデル(autorater)に採点させる。理想としては、人の採点をまねられるようになる、としている
用語集には、具体的なベンチマークや物差しの項もあります。たとえば「SuperGLUE」は、文章を理解して書く力を全体として採点するための、8つのデータの集まりをまとめたものです。「pass at k」は、大規模言語モデルが書いたコードを測る物差しで、同じ問題に k 通りのコードを書かせ、少なくとも1つがすべての単体テストに通る見込みを見ます。k を大きくすると点はふつう上がるが、そのぶんモデルとテストに使う資源が多く要る、と書かれています。
公的機関の文書での扱い:使い道と限界
NIST(米国の国立標準技術研究所)の生成AI のリスクの文書(NIST AI 600-1、2024年7月)は、ベンチマークについて次のように書いています。
- 推奨する取り組みの1つとして、ファインチューニングや RAG のもとにするモデルを選ぶとき、いくつものベンチマークでの基本の成績を考えに入れることを挙げている
- ベンチマークに広く使われるテストデータにも、正解の付け間違いが含まれることがある。そうした誤りは、多くの実務者がモデル選びで参考にするベンチマークの安定さを損ないうる、としている
- ゲームや人向けの試験(知能テストや専門職の資格試験など)でその場かぎりに試しても、その分野で AI が正しく確かに働くことの保証にはならない、としている
- 今の試し方は実験室の条件やベンチマークのテストデータに偏りがちで、実際に使われる場面にうまく当てはまらないことがある。指示の書き方で結果が変わりやすいことや、使われ方が幅広いことで、ベンチマークと実際の使われ方との差はさらに広がりうる、としている
- 偏りなどを測るベンチマークを使う取り組みの中で、実際に使う環境と照らしてベンチマークの前提と限界を書き残すことも挙げている。限界の例は、学習データとテストデータが混ざっていること(またはその可能性)
ニュースでの出方
AIログのニュースでは、ベンチマークという言葉はまだ出ていません。「評価」は、次の記事に出てきます。
- 中国の公開モデル GLM-5.3 について、NIST の AI の評価部門(CAISI)が 9/17 に評価を出し、これまでに出た公開モデルで最もサイバーの力が高い一方、米国の最先端のモデルよりははっきり低い、とまとめていました。記事は、Anthropic の研究チームの調べについて「比べ方も Anthropic が決めている」と注意しています
- Anthropic の研究チーム「誰でも使える中国の公開モデルが、攻撃の力で一線を越えた」
関連する言葉
- 大規模言語モデル・学習(事前学習)と推論・ハルシネーション・レッドチーミングと安全性の評価・バイアス(偏り)(→ この欄の別ページ)
出典
- Google for Developers「Machine Learning Glossary」の evaluation・evals・LLM evaluations・automatic evaluation・human evaluation・autorater evaluation・ROUGE・BLEU・SuperGLUE・pass at k・validation set の項 developers.google.com ↗
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月、2.12節・MS-2.3・MS-2.11・A.1.4節 doi.org ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」2026年3月31日、第1部の「学習」の定義 soumu.go.jp ↗
確認メモ:2026年10月1日に、上の3つの出典の原文を開いて確かめました。Google の用語集は、評価に関わる11の項を読みました。用語集には「benchmark」そのものの項は無く、「LLM の評価」の説明と、ベンチマークとして挙がっているデータの集まり(SuperGLUE など)から説明しています。冒頭の「一言で」のベンチマークの言い換えは、これらの項をもとにしたものです。NIST の文書は、2.12節(部品やデータを外から取り入れることのリスク)、評価に関わる推奨する取り組み(MS-2.3・MS-2.11)、A.1.4節(使い始める前の試験)を読みました。3つの出典で、評価の説明に食い違いは見当たりませんでした。NIST が例に挙げている偏りを測るベンチマークの名前や、点数の計算の式は載せていません。安全面の評価の詳しいやり方は、別ページ「レッドチーミングと安全性の評価」の範囲として、ここでは書いていません。「ニュースでの出方」は、AIログの記事の無料部分にある記述をそのまま挙げています。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。