AI Log

AIの基本 / ニュースに出る言葉

ベンチマークと評価:AI の出来を測って比べるしくみと、その限界

出典を確かめた日 2026年10月1日(木) / 約6分で読めます

一言で

評価は、AI のモデルの出来の良し悪しを測ったり、複数のモデルを比べたりすることです。ベンチマークは、評価に使われる共通の試験の材料で、出典では、モデルを比べるのに広く使われるテストデータ(SuperGLUE など)が例に挙がっています。

このページで分かること

先に知っておく言葉

評価とは何か(出典ごとの説明)

採点のしかた:機械か、人か

Google の用語集には、誰が採点するかで分けた3つの項があります。

用語集には、具体的なベンチマークや物差しの項もあります。たとえば「SuperGLUE」は、文章を理解して書く力を全体として採点するための、8つのデータの集まりをまとめたものです。「pass at k」は、大規模言語モデルが書いたコードを測る物差しで、同じ問題に k 通りのコードを書かせ、少なくとも1つがすべての単体テストに通る見込みを見ます。k を大きくすると点はふつう上がるが、そのぶんモデルとテストに使う資源が多く要る、と書かれています。

公的機関の文書での扱い:使い道と限界

NIST(米国の国立標準技術研究所)の生成AI のリスクの文書(NIST AI 600-1、2024年7月)は、ベンチマークについて次のように書いています。

ニュースでの出方

AIログのニュースでは、ベンチマークという言葉はまだ出ていません。「評価」は、次の記事に出てきます。

関連する言葉

出典

  1. Google for Developers「Machine Learning Glossary」の evaluation・evals・LLM evaluations・automatic evaluation・human evaluation・autorater evaluation・ROUGE・BLEU・SuperGLUE・pass at k・validation set の項 developers.google.com ↗
  2. NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月、2.12節・MS-2.3・MS-2.11・A.1.4節 doi.org ↗
  3. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」2026年3月31日、第1部の「学習」の定義 soumu.go.jp ↗

確認メモ:2026年10月1日に、上の3つの出典の原文を開いて確かめました。Google の用語集は、評価に関わる11の項を読みました。用語集には「benchmark」そのものの項は無く、「LLM の評価」の説明と、ベンチマークとして挙がっているデータの集まり(SuperGLUE など)から説明しています。冒頭の「一言で」のベンチマークの言い換えは、これらの項をもとにしたものです。NIST の文書は、2.12節(部品やデータを外から取り入れることのリスク)、評価に関わる推奨する取り組み(MS-2.3・MS-2.11)、A.1.4節(使い始める前の試験)を読みました。3つの出典で、評価の説明に食い違いは見当たりませんでした。NIST が例に挙げている偏りを測るベンチマークの名前や、点数の計算の式は載せていません。安全面の評価の詳しいやり方は、別ページ「レッドチーミングと安全性の評価」の範囲として、ここでは書いていません。「ニュースでの出方」は、AIログの記事の無料部分にある記述をそのまま挙げています。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。