要約(3行)
- Microsoft と Hugging Face が 10/3 付のブログで、AI エージェントの評価の道具「ThinkingBox」を紹介した。AI の返事ではなく、仕事のあとにデータベースに残った記録で採点し、同じ仕事を20回やらせて毎回できるかを見る。
- 小売・自動車保険・旅行・ネオバンク・コンサルの507件の業務を、18のモデルに20回ずつ。1回目の成功率は Claude Opus 5.5 が67.16%で最高だが、20回とも成功した仕事の数は Opus 5.5 と Opus 5 がどちらも241件(47.53%)で並んだ。
- コードは MIT、データは CDLA-Permissive-2.0 で公開。Linux か WSL、Python 3.11 以上、uv、Docker があれば自分でも動かせる(環境の部分は BSD-3-Clause)。
今後の使い方の流れ
- 「1回の成功」で選ばない。 評価は、1回目の成功率(pass@1)、20回のうち1回でも成功した割合(pass@20)、20回とも成功した仕事の数(20/20)の3つに分けて出ている。業務に組み込むなら見るのは3つ目。
- 自分の仕事で20回試す。 ブログは、同じ初期状態から20回やり直し、そのたびにデータベースの終わりの状態を確かめる手順を載せている。手元の業務に近い仕事を作って試すのが次の一歩。
- 失敗の中身を見る。 失敗の約8割は考え方の誤りではなく、道具(ツール)の使い方だったと書かれている。エラーが出たあとの立て直し方が先に直す所になる。
- 返事ではなく、記録を確かめる。 終わったと言ったかどうかではなく、データが正しい状態になったかを仕組みで見る。ブログはこれを本番でも使える見方として勧めている。
この発表で何が変わりそうか(分析)
- 「終わりました」を信じない評価が増えそう。 ブログの冒頭の例では、エージェントが9回の道具の呼び出しを丁寧に行い、チケットを「解決済み」にして返事をしたが、本当に必要だった状態は「保留」だった。道具の呼び出しも返事も整っていて、データベースだけが食い違っていた。
- 新しいモデルが、毎回の確かさまで上げるとは限らない。 Opus 5.5 は1回目の成功率が Opus 5(66.50%)より高いのに、20回とも成功した仕事は同じ241件。ブログは、この0.5ポイントほどの精度の差は、毎回の確かさを少しも増やさなかったと書いている。
- 安いモデルが安く済むとも限らない。 20回とも成功した仕事1件あたりの費用の推計は、GPT-5.4 が6.80ドル、GPT-6 Astra が7.45ドル、Claude Opus 5.5 が7.80ドル、Claude Opus 5 が13.30ドル。1回成功するだけの費用で最も安い GPT-5.6 Sol は、毎回成功するほうで見ると9.76ドルになる。費用は OpenRouter の定価から推計した値で、請求額ではない。
- 業務の種類で成績が大きく変わる。 Claude Opus 4.6 は小売で68.62%、自動車保険で8.30%。1つの業務で良かったからといって、別の業務でも良いとは限らない【推測を含む】。
- 評価の道具そのものが公開されるので、各社や各チームが同じ物差しで測れる。 ただし、これは Microsoft が作った業務の再現(架空の顧客)で、実際の自社の業務とは別。自社の仕事での成績は、自分で測るまで分からない【推測】。
- 中の人の言葉:ブログの筆者として最初に名前が出ている Tuhin Kundu(Microsoft の組織名で投稿)の、節の見出し。"A tool call is not an outcome"(huggingface.co ↗ )
出典
- Microsoft・Hugging Face「The Agent Said It Was Done. The Database Disagreed.」(2026-10-03)huggingface.co ↗
確認メモ(2026-10-05 に確認):ブログ本文を開いて、507件・5分野・18モデル・20回の試行、成績の表、費用の表、失敗の分類、公開の条件を確かめた。数字は Microsoft 自身の測定で、第三者による追試は確かめていない。ブログは各分野の業務を「実際の企業のパターンを模した架空の再現」と書いている。論文(arXiv)、GitHub のコード、データセットのページは開いていない。費用は OpenRouter の定価(2026-09-20 時点、Opus 5.5 は Anthropic の公式サイトの価格)から推計したもので、各社の実際の請求とは違う。

