AI Log

Microsoft / エージェント / 仕事の道具

AI エージェントを「同じ仕事を20回やらせて、データベースの中身で採点する」Microsoft の ThinkingBox。1回の成功と毎回の成功は別物だった

公開 2026年10月5日(月) / 元の発表 10月3日(土) / 約4分で読めます
AI(Claude)で下書きし、出典に当たって確かめたものです。 【推測】の印について

要約(3行)

今後の使い方の流れ

  1. 「1回の成功」で選ばない。 評価は、1回目の成功率(pass@1)、20回のうち1回でも成功した割合(pass@20)、20回とも成功した仕事の数(20/20)の3つに分けて出ている。業務に組み込むなら見るのは3つ目。
  2. 自分の仕事で20回試す。 ブログは、同じ初期状態から20回やり直し、そのたびにデータベースの終わりの状態を確かめる手順を載せている。手元の業務に近い仕事を作って試すのが次の一歩。
  3. 失敗の中身を見る。 失敗の約8割は考え方の誤りではなく、道具(ツール)の使い方だったと書かれている。エラーが出たあとの立て直し方が先に直す所になる。
  4. 返事ではなく、記録を確かめる。 終わったと言ったかどうかではなく、データが正しい状態になったかを仕組みで見る。ブログはこれを本番でも使える見方として勧めている。

この発表で何が変わりそうか(分析)

出典

  1. Microsoft・Hugging Face「The Agent Said It Was Done. The Database Disagreed.」(2026-10-03)huggingface.co ↗

確認メモ(2026-10-05 に確認):ブログ本文を開いて、507件・5分野・18モデル・20回の試行、成績の表、費用の表、失敗の分類、公開の条件を確かめた。数字は Microsoft 自身の測定で、第三者による追試は確かめていない。ブログは各分野の業務を「実際の企業のパターンを模した架空の再現」と書いている。論文(arXiv)、GitHub のコード、データセットのページは開いていない。費用は OpenRouter の定価(2026-09-20 時点、Opus 5.5 は Anthropic の公式サイトの価格)から推計したもので、各社の実際の請求とは違う。


会社:Microsoft / テーマ:エージェント 仕事の道具

X でポストはてなブックマーク