要約(3行)
- ServiceNow の研究チーム(CoreAI)が 10/2 付の Hugging Face のブログで「AutoSynthData」を紹介した。AI モデルが苦手な業務を見つけ、その弱点を練習できる問題と採点の仕組みを自動で作り、追加の訓練(SFT)に使う方法。
- 社内システムを模した試験環境 EnterpriseOps Gym の Hybrid 分野で、Gemma-4-26B-A4B-it の1回目の成功率(pass@1)が7.2ポイント(相対で35%)上がり、ITSM 分野では18.77%から27.18%になった。
- 作った問題は Hybrid で2,000件(約18時間)、ITSM で1,994件(66時間)。ブログは、AutoSynthData そのものの公開(コードやモデルの配布)については書いていない。
今後の使い方の流れ
- 自分の環境でのつまずきを集める。 方法は、試験用の仕事を対象のモデルと、より強い「先生役」のモデルの両方に解かせ、対象のモデルだけが失敗するところを調べることから始まる。
- 失敗の型を「カード」にする。 何の能力を試す問題か、どの道具をどう使うか、正しい終わりの状態は何か、をカードにまとめる。元の問題の文面や答えは、問題を作る側には渡さない。
- 新しい問題を作って、通ったものだけ使う。 先生役の手本の通りに実際に解けるか、採点の仕組みが正解と不正解を分けられるかを確かめ、通った問題だけを訓練に使う。
- 訓練して、また測る。 訓練後に同じ環境で測り直し、まだ解けない所を次の問題作りに回す。
この発表で何が変わりそうか(分析)
- 「データを集める」から「弱点から作る」へ。 一般的な業務のデータを大量に集めるのではなく、特定の環境でそのモデルが苦手な所を狙って問題を作る考え方。ブログも「その環境と、その環境で動くモデルの両方に依存する」と書いている。
- 採点の仕組みづくりに手間をかけている。 問題は、その環境で実際に解けるか、手本の解き方が通るか、採点が不正解を見逃さないかを、作った1件ごとに確かめる。生成が簡単でも、使える問題にするのはこの検査だと、ブログが強調している。
- 小さめのモデルを自社の業務向けに鍛える使い方の例が増える。 今回の対象 Gemma-4-26B-A4B-it は、公開された中規模のモデル。大きなモデルを呼ぶだけでなく、自社の環境向けに調整する選択肢が現実の数字で示された【推測】。
- 時間と手間の目安が出ている。 同じ約2,000件でも、Hybrid は約18時間、ITSM は66時間。ブログは、ITSM は大きい先生役のモデルを使い、処理を速くする改良の前だったため長くかかったと説明している。
- 数字の読み方に注意が要る。 改善は、ブログが使った試験環境での結果で、ServiceNow 自身の測定。ITSM の比較で「基準のモデルとの差をどれだけ縮めたか」は書かれていない。実際の会社の業務での効果までは分からない。
- 中の人の言葉:署名した個人の短い発言が無いため、載せない。
出典
- ServiceNow CoreAI「AutoSynthData: Generating Training Data for Enterprise Agents」(2026-10-02)huggingface.co ↗
確認メモ(2026-10-05 に確認):ブログ本文を開いて、仕組み、2つの実験の数字、訓練に使ったモデルを確かめた。数字は ServiceNow 自身の測定で、第三者の追試は確かめていない。論文、コード、生成した訓練データが公開されているかは、ブログに書かれておらず、確かめられなかった。EnterpriseOps Gym の論文とデータセットのページは開いていない。

