評価グラフと実験構造を重ねたAI研究の抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / Enterprise Agents

ServiceNow CoreAI、企業エージェント向け合成データ基盤「AutoSynthData」を公開 — 失敗分析からカリキュラムを生成、HybridでPass@1が+7.2ptと報告

ターゲットモデルの失敗と強い教師モデルの成功から能力ギャップを特定し、新規タスクを生成・検証してSFTに回す循環型パイプライン。EnterpriseOps GymのHybridとITSMで改善を確認したとしている。

企業が自社環境でエージェントを動かすとき、汎用に賢いモデルでも特定のワークフローやツール連携、制約順守でつまずくことがある。ServiceNow CoreAIは2026年10月2日、そうした能力ギャップを訓練データに変えるパイプライン「AutoSynthData」をHugging Faceブログで公開した。モデルの失敗を起点にカリキュラムを組み直す点が特徴で、EnterpriseOps Gymを用いた実験結果も示している。以下はすべて一次情報(同ブログ記事)の記載範囲に基づく。

失敗を起点にカリキュラムを組む仕組み

  • 入力は評価実行の差分: 対象環境でターゲットモデルとより強い教師モデルを走らせ、使うツールとワークフロー構造、ターゲットの失敗箇所と教師の成功振る舞い、正しい最終状態の条件、能力を保ったまま変えられる次元を抽出する。
  • 能力仕様カードに消毒して集約: 評価タスクの原文プロンプト・実体・軌跡・検証器の詳細は生成器に渡さず、消毒済みの能力仕様カードだけを渡して新規タスクを作らせる。評価タスクの丸写しを防ぐ設計である。
  • 2段階で訓練規模に拡張: まず並列ワーカーが能力仕様から中核サンプルを生成・検証する「target」段階、次に受理済みサンプルから新規変種を作る「multiply」段階。変種がさらに変種を生むことは禁止し、中核集合からの漂流を抑える。
  • 生成と実行の分離: 生成・品質管理・網羅率を担う共有コントローラーと、環境実行・状態管理・検証を担うアダプターを分け、環境を差し替え可能にしている。

二層の検証 — サンプル単位とバッチ単位

  • 難易度の選別: ここでの設定は、ターゲットモデルが3試行中1回以下しか解けず、強いソルバーが3試行中2回以上解けるタスクを優先する。解けなさすぎず、解けきってもいない境界帯を狙う。
  • 正例ゲート: 参照軌跡を環境で実行し、候補の検証器が成功と判定するかを確認する。プロンプト・初期状態・解法・成功条件の不整合をあぶり出す。
  • 負例ゲート: 期待される結果の一部を改変し、それが検証を通過しなくなることを確認する。誤った振る舞いに報酬を与える緩い検証器を検出する。
  • 有界の修復: 不合格候補は破棄前に批評(critic)が診断し、狙いを絞った修復を固定回数だけ試す。修復後もゲートを再通過する必要がある。
  • バッチ単位のメタレビュー: 受理・却下サンプルと生成挙動を横断し、過剰代表のタスク群、欠落した能力次元、反復パターン、系統的問題を点検して次バッチの生成方針を調整する。
  • 閉ループ: 訓練後に同環境で再評価し、解けるようになったタスクを次回の対象から外し、残る失敗に生成を集中させる。SFTでの実証が中心で、RLへの拡張は今後の計画としている。

EnterpriseOps Gymでの実験結果(ベンダー公表値)

  • Hybridドメイン: ターゲットはGemma-4-26B-A4B-it、教師はQwen3.8-27B。約18時間で2,000件の合成サンプルを生成しSFTした結果、最良チェックポイント(epoch 5)で平均Pass@1が7.2pt改善(相対35%)、検証器成功率は63.01%→68.55%、Gemmaと参照モデル間のPass@1差の59%を埋めたとしている。
  • ITSMドメイン: 同じターゲットに教師DeepSeek-V4.1-Flashで1,994件を66時間かけて生成(大規模教師の使用と最適化前の実行が主因と説明)。平均Pass@1は**18.77%→27.18%**に上昇したとしている。
  • 解釈の注意: いずれもServiceNow側の報告値で、単一ベンチマーク環境(EnterpriseOps Gym、Malayら2026年の公開データセット)内のSFT結果である。独立した再現評価や、実業務環境への転移効果はこの記事の範囲では確認できない。

出典