ServiceNow CoreAIは、AIエージェントの能力ギャップを高品質な合成トレーニングデータへと変換するために設計されたシステム、AutoSynthDataを発表しました。このパイプラインは、特定のエンタープライズ環境において、実行可能で、現実的であり、かつ十分に難易度の高いトレーニングタスクを作成することの困難さを解消するものです。
ServiceNow CoreAIが、エンタープライズ・エージェント向けの合成トレーニングデータを生成するAutoSynthDataを発表
この記事は翻訳です。 原文を読む
AutoSynthDataは、ターゲットモデルが苦戦するタスクのパターンを特定することで動作します。より強力な「ティーチャー(教師)」モデルを使用して成功した行動を実演させ、システム仕様、ユーザープロンプト、および検証器(verifier)を含む、新しい実行可能なタスクを生成します。その後、ターゲット環境での実行と自動検証を含む厳格な品質管理ループを通じて、それらのタスクが解決可能であり、かつ健全であることを検証します。
データセットは2つのフェーズで構築されます。コアサンプルを生成する「ターゲット」フェーズと、それらのサンプルの新しいバリエーションを作成する「マルチプライ」フェーズです。この二段階のアプローチにより、データドリフトを防ぎながら、トレーニング規模のデータセット構築への道筋を提供します。
EnterpriseOps Gymベンチマークを用いた実験において、このパイプラインは大幅なパフォーマンス向上を示しました。ハイブリッドドメインにおいて、Gemma-4-26B-A4B-itをターゲットモデル、Qwen3.8-27Bをティーチャーとして使用した場合、18時間以上かけて生成された2,000個の合成サンプルでファインチューニングを行った結果、平均Pass@1が相対的に35%向上しました。また、ITSMドメインにおいても有効性が示され、合成による教師あり微調整(SFT)によって、平均Pass@1が18.77%から27.18%へと上昇しました。
出典
- AutoSynthData: Generating Training Data for Enterprise Agents (Hugging Face Blog, 2026-10-02)