日本語

製品発表Amazon Web ServicesKiro

AWS、AIエージェント「Kiro」のプロンプトを継続評価する仕組みを公開 実会話データとLLMで分析

Amazon Web Services(AWS)は、AIコーディングエージェント「Kiro」のシステムプロンプトを継続的に評価する取り組み事例を明らかにしました。ベンチマークの結果と、社内の開発者による数千件のKiroとの会話データを大規模言語モデル(LLM)で分析した結果を組み合わせ、タスク完遂やツール利用における改善機会を特定しています。

AIエージェントのシステムプロンプトは、基盤モデル、ツール、コードベース、タスク、ユーザーのあらゆる組み合わせの中で動作するため、テストスイートですべての挙動を網羅的に検証することは困難です。また、LLMの性能向上によって指示がより厳密に解釈されるようになることで、旧モデル向けに調整されたプロンプトがかえって悪影響を及ぼす「プロンプトの陳腐化(staleness)」も課題となります。

AWSが導入した評価フレームワークは、社内の会話セッションを15の挙動品質の観点でスコアリングする「LLMジャッジ」を中核としています。ジャッジは、ユーザーによる明示的な不満や会話の放棄、タスクの中断といった具体的な証拠に基づいて判定を行い、過剰な偽陽性の判定を避けるため、曖昧な会話は評価に含めない設計となっています。

同社は、この仕組みを用いてシステムプロンプトの変更をABテスト形式で比較しています。27個の変更候補をスクリーニングして悪影響のあるものを排除するなどの運用を行っており、実験の結果、Kiro CLIでは明示的な不満シグナルが5%減少、Kiro IDEでは挙動品質の問題が20%減少するなど、改善効果が見られました。

また、新しいモデルへ更新した際、旧モデル向けの過剰な制約がボトルネックになるケースがあるとAWSは述べています。これを受け、AWSはモデルの更新を単なる差し替えとは捉えず、新しいモデルとプロンプトの組み合わせとして一から再チューニングを行う運用を進めています。

出典

  1. 「システムプロンプト陳腐化」をどう防ぐか AWSの試行錯誤に見る「自社AIエージェント」運用のポイント (ITmedia AI+、2026-10-01)
  2. AWS公式ブログ