日本語

ニュースReal-SWE

新しいベンチマーク「Real-SWE」が登場、プライベートな実世界のエンタープライズ・コードベースでAIモデルを評価

この記事は翻訳です。 原文を読む

Real-SWEは、プライベートな実世界のエンタープライズ・グレードのコードベース上で、最先端のAIモデルを評価するために設計された新しいベンチマークとしてリリースされました。専門家が作成したタスクや合成タスクに依存する従来のベンチマークとは異なり、Real-SWEのタスクは、実世界の企業からライセンスを受けたプライベートなプロダクション環境からそのまま抽出されています。

このベンチマークは、変更がアプリケーションの複数の部分に及ぶことが多い、実際のソフトウェア・エンジニアリングの複雑さに焦点を当てています。各タスクでは、エージェントが実際の運用コンテキストにおける既存のビジネスロジック、アーキテクチャ、およびコーディングパターンを理解することが求められます。リリースによると、Real-SWEにおける典型的な指示は長さが約 1,742 文字であり、複数のファイルにわたる変更を伴い、1タスクあたりの平均ファイル数は 11 ファイルとのことです。

評価は、エンジニアの実際の作業内容を反映させるため、ネイティブなハーネスを使用した隔離されたサンドボックス内で行われます。このアプローチでは、モデル単体ではなく、モデルとハーネスの組み合わせを評価します。タスクは、DeepSWEやTerminal Benchなどのベンチマークと同様に、あえて詳細な仕様を不足させた状態で設計されており、エージェントがコードベース内および周囲のツールの中から実装の詳細を見つけ出すことが求められます。

出典

  1. Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases (Hacker News Frontpage, 2026-09-12)