日本語

モデル発表ネイサン・ラングレー

最先端AIモデルの性能低下を追跡する新しいベンチマーク「livenerf」が公開

この記事は翻訳です。 原文を読む

最先端のAIモデルが公式リリース後に性能の低下を経験しているかどうかを追跡するために、「livenerf」と呼ばれる新しいベンチマークが公開されました。研究者のNathan Langley(ninjahawk)氏によって開発されたこのツールは、モデルの能力が「ナーフ(nerfed)」されているかどうかを客観的に議論できるように設計されています。「ナーフ」とは、量子化、同名のままより小さなモデルへの切り替え、推論負荷の軽減、あるいはルーティングの変更といった手法を通じて性能が低下する場合に用いられる用語です。

このベンチマークは、英国AI安全研究所(AISI)のオープンソース評価フレームワークであるInspectに基づいて構築されています。高精度な結果を保証するため、livenerfは決定論的なテストに焦点を当てており、プロンプトの固定、CLIバージョンの固定、および正確なグレーダーを使用することでノイズを最小限に抑えています。このツールは、進化する期待値によって生じるユーザーの認識エラーと、実際の性能変化を区別することを目指しています。

現在、livenerfはClaude Opus 5.5の一連のテストを実行しており、2026年9月後半のリリース期間のデータを追跡しています。このベンチマークは、リリース直後に確立された10日間のベースラインと比較して性能を測定します。統計的なドリフトをより正確に検出するために、モデルの成功率が変動しやすい質問(およそ50%)を特に対象としています。他の多くの評価とは異なり、livenerfは出力トークン数も監視します。トークン数の減少は、精度が低下する前にモデルが「思考」を減らしていることを示す早期指標となる可能性があるためです。

出典

  1. 最先端AIモデルがリリース後にひそかに劣化しているかどうかを検出するためのベンチマーク「livenerf」 (GIGAZINE, 2026-10-01)
  2. GitHub