日本語

製品発表KapaCompany Knowledge Bench

Kapaが実データを用いたエージェントの検索能力を評価するCompany Knowledge Benchを発表

この記事は翻訳です。 原文を読む

AIエージェント向けに社内知識をインデックス化するプラットフォームを提供するKapaは、既存の公開ベンチマークの限界に対処するために設計された新しい評価フレームワーク「Company Knowledge Bench」を発表しました。同社によると、現在のベンチマークの多くは合成ドキュメントや、法律、医学といった狭い領域に依存しており、現実世界のエンタープライズにおける多様で複雑なクエリの性質を捉えきれていないといいます。

このベンチマークは、実際のプロダクションデータからアノテーションされた1,000の評価ケースで構成されています。拡張性と正確性を確保するため、Kapaはエージェントを使用してラベルを生成し、人間がラベル付けした170ケースのデータセットと比較してその性能を検証しました。このベンチマークでは、検索エンジン(retriever)を「網羅性(completeness)」「最小性(minimality)」「ソースの優先順位(source preference)」の3つの主要な特性に基づいて評価します。なお、ソースの優先順位については、権威性のある最新のドキュメントを優先する仕組みになっています。

Kapaはこのベンチマークを用いて、従来のハイブリッド検索から高度なエージェント型検索(agentic retrievers)に至るまで、7つの異なる検索戦略をテストしました。その結果、精度、レイテンシ、コストの間に大きなトレードオフがあることが明らかになりました。最適化されたエージェント型検索エンジンである「Kapa Deep」は約5秒間で最高スコアの0.65を達成した一方、大規模言語モデルを使用したより単純な「agentic grep」手法は、コストが大幅に高く、速度も遅く、多くの場合で過剰なトークンを返してしまうことが判明しました。

今回の調査結果は、企業がより多くのエージェントを導入するにつれて、検索の精度と、レイテンシおよびトークン使用量に伴う運用コストとのバランスを最適化することが、引き続き極めて重要な課題であることを示唆しています。

出典

  1. Benchmarking retrieval for agents on messy real-world company knowledge (Hacker News Frontpage, 2026-10-02)