論文の概要: Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms
- arxiv url: http://arxiv.org/abs/2608.01004v1
- Date: Sun, 02 Aug 2026 05:19:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.04994
- Title: Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms
- Title(参考訳): Eval Setの長所は誰か? エージェント拡張プラットフォームにおけるRegression Eval Setの計算のための能力タキソノミー駆動パイプライン
- Authors: Tezan Sahu, Aritra Das, Pankaj Mittal, Sudipta Das,
- Abstract要約: Microsoft 365 Copilotのカスタムアクションを備えた宣言型エージェントに適用する機能-分類駆動型キュレーションパイプラインについて説明する。
エージェント仕様と顧客のevalセットを入力として、各クエリをプラットフォームが所有する機能分類に投影する。
このメカニズムは分類に非依存であり、型付き能力分類を伴う任意の回帰eval-set問題に適用される。
- 参考スコア(独自算出の注目度): 1.7499351967216341
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Platform teams hosting agent-extensibility surfaces face a regression-economics paradox: every onboarding customer ships an evaluation set tuned to their domain, but the platform's regression set must live under a hard query-count ceiling bounded by release cadence. To our knowledge, no published industrial pipeline addresses this platform-side curation problem: existing evaluation frameworks are customer-side, and benchmark-compression work treats benchmarks as fixed pools rather than streams of incoming sets. We describe a capability-taxonomy-driven curation pipeline applied to declarative agents with custom actions in Microsoft 365 Copilot. It takes an agent specification and a customer's eval set as input, projects each query into a platform-owned capability taxonomy, and outputs per-query decisions (admit, drop, swap, or human review), under the philosophy that a healthy regression set is the minimal set of queries capturing the maximal spread of capability signatures -- distinct combinations of capabilities a query exercises together. Three components instantiate this: a classifier producing per-(query, capability) verdicts via a hybrid of deterministic specification-based extraction and large-language-model (LLM) semantic inference; an Invocation Quality (IQ) rater scoring how thoroughly a query exercises each capability, so a new query sharing a signature with an existing entry can still be recognized as a better test and displace it; and a consolidator comparing incoming queries against the regression set on coverage and quality through a rule-based decision cascade, backed by a conservative curator that only suggests evictions. The mechanism is taxonomy-agnostic and applies to any regression eval-set curation problem with a typed capability taxonomy, including taxonomies that evolve in response to the very evidence the pipeline surfaces.
- Abstract(参考訳): エージェントの拡張をホストするプラットフォームチームは、レグレッション・エコノミクスのパラドックスに直面している。 オンボードするすべての顧客は、自身のドメインに調整された評価セットを出荷するが、プラットフォームのレグレッションセットは、リリースケイデンスによって制限された厳しいクエリカウントの天井の下に留まる必要がある。
既存の評価フレームワークは顧客側であり、ベンチマーク圧縮作業は、入ってくるセットのストリームではなく、ベンチマークを固定プールとして扱います。
Microsoft 365 Copilotのカスタムアクションを備えた宣言型エージェントに適用する機能-分類駆動型キュレーションパイプラインについて説明する。
エージェント仕様と顧客のevalセットを入力として、各クエリをプラットフォームが所有する機能分類に投影し、クエリごとの判断(コミット、ドロップ、スワップ、あるいはヒューマンレビュー)を出力する。
3つのコンポーネントは、決定論的仕様ベースの抽出と大言語モデル(LLM)セマンティック推論のハイブリッドによる検証を生成する分類器、実行品質(IQ)レーダ、クエリが各機能をどの程度徹底的に実行しているかを評価するため、既存のエントリとシグネチャを共有する新しいクエリは、よりよいテストとして認識され、置き換えられる。
このメカニズムは分類学に依存しないものであり、パイプライン表面の非常に証拠に反応して進化する分類学を含む、型付き能力分類学を持つ回帰eval-setキュレーション問題に適用される。
関連論文リスト
- Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures [5.14587904921075]
既存の評価は、エージェントの障害をシステムレベルの結果に還元し、どの障害がどこから発生し、どの介入がエージェントシステムを改善するのかを無視する。
同じ可視的障害は、トレーニング後のモデル、ハーネスエンジニアリング、環境再設計、あるいはそのソースによるベンチマーク修復を要求する可能性がある。
ほとんどの失敗は、ベンチマークに特有で共有構造がないため、この問題を解決するのにほとんど役立ちません。
そこで本研究では,障害を発生源とする相互作用に局所化し,責任成分を同定する相互作用中心の分類法を提案する。
論文 参考訳(メタデータ) (2026-07-30T19:55:14Z) - PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems [0.0]
PIPE-Cypherは、ライブプロパティグラフとオプションのシードクエリをバランスの取れたNL-to-Cypherベンチマークに変換する、ベンチマーク生成パイプラインである。
PIPE-Cypher がFinBench/SNB の例を3,000 個エクスポートし、3 つの監査されたアブレーションスイートを完了し、人間のラベルによる判断行動を校正し、11 つのローカルダウンストリームモデルを評価した。
論文 参考訳(メタデータ) (2026-06-07T06:53:09Z) - Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval [0.0]
Retrieval-Augmented Generation (RAG) は、言語モデル(LLM)を拡張し、その応答を外部知識に基盤付ける。
本稿では,動的クエリ分解,反復検索,および有界自己回帰評価ループを導入したエージェントオーケストレーション適応型RAGフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-04T03:38:46Z) - Linear Strategic Classification with Endogenous Improvements [6.798190446932253]
本研究では,戦略応答が結果関連特徴の真の変化を誘発する改良型について検討する。
エージェントは、配置後特徴ベクトルを戦略的に選択し、その後、安定した条件付き結果法に従ってラベルを生成する。
論文 参考訳(メタデータ) (2026-05-31T12:22:30Z) - PaQ-DETR: Learning Pattern and Quality-Aware Dynamic Queries for Object Detection [12.128587982317974]
PaQ-DETR(Pattern and Quality-Aware DETR)は、クエリ適応性と監視バランスを高める統合フレームワークである。
グローバルなセマンティクスをキャプチャし、画像固有のクエリを動的に生成する、共有潜在パターンのコンパクトなセットを学ぶ。
COCO、CityScapes、その他のベンチマークの実験では、DETRバックボーン全体で1.5%-4.2% mAPが一貫した上昇を示した。
論文 参考訳(メタデータ) (2026-03-06T22:35:35Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Continual Action Quality Assessment via Adaptive Manifold-Aligned Graph Regularization [53.82400605816587]
アクション品質アセスメント(AQA)は、ビデオにおける人間の行動を定量化し、スポーツスコアリング、リハビリテーション、スキル評価の応用を支援する。
大きな課題は、現実世界のシナリオにおける品質分布の非定常的な性質にある。
本稿では,進化する分布を扱うための連続学習機能を備えた連続AQA(Continuous AQA)を紹介する。
論文 参考訳(メタデータ) (2025-10-08T10:09:47Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Adaptive Query Rewriting: Aligning Rewriters through Marginal Probability of Conversational Answers [66.55612528039894]
AdaQRは、シードデータセットからの限定的な書き直しアノテーションと完全にパスラベルのないクエリ書き換えモデルをトレーニングするフレームワークである。
会話クエリに条件付き回答の確率を用いて,これらの候補に対する検索者の嗜好を評価する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-06-16T16:09:05Z) - Robust Question Answering Through Sub-part Alignment [53.94003466761305]
我々はアライメント問題として質問応答をモデル化する。
私たちは、SQuAD v1.1でモデルをトレーニングし、いくつかの逆および外ドメインデータセットでそれをテストします。
論文 参考訳(メタデータ) (2020-04-30T09:10:57Z) - Conditional Self-Attention for Query-based Summarization [49.616774159367516]
条件依存モデリング用に設計されたニューラルネットワークモジュールであるテキスト条件自己アテンション(CSA)を提案する。
DebatepediaとHotpotQAベンチマークデータセットの実験は、CSAがバニラトランスフォーマーを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2020-02-18T02:22:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。