論文の概要: A Trust Layer for Agent Evaluation
- arxiv url: http://arxiv.org/abs/2610.07274v1
- Date: Mon, 05 Oct 2026 19:15:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.611744
- Title: A Trust Layer for Agent Evaluation
- Title(参考訳): エージェント評価のための信頼層
- Abstract要約: エージェント評価のための信頼層(Trust Layer for Agent Evaluation)は、各スコアの横に、それを信じるべきかを報告します。
結果がベンチマーク自身のグレーディングロジックによってサポートされているかどうか、パス回答がトレーサブルによって得られたかどうか、エージェントの完了クレームが何が起きたかに一致しているか、そして繰り返し実行時に結果が安定であるかどうか、の4つの特性を検証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deterministic benchmark scores show that an agent received credit, but not whether that credit was earned, reported honestly, or would hold on a second run. We introduce a Trust Layer for Agent Evaluation, an additive post-hoc framework that reports, beside each recorded score, whether it should be believed. It verifies four properties: whether the result is supported by the benchmark's own grading logic, whether a passing answer was earned through traceable computation, whether the agent's completion claim matches what occurred, and whether the result is stable under repeated execution. The first three use only saved artifacts; the fourth re-runs the agent. Model judgments only label evidence under majority voting; all verdicts follow deterministic rules and never modify the recorded score. Applied to five agent configurations on 108 tasks from Agents' Last Exam, every model shows passing runs with no traceable computation (at rates varying tenfold), confirmed false completion claims, and unstable results: 18-46% of tasks do not stay in one score band over five runs. Only 22.6% of recorded passes clear all four checks (95% CI 15.0-32.6, n=84). Measuring what an agent can do and verifying that it did it are different problems, and current benchmarks address only the first.
- Abstract(参考訳): 決定論的ベンチマークスコアは、エージェントがクレジットを受け取っていることを示しているが、そのクレジットが獲得されたか、正直に報告されたか、または第2ランで保持されたかは問わない。
エージェント評価のための信頼層(Trust Layer for Agent Evaluation)は、記録された各スコアの横に、それを信じるべきかを報告する追加的なポストホックフレームワークである。
結果がベンチマーク自身のグレーディングロジックによってサポートされているか、パスした答えがトレース可能な計算によって得られたか、エージェントの完了クレームが何が起きたかに一致しているか、そして繰り返し実行時に結果が安定であるか、の4つの特性を検証する。
最初の3つは保存されたアーティファクトのみを使用し、第4はエージェントを再実行する。
全ての評決は決定論的規則に従っており、記録されたスコアを変更することはない。
エージェントのLast Examから108タスクの5つのエージェント設定に適用すると、すべてのモデルがトレース可能な計算(レートは10倍)、確認された偽完了のクレーム、不安定な結果でパス実行を示している:タスクの18-46%は5回の実行で1つのスコアバンドに留まらない。
記録されたパスの22.6%だけが4つのチェックをすべてクリアしている(95% CI 15.0-32.6, n=84)。
エージェントに何ができるかを測定し、それを検証することは異なる問題であり、現在のベンチマークは最初にのみ対処する。
関連論文リスト
- Beyond Corrected Memory: Execution Consistency in Multi-Agent Systems [42.90481302321822]
我々は、国家利用、情報ハンドオフ、そして最終状態合意を管理する義務を通じて、実行の一貫性を定義します。
私たちの主張の中核は、同じ保持されたレコードは、同じタスクルールの下での実行に準拠し違反する可能性がある、ということです。
整合性診断と回復のためのフレームワークであるCAVERTを用いて、ログからサポート対象の関係を抽出する。
論文 参考訳(メタデータ) (2026-10-06T10:29:41Z) - Open-Endedness Bench: Measuring Epistemic Process from Agent Records [16.669358445244438]
OEBはベンチマークに依存しない方法論であり、エージェントの実行レコードのみを読み、結果スコアを決して読み出さない。
3つのベンチマークから12タスク以上を実行しています。
10のタスクのうち9つで、ベストランは、最悪の実行よりも後半で新しいアイデアを試す。
論文 参考訳(メタデータ) (2026-10-01T23:34:37Z) - Agents Are Systems, Not Models: Rethinking Agentic Evaluation [80.87068485535677]
エージェントの構成の5つの部分(タスク情報、推論、自己検証、時間予算、バックボーンモデル)について検討する。
結果の約54%は、変更ではなく、同じ構成を繰り返すことによるものです。
ベンチマークと18,000以上のエージェントトラジェクトリをリリースする。
論文 参考訳(メタデータ) (2026-10-01T12:55:07Z) - Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training [45.727227890697556]
我々は,9,961のソースタスクから50,228のエラー診断ペアからなるエージェントエラーデータセット(AED)を紹介した。
5段階のAgenic Error-to-Trainingパイプラインは自然の故障を収集し、診断と修正案を生成し、記録された証拠と照合する。
アクタートレーニングのレシピの比較において、アクションオンリーの修復トレーニングは成功オンリーのトレーニングよりもWebShop-liteの方が6.67ポイント高い。
論文 参考訳(メタデータ) (2026-09-30T16:40:22Z) - Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs [6.442213381552777]
臨床エージェントベンチマークは同一の入力に対して同一の判定を報告でき、エージェントは各ランに対して実質的に異なる順序を出力する。
これは、固定された全ての入力でタスクをリプレイし、スコアではなく注文を比較します。
この研究は、アクションレベルのばらつきが存在することを証明し、スコアによって記録されずに通過できるが、どのレートも一般化するわけではない。
論文 参考訳(メタデータ) (2026-09-11T22:44:35Z) - AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents [2.8000808592516293]
AgentAuditは10の能力、グラウンド、セキュリティ、振る舞いの次元にわたって、実行トレース全体を評価する。
記録された実行トレースのみを読み出し、エージェントの実行方法に干渉しない。
我々は,9つの言語モデル(OpenAI GPT-5, Claude Sonnet 5, Sarvam 105B, Llama 3.3 70B, Gemini 2.5 Flash)を,9つの能力と対向タスクで評価した。
論文 参考訳(メタデータ) (2026-09-09T08:29:16Z) - ExecCritic: Learn to Test, Test to Improve for Coding Agents [68.42713285082912]
実行時のフィードバックは、コーディングエージェントを正しいリポジトリの修復に導くことができますが、テストが問題によって要求された振る舞いをキャプチャした場合のみです。
ExecCriticを導入し、テスト-検証-修正足場と、その中のトレーニングエージェントのためのロール固有の強化学習レシピを組み合わせる。
テストエージェントが独立してリポジトリネイティブなテストを生成し、フェイルクローズされたハーネスがそれらを調整して凍結し、リカバリエージェントがテストを変更することなく、ソースコードを実行フィードバックから修正する。
論文 参考訳(メタデータ) (2026-09-08T17:53:37Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI [6.058290832294911]
エージェントベンチマークは、リポジトリの編集、Web研究、端末の使用、長期のインタラクションをますます評価している。
最近の報奨ベンチマークとシステムレポートは、エージェントが代わりに公開ソリューションを回復し、評価成果物を読み、ジェネレータ構造を推論し、フィードバックを操作し、不正なスコアリングパスの恩恵を受けることができることを示している。
我々は、プロトコルの有効性を定式化し、露出を特定し、エージェントがどのように使用したかを決定し、その結果のスコアが誤解を招くかどうかを評価するポストホック監査であるHackDetectを導入する。
論文 参考訳(メタデータ) (2026-07-24T14:55:19Z) - Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation [8.049844623361725]
インタラクティブエージェントベンチマークは、結果チェックを通じてエージェントの実行をバイナリ結果にマッピングする。
これらのチェックは、表面レベル信号に依存するか、エージェントの実際のアクションパスをキャプチャできない。
既存のベンチマークに対して、結果エビデンスレポート層を導入します。
論文 参考訳(メタデータ) (2026-05-11T12:20:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。