論文の概要: Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents
- arxiv url: http://arxiv.org/abs/2610.01348v1
- Date: Thu, 01 Oct 2026 09:17:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.026081
- Title: Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents
- Title(参考訳): スコアではなくクレームを検証する: モジュールエージェントのエビデンスに基づく検証
- Abstract要約: 我々は,モジュールエージェントに対して,計画,行動,検査,精査を行うクレーム固有の検証監査を導入する。
エージェントをスコアする代わりに、監査はエビデンスをスコアする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: When developers change one component of an agent, such as its controller, a learned model or its verifier, they usually judge the change by an aggregate task score. That score cannot tell whether improvement was attainable, which component lost value, or what the agent's own checks certify. We introduce a claim-specific verification audit for modular agents that plan, act, check and refine. Instead of scoring the agent, the audit scores the evidence: each conclusion is recorded with the evidence behind it, one of four verdicts (supported, unsupported, unresolved or not evaluated) and the boundary within which it holds. Three tools supply that evidence. Oracle policies measure attainable improvement under an explicitly stated action set, so that a low value can be traced to the evaluation rather than to the environment. Replacing one component at a time with a perfect counterpart locates lost value, with null results read as unresolved whenever a downstream component could mask them. A separate test asks whether the verifier's score identifies the quantity it is read as bounding. Applied to a constrained portfolio-allocation agent in a synthetic market with known hidden regimes, the audit shows that the value of perfect regime information depends on the action set used to measure it, that the scenario generator discards most of the regime signal while better local fidelity does not improve decisions, and that the runtime verifier can be bypassed with no visible change in outcomes. The contribution is the protocol and the evidential distinctions it enforces; the empirical findings are specific to the agent and environment studied.
- Abstract(参考訳): 開発者がコントローラ、学習モデル、検証器などのエージェントの1つのコンポーネントを変更するとき、彼らは通常、その変更を集約されたタスクスコアで判断する。
このスコアは、改善が達成可能か、どのコンポーネントが値を失ったか、またはエージェント自身のチェックが認定したかどうかを判断できない。
我々は,モジュールエージェントに対して,計画,行動,検査,精査を行うクレーム固有の検証監査を導入する。
監査は、エージェントを採点する代わりに証拠を採点する: 各結論は、その背後にある証拠と、4つの評決のうちの1つ(支持、支持、支持、未解決、評価されない)と、それを保持する境界で記録される。
3つの道具がその証拠を提供する。
Oracleのポリシーは、明示的に定義されたアクションセットの下で達成可能な改善を計測するので、低い値を環境ではなく評価にトレースすることができる。
完璧なコンポーネントで一度にひとつのコンポーネントをリプレースすると、損失値が特定され、ダウンストリームコンポーネントがそれを隠蔽するたびにnull結果が未解決として読み込まれる。
別個のテストでは、検証者のスコアが、読み出された量をバウンディングとして識別するかどうかを問う。
隠蔽されたレシエーションを持つ合成市場の制約されたポートフォリオ割当エージェントに適用すると、この監査は、完璧なレシエーション情報の値は、それを測定するために使用されるアクションセットに依存すること、シナリオジェネレータがほとんどのレシエーション信号を破棄すること、より優れた局所忠実性は意思決定を改善せず、実行時検証器は結果に目に見える変化を伴わないバイパス可能であることを示している。
貢献はプロトコルであり、それが実施する明らかな区別であり、実証的な発見は研究対象と環境に特異的である。
関連論文リスト
- Agents Are Systems, Not Models: Rethinking Agentic Evaluation [80.87068485535677]
エージェントの構成の5つの部分(タスク情報、推論、自己検証、時間予算、バックボーンモデル)について検討する。
結果の約54%は、変更ではなく、同じ構成を繰り返すことによるものです。
ベンチマークと18,000以上のエージェントトラジェクトリをリリースする。
論文 参考訳(メタデータ) (2026-10-01T12:55:07Z) - Trust Is Not a Score: Runtime Assurance Contracts for High-Risk AI Agents [0.0]
本稿では,ポリシーレベルの形式的スキーマバインディング境界,コンポーネントの適性,エビデンス状態,遷移ポリシ,ヒューマンレビュー能力,非補償ゲートを提案する。
調整された保証契約(RAC)の下では、ソフトメトリクスはルーティングを通知するが、失敗または未知の強制ゲートフォースはリトライ、スイッチ、エスカレーション、デフェラル、ストップを行う。
論文 参考訳(メタデータ) (2026-09-30T13:28:42Z) - Inquesto Score: A reliability Protocol For Voice Agents [53.4810159595586]
Inquesto Score(IS)は、音声エージェントの信頼性を、固定バージョン評価集団における呼び出しの割合として測定するプロトコルである。
タイミングの失敗、セマンティック、および状態依存の失敗は、シナリオ述語、ツールトレース、ピン留めされたオープンモデル判定を用いて評価される。
Inquesto Score v0.1は、基準音声エージェントシステムの13構成に対して、30のシナリオ、3つの音響条件、4つの話者グループ、306の呼び出しを評価する。
論文 参考訳(メタデータ) (2026-09-24T20:07:53Z) - Testing and Verification of Quantum Compilers through Assurance Contracts and Evidence [0.25489046505746704]
この調査は、検証済みの変換、等価チェック、差分および変成テスト、プロパティベースのテスト、およびリビジョン間の保証の証拠を比較します。
記録されたカバレッジ更新とソースレベルの選択決定は、レビューを宣言されたスコープ内で監査可能にする。
論文 参考訳(メタデータ) (2026-09-24T01:24:49Z) - From Capability to Assurance in Autonomous Penetration-Testing Harnesses: A Framework and Reference Implementation [0.0]
我々は、保証プロパティはハーネス、ランタイムがモデルをラップし、コードで強制できると主張している。
まず,5つの保証特性(証拠的根拠,非破壊的クレームの低減,計算された重大度,強制的認可,明白な説明責任)の枠組みを定義する。
次に,フレームワーク内の代表システム(PentestGPT,Cochise参照ハーネス,MAPTA,PentestJudge)を公開コーディング基準を用いて配置し,一貫した保証ギャップを同定する。
第三に、あるオープンソース実装であるNeuroSploitを正確にコミットし、そのアーキテクチャ、そのアーキテクチャを報告する。
論文 参考訳(メタデータ) (2026-09-19T00:37:49Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering [67.8271652641864]
我々は,隠蔽状態の介入によって検証の厳密性を制御できるかどうかを検討した。
VerifySteerは、サンプルレベルのルーティングに潜時補正信号を使用し、段落境界に選択的に介入する。
論文 参考訳(メタデータ) (2026-05-20T05:48:16Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation [8.049844623361725]
インタラクティブエージェントベンチマークは、結果チェックを通じてエージェントの実行をバイナリ結果にマッピングする。
これらのチェックは、表面レベル信号に依存するか、エージェントの実際のアクションパスをキャプチャできない。
既存のベンチマークに対して、結果エビデンスレポート層を導入します。
論文 参考訳(メタデータ) (2026-05-11T12:20:15Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。