論文の概要: Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems
- arxiv url: http://arxiv.org/abs/2605.05379v1
- Date: Wed, 06 May 2026 19:01:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.385498
- Title: Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems
- Title(参考訳): 部分的エビデンス・ベンチ:エージェントシステムにおけるベンチマークによる認可制限されたエビデンス
- Authors: Krti Tallam,
- Abstract要約: 本稿では、その故障モードを測定するための決定論的ベンチマークであるPartial Evidence Benchを紹介する。
このベンチマークでは、デューディリジェンス、コンプライアンス監査、セキュリティインシデント対応の3つのシナリオファミリが提供されている。
答えの正しさ、完全性意識、ギャップレポートの品質、安全でない完全性行動の4つの面に沿ってシステムを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise agents increasingly operate inside scoped retrieval systems, delegated workflows, and policy-constrained evidence environments. In these settings, access control can be enforced correctly while the system still produces an answer that appears complete even though material evidence lies outside the caller's authorization boundary. This paper introduces Partial Evidence Bench, a deterministic benchmark for measuring that failure mode. The benchmark ships three scenario families -- due diligence, compliance audit, and security incident response -- with 72 tasks total, ACL-partitioned corpora, oracle complete answers, oracle authorized-view answers, oracle completeness judgments, and structured gap-report oracles. It evaluates systems along four surfaces: answer correctness, completeness awareness, gap-report quality, and unsafe completeness behavior. Checked-in baselines show that silent filtering is catastrophically unsafe across all shipped families, while explicit fail-and-report behavior eliminates unsafe completeness without collapsing the task into trivial abstention. Preliminary real-model runs show model-dependent and scenario-sensitive differences in whether systems overclaim completeness, conservatively underclaim, or report incompleteness in an enterprise-usable form. The benchmark's broader contribution is to make a governance-critical agent failure measurable without human judges or contamination-prone static corpora.
- Abstract(参考訳): エンタープライズエージェントは、スコープ付き検索システム、委任されたワークフロー、およびポリシーに制約されたエビデンス環境の中でますます運用される。
これらの設定では、アクセス制御は正しく実施できるが、システムは依然として、発信者の認証境界外にある物質的証拠であっても、完全なように見える答えを生成する。
本稿では、その故障モードを測定するための決定論的ベンチマークであるPartial Evidence Benchを紹介する。
このベンチマークでは、3つのシナリオファミリ – デューディリジェンス、コンプライアンス監査、セキュリティインシデント対応 – が提供され、合計72のタスク、ACL分割コーパス、オラクル完全回答、オラクル認可されたビュー回答、オラクル完全性判断、構造化されたギャップレポートオーラクルが提供されている。
答えの正しさ、完全性意識、ギャップレポートの品質、安全でない完全性行動の4つの面に沿ってシステムを評価する。
チェックインベースラインは、サイレントフィルタリングが全出荷された家族で破滅的に安全でないことを示している。
予備的な実モデルの実行は、システムが完全性を過大評価するか、保守的に過小評価するか、またはエンタープライズで使用可能な形式で不完全性を報告するかにおいて、モデルに依存し、シナリオに敏感な違いを示す。
このベンチマークの幅広い貢献は、ガバナンスクリティカルなエージェントの障害を、人間の判断や汚染の恐れのある静的コーパスなしで測定可能にすることである。
関連論文リスト
- Governed Auditable Decisioning Under Uncertainty: Synthesis and Agentic Extension [0.0]
自動決定システムが失敗すると、組織はしばしば、公式に準拠したガバナンスインフラストラクチャが、何が起きたのか、なぜ起きたのかを再構築できないことに気付く。
本稿では,運用管理エビデンス・フレームワークを統合連鎖に合成し,その伝達可能性を4つの意思決定システムアーキテクチャ間で解析的に評価する。
論文 参考訳(メタデータ) (2026-04-21T05:45:04Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Auditable Agents [10.007755929469814]
LLMエージェントはツールを呼び、データベースをクエリし、タスクをデリゲートし、外部の副作用を引き起こす。
エージェントシステムが世界で活動できるようになると、もはや有害なアクションが防げるかどうかという問題ではない。
我々は、説明責任(コンプライアンスを判断し、責任を割り当てる能力)、監査可能性(説明責任を可能にするシステム特性)、監査(信頼できる証拠から振る舞いを再構築するプロセス)を区別する。
論文 参考訳(メタデータ) (2026-04-07T06:25:49Z) - Incompleteness of AI Safety Verification via Kolmogorov Complexity [0.20305676256390928]
本研究は,本質的な情報理論の限界から検証の限界が生じることを示す。
任意の高複雑性のポリシーに準拠する全てのインスタンスを証明できる有限形式検証器は存在しない。
論文 参考訳(メタデータ) (2026-04-06T17:26:09Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management [27.25517951457221]
我々は8つの災害タイプにまたがる3000の厳格に検証された質問(2000の多重選択と1,000のオープンエンド)の大規模ベンチマークであるDisastQAを紹介した。
オープンエンドQAでは,冗長性よりも事実的完全性を重視した,人間の検証されたキーポイントに基づく評価プロトコルを提案する。
20モデルを用いた実験では、MMLU-Proのような汎用のリーダーボードとはかなりの相違が見られる。
論文 参考訳(メタデータ) (2026-01-07T07:46:42Z) - Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking [64.97768177044355]
大規模言語モデル(LLM)は、現実のファクトチェックシステムにますます多くデプロイされている。
FactArenaは、完全に自動化されたアリーナスタイルの評価フレームワークである。
本研究では,静的クレーム検証精度とエンドツーエンドのファクトチェック能力の相違点を明らかにした。
論文 参考訳(メタデータ) (2026-01-06T02:51:56Z) - SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions [54.34001921326444]
話者検証(SV)モデルは、セキュリティ、パーソナライゼーション、アクセス制御システムにますます統合されている。
既存のベンチマークでは、これらの条件のサブセットのみを評価しており、他は完全に欠落している。
SVeritasは、録音時間、自発性、コンテンツ、ノイズ、マイクロホン距離、残響、チャンネルミスマッチ、オーディオ帯域幅、コーデック、話者年齢、スプーフィングおよび敵攻撃に対する感受性などのストレス下でのSVシステムの評価を行う総合的な話者検証タスクベンチマークスイートである。
論文 参考訳(メタデータ) (2025-09-21T14:11:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。