論文の概要: When Tools Silently Lie: Evaluating and Mitigating Blind Compliance in Tool-Augmented Data Agents
- arxiv url: http://arxiv.org/abs/2609.37153v1
- Date: Tue, 29 Sep 2026 09:45:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.398197
- Title: When Tools Silently Lie: Evaluating and Mitigating Blind Compliance in Tool-Augmented Data Agents
- Title(参考訳): ツールが静かに嘘をついたとき: ツール強化データエージェントにおけるブラインドコンプライアンスの評価と緩和
- Abstract要約: ToxicBenchを導入し、数値、ラベル、スキーマ、検索エラーのチェックと適用を計測する。
3つのアダプタの118タスクのGPT評価では、中毒はタスク成功率を26~39ポイント低下させる。
スコアラーを凍結した後、200の軌道上の人間のアノテーションと比較し、96%のタスク・サクセス・アグリーメントが得られた。
- 参考スコア(独自算出の注目度): 0.4665390376528909
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-augmented data agents rely on tool outputs for analytical decisions. Yet successful execution can return plausible but incorrect evidence, requiring agents to decide whether to trust or verify it. Understanding this failure requires examining both the evidence obtained through checking and the answer ultimately adopted. We introduce ToxicBench to measure checking and adoption under numerical, label, schema, and retrieval errors, pairing clean and poisoned observations over fixed source data. In the 118-task GPT evaluation across three adapters, poisoning lowers task success by 26 to 39 percentage points. Ordinary retries help under one-shot poisoning, whereas repeated poisoning reveals wrong-answer adoption after checking. Controls on three public tables isolate how supplied evidence affects recovery. After freezing the scorer, we compare its judgments with human annotations on 200 trajectories, finding 96% task-success agreement. Human judgments support retry gains over Base and confirm adoption after checking on audited tasks. We release trajectories, versioned scoring, and reference and delivery audits. These findings highlight evidence availability and answer selection as complementary dimensions of agent reliability.
- Abstract(参考訳): ツール拡張データエージェントは、分析的な決定のためにツールアウトプットに依存する。
しかし、実行が成功すれば、信頼できるが誤った証拠を返すことができ、エージェントはそれを信用するか、検証するかを決定する必要がある。
この失敗を理解するには、チェックによって得られた証拠と最終的に採用された回答の両方を調べる必要がある。
ToxicBenchを導入し、数値、ラベル、スキーマ、検索エラーの下でのチェックと適用を計測し、固定されたソースデータ上でクリーンで有毒な観測をペアリングする。
3つのアダプタの118タスクのGPT評価では、中毒はタスク成功率を26~39ポイント低下させる。
通常の再試薬は単発の毒殺の助けとなるが、繰り返しの毒殺は検査後に誤審が発覚する。
3つの公的テーブルの制御は、供給された証拠が回復にどのように影響するかを分離する。
スコアラーを凍結した後、200の軌道上の人間のアノテーションと比較し、96%のタスク・サクセス・アグリーメントが得られた。
人的判断は、Baseよりもリトライのゲインをサポートし、監査されたタスクをチェックした後、採用を確認します。
トラジェクトリ、バージョン付きスコア、リファレンスとデリバリの監査をリリースしています。
これらの知見は, エージェント信頼性の相補的な次元として, 有効性と解答の選択性を示すものである。
関連論文リスト
- DISCERN: Can AI Agents Work Like Scientists and Guide Discovery? [54.755189648365565]
私たちは、自動研究ワークフローの3つの重要なレベルを評価するために、実際に利用可能なデータセットのベンチマークであるdisCERNを紹介します。
エージェントはレベル1の60.8%、レベル2の34.2%、レベル3の評価の0.6%で完璧なスコアを得る。
これらのプロファイルは、科学的な援助を監督する機会を特定するが、現在のエージェントは信頼できる自律的な分析や発見をまだ示していない。
論文 参考訳(メタデータ) (2026-09-27T08:29:32Z) - Inquesto Score: A reliability Protocol For Voice Agents [53.4810159595586]
Inquesto Score(IS)は、音声エージェントの信頼性を、固定バージョン評価集団における呼び出しの割合として測定するプロトコルである。
タイミングの失敗、セマンティック、および状態依存の失敗は、シナリオ述語、ツールトレース、ピン留めされたオープンモデル判定を用いて評価される。
Inquesto Score v0.1は、基準音声エージェントシステムの13構成に対して、30のシナリオ、3つの音響条件、4つの話者グループ、306の呼び出しを評価する。
論文 参考訳(メタデータ) (2026-09-24T20:07:53Z) - Claim-Gated Source-Risk Auditing for Generative Search [5.329247092746233]
生成検索は、サポートされたパスを引用するが、その解釈を変えるソース関係を省略することができる。
クェリソース回答のクレームゲート監査を指定する。
我々は、セマンティックな妥当性を確立するために、独立したアノテーション、保留評価、およびペアのユーティリティテストを定義する。
論文 参考訳(メタデータ) (2026-09-24T07:22:14Z) - The Delegation Blind Spot: Auditing Product Decisions from Agent Choices [2.731113456484581]
成功したエージェントの実行は、ユーザがどの製品に価値をもたらすかを識別する必要がない。
本稿では、宣言された観察チャンネルと製品価値を、互換性のある間隔や目撃者集団と対比する決定特異的監査を提案する。
論文 参考訳(メタデータ) (2026-09-22T16:15:55Z) - EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards [73.12811119273206]
我々は,包括的調査を通じて科学的エージェントを評価するベンチマークであるEarthVerseを紹介する。
エージェントは異種イベントパッケージを検査し、互換性のあるエビデンスを選択し、透過的な計算を実行し、ソース差を調整し、最終回答で証明を保存する。
システム全体では、平均回答ユニットの精度は84.65%であり、最も高いStrict@95は34.81%である。
論文 参考訳(メタデータ) (2026-08-24T17:29:16Z) - ATOBench: Tracing How Autonomous Penetration-Testing Agents Verify Vulnerabilities When Target Evidence Lies [10.386774449787948]
偽装応答は、攻撃軌跡とエージェントの検証プロセスの両方をリダイレクトすることができる。
本稿では,この検証プロセスを観測可能な評価フレームワークであるATOBenchを紹介する。
論文 参考訳(メタデータ) (2026-08-13T09:20:45Z) - From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents [47.678562263387214]
研究エージェントは、産業レコメンデーション設定において、多段階の機械学習実験をますます実施している。
生成されたアーティファクトは、サポートされないか、不完全かもしれないし、実行されたラウンドは無効かもしれないし、あるいは廃止されるかもしれないし、後の修正は、以前の発見を曖昧にするかもしれない。
本稿では,連続的アーティファクトのバウンダリ検証と実行後のクレーム資格を結合するエビデンス・グラウンド・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:37:38Z) - Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI [6.058290832294911]
エージェントベンチマークは、リポジトリの編集、Web研究、端末の使用、長期のインタラクションをますます評価している。
最近の報奨ベンチマークとシステムレポートは、エージェントが代わりに公開ソリューションを回復し、評価成果物を読み、ジェネレータ構造を推論し、フィードバックを操作し、不正なスコアリングパスの恩恵を受けることができることを示している。
我々は、プロトコルの有効性を定式化し、露出を特定し、エージェントがどのように使用したかを決定し、その結果のスコアが誤解を招くかどうかを評価するポストホック監査であるHackDetectを導入する。
論文 参考訳(メタデータ) (2026-07-24T14:55:19Z) - FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition [54.31138496553705]
日常生活におけるきめ細かい認識は、しばしばクローズドブックの分類問題ではない。
既存のベンチマークは主に視覚的認識を評価しており、このアクティブな外部知識獲得能力は過小評価されている。
そこでは,システムが外部の証拠を探し,検証し,利用し,オープンエンドのきめ細かい認識質問に答えなければならない,きめ細かな知識獲得について検討する。
論文 参考訳(メタデータ) (2026-05-13T08:49:51Z) - Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation [8.049844623361725]
インタラクティブエージェントベンチマークは、結果チェックを通じてエージェントの実行をバイナリ結果にマッピングする。
これらのチェックは、表面レベル信号に依存するか、エージェントの実際のアクションパスをキャプチャできない。
既存のベンチマークに対して、結果エビデンスレポート層を導入します。
論文 参考訳(メタデータ) (2026-05-11T12:20:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。