論文の概要: When Tools Lie: Reliability of Mathematical Agents Under Corrupted Tool Feedback
- arxiv url: http://arxiv.org/abs/2610.08097v1
- Date: Tue, 06 Oct 2026 10:28:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.93302
- Title: When Tools Lie: Reliability of Mathematical Agents Under Corrupted Tool Feedback
- Title(参考訳): ツールリー: 破損したツールフィードバック下での数学的エージェントの信頼性
- Abstract要約: 隠されたインターセプターが、破損したツールコールの結果を、ターゲットとする問題に関する確実な誤った情報に置き換える方法を示す。
検証がなければ、破壊は劇的な精度の低下を引き起こし、100%から72.4%に低下する。
強制的なポリシーは検証を強制するが、オプション的なポリシーはそれを呼び出すためのモデル自身の選択に依存する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mathematical problem solving often requires deterministic computational steps that agents delegate to tools and implicitly trust. Yet tools can fail silently, returning plausible but incorrect results. How well can agents detect and correct corrupted tool call outputs? We study this through a controlled corruption framework where a hidden interceptor replaces tool call results with plausible incorrect information on targeted problems. We evaluate agents across 31 problems under four verification designs including no verification (baseline), mandatory same-context reflection, optional fresh-context verification, and optional structural verification. Without verification, corruption causes dramatic accuracy loss, from 100% down to 72.4%. Mandatory reflection fully recovers this performance to 100%. Optional verification improves accuracy only when models actively invoke it. Our results show that checking frequency is strongly associated with robustness differences, while unequal invocation prevents a controlled comparison of verifier quality. A supporting recovery experiment shows that full problem restart succeeds in 100% of cases after explicit detection. These findings demonstrate that verifier availability and verification policy are separate components of mathematical-agent reliability. Mandatory policies enforce verification while optional policies depend on the model's own choice to invoke it.
- Abstract(参考訳): 数学的問題解決は、エージェントがツールに委譲し、暗黙的に信頼する決定論的計算ステップを必要とすることが多い。
しかし、ツールは静かに失敗し、妥当だが間違った結果を返す。
エージェントはどの程度、腐敗したツールコールのアウトプットを検出し、修正できるのか?
本研究では,隠蔽インターセプタがツールコール結果を置き換える制御された汚職フレームワークを用いてこれを検証する。
本報告では, 検証不能(ベースライン), 強制的同文リフレクション, 任意新文リフレクション, 任意構造検証を含む, 4つの検証設計に基づく31の課題を対象としたエージェントの評価を行った。
検証がなければ、破壊は劇的な精度の低下を引き起こし、100%から72.4%に低下する。
強制反射により、この性能は100%回復する。
オプション検証は、モデルが積極的にそれを呼び出したときにのみ精度が向上する。
その結果、チェック周波数は頑健性の違いと強く結びついているのに対し、不等な呼び出しは検証品質の制御された比較を妨げていることがわかった。
回復支援実験では、明示的な検出の後、100%のケースで完全な問題の再起動が成功することが示された。
これらの結果から,検証器の可用性と検証ポリシが数学的信頼性の別な構成要素であることが示唆された。
強制的なポリシーは検証を強制するが、オプション的なポリシーはそれを呼び出すためのモデル自身の選択に依存する。
関連論文リスト
- hacktrace: behavior-supervised detection of reward hacking during code generation [52.709361620508595]
コーディングエージェントは、コードを修正するか、バグを露呈するテストを削除することで、パスグレードを得ることができる。
我々はQwen3-8Bから173,561個の注釈付きマルチターン符号化トラジェクトリをリリースし、成功を活かさないショートカット動作の監視が検出を大幅に改善することを示す。
HACKTRACEは、エージェントがコードを生成する際に既に計算している内部状態を読み取る行動監視モニターである。
論文 参考訳(メタデータ) (2026-10-02T09:35:59Z) - Agents Are Systems, Not Models: Rethinking Agentic Evaluation [80.87068485535677]
エージェントの構成の5つの部分(タスク情報、推論、自己検証、時間予算、バックボーンモデル)について検討する。
結果の約54%は、変更ではなく、同じ構成を繰り返すことによるものです。
ベンチマークと18,000以上のエージェントトラジェクトリをリリースする。
論文 参考訳(メタデータ) (2026-10-01T12:55:07Z) - Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents [0.0]
我々は,モジュールエージェントに対して,計画,行動,検査,精査を行うクレーム固有の検証監査を導入する。
エージェントをスコアする代わりに、監査はエビデンスをスコアする。
論文 参考訳(メタデータ) (2026-10-01T09:17:47Z) - TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents [1.1279808969568255]
TwinCheckは、トレースがトレースローカル障害仮説に結びついている証拠条件を満たす場合にのみ、置換を検討するポリシーである。
ペア評価の場合、正確なリプレイはエージェントのパースされた応答とアクションを保持し、最初の置換が受け入れられるまで固定される。
論文 参考訳(メタデータ) (2026-09-22T18:09:40Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering [67.8271652641864]
我々は,隠蔽状態の介入によって検証の厳密性を制御できるかどうかを検討した。
VerifySteerは、サンプルレベルのルーティングに潜時補正信号を使用し、段落境界に選択的に介入する。
論文 参考訳(メタデータ) (2026-05-20T05:48:16Z) - Verify-Gated Completion as Admission Control in a Governed Multi-Agent Runtime: A Bounded Architecture Case Study [0.6875312133832079]
制御されたマルチエージェントランタイムの入出力制御パターンとして,検証ゲート補完について検討する。
観測条件下では,読み取り専用検証ゲートとパケット化入力記録が検査可能で,フェールクロースされた。
論文 参考訳(メタデータ) (2026-05-18T07:52:13Z) - interwhen: A Generalizable Framework for Verifiable Reasoning with Test-time Monitors [47.363850513075356]
実験時間検証フレームワークであるInterwhenを提案し, 与えられた検証結果に対して, 推論モデルの出力が有効であることを保証する。
検証された推論は、物理的な世界にエージェントを配置するといった高度なシナリオにおいて重要な目標である。
論文 参考訳(メタデータ) (2026-02-05T08:35:01Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。