論文の概要: Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents
- arxiv url: http://arxiv.org/abs/2607.07405v1
- Date: Wed, 08 Jul 2026 13:38:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.396327
- Title: Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents
- Title(参考訳): ツール使用 LLM エージェントの無作為なポリシー違反モードを再現する決定論的ゲート
- Abstract要約: ポリシーを許容する環境では、対応する状態遷移がドメインポリシーによって禁じられている場合であっても、ツールはよくできた呼び出しを実行できる。
我々は、この障害モードを2ドルの航空会社ドメインで研究する。
我々は、決定論的かつリードオンリーの事前実行ゲートという、軽量な介入を評価する。
- 参考スコア(独自算出の注目度): 1.6567880228735357
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-using LLM agents can violate the very policies they are deployed to enforce while appearing to complete the task successfully. In policy-permissive environments, a tool may execute any well-formed call even when the corresponding state transition is forbidden by domain policy. The result is a silent wrong state (a booking cancelled, a passenger count changed, a claim acted on without verification) that neither the tool nor the agent's self-report exposes. We study this failure mode in the $τ^2$-bench airline domain. On a budget agent, 78% of observed failures are silent wrong-state failures with no tool error, and the aggregate failure rate is reproducible across disjoint seeds, not sampling noise. We then evaluate a lightweight intervention: deterministic, read-only pre-execution gates that inspect the proposed call and current state before allowing a write. A four-gate suite raises full-benchmark success from 29.6% to 42.0% on gpt-4o-mini (+12.4pp; paired task-level bootstrap P=0.0012), and the lift reproduces on a disjoint 15-seed set (+12.3pp; P=0.0008). The effect is concentrated where the gates fire: on the 26/50 firing tasks, success rises by +19.2pp, while movement on the 24 non-firing tasks does not exclude zero. Two negative controls (a self-enforcing retail domain and BFCL) bound the mechanism: gates help when tools are policy-permissive and add little where tools already self-enforce. As suggestive evidence, not a central claim, the same failure mode persists at the frontier: gpt-5.2 at default reasoning still attempts policy-violating writes, and the same suite improves success from 61.2% to 71.6% (+10.4pp; P=0.020; n=5, no replication). The contribution is a bounded evaluation and reliability result: deterministic gates do not guarantee task success, but they can deterministically prevent a known class of silent policy-violating writes at the action boundary.
- Abstract(参考訳): ツールを使用するLLMエージェントは、タスクを正常に完了させるように見える間に、それらが強制的に実施されるポリシーに違反する可能性がある。
ポリシーを許容する環境では、対応する状態遷移がドメインポリシーによって禁じられている場合であっても、ツールはよくできた呼び出しを実行できる。
その結果は、ツールもエージェントの自己報告も露呈しない静かな不正状態(予約がキャンセルされ、乗客数が変更され、検証無しに請求が実行された)となった。
我々は、この障害モードを$τ^2$-benchの航空会社ドメインで研究する。
予算エージェントでは、観測された故障の78%は、ツールエラーのない無音状態の故障であり、総失敗率は、サンプリングノイズではなく、未結合の種間で再現可能である。
次に、書き込みを許可する前に提案された呼び出しと現在の状態を検査する、決定論的で読み取り専用の事前実行ゲートという、軽量な介入を評価します。
4ゲートのスイートは、gpt-4o-mini (+12.4pp; paired task-level bootstrap P=0.0012)で29.6%から42.0%に完全ベンチマーク成功し、リフトは15シードセット(+12.3pp; P=0.0008)で再生される。
26/50発の発射では、成功率は+19.2pp上昇するが、24発の非破壊作業では0を除外しない。
2つの負のコントロール(自己強化の小売ドメインとBFCL)は、そのメカニズムに縛られている。
gpt-5.2は依然としてポリシー違反の書き込みを試みており、同じスイートは61.2%から71.6%に改善されている(+10.4pp; P=0.020; n=5, no replication)。
決定論的ゲートはタスクの成功を保証しないが、アクション境界における既知のサイレントポリシー違反書き込みのクラスを決定論的に阻止することができる。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - Fabrication After Tool Failure: Tool-Augmented Agents Assert Values Their Tools Did Not Return [7.146717861821737]
ツール拡張言語モデルは、ツールの供給に失敗した時に正直に報告するかどうかではなく、正しい回答に達するかどうかで評価される。
16のシステムドメインと8つのツール障害タイプにまたがる1024項目のベンチマークで、この障害後の決定を分離する。
論文 参考訳(メタデータ) (2026-09-13T19:46:42Z) - Engineering Reliable Commit Gates for Agentic AI: Cost-Aware Verification Portfolios under Common-Mode Data Failures [4.287745257410248]
コスト対応コミットゲートのランタイム保証ベンチマークを提案する。
48のタスクテンプレートは、6つの障害レジームで2,880のシナリオを生成する。
結果は明確なエビデンスライン、コストアウェアの選択、コミットタイムの実施を動機付けます。
論文 参考訳(メタデータ) (2026-09-10T01:42:40Z) - IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier [0.0]
監査された18のベンチマークはすべて、広告付きモデルの識別子をスコア付けする。
ゴールドブラインド機能バインディングプレフライトは、どのタスクが到達する前に、ルートが評価契約を実行可能であることを確認する。
信頼性非包括的なファーストパススコアリングルールは、有効性を保ちながらスコアの失敗を維持する。
論文 参考訳(メタデータ) (2026-09-09T17:31:29Z) - If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary [0.07499722271664146]
Out-of-Band Policy Enforcement (OBPE)は、エージェント推論以外の信頼できる境界である。
OBPEは型付き操作とリソースを許可し、バックエンド呼び出しの前にクエリを絞り込み、それからレコードとフィールドをフィルタリングし、レスポンスの値にマスクを付ける。
論文 参考訳(メタデータ) (2026-08-27T19:35:48Z) - When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents [45.88028371034407]
ツールを使用する大規模言語モデルエージェントは、ユーザが許可しなかったり、タスクが不要であったりする権限を行使しながらタスクを完了することができる。
本研究では,6次元のリスクを伴って各行動が実行前および観測結果から監査される枠組みを提案する。
このフレームワークを1500以上のタスクでQwen3.5-4Bでトレーニングした後、選択された種子は2,896回の評価エピソードで98.48%の安全成功に達した。
論文 参考訳(メタデータ) (2026-08-18T22:07:23Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - ContractBench: Can LLM Agents Preserve Observation Contracts? [9.057486468322933]
観察契約の遵守は、緊急かつ回帰的な能力であることを示す。
ContractBenchは、2つの障害モードを探索する33の二重軸タスクのベンチマークである。
i)評価モデルが80%,Claude-Opus-4.6が77.8%, (ii)Qwen 3.5で4B (0%) から9B (56.6%) の急激な家庭内能力崖が397B-A17Bで70.7%, (iii) GPT-5ファミリーでの非単調性スケーリングが消失した。
論文 参考訳(メタデータ) (2026-05-17T06:37:04Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents [0.0]
Open Agent Passport (OAP)は、実行前にツール呼び出しを同期的にインターセプトするオープン仕様とリファレンス実装である。
OAPは、53ms(N=1,000)の中央値で認可決定を強制する
セキュリティ制約を強制するのと同じインフラストラクチャでは,品質ゲートや運用契約,コンプライアンスコントロールも実施されている。
論文 参考訳(メタデータ) (2026-03-21T21:34:09Z) - Guardrails as Infrastructure: Policy-First Control for Tool-Orchestrated Workflows [0.0]
Policy-First Toolingは、明示的な制約、リスク認識ゲーティング、リカバリコントロール、監査可能な説明を通じて、ツールの実行を仲介する。
制御された5つのポリシーパックと3つの障害プロファイルをまたいだ225の運用では、厳格なパックにより、違反防止はP0の0.000からP4の0.681に改善され、タスク成功は0.356から0.067に減少した。
論文 参考訳(メタデータ) (2026-03-18T01:19:33Z) - Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks [0.38991526486631006]
信頼性障害の多くは、タスクの潜在解構造からのドリフトに起因するものであり、能力障害ではない、と我々は主張する。
我々は、モデル能力と作業難易度を維持できる自然実験を用いて、これを因果的に確立する。
論文 参考訳(メタデータ) (2026-02-22T02:37:57Z) - Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents [18.383906296536185]
Traversal-as-Policy: サンドボックス化されたOpenHandsの実行ログを単一の実行可能なGated Behavior Tree (GBT)に蒸留する
各ノードは状態条件のアクションマクロを符号化し、成功した軌道からマージチェックを行う。
実行時に、軽量なトラバーサは、子マクロに対するベースモデルの意図と一致します。
論文 参考訳(メタデータ) (2026-01-30T16:25:08Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。