論文の概要: Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales
- arxiv url: http://arxiv.org/abs/2607.25364v2
- Date: Wed, 29 Jul 2026 15:58:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.725448
- Title: Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales
- Title(参考訳): AIエージェントのための説明境界ツール実行: モデル合理性を信頼せずに、サーバ検証されたアクションクレーム
- Abstract要約: 説明境界ツール実行(Explanation-Bound Tool Execution)は、意思決定に関連する合理的なコンテンツを型付けされたアクションクレームに変換し、それらをサーバが所有するインテント、ポリシー、ペイロード、ツール、リスク、証明、新鮮な事実に対してチェックする。
我々は,この構成を明示的な調停と信頼性のある仮定の下で形式化し,最小限の監査パケットを用いたバージョン付き参照プロファイルを実装した。
- 参考スコア(独自算出の注目度): 4.805352087824778
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-using agents expose structured calls but commonly attach free-form rationales. Such rationales are neither authorization nor reliable introspection. We present Explanation-Bound Tool Execution (EBTE), a claim-carrying mediation layer that converts decision-relevant rationale content into typed action claims and checks them against server-held intent, policy, payload, tool, risk, provenance, and freshness facts. EBTE cannot widen baseline authority: conflicts deny, incomplete or uncertain claims review, and only matching claims remain eligible for governed execution. We formalize this composition under explicit mediation and trusted-fact assumptions and implement a versioned reference profile with minimized audit packets. Across 136 authored conformance scenarios, the full profile matches all specified dispositions, admits none of 96 designated hard contradictions, and passes 232 metamorphic checks. A draft-only reference integration forwards none of 48 authored hard cases under EBTE while preserving all 16 soft-review and 4 aligned draft paths. In a frozen 2026-07-12 exploratory 224-attempt hosted-model record, the historical generation/runner agreement counts are 71/96, 66/96, and 19/32; a zero-call revalidation of the preserved minimized claims under the current pipeline yields 70/96, 65/96, and 17/32. In an AgentDojo-derived semantic check, existing high-risk controls make all 12 attack proposals non-allow, while EBTE resolves the task--proposal contradictions as deny. Together, these studies establish profile conformance and demonstrate the feasibility of server-checked action claims within the evaluated settings.
- Abstract(参考訳): ツールを使用するエージェントは構造化された呼び出しを公開しますが、通常は自由形式の合理性を加えます。
このような合理性は、承認や信頼性の高い内観にはならない。
本稿では,意思決定関連合理的なコンテンツを型付けされたアクションクレームに変換し,サーバが所有する意図,ポリシー,ペイロード,ツール,リスク,証明,新鮮さの事実に対してチェックするクレームキャリング仲介層であるExplanation-Bound Tool Execution(EBTE)を紹介する。
対立は否定、不完全または不確実なクレームをレビューし、一致したクレームのみが統治された実行に該当する。
我々は,この構成を明示的な調停と信頼性のある仮定の下で形式化し,最小限の監査パケットを用いたバージョン付き参照プロファイルを実装した。
136年にわたって、完全なプロファイルは全ての指定された配置と一致し、96の厳密な矛盾を認めず、232の変成チェックをパスした。
ドラフトのみの参照統合では、EBTEの下で48件のハードケースが作成されず、また16のソフトリビューと4つのアライメントされたドラフトパスをすべて保存している。
凍結された2026-07-12 探索用224-attempt ホストモデル記録では、履歴生成/実行契約数は71/96、66/96、19/32であり、現在のパイプラインにおける保存された最小限のクレームのゼロコール無効化は70/96、65/96、17/32となる。
AgentDojoベースのセマンティックチェックでは、既存のハイリスクコントロールは12のアタック提案をすべて無効にします。
これらの研究は、プロファイル適合性を確立し、評価された設定内でサーバチェックされたアクションクレームの実現可能性を示す。
関連論文リスト
- Cognitive Admission Control: Risk-Conditioned Assurance for Consequential Actions in Agentic Distributed Systems [2.124730017640531]
エージェント分散システムでは、エージェントは外部のインフラを変更できるが、突然変異の実行準備が整っているという証拠は欠如している。
CAC(Cognitive Admission Control)は、この証拠を明示する。
ポリシーは、型付けされた行動とそのモデル化されたリスクを、述語、エビデンスクラス、スコープ、鮮度、証人セットの制約を指定する保証義務にマップする。
承認が成功すると、アクション、証人マニフェスト、ディスパッチタイムガードを結び付ける証明書が生成される。
論文 参考訳(メタデータ) (2026-09-14T20:20:54Z) - From Intent to Execution Grant: An Execution-Boundary Conformance Profile for High-Risk AI Actions [9.27474112226667]
EBL-Coreは、1つの標準的な、完全に実体化されたAI生成候補が、明示的な条件下でアクションスコープ実行権限を受け取ることができるかどうかを決定する。
拘束力、政策非監視、エビデンス処理、決定論的判断、検証、ライフサイクル行動の付与などである。
100回の試験で32回の同時再空輸試験が成功し、1回の試行で完全に1回成功し、テスト効果が保護された。
論文 参考訳(メタデータ) (2026-09-10T14:21:45Z) - Zero-Knowledge Predicate Proofs Between AI Agents: A Measured, Cross-Protocol Gateway and the Source-Integrity Gap [0.0]
マルチエージェントAIプラットフォームは、ステージングからプロダクションへ素早く移行するが、エージェントが信頼を確立する方法はまだ初歩的だ。
提案から実行システムまで,エージェント間での検証可能なデータ最小化を行う。
32ビットのしきい値述語は6.2msで証明され、608バイトのBulletproofs証明で1.0msで検証される。
論文 参考訳(メタデータ) (2026-08-30T23:16:17Z) - Runtime Compliance Verification for AI Agents [0.19116784879310025]
現在のテストプラクティスは、オフラインのレッドチームや静的レビューに依存しているが、エージェントの動作がルールに従うことを保証していない。
本稿では,C-Trace (Compliance Trace Enforcement) を提案する。
論文 参考訳(メタデータ) (2026-06-17T16:22:34Z) - Semantic Quorum Assurance: Collective Certification for Non-Deterministic AI Infrastructure [2.124730017640531]
非決定論的エージェント基盤を管理するためのコントロールプレーンプリミティブであるQuorum Semantic Assurance(SQA)を紹介する。
SQAは暗号エビデンスチェーンに縛られた宣言的実行契約として提案を表現し、それを読み取り専用でサンドボックス化されたバリデータエージェントのさまざまなパネルにルーティングする。
インフラにインスパイアされた500の突然変異シナリオでは、曖昧なシナリオを除く安全/安全でない試験の安全性が報告され、SQAはシングルエージェント検証の18.5%から0.3%まで安全でない承認を減じている。
論文 参考訳(メタデータ) (2026-06-06T07:31:04Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation [0.0]
混在した証拠は、ある主張を支持し、別の主張の条件を必要とし、第三の主張に矛盾する可能性がある。
我々は、クレーム選択応答を検証可能なクレームに検証し、回収された証拠に対して評価し、インテントを意識したセレクタによって完全な、部分的、紛争、棄却にマッピングする。
結果として生じるインターフェースは、アクションラベル予測と、混在する証拠の下でのエビデンスリンクされたクレーム選択を分離する。
論文 参考訳(メタデータ) (2026-05-21T03:29:50Z) - Hallucination as Exploit: Evidence-Carrying Multimodal Agents [10.441697487723568]
マルチモーダルエージェントはますます、スクリーンショットやドキュメント、Webページからツールコールを選択している。
本稿では,自由形式モデルテキストを不許容な証拠として扱うエビデンス搬送型マルチモーダルエージェント(ECA)を提案する。
ECAは不透明なモデルの信念を検証者、スキーマ、実装レベルで監査可能な残留物に変換する。
論文 参考訳(メタデータ) (2026-05-18T23:40:43Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Parallax: Why AI Agents That Think Must Never Act [0.0]
本稿では,4つの原則に基づく自律型AI実行のパラダイムであるParallaxを紹介する。
本稿では、Goのオープンソースリファレンス実装であるOpenParallaxを紹介し、Assume-Compromise Evaluationを用いて評価する。
9つの攻撃カテゴリにおける280件の敵の試験ケースのうち、パララックスは98.9%の攻撃をブロックし、デフォルト設定ではゼロの偽陽性、最大セキュリティ設定では100%の攻撃をブロックした。
論文 参考訳(メタデータ) (2026-04-14T17:20:48Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - DRAFT: Task Decoupled Latent Reasoning for Agent Safety [59.46137757545185]
DRAFT(Task Decoupled Latent Reasoning for Agent Safety)を提案する。
エクストラクターは、完全な軌跡をコンパクトな連続的な潜伏ドラフトに蒸留し、リゾナーはドラフトと元の軌跡に共同で参加して安全性を予測する。
DRAFTの精度は63.27%(LoRA)から91.18%に向上した。
論文 参考訳(メタデータ) (2026-02-11T07:45:14Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - Retrieval-Augmented Generation with Conflicting Evidence [57.66282463340297]
大規模言語モデル (LLM) エージェントは、応答の事実性を改善するために、検索強化世代 (RAG) をますます採用している。
実際には、これらのシステムは曖昧なユーザクエリを処理し、複数のソースからの情報に衝突する可能性がある。
RAMDocs(Retrieval with Ambiguity and Misinformation in Documents)は,ユーザクエリのエビデンスを矛盾させるような,複雑で現実的なシナリオをシミュレートする新しいデータセットである。
論文 参考訳(メタデータ) (2025-04-17T16:46:11Z) - FIRE: Fact-checking with Iterative Retrieval and Verification [63.67320352038525]
FIREはエビデンス検索とクレーム検証を反復的に統合する新しいフレームワークである。
大きな言語モデル(LLM)のコストを平均7.6倍、検索コストを16.5倍削減しながら、パフォーマンスが若干向上している。
これらの結果から,FIREは大規模ファクトチェック業務における適用を約束していることが明らかとなった。
論文 参考訳(メタデータ) (2024-10-17T06:44:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。