論文の概要: CIVeX: Causal Intervention Verification for Language Agents
- arxiv url: http://arxiv.org/abs/2605.09168v1
- Date: Sat, 09 May 2026 21:06:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.098007
- Title: CIVeX: Causal Intervention Verification for Language Agents
- Title(参考訳): CIVeX: 言語エージェントの因果干渉検証
- Abstract要約: 我々はCIVeXという因果介入検証器を導入し、提案した動作をコミットされた動作状態グラフ上の構造因果クエリにマッピングする。
Causal-ToolBench (1,890のインスタンス、7つのシード)では、CIVeXは中等度および対向的な共起で観測された偽の実行をゼロにする。
IHDPとZOZO Open Bandit(一様にランダムな真実を持つ実運用ログ)では、CIVeXはOracleの正しい実行と0.1pp以内で一致し、ネイティブなベースラインに対して、実行時の偽実行を>=50倍削減する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A valid tool call is not necessarily a valid intervention. Tool-using language agents are guarded by schema validators, policy filters, provenance checks, state predictors, and self-verification, yet such safeguards do not certify that a state-changing action has an identifiable causal effect. In confounded workflows, the action that looks optimal in observational logs can reduce utility when executed. We introduce CIVeX, a causal intervention verifier that maps proposed actions to structural causal queries over a committed action-state graph, checks identifiability, and returns one of four auditable verdicts: EXECUTE, REJECT, EXPERIMENT, or ABSTAIN. Execution requires an assumption-scoped causal certificate carrying graph commitments, an identification argument, a one-sided lower confidence bound (LCB), provenance, and risk limits. On Causal-ToolBench (1,890 instances, 7 seeds), CIVeX yields zero observed false executions across moderate and adversarial confounding. Under adversarial confounding it reaches 84.9% accuracy and 81.1% of oracle utility (+2.23 vs +2.76) and is the only non-oracle method whose constrained utility under a zero-false-execution constraint exceeds the AlwaysAbstain floor. On IHDP and ZOZO Open Bandit (real production logs with uniform-random ground truth), CIVeX matches Oracle correct-execution within 0.1pp and cuts per-execute false-execution by >=50x over naive baselines. A chain-of-thought LLM verifier (Claude Opus, Sonnet) cuts false-execution by an order of magnitude over a terse baseline, yet under adversarial confounding Opus's utility falls to 74% of CIVeX's. Intervention identifiability, not action validity, is the missing primitive for reliable tool use.
- Abstract(参考訳): 有効なツールコールは必ずしも有効な介入ではない。
ツールを使用する言語エージェントは、スキーマバリデータ、ポリシーフィルタ、前処理チェック、状態予測器、自己検証によって保護されるが、状態変更アクションが因果効果を識別するものではない。
統合されたワークフローでは、観察ログで最適に見えるアクションは実行時に有用性を低下させる。
CIVeXは、提案した動作を、コミットされた動作状態グラフ上の構造的因果クエリにマッピングし、識別可能性を確認し、監査可能な4つの評定のうちの1つを返す因果介入検証器である。
実行には、グラフのコミットメント、識別引数、一方的な低信頼境界(LCB)、証明、リスク制限を含む仮定スコープによる因果証明が必要である。
Causal-ToolBench (1,890のインスタンス、7つのシード)では、CIVeXは中等度および対向的な共起で観測された偽の実行をゼロにする。
反対の条件下では、84.9%の精度と81.1%のオラクルユーティリティ(+2.23 vs +2.76)に達し、ゼロ・ファス・エグゼクティオン制約の下で制約されたユーティリティがAlwaysAbstainフロアを超える唯一の非オラクル法である。
IHDPとZOZO Open Bandit(一様にランダムな真実を持つ実運用ログ)では、CIVeXはOracleの正しい実行と0.1pp以内で一致し、ネイティブなベースラインに対して、実行時の偽実行を>=50倍削減する。
LLM検証器(Claude Opus, Sonnet)は、厳密なベースラインに対して桁違いに偽実行をカットするが、Opusの効用はCIVeXの74%に低下する。
介入識別性は、アクションの妥当性ではなく、信頼できるツールの使用において欠落しているプリミティブである。
関連論文リスト
- Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents [1.0262304700896199]
影響に基づくガードレールの鍵となる制限は、正当でユーザ認証されたアクションと悪意のある不正なアクションとを確実に区別しないことである。
我々は,この制限を,24件のベースケースから抽出した96条件の認証等価監査を通じて明らかにした。
シャドーベースのガードレールは、テストされたすべての無害走行を可能にするが、一致した不正な動作をより頻繁に拒否することはない。
論文 参考訳(メタデータ) (2026-08-30T18:16:04Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents [1.116726665785374]
LLM推論と特殊なツールを組み合わせたグラフ誘導RCAエージェントであるグラフトラバースエージェントを提案する。
我々は、読み取り専用エビデンス収集、伝搬認識診断、有界実行、独立に検証された検証を含む運用上の制約をマップする。
ある固定されたqwenオーバージャッジによってスコアされたITBenchスナップショットでは、監査されたシステムは、同じシステムの初期のイテレーションに対してルート因果F1を上昇させる。
論文 参考訳(メタデータ) (2026-06-07T12:05:09Z) - Hallucination as Exploit: Evidence-Carrying Multimodal Agents [10.441697487723568]
マルチモーダルエージェントはますます、スクリーンショットやドキュメント、Webページからツールコールを選択している。
本稿では,自由形式モデルテキストを不許容な証拠として扱うエビデンス搬送型マルチモーダルエージェント(ECA)を提案する。
ECAは不透明なモデルの信念を検証者、スキーマ、実装レベルで監査可能な残留物に変換する。
論文 参考訳(メタデータ) (2026-05-18T23:40:43Z) - Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode [9.116800340266066]
Claude Codeの自動モードは、AIコーディングエージェントに最初にデプロイされたパーミッションシステムである。
Anthropicは、生産トラフィックに対して0.4%の偽陽性率と17%の偽陰性率を報告している。
本研究では, 個々の行動レベルでの状態変化行動253件を, オラクル・グラウンドの真理に対して評価した。
論文 参考訳(メタデータ) (2026-04-04T17:56:30Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents [0.0]
NabaOSは対話型エージェントのための軽量な検証フレームワークである。
ソースによってAI応答内のすべてのクレームを分類する。
製造されたツールの実行の94.2%、誤り回数の87.6%、虚偽の欠席債権の78.4%を検知する。
論文 参考訳(メタデータ) (2026-03-09T20:45:41Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution [49.689452243966315]
ツールコール機能を備えたAIエージェントは、IPI(Indirect Prompt Injection)攻撃の影響を受けやすい。
本稿では,選択防衛フレームワークCausalArmorを提案する。
AgentDojoとDoomArenaの実験は、CausalArmorが攻撃的な防御のセキュリティと一致することを示した。
論文 参考訳(メタデータ) (2026-02-08T11:34:08Z) - PRISM: Festina Lente Proactivity -- Risk-Sensitive, Uncertainty-Aware Deliberation for Proactive Agents [11.440330367799513]
PRISMは、決定論的ゲートとデュアルプロセス推論アーキテクチャを結合する新しいフレームワークである。
フェスティナ・レンテ(ラテン語: "make haste slow")にインスパイアされた私たちは、受け入れ校正されたコスト由来の閾値でゲートする。
ProactiveBenchでは、PRISMは誤報を22.78%減らし、F1を20.14%改善している。
論文 参考訳(メタデータ) (2026-02-02T01:56:29Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models [10.377264470934843]
大きな言語モデルに対するバックドア攻撃は、通常、暗黙の悪意のある出力に秘密のトリガーを伴います。
我々はコンプライアンスのみのバックドアを導入し、ほぼ良質なデータセットで教師付き微調整を行い、プロンプトの小さなサブセットを任意の単一ワードトリガでサフィックスする。
本研究は, 毒性予算, 総微調整データセットサイズ, モデルサイズにまたがる, この良性ラベル中毒行動のマルチスケール解析を行った。
論文 参考訳(メタデータ) (2025-11-16T02:01:58Z) - Evidence-Bound Autonomous Research (EviBound): A Governance Framework for Eliminating False Claims [0.609170287691728]
EviBoundは、二重ガバナンスゲートを通じて偽のクレームを排除するエビデンスベースの実行フレームワークである。
事前実行承認ゲートは、コードが実行される前に受け入れ基準スキーマを検証する。
実行後検証ゲートは、MLflow APIクエリを通じてアーティファクトを検証する。
論文 参考訳(メタデータ) (2025-10-28T17:47:13Z) - Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning [58.57194301645823]
大規模言語モデル(LLM)は、現実のパーソナライズされたアプリケーションにますます統合されている。
RAGで使用される知識基盤の貴重かつしばしばプロプライエタリな性質は、敵による不正使用のリスクをもたらす。
これらの知識基盤を保護するための透かし技術として一般化できる既存の方法は、一般的に毒やバックドア攻撃を含む。
我々は、無害な」知識基盤の著作権保護の名称を提案する。
論文 参考訳(メタデータ) (2025-02-10T09:15:56Z) - FIRE: Fact-checking with Iterative Retrieval and Verification [63.67320352038525]
FIREはエビデンス検索とクレーム検証を反復的に統合する新しいフレームワークである。
大きな言語モデル(LLM)のコストを平均7.6倍、検索コストを16.5倍削減しながら、パフォーマンスが若干向上している。
これらの結果から,FIREは大規模ファクトチェック業務における適用を約束していることが明らかとなった。
論文 参考訳(メタデータ) (2024-10-17T06:44:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。