論文の概要: Safeguarding LLM Agents from Misalignment through Provenance Analysis
- arxiv url: http://arxiv.org/abs/2607.01236v1
- Date: Fri, 01 May 2026 03:16:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.971061
- Title: Safeguarding LLM Agents from Misalignment through Provenance Analysis
- Title(参考訳): 異常解析によるLSM剤の脱臭防止
- Authors: Yining She, Yiliang Liang, Eunsuk Kang,
- Abstract要約: 既存のランタイムガードレールは LLM-as-a-judge パラダイムに依存している。
本稿では,不整合検出を形式化する証明に基づく概念的枠組みを提案する。
ProvenanceGuardはミスアライメントトレースのエラー率を42.9%から1.8%に減らし、Agent-SafetyBenchでは32.1%から17.3%に減らした。
- 参考スコア(独自算出の注目度): 4.942326117464286
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As LLM agents gain increasing access to powerful tools, ensuring that their actions are aligned with the user's intent becomes critical. When an agent's proposed tool invocation deviates from the user's intent -- a phenomenon called misalignment -- it may lead to harmful consequences that are difficult to undo. Existing runtime guardrails rely on an LLM-as-a-judge paradigm that lacks a systematic framework for reasoning about alignment, often producing judgments that are inconsistent or difficult to audit. Motivated by provenance analysis, we propose a provenance-based conceptual framework that formalizes misalignment detection as determining whether a proposed tool call is supported by traceable evidence in the agent's context. Building on this framework, we propose ProvenanceGuard, a multi-stage pipeline that analyzes the agent's action for three types of misalignment before the selected tool is executed and only allows the action to take place when it is considered aligned with the user's input query. We evaluated our proposed approach on two different benchmarks, Agent-SafetyBench and WorkBench, across 10 backbone LLMs. Compared to the LLM-as-a-judge baseline, ProvenanceGuard reduces error rate on misaligned traces from 42.9% to 1.8% on Agent-SafetyBench and from 32.1% to 17.3% on WorkBench, while reducing intervention burden on task-successful traces from 30.5% to 12.8% and introducing no statistically significant increase in unnecessary interventions on aligned traces. These results demonstrate that structured, provenance-based reasoning provides an effective and practical foundation for safeguarding LLM agents from misalignment.
- Abstract(参考訳): LLMエージェントは強力なツールへのアクセスが増えるにつれて、ユーザの意図に合わせたアクションが重要になる。
エージェントの提案したツールの呼び出しが、ユーザの意図から逸脱する、つまり、ミスアライメントと呼ばれる現象を発生させると、それを解き放つのが難しい有害な結果につながる可能性がある。
既存のランタイムガードレールはLCM-as-a-judgeパラダイムに依存しており、アライメントを推論するための体系的なフレームワークが欠如している。
提案手法は,提案手法がエージェントの文脈におけるトレーサブルなエビデンスによって支持されているかどうかを判断するものとして,誤認識検出を形式化する,証明に基づく概念的枠組みを提案する。
提案するマルチステージパイプラインであるProvenanceGuardは,選択したツールが実行される前に,エージェントの動作を3種類のミスアライメントに対して解析し,ユーザの入力クエリに適合していると考えられる場合にのみアクションを実行することができる。
提案手法を,10個のバックボーンLLMに対して,エージェントセーフティベンチとワークベンチの2つのベンチマークで評価した。
LLM-as-a-judgeベースラインと比較して、ProvenanceGuardはミスアライメントトレースのエラーレートを42.9%から1.8%に減らし、エージェントセーフティベンチでは32.1%から17.3%に減らした。
これらの結果から, 構造的, 証明に基づく推論は, LLM剤の悪用から保護するための有効かつ実用的な基礎となることが示唆された。
関連論文リスト
- Agents that Matter: Optimizing Multi-Agent LLMs via Removal-Based Attribution [21.301961149692453]
エージェント属性を協調ゲームとして形式化し、連立分布、削除プロトコル、ターゲットメトリックによってパラメータ化する。
そこで,LOO(Leave-One-Out)はボトルネックエージェントをボトルネック手法として効果的に識別するが,計算コストのごく一部に留まることを示す。
また、診断精度と倫理的行動に対するエージェントの貢献がしばしば分離されることを明らかにするため、医療MASの監査に我々の枠組みを適用した。
論文 参考訳(メタデータ) (2026-05-26T19:39:27Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks [19.272001035427987]
本稿では,トリアージをエビデンス制約決定プロセスとして扱う,説明可能なAMLトリアージフレームワークを提案する。
提案手法は, (i) ポリシー/タイポロジーガイダンス, 顧客コンテキスト, 警告トリガ, トランザクションサブグラフと, (ii) 明示的な引用を必要とする構造的LCM出力契約, (iii) 矛盾や欠落した証拠から分離する構造的LCM出力契約, (iii) 最小限の, 妥当な摂動が, トリアージの推奨と理性の両方に一貫性のある変化をもたらすかどうかを検証した事実チェックを組み合わせる。
論文 参考訳(メタデータ) (2026-03-22T05:51:40Z) - Intentional Deception as Controllable Capability in LLM Agents [0.0]
本稿では,マルチエージェントシステムにおいて,意図的騙しを工学的能力として体系的に研究する。
本研究では,ターゲットエージェントの特徴を推定し,その信念や動機に反する行動に対して,意図的反応を操る2段階のシステムについて検討する。
認知的介入は、一様分布ではなく、特定の行動プロファイルに集中する差分効果を生じさせる。
論文 参考訳(メタデータ) (2026-03-08T23:48:49Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Structured Uncertainty guided Clarification for LLM Agents [126.26213027785813]
LLMエージェントは、ツールコール機能を備えた大きな言語モデルを拡張するが、曖昧なユーザ命令は、しばしば誤った呼び出しやタスクの失敗につながる。
本稿では,ツールコールパラメータに対する構造的不確かさの定式化,完全情報の期待値(EVPI)を目標としたPOMDPのモデル化,冗長性防止のためのアスペクトベースコストモデルを提案する。
我々のSAGE-Agentは、この構造化された不確実性を活用し、より優れた効率を達成するために、曖昧なタスクのカバレッジを7~39%増加させ、明確な質問を1.5~2.7$times$に減らした。
論文 参考訳(メタデータ) (2025-11-11T21:50:44Z) - Preemptive Detection and Correction of Misaligned Actions in LLM Agents [58.39520480675366]
InferActは、実行前に不整合アクションを検出する新しいアプローチである。
タイムリーな修正をユーザーに警告し、有害な結果を防ぐ。
InferActは、ミスアライメントされたアクション検出におけるベースラインに対するMarco-F1の最大20%の改善を実現している。
論文 参考訳(メタデータ) (2024-07-16T15:24:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。