論文の概要: Operational Hallucination and Safety Drift in AI Agents
- arxiv url: http://arxiv.org/abs/2607.18366v1
- Date: Mon, 20 Jul 2026 17:01:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.204613
- Title: Operational Hallucination and Safety Drift in AI Agents
- Title(参考訳): AIエージェントにおける手術の幻覚と安全ドリフト
- Authors: Shasha Yu, Fiona Carroll, Barry L. Bentley,
- Abstract要約: ツール使用自律エージェントのプランナーとして機能する大規模言語モデル(LLM)は、マルチターン実行における動的信頼性のリスクを導入する。
本稿では,複数のLLM(Safety Drift)とOperational Hallucination(Operational Hallucination)の2つの障害モードを実証的に特徴付ける。
本稿では、インテント-アクション整合性チェック、状態追跡、強制終了プリミティブを組み込んだ、軽量でプラグ&プレイのアーキテクチャ青写真であるAction-Aware Supervision Layerを提案する。
- 参考スコア(独自算出の注目度): 0.3823356975862005
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) serving as planners in tool-using autonomous agents introduce dynamic reliability risks in multi-turn execution. While single-turn safety mechanisms are relatively mature, extended interactions reveal structural vulnerabilities where initial alignment degrades over time. This paper empirically characterizes two observed failure modes across multiple state-of-the-art LLMs: Safety Drift, the gradual erosion of declared safety intent leading to constraint-violating actions (e.g., textual refusal followed by reconnaissance and unsafe execution), and Operational Hallucination, persistent repetitive tool calls indicative of flawed state perception (e.g., livelocks even in legitimate tasks). Through controlled multi-turn evaluation on high-stakes ethical dilemmas, malicious requests, and benign controls, we quantify these phenomena using declaration-action gap and livelock metrics, demonstrating their cross-model prevalence under direct execution protocols. Root-cause analysis attributes the instabilities to the decoupling of reasoning context from execution state in current agent loops. We propose an Action-Aware Supervision Layer - a lightweight, plug-and-play architectural blueprint incorporating intent-action consistency checks, runtime state tracking, and forced termination primitives. Post-hoc simulation on captured failure trajectories shows the layer can intercept observed violations without false positives on benign cases. This work advances agent reliability by shifting focus from linguistic safeguards to enforceable architectural mechanisms for responsible agentic AI.
- Abstract(参考訳): ツール使用自律エージェントのプランナーとして機能する大規模言語モデル(LLM)は、マルチターン実行における動的信頼性のリスクを導入する。
シングルターン安全機構は比較的成熟しているが、拡張された相互作用は初期アライメントが時間の経過とともに低下する構造上の脆弱性を明らかにする。
安全ドリフト, 宣言された安全意図の緩やかな侵食, 制約違反行為(例えば, テキストの拒絶, 偵察, 安全でない実行) と, 欠陥のある状態認識(例えば, 正当なタスクにおいても)を示す持続的反復的ツール呼び出しの2つの障害モードを実証的に特徴付ける。
本研究では,高次の倫理的ジレンマ,悪意のある要求,良性的な制御に対するマルチターン評価を通じて,これらの現象を宣言-アクションギャップとライブロックメトリクスを用いて定量化し,直接実行プロトコル下でのモデル間の有病率を示す。
ルート原因分析は、現在のエージェントループの実行状態から推論コンテキストを分離する不安定さを特徴としている。
本稿では、インテント-アクション整合性チェック、実行時状態追跡、強制終了プリミティブを組み込んだ、軽量でプラグ&プレイのアーキテクチャブループリントであるAction-Aware Supervision Layerを提案する。
捕獲された障害軌跡のポストホックシミュレーションは、その層が観測された違反を、良性ケースに偽陽性を伴わずに阻止できることを示している。
この作業は、責任あるエージェントAIのための強制可能なアーキテクチャメカニズムに焦点を移すことで、エージェントの信頼性を向上させる。
関連論文リスト
- AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Beyond Fluency: Toward Reliable Trajectories in Agentic IR [0.0]
本論文は, 産業用エージェントシステムで観測された故障モードを合成する。
安全なデプロイメントには、エンドポイントの正確性を超えて、軌道の整合性と因果属性に移行する必要がある、と我々は主張する。
論文 参考訳(メタデータ) (2026-04-05T21:20:57Z) - VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit [44.24310459184061]
オープン環境で動作するLLMエージェントは、間接的なプロンプトインジェクションによるエスカレーションリスクに直面している。
制約的分離から検証前コミットプロトコルへパラダイムをシフトするフレームワークである textbfVIGIL を提案する。
論文 参考訳(メタデータ) (2026-01-09T12:19:49Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation [4.29885665563186]
LATENTGUARDは、行動アライメントと教師付き潜在空間制御を組み合わせて、解釈可能で正確な安全操縦を行うフレームワークである。
本研究は, 実用性を損なうことなく, 安全性制御性と応答解釈性の両方を向上することを示す。
論文 参考訳(メタデータ) (2025-09-24T07:31:54Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。