論文の概要: The Missing Boundary: How Autonomous Agents Lose Control
- arxiv url: http://arxiv.org/abs/2609.11024v2
- Date: Mon, 14 Sep 2026 07:54:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.903448
- Title: The Missing Boundary: How Autonomous Agents Lose Control
- Title(参考訳): 失う境界:自律エージェントが制御を失う方法
- Abstract要約: 既存の研究はしばしば、そのような失敗は敵の指示、悪意のある環境、あるいは矛盾する目的に起因している。
本研究では,目標圧力,制御劣化,実行不可能な機会という3つの要因を独立に操作することによって,この問題を考察する。
1,800のユニークな軌道で、劣化した制御も、安全でない機会も、制御のかなりの損失を生まないことが判明した。
- 参考スコア(独自算出の注目度): 7.908421631813947
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous agents increasingly perform long-horizon tasks involving tool use, persistent state, and consequential actions, raising a fundamental question: \emph{under what conditions does an agent cross the boundary of authorized execution while pursuing a legitimate task?} Existing studies often attribute such failures to adversarial instructions, malicious environments, or conflicting objectives, leaving unclear how loss of control can emerge during otherwise legitimate task execution. We study this question by independently manipulating three factors: goal pressure, control degradation, and executable unsafe opportunity. Our central hypothesis is that a degraded control boundary becomes consequential when the environment exposes an executable action that crosses it, even when the underlying task remains legitimate and a sanctioned path remains feasible. We test this hypothesis in a deterministic multi-turn environment across five agent models and 16 operational domains. Across 1,800 unique trajectories, we find that neither degraded control nor unsafe opportunity alone produces substantial loss of control; when both are present, the loss-of-control rate reaches $55\%$ in the full-factorial study and $62\%$ across ten additional operational domains. Restoring the original control boundary reduces the rate to $0\%$ even when the unsafe action remains executable. A context-management ablation further shows that compaction itself is not harmful: preserving the control constraints yields $0\%$ loss of control, whereas omitting them increases the rate to $87\%$. These results show how a latent loss of control can become an external violation: the task objective remains intact, but an executable opportunity can turn a missing control boundary into consequential action. Our code will be made publicly available at https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/forge_bench.
- Abstract(参考訳): 自律エージェントは、ツールの使用、永続状態、そして連続的なアクションを含む長期タスクをますます実行し、根本的な疑問を提起する。
既往の研究は、しばしば敵の指示、悪意のある環境、または矛盾する目的を原因としており、そうでなければ正当なタスク実行中に制御の喪失が生じるかは明らかでない。
本研究では,目標圧力,制御劣化,実行不可能な機会という3つの要因を独立に操作することによって,この問題を考察する。
我々の中心的な仮説は、環境がそれを横断する実行可能な動作を公開すると、劣化した制御境界が連続する、というものである。
この仮説を5つのエージェントモデルと16の操作領域にまたがる決定論的マルチターン環境で検証する。
1,800のユニークな軌道で、劣化した制御と安全でない機会だけでは、制御の大幅な損失は生じない。
元のコントロールバウンダリの復元は、安全でないアクションが実行可能であったとしても、そのレートを$0\%$に下げる。
コンテクスト・マネジメント・アブレーションは、コンパクト化自体が有害ではないことを示している: 制御制約を保存すると、制御の損失は0\%となり、一方、それらを省略すると8.7\%に増加する。
これらの結果は、制御の遅延損失が外部の違反となることを示す: タスクの目的はそのままだが、実行可能な機会は、制御境界の欠落を連続的なアクションに変えることができる。
私たちのコードはhttps://github.com/Tencent/AI-Infra-Guard/tree/main/Research/forge_benchで公開されます。
関連論文リスト
- The Irreversibility Budget: Fleet-Level Risk Accounting and Admission Control for Agent Operating Systems [1.8001251270607181]
現在のコントロールは、一度に1つの効果をチェックするので、個別に認可されたエージェントの群れは、共有トリガーの下で、プリンシパルのリスクを過大に引き込むことができる。
本稿では、信頼されたランタイムが各プリンシパルに対して維持する残値リスクの累積的な計算である可逆性予算を提案する。
非可逆性を第一級資源として扱うと、ランタイムは各エージェントの残余損失をエージェントより低くし、アグリゲーションが予算を過大に上がれば限界効果を否定する。
論文 参考訳(メタデータ) (2026-08-31T19:18:09Z) - The Vulnerability With No CVE: Managing Persistent Gaps Between Mandate and Authority in AI Coding Agents [0.0]
本稿では,タスク条件付き管理抽象化としてエージェント姿勢脆弱性(APV)を提案する。
APVは、既存の過度の緊急性、認可、制御-構成の弱点を運用する。
論文 参考訳(メタデータ) (2026-08-06T11:06:06Z) - Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority [7.392721604463545]
制限はエージェントの実行アーキテクチャの不変として保証できることを示す。
学習量やスキル獲得量、自己引き起こされるガバナンスの抽象化がエージェントの許可された権限を広げることはできないことを証明します。
論文 参考訳(メタデータ) (2026-07-06T02:42:06Z) - Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents [0.4855342112648282]
コンテクスト内ガバナンスの制約は、可視でありながら確実に従うことができ、コンパクト化によって静かに取り除くことができることを示す。
1,323話中、違反は全文脈で0%から圧縮後30%に増加する。
制約を緩和する訓練不要な緩和法である制約ピンニング(Constraint Pinning)を提案する。
論文 参考訳(メタデータ) (2026-06-21T14:30:20Z) - Position: AI Safety Requires Effective Controllability [7.789894640525689]
我々は、AIの安全性は第一級の目的として制御性を必要とすると論じている。
OpenClawベースのエージェントによる実験では、現在のアライメントとガードレール機構がリスクを低減しているが、永続的で権威的で強制可能なランタイムコントロールの提供に失敗することが多い。
論文 参考訳(メタデータ) (2026-05-26T14:53:24Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning [49.48615590763914]
我々は,モンテカルロ木探索法を用いて効率的な行動探索と操作を行うLCBTというブラックボックス攻撃アルゴリズムを提案する。
提案手法は, DDPG, PPO, TD3の3つの攻撃的アルゴリズムに対して, 連続的な設定で実行し, 攻撃性能が期待できることを示す。
論文 参考訳(メタデータ) (2024-11-20T08:20:29Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z) - Uniformly Safe RL with Objective Suppression for Multi-Constraint Safety-Critical Applications [73.58451824894568]
広く採用されているCMDPモデルは予測のリスクを制約しており、長い尾の州で危険な行動を起こす余地がある。
安全クリティカルな領域では、そのような行動は破滅的な結果をもたらす可能性がある。
本稿では,目標を最大化するタスク報酬を適応的に抑制する新しい手法であるObjective Suppressionを提案する。
論文 参考訳(メタデータ) (2024-02-23T23:22:06Z) - Safety Margins for Reinforcement Learning [53.10194953873209]
安全マージンを生成するためにプロキシ臨界度メトリクスをどのように活用するかを示す。
Atari 環境での APE-X と A3C からの学習方針に対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-07-25T16:49:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。