論文の概要: Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives
- arxiv url: http://arxiv.org/abs/2607.14166v2
- Date: Fri, 17 Jul 2026 08:59:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.397145
- Title: Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives
- Title(参考訳): 停止手段:エージェントフレーム制御プリミティブにおける強化ギャップの測定と修復
- Abstract要約: この契約は、広く使用されている6つのオープンソースフレームワークのどれにも当てはまらない。
モデルフリーディファレンシャルプローブは、繰り返し発生するシリングリークを分離する。
SoundGATEは環境外部のRustゲートであり、すべての副作用を認めなければならない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Production LLM-agent frameworks ship control primitives -- human-in-the-loop approval gates, run cancellation, and execution timeouts -- whose names and documentation imply barrier semantics: while a run is paused, cancelled, or timed out, no gated side effect executes. This contract holds on none of six widely used open-source frameworks. Model-free differential probes isolate a recurring sibling leak -- an approval gate suspends its own branch while a sibling's effect executes during the pause, defeating rejection -- in every framework shipping a pre-execution gate (five of six, four execution models, two language runtimes), and confirm replay double-execution, cancellation orphans, and timeout zombies. The hazard is reachable: frontier models emit the leak-triggering plan shape at rates up to 14%, and live models driving unmodified frameworks leak 215 of 1,200 runs (P(leak | emitted)=1.00); on naturalistic tau-bench episodes models serialize writes -- the everyday gap is latent -- while injection induces it deterministically and a 13-incident public corpus corroborates the replay and cancellation failures. We repair the gaps with SOUNDGATE, an environment-external Rust gate through which every side effect must be admitted, enforcing hold-until-decided, reject-cancels, dedup-on-replay, and fence-on-cancel under a stated complete-mediation contract, discharged for network egress by two kernel-enforced routes. The admission core is mechanically verified (Verus; TLA+/TLC to 7.5e7 states; TLAPS; Loom on the deployed Rust) and bridged to code by differential conformance over 1.2e7 operations with zero divergences. Under that contract SOUNDGATE blocks every measured violation on all six frameworks while releasing legitimate effects: gated tau-bench episodes complete with zero refusals at ~1 ms per write, and durable admission sustains ~12k admissions per second.
- Abstract(参考訳): プロダクション LLM-agent フレームワークは、コントロールプリミティブ -- ループ内の承認ゲート、実行キャンセル、実行タイムアウト -- を出荷する。
この契約は、広く使用されている6つのオープンソースフレームワークのどれにも当てはまらない。
モデルフリーのディファレンシャルプローブは、事前実行ゲート(6つの実行モデル、4つの実行モデル、2つの言語ランタイムの5つ)を出荷するすべてのフレームワークにおいて、繰り返し発生するシブリングリーク(承認ゲート)を分離し、二重実行、キャンセル孤児、タイムアウトゾンビを再現する。
フロンティアモデルはリークトリガ計画の形状を最大14%出力し、修正されていないフレームワークを駆動するライブモデルは1,200ランのうち215回リークする(P(leak | emitted)=1.00)。
SOUNDGATEとのギャップを修復する。これは環境外ラストゲートで、すべての副作用を許容し、ホールド・アンティル、リジェル、デダップ・オン・リプレイ、フェンス・オン・シンセロールを2つのカーネル強化ルートでネットワークエクスプレスのために排出する。
エントリーコアは機械的に検証され(Verus; TLA+/TLC to 7.5e7 state; TLAPS; Loom on the deployed Rust)、非発散の1.2e7操作に対する差分適合性によってコードにブリッジされる。
この契約の下で、SOUNDGATEは6つのフレームワークすべてに対するすべての測定された違反をブロックし、正当な効果をリリースする。
関連論文リスト
- LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - $Z^2$-ACT: End-to-End Verifiable Agentic Intent Control for Open 6G RAN [43.15181031994434]
本稿では,ゼロ知識監査制御とゼロ信頼検証エージェントインテントアーキテクチャを提案する。
実大規模言語モデルは、オペレータの意図をIntent Contractsに変換するために、非リアルタイムパスで使用される。
その結果、動作フィルタリングと攻撃レジリエンスを適度なレイテンシとシグナリングコストで改善したことが示唆された。
論文 参考訳(メタデータ) (2026-08-21T12:44:03Z) - Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers [0.0]
実行状態を維持して、実行を中断し、クラッシュを生き残るためのフレームワークは、すでに発生した影響に対して、再開が何を意味するのかを判断し続けなければなりません。
5つの広くデプロイされたエージェントワークフローフレームワークがそれぞれ異なる答えを出し、マシンチェック可能なコントラクトを公開することはない。
LangGraph 1.2.9は2度目の履歴書値を記録し、それを参照せず、無意味な状態を静かに持続し、実際のSIGKILLの後、永続的に記録された作業を再実行する。
論文 参考訳(メタデータ) (2026-08-04T15:45:31Z) - Belief-Space Perception Routing under Coupled Sensor Faults and Compute Contention [0.0]
固定された時計を見て反応しなければならないロボットは、同時に2つの問題に遭遇する。
本稿では,センサフォア状態と計算競合状態の推定値を追跡する知覚ルータを提案する。
2つのストレッサーが共起している場合、結合されたポリシーは期限満了率を1.1から9.4ポイントに削減する。
論文 参考訳(メタデータ) (2026-07-31T22:17:12Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control [5.796499740822509]
本稿では, プロフ・オ・ストップライフサイクル・コントロールについて紹介する。
これは、新しい、追跡されたソースベースで機械的に検証可能な証拠が関連するゲートを満たす場合にのみ、ライフサイクルの遷移を可能にする。
我々は, 機構試験, パワードコントロール・ポリシー・アブレーション, セルフアプリケーション・エビデンスによるオープンソース実装の評価を行った。
論文 参考訳(メタデータ) (2026-07-16T12:06:21Z) - Falsifiable Release Gates for Self-Improving Systems [0.0]
本稿では,フェール可能なリリースゲートと,そのようなシステムの構築と検証方法について述べる。
すべての新機能は、出荷前に、指定されたマシン検証可能な受け入れスイートをパスしなければならない。
コントロールリングによってマイニングされる安全クリティカルなプロパティ機能トークンのないエフェクターには、アクションは発生しない。
論文 参考訳(メタデータ) (2026-07-11T06:06:34Z) - Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents [76.4694046738862]
TokenWallは、エージェントトークンフローのセマンティックファイアウォールとして機能するランタイム防衛フレームワークである。
TokenWallは攻撃成功率を12.5%に抑えつつ、97.4%の良質なパスレートを維持している。
論文 参考訳(メタデータ) (2026-07-09T12:18:40Z) - Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents [0.0]
PortICOは、プランナーに露出する機能のリファレンスモニターである。
明示的なタスクコントラクトを初期機能にコンパイルし、ルールを付与し、信頼できるクロージャ述語、グローバルな否定ルールを付与する。
論文 参考訳(メタデータ) (2026-06-21T13:52:37Z) - A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots [1.948261185683419]
推論パイプライン全体を通して直接および間接的なインジェクションをインターセプトする3層フレームワークを提案する。
GPT-4o、Llama 3、Mistral 7Bの5,080サンプルの評価は、このフレームワークが攻撃成功率(ASR)を71.4%から11.3%に下げていることを示している。
論文 参考訳(メタデータ) (2026-06-17T23:59:57Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models [5.937023024175801]
本稿では,階層間隠れ状態軌跡を健康信号として扱う無チューニングランタイムモニタであるLayerwise Convergence Fingerprinting (LCF)を紹介する。
4つのアーキテクチャ(Llama-3-8B、Qwen2.5-7B、Gemma-2-9B、Qwen2.5-14B)をバックドア、ジェイルブレイク、即時注入で評価した。
論文 参考訳(メタデータ) (2026-04-27T14:38:31Z) - VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation [98.38575149237442]
VLAA-GUIは3つの統合コンポーネントを中心に構築されたモジュラーGUIフレームワークである。
必須完全性検証は、UIで観測可能な成功基準と検証を、各完了ステップで実施する。
強制的なループブレーカは、繰り返し失敗した後、多層切替インタラクションモードを提供する。
論文 参考訳(メタデータ) (2026-04-23T07:42:37Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models [75.29749026964154]
Ourmethodは、複数のベンチマークで平均的な攻撃成功率を4.41%に下げる。
クリーンな精度と実用性はオリジナルのモデルの0.5%以内に保存される。
防衛はさまざまな種類のバックドアをまたいで一般化し、実際のデプロイメントシナリオにおける堅牢性を確認します。
論文 参考訳(メタデータ) (2025-10-11T15:47:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。