論文の概要: Multi-Aspect Runtime Verification for Simulation-Based V&V of LLM-Enabled Autonomous Agents
- arxiv url: http://arxiv.org/abs/2610.08928v1
- Date: Tue, 06 Oct 2026 18:00:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.532971
- Title: Multi-Aspect Runtime Verification for Simulation-Based V&V of LLM-Enabled Autonomous Agents
- Title(参考訳): LLM型自律エージェントのシミュレーションに基づくV&Vのためのマルチアスペクト実行時検証
- Abstract要約: 本稿では、自然言語ポリシー条項を1つの標準イベントストリーム上で、タイプ付き空間/時間/意味三重に分解するフレームワークを提案する。
これらの空間的義務は、一般に一階の時間的仕様によって仮定されないことを示す。
2つのミッション領域にまたがって、死傷者退去と持続性に異議を唱えた1つの民間ドメインは、予防的封鎖政策の下で構成され、攻撃の成功をゼロにする。
- 参考スコア(独自算出の注目度): 0.3908906925636173
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-based agents are entering decision-support roles in defence staff work, where the obligations they must respect are already written down and binding, and where retraining is not available as a control because models arrive as procured components. What can be placed under engineering control is the interface between the agent and the systems it acts on. Those obligations are at once spatial, temporal and text-semantic, and a violation typically lives in the composition of a multi-step interaction, which is why per-event guardrails miss sequential tool-attack chains. We present a multi-aspect runtime-verification framework that decomposes a natural-language policy clause into a typed spatial/temporal/semantic triple over one canonical event stream, checks each aspect with its own monitoring specification, and fuses the verdicts through a four-valued algebra that carries provenance. The spatial aspect is interpreted over a weighted two-sorted location graph in which mission geometry and information-release topology are one object; we show that these spatial obligations are not in general subsumed by a first-order temporal specification. The past-time aspect runs on the unmodified MonPoly engine, which agrees with our reference monitor at every time point. Across two mission domains, casualty evacuation and contested sustainment, and one civil domain, composition under the precautionary blocking policy drives attack success to zero with no observed false positives and microsecond-scale per-event cost, while every single aspect and every pair leaves a substantial share of attacks succeeding. In a closed-loop experiment a policy-naive planner reaches a violating state in most unshielded missions and in none when shielded, and four refused episodes in five still recover to a compliant outcome.
- Abstract(参考訳): LLMベースのエージェントは、防衛スタッフの仕事において意思決定支援の役割を担っている。そこでは、彼らが尊重すべき義務はすでに書き下され、拘束され、また、モデルが調達されたコンポーネントとして到着するので、再訓練はコントロールとして利用できない。
エンジニアリングコントロールの下に置くことができるのは、エージェントとそれが作用するシステムの間のインターフェースです。
これらの義務は、一度に空間的、時間的、およびテキスト・セマンティックであり、違反は通常、多段階の相互作用の合成に存在している。
本稿では,自然言語のポリシー条項を1つの標準イベントストリーム上に型付き空間/時間/意味のトリプルに分解し,それぞれのアスペクトを独自の監視仕様でチェックし,検証結果を4値代数で融合する多アスペクト実行検証フレームワークを提案する。
空間的側面は、ミッション幾何学と情報リリーストポロジが一つの対象である重み付き2方向の位置グラフ上で解釈される。
過去のアスペクトは修正されていないMonPolyエンジン上で実行されます。
2つのミッションドメイン、死傷者退避と持続性に異議を唱えた1つの民間ドメイン、および予防的ブロックポリシーの下で構成された構成は、攻撃の成功をゼロにし、観測された偽陽性とマイクロ秒単位のコストを伴わない。
クローズドループ実験では、ポリシーナイーブプランナーは、ほとんどのシールドされていないミッションにおいて違反状態に到達し、遮蔽された時点では無くなる。
関連論文リスト
- LIBERO-MAX: Do Robot Policies Adapt When the World Changes? [61.52324972910026]
多くのシミュレーションロバストネスベンチマークは、リセット時に外部条件を修正し、この時間的課題を過小評価する。
LIBERO-MAXは、幾何学、観察、外観、乱雑、経路の8種類の変化にまたがる8000のペアケースのベンチマークである。
各ペアはタスク実行と、タスク、初期状態、ポリシーシード、修正前のアクションシーケンスを保持する中タスクイベントとを比較します。
論文 参考訳(メタデータ) (2026-09-29T02:12:26Z) - Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents [16.24087700490158]
大規模言語モデルエージェントは、自律ループとしてますますデプロイされる。
これは実装の詳細ではなく、構成の失敗であることを示す。
LoopHarnessは、ループレベルでの永続的非遅延安全状態を復元する。
論文 参考訳(メタデータ) (2026-08-27T13:52:31Z) - Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle [65.6642776933861]
この介入点付近で成長した保護パラダイムについて検討する。
ほとんどの保護は、主に静的あるいは弱い適応的な敵に対して検証されている。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
論文 参考訳(メタデータ) (2026-08-05T00:46:50Z) - Claim Plane: Enforceable Change Intents and Dynamic Scope for Parallel Coding Agents [1.4721615285883427]
本稿では,同時ソフトウェア変更をプリライト入力問題として扱うモデルに依存しない協調アーキテクチャであるClim Planeを提案する。
決定論的制御プレーンは、互換性のある意図をアトミックに認め、宣言された領域に同ファイルの並列性を制約し、未解決の重複をシリアライズし、依存性の無効性を追跡し、曖昧な権限で閉じる。
最初に試みられた突然変異は、現在のアクティブセットに対するアトミックスコープの促進と再許可を引き起こす。
論文 参考訳(メタデータ) (2026-07-24T02:30:50Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation [91.20850436220267]
Referring-Aware Visuomotor Policy(ReV)について紹介する。
ReVは、人間または高レベルの推論プランナーによって提供されるスパース参照ポイントを組み込む。
これは、専門家のデモンストレーションにターゲットの摂動を適用することでのみ訓練される。
論文 参考訳(メタデータ) (2026-04-07T07:41:11Z) - Unsupervised 4D LiDAR Moving Object Segmentation in Stationary Settings
with Multivariate Occupancy Time Series [62.997667081978825]
静止センサから記録された4次元LiDARデータにおける非教師なし移動物体セグメンテーション(MOS)の問題に対処する。
教師なしMOSの問題を緩和する時系列に基づく新しい4次元LiDAR表現を提案する。
Raw KITTIデータセットによる静止シーンの実験では、完全に教師なしのアプローチが、教師付き最先端アプローチに匹敵するパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2022-12-30T14:48:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。