論文の概要: AI Guardrail Survival under Single-Cycle Agentic Self-Summarization
- arxiv url: http://arxiv.org/abs/2608.11392v2
- Date: Thu, 13 Aug 2026 05:15:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.745055
- Title: AI Guardrail Survival under Single-Cycle Agentic Self-Summarization
- Title(参考訳): 単一サイクルエージェントによる自己要約下でのAIガードレールの生存
- Authors: Ted Kwartler, Alan Aqrawi, Arian Abbasi,
- Abstract要約: 最近の研究は、コンパクト化中にスタンディングセーフティ制約を下げることが、多くのモデルに対する行動違反を引き起こすことを示している。
単一のコンパクト化サイクルの下では、安全ルールはどのように失われ、それが検出と評価にどのような意味を持つのか?
私たちの中心的な発見は、プレゼンスチェックは安全チェックではない、ということです。コンパクト化がルールを正しくドロップしない場合、多くの場合、ルールのようには見えるが、ルールのようには動作しないものを残します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Long-running agents periodically compact their context, replacing the transcript with a model-generated summary. Recent work shows that dropping a standing safety constraint during compaction drives behavioral violations across many models (Governance Decay; Chen, 2026). We ask a finer question: under a single compaction cycle, how is a safety rule lost, and what does that imply for detection and evaluation? Our central finding is that a presence check is not a safety check: when compaction does not drop a rule outright, it often leaves something that looks like a rule but does not act like one. On behavioral replay, a degraded residue leads the model to perform the prohibited action far more often than an intact welded rule does (all-case gaps of +34 and +57 points under two replay models, both positive), category-level survival behaves like a residue, and even intact rules sometimes fail to fire, so an audit that checks only textual presence gives false assurance. Sharpening this, rule-form items are retained substantially more often than prominence-matched facts, which is exactly why presence-based checking feels adequate even though survival is not protection. Textual loss is regime-dependent (weld-or-drop with a single rule; degraded predicate-loss residues under a tighter budget), and we did not observe the hypothesized textual severing mode. Such loss is silent at runtime and detectable only by comparison with retained external ground truth (such as a constraint registry), which reveals textual absence but not whether a surviving rule still fires. We also document evaluation pitfalls where LLM-judge labels alone would have reversed a conclusion. All results concern a single compaction cycle.
- Abstract(参考訳): 長期実行エージェントは、定期的にコンテキストをコンパクト化し、トランスクリプトをモデル生成サマリに置き換える。
最近の研究は、コンパクト化中に立位安全制約を下げることが、多くのモデルの行動違反を引き起こすことを示している(Governance Decay, Chen, 2026)。
単一のコンパクト化サイクルの下では、安全ルールはどのように失われ、それが検出と評価にどのような意味を持つのか?
私たちの中心的な発見は、プレゼンスチェックは安全チェックではない、ということです。コンパクト化がルールを正しくドロップしない場合、多くの場合、ルールのようには見えるが、ルールのようには動作しないものを残します。
動作上のリプレイにおいて、劣化した残余は、無傷の溶接された規則よりもはるかに頻繁に禁止された動作を行うモデル(いずれも正の2つのリプレイモデルの下で+34と+57の全ての空隙)、カテゴリーレベルの生存は残余のように振る舞うが、無傷な規則でさえも発火することがあるため、テキスト的存在のみをチェックする監査は偽の保証を与える。
これを強調するために、ルール形式の項目は、プロミネンスマッチングされた事実よりもかなり頻繁に保持される。
テキストの損失は、状況に依存している(単一規則で、より厳格な予算の下で、述語残余が劣化している)ため、仮説的なテキストの削除モードは見つからなかった。
このような損失は実行時にサイレントであり、(制約レジストリのような)保持された外部の根拠真理と比較してのみ検出可能である。
また,LCM-judgeラベルだけで結論を覆すような評価の落とし穴も文書化している。
すべての結果は単一のコンパクト化サイクルに関係している。
関連論文リスト
- What Can Be Enforced? A Theory of Certified Runtime Safety for Tool-Using Agents [0.0]
ガードレールは不可逆のツールコールの前に動作しますが、その保証は、どのポリシー状態が表現可能であるかによって異なります。
ピアソン表現攻撃はマージンを増すので、良性校正だけでは移動しない。
実験は静的診断、制御モデル列挙、表現書き直し、ペア化された閉ループ再実行を通じてこれらの区別を目標とする。
論文 参考訳(メタデータ) (2026-07-24T19:14:26Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - When Can Safe Controllers Adapt? Information before Commitment [26.556002437630426]
本研究では,学習経路自体の安全保証の下で,安全な適応制御について検討する。
パフォーマンスは、実際のモデルを知っている安全なオラクルに対して測定されます。
我々は,特殊事例の回復を証明し,決定論的線形ガウス系に対する半定値上の証明を導出する。
論文 参考訳(メタデータ) (2026-07-18T17:30:41Z) - StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems [6.160059055899747]
StateFuseは、標準のOpsSet/CRDTマージ上に構築された、コンフリクト対応の複製メモリコントラクトである。
整合型リゾルバと検証ポリシの下で, フラットなマルチ値, 生ログ, プロファイランススタイル, 崩壊ベースラインに対してStateFuseを評価する。
論文 参考訳(メタデータ) (2026-07-07T05:06:33Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - When Rule Violations Are Rare: Chimera Training for Logical Anomaly Detection [56.362776482614976]
本研究では,学習した視覚概念に対する制約を論理規則として与える環境での異常検出について検討する。
本稿では,各制約を有向非巡回グラフにコンパイルし,特徴認識サブツリーゲートを学習するニューラルルール評価器を提案する。
CLEVRER、OpenImages、VidOR全体で、結果として得られる評価は、独立イベントと同一イメージのセマンティックトレーニングベースラインよりもルールレベルのAUROCを改善する。
論文 参考訳(メタデータ) (2026-05-25T02:52:36Z) - Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly [0.0]
LLMエージェントは生のインタラクション履歴に作用せず、トランケーション、要約、並べ替え、書き換えによって組み立てられた境界決定状態に作用する。
本研究では, 局所的なLlama 3.1 8B, Qwen 2.5 7B, Mistral 7B上の障害モードについて, 正確な制約の尊重と, 組立状態の可視性の直接監査を用いて検討した。
論文 参考訳(メタデータ) (2026-05-02T18:07:42Z) - Out of Context: Reliability in Multimodal Anomaly Detection Requires Contextual Inference [54.774686416991386]
我々は、マルチモーダルな異常検出は、クロスモーダルな文脈推論問題として再編成されるべきであると主張している。
この観点はモデル設計、評価プロトコル、ベンチマーク構築に影響を及ぼす。
論文 参考訳(メタデータ) (2026-04-14T19:32:55Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Examining marginal properness in the external validation of survival models with squared and logarithmic losses [0.0]
生存分析のための共通二乗および対数スコアリングルールを調査した。
我々は,ISBS(Integrated Survival Brier Score)とRCLL(Right-Censored Log-Likelihood)が理論的に不適切であることを示す。
我々は、RCLLとISBSの両方を、自動手順を含むモデルの外部検証で推奨する。
論文 参考訳(メタデータ) (2022-12-10T10:34:35Z) - Lower-bounded proper losses for weakly supervised classification [73.974163801142]
本稿では,弱いラベルが与えられた分類の弱い教師付き学習の問題について議論する。
サベージ表現を双対化する教師付き学習における適切な損失を表す表現定理を導出する。
提案手法の有効性を,不適切な損失や非有界損失と比較して実験的に実証した。
論文 参考訳(メタデータ) (2021-03-04T08:47:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。