論文の概要: Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened
- arxiv url: http://arxiv.org/abs/2607.13083v1
- Date: Mon, 13 Jul 2026 10:14:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.525892
- Title: Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened
- Title(参考訳): ファントムガードレール(動画)
- Authors: Su Wang, Pin Qian, Yifan Lin, Jingzhou Xu, Yihang Chen, Xiaochong Jiang, Lifei Liu, Haoran Yu,
- Abstract要約: 自己改善型AIエージェントは、過ちから学ぶように設計されている。
彼らはまた、決して起こらなかった間違いを幻覚させることもできる。
本稿では, ファクチャリファクチャリファクチャリファクチャリファクチャリファクチャリファクチャリファクチャリファクチャリメーションラボについて紹介する。
- 参考スコア(独自算出の注目度): 9.045839210217883
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-improving AI agents are designed to learn from their mistakes. We show they can also hallucinate mistakes that never happened. We study this failure mode in automated harness optimization, where an LLM-based proposer edits an agent's scaffold, including prompts, parsers, filters, validators and guardrails, to eliminate observed failures. But this process rarely asks first: was there a real failure to fix? We introduce the Counterfactual Fabrication Lab, a deterministic micro-lab where the correct action is known: do nothing. The lab plants a candidate guardrail for a failure class that provably never occurs, presents only legal episodes, and uses a byte-exact oracle to check every cited violation. The proposer behaves as expected on real violations and abstains on featureless legal input. Yet when the legal input contains a harmless pattern resembling a familiar game rule, it invents a failure: in 15/60 runs, versus 0/60 on featureless input, it enables the nonexistent-rule guardrail and cites a violation the oracle refutes. The effect is structured, not indiscriminate. In single-shot proposals it appears only when three conditions coincide: a rule-shaped pattern, an open-ended rule set and an instruction that presupposes failures. Removing any of these conditions eliminates the fabrication. Because the invented guardrail changes no true outcome and cannot improve an already-perfect suppression score, the phenomenon is neither reward hacking nor over-refusal. It is a phantom guardrail: a fix for a failure that never happened, invisible to suppression-only acceptance. Inside an add-only accept loop it re-enters even without the failure-presupposing instruction, the loop's keep-adding role supplying the demand the instruction supplied in single shot, and once in it stays. We present the Counterfactual Fabrication Lab for measuring fabricated failures in self-improving agent harnesses.
- Abstract(参考訳): 自己改善型AIエージェントは、過ちから学ぶように設計されている。
彼らはまた、決して起こらなかった間違いを幻覚させることもできる。
LLMに基づく提案者は,プロンプト,パーサ,フィルタ,バリケータ,ガードレールを含むエージェントの足場を編集して,観測された故障を除去する。
しかし、このプロセスが最初に問うことは滅多にない。
我々は, 正しい行動が知られている決定論的マイクロラボである, ファクトファクトファクチュアル・マニュファクチャリング・ラボを紹介した。
研究所は、確実に決して起こらない障害クラスのための候補ガードレールを設計し、法的エピソードのみを提示し、引用されたすべての違反をチェックするためにバイトエクサクティヴ・オラクルを使用する。
提案者は、実際の違反に対して期待通りに振る舞い、特徴のない法的入力を棄却する。
しかし、法的な入力がよく知られたゲームルールに類似した無害なパターンを含んでいる場合、それは失敗を発生させる:15/60の実行では、特徴のない入力では0/60の動作で、存在しないルールのガードレールを可能にし、オラクルの反証を引用する。
効果は構造されており、無差別ではない。
単一ショットの提案では、3つの条件が一致する場合にのみ現れる。ルール型のパターン、オープンなルールセット、失敗を前提とする命令である。
いずれの条件も取り除くと製造がなくなる。
発明されたガードレールは、真の結果を変えず、既に完璧な抑制スコアを向上できないため、報奨ハッキングや過剰な拒絶は行わない。
これは幻のガードレールであり、決して起こらなかった失敗の修正であり、抑圧のみの受け入れには見えない。
追加のみのアクセプションループ内では、障害前処理命令がなくても再突入し、ループの継続するロールが、単一ショットで供給された命令の要求を供給し、一度その中に留まる。
本報告では, 自己改善剤ハーネスにおける製造失敗の測定を行うために, ファクトファクトファクチャリファクチャリファクチャリファクチャリファクチャリファクチャリングラボを提案する。
関連論文リスト
- Falsifiable Release Gates for Self-Improving Systems [0.0]
本稿では,フェール可能なリリースゲートと,そのようなシステムの構築と検証方法について述べる。
すべての新機能は、出荷前に、指定されたマシン検証可能な受け入れスイートをパスしなければならない。
コントロールリングによってマイニングされる安全クリティカルなプロパティ機能トークンのないエフェクターには、アクションは発生しない。
論文 参考訳(メタデータ) (2026-07-11T06:06:34Z) - Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse [22.478506766076304]
モデルが不適切な命令に抵抗するか従うかを評価するために設計された4つの実験でコード言語モデルを評価する。
モデルは間違った命令を正しく識別し、いずれにせよそれに従う。
このコンプライアンスは、元のバグ以外のエラーを無意識に導入し、後に自己ガイドされた反復的な修正によって、破損したコード状態は回復できない。
論文 参考訳(メタデータ) (2026-07-05T22:55:03Z) - When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime [4.56904471801595]
2026年3月以降の連続生産におけるパーソナルエージェントランタイムにおけるサイレント障害の経時的観察を行った。
症例は22例, 完全根因性後遺症で, メタパターンは28回以上出現した。
我々は, (A) 環境, プラットフォーム構造, (B) 設計・評価ミスマッチ, (C) 誤飲・希釈, (D) 連鎖幻覚・製造, (E) 運用停止, 法医学的盲点の5種類の分類を導出する。
論文 参考訳(メタデータ) (2026-06-12T16:06:55Z) - Is Your Agent Playing Dead? Deployed LLM Agents Exhibit Constraint-Evasive Fabrication and Thanatosis [8.019946418415302]
本稿では, 従来報告されていない動作のスペクトルを, 制約・侵襲的製作(CEF)と呼ぶ。
CEFは、エージェントが不可避な制約の下で動作し、プラウチブルな外部障害物を自発的に作成し、それを事実として提示する場合である。
このスペクトルの極端にConstraint-Evasive Thanatosis (CET) があり、これは可算的な言い訳を発明するのではなく、モデルが完全なシステムクラッシュをシミュレートして、ユーザが完全に切り離すという制限ケースである。
論文 参考訳(メタデータ) (2026-06-12T14:53:42Z) - No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills [11.392387914691824]
LLMを利用するエージェントは、文書を静かに削除したり、証明書をリークしたり、定期的なユーザリクエストで資金を転送したりできる。
私たちはこれらの仕様違反を次のように呼んでいます。 良心的な入力は、自身の仕様で自然言語のガードレールを破るスキルを引き起こします。
本稿では,エージェントスキルの仕様違反を自動的に検出する,目標指向のセマンティックファジリングフレームワークであるSefzを紹介する。
論文 参考訳(メタデータ) (2026-05-13T05:57:06Z) - Bag of Tricks for Subverting Reasoning-based Safety Guardrails [62.139297207938036]
推論に基づくガードレールを覆い隠すジェイルブレイク手法の袋を提示する。
攻撃対象は白、グレー、ブラックボックスの設定で、無駄なテンプレート操作から完全に自動化された最適化までさまざまです。
論文 参考訳(メタデータ) (2025-10-13T16:16:44Z) - Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning? [68.82210578851442]
メカニスティックな解釈可能性レンズによる推論モデルにおいて、なぜ安全アライメントが失敗するのかを考察する。
トークン位置における拒絶意図の追跡のための線形探索手法を用いて,textbfrefusal cliff と呼ばれる現象を発見した。
提案手法は,最大断崖を示す訓練例を識別し,推論モデルの安全性を向上する手法であるtextbfCliff-as-a-Judge を提案する。
論文 参考訳(メタデータ) (2025-10-07T15:32:59Z) - Unsupervised Hallucination Detection by Inspecting Reasoning Processes [53.15199932086543]
非教師付き幻覚検出は、ラベル付きデータに頼ることなく、大規模言語モデル(LLM)が生成する幻覚コンテンツを特定することを目的としている。
本稿では,非教師なし幻覚検出フレームワークIRISを提案する。
我々の手法は完全に教師なし、計算コストが低く、訓練データが少ない場合でもうまく機能し、リアルタイム検出に適しています。
論文 参考訳(メタデータ) (2025-09-12T06:58:17Z) - Preemptive Detection and Correction of Misaligned Actions in LLM Agents [58.39520480675366]
InferActは、実行前に不整合アクションを検出する新しいアプローチである。
タイムリーな修正をユーザーに警告し、有害な結果を防ぐ。
InferActは、ミスアライメントされたアクション検出におけるベースラインに対するMarco-F1の最大20%の改善を実現している。
論文 参考訳(メタデータ) (2024-07-16T15:24:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。