論文の概要: Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents
- arxiv url: http://arxiv.org/abs/2607.24300v1
- Date: Mon, 27 Jul 2026 11:45:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.40601
- Title: Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents
- Title(参考訳): 自己認証による検証は、ヒューリスティックな自己改善エージェントでは信頼できない
- Authors: Diandian Guo, Cong Cao, Fangfang Yuan, Yingqi Wang, Yueshan Wang, Dakui Wang,
- Abstract要約: 検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
- 参考スコア(独自算出の注目度): 5.91817208489443
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-improving agents accumulate capability by repeatedly rewriting procedural policies, controllers, or heuristic rules. They typically rely on self-authored tests or metrics to decide whether to accept subsequent edits. The agent controls both the optimized object and its verifier. As a result, self-assigned scores can remain near perfect while real deployment performance degrades or stays low. We study this problem through the verifier--deployment gap. This gap refers to the discrepancy between an agent's self-authored verification signal and a sealed deployment evaluation that the agent cannot observe or access. We ask how self-authored verification fails under iterative policy-and-test rewriting, how the failure changes with capability, and how little exogenous trust is sufficient to prevent real regressions from being deployed. To address this problem, we introduce a Sealed Exogenous Acceptance Loop (SEAL). SEAL retains self-authored tests but compares each candidate with the incumbent through a fixed harness-side audit. The agent cannot author or inspect the audit, receives only accept/reject, and the whole incumbent state is retained after a clear regression. Our experiments show that this problem often appears in heuristic learning settings. These settings require trial-and-error discovery of the target objective. We further find that failures of self-written verification are stratified by capability. Weaker agents tend to damage previously acquired strategies behind easy self-tests. Stronger agents are more stable, but they still mismeasure the deployment distribution. Standard self-written constraints do not reliably close this gap. In contrast, SEAL outperforms unprotected baselines across six models and three random seeds. Reliable self-improvement need not abandon self-verification, but it requires at least one deployment-acceptance signal outside the agent's control.
- Abstract(参考訳): 自己改善エージェントは、手続きポリシー、コントローラ、またはヒューリスティックルールを繰り返し書き直すことで、能力を蓄積する。
通常は、後続の編集を受け入れるかどうかを決定するために、自己承認テストやメトリクスに依存します。
エージェントは、最適化されたオブジェクトとその検証者の両方を制御する。
その結果、自己アサインされたスコアは完璧に近い状態に保たれ、実際のデプロイメントパフォーマンスは低下するか、低いままになる。
この問題を検証器-展開ギャップを通して研究する。
このギャップは、エージェントの自己認証信号と、エージェントが監視またはアクセスできない封印されたデプロイメント評価との相違を指す。
我々は、反復的なポリシ・アンド・テストの書き換えの下で、自己権限による検証がフェールするか、機能によって障害がどのように変化するのか、実際のレグレッションがデプロイされるのを防ぐために、どの程度の外部信頼が不十分なのかを尋ねる。
この問題に対処するため,Searled Exogenous Acceptance Loop (SEAL)を導入する。
SEALは自己承認テストを維持しているが、各候補者と現職候補を固定ハーネス側の監査を通じて比較する。
エージェントは監査のオーディションを作成または検査することができず、受け入れ/拒絶のみを受け取り、既存の状態全体が明確な回帰後に保持される。
実験の結果,この問題はヒューリスティックな学習環境によく現れることがわかった。
これらの設定では、ターゲットの目的を試行錯誤で発見する必要がある。
さらに、自己記述による検証の失敗は能力によって階層化されていることに気付きました。
ウィーカーエージェントは、以前取得した戦略を手軽な自己テストで損なう傾向にある。
より強いエージェントはより安定しているが、それでもデプロイメントの分布を誤っている。
標準的な自己記述制約は、このギャップを確実に埋めるものではない。
対照的にSEALは、保護されていないベースラインを6つのモデルと3つのランダムシードで上回る。
信頼性の高い自己改善は、自己検証を放棄する必要はないが、エージェントの制御外の少なくとも1つのデプロイメント受け入れ信号が必要である。
関連論文リスト
- AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows [1.6785141970297952]
AEVAL(Agentic Evaluation)はCI統合フレームワークで、このプラクティスをエージェントスキルのための決定論的かつ再現可能なテストパイプラインに置き換える。
すべてのスキル変更がテストイベントをトリガーする。スキルは、自動エグゼキュータ内の開発者が宣言した評価契約に対して実行される。
鍵となる要素は、実行子とグレーダの間の構造的分離であり、微妙だが広汎な障害モードを防止する。
論文 参考訳(メタデータ) (2026-07-16T21:33:05Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority [7.392721604463545]
制限はエージェントの実行アーキテクチャの不変として保証できることを示す。
学習量やスキル獲得量、自己引き起こされるガバナンスの抽象化がエージェントの許可された権限を広げることはできないことを証明します。
論文 参考訳(メタデータ) (2026-07-06T02:42:06Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents [0.0]
自己進化型エージェントは、自身のプロンプト、スキル、オーモーフィケーションの変更を繰り返し提案することで改善する。
Qwen2.5 のエージェント (0.5B-3B) が GSM8K, SVAMP, ARC-Challenge のプロンプトレベルで自己進化する際、greedy は 30-42% の偽陽性と 10-33% の有害な編集をコミットする。
PACEは実際のものをコミットし、グリーディのホールトアウトの精度を著しく低いばらつきと約18%低い評価コストで一致させる。
論文 参考訳(メタデータ) (2026-06-06T11:12:11Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering [8.201374511929538]
AgentDevelは、現行のエージェントを反復的に実行するリリースエンジニアリングパイプラインである。
実行トレースから実装盲の症状レベルの品質信号を生成する。
主要な症状パターンを集約し、監査可能なエンジニアリング仕様を生成する。
論文 参考訳(メタデータ) (2026-01-08T05:49:01Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。