論文の概要: When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops
- arxiv url: http://arxiv.org/abs/2607.25152v1
- Date: Mon, 27 Jul 2026 23:52:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.662724
- Title: When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops
- Title(参考訳): エージェントループはいつ進行に悪影響を及ぼすか? 長期自律型LDMエージェントループにおける自己評価バイアスと外部根拠検証
- Authors: Hyundoo Park, Byungho Choi,
- Abstract要約: 長期にわたる自律エージェントは、人間の介入なしに自らの完了を計画し、行動し、判断する。
エージェントが自身の仕事を格付けすると、自己評価バイアスが保たれます。
我々はエージェントとそのツール表面を固定したテストベッドを構築し、ループをゲートする評価器の情報チャネルタイプのみを操作する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-running autonomous agents plan, act, and judge their own completion without human intervention. When an agent grades its own work, self-evaluation bias takes hold: plausible changes are accepted as progress while real-world outcomes stagnate or regress. We name this failure mode the progress mirage and show, with controlled measurement, that it is a question of what the evaluator is grounded in. We built a testbed that holds the agent and its tool surface fixed and manipulates only the information-channel type of the evaluator that gates the loop. A world-state oracle, unfakeable in principle, is enforced by container and network isolation and verified at every run. Across 54 cycles a frontier agent claimed improvement every time, yet 56 percent had a measured delta of zero or below. Self-report was thus uninformative, and the self-verdict gate degenerated into accept-all, eroding the best deployed state it had reached by 19 percent. Even the strongest in-band judge, reading the full artifact text, the change diff, and its own verdict history, accepted cycles of which 44 percent were real-world regressions and rejected 38 percent of real improvements; the preregistered adversarial hypothesis that a strong judge closes the gap was rejected. On a boundary task whose success specification is verifiable from the artifact itself, the same judge's mirage vanished to zero and the gap collapsed within the registered threshold, showing that the gap depends on where the success signal resides. A sign-only variant returning only the acceptance verdict kept real-world output similar to full feedback (110.0 versus 113.0), locating the benefit in the gate's grounding rather than in feedback content. For open-ended objectives whose success signal lives outside the transcript, scaling up the judge is not enough; out-of-band evaluation with real-world access is a structural requirement.
- Abstract(参考訳): 長期にわたる自律エージェントは、人間の介入なしに自らの完了を計画し、行動し、判断する。
エージェントが自身の仕事を格付けすると、自己評価バイアスが保たれます。
この障害モードをプログレッシブミラーと命名し、制御された測定値により、評価者が何を根拠としているのかという問題であることを示す。
我々はエージェントとそのツール表面を固定したテストベッドを構築し、ループをゲートする評価器の情報チャネルタイプのみを操作した。
原則として実現不可能な世界状態のオラクルは、コンテナとネットワークの分離によって実施され、すべての実行時に検証される。
フロンティアのエージェントが毎回54サイクルにわたって改善を主張するが、56%は0以下で測定されたデルタを持っていた。
そのため、自己申告は非形式的であり、自己評定ゲートはアクセプションオールに変形し、それが到達した最も優れた状態である19%を侵食した。
最強のバンド内判事でさえ、完全なアーティファクトテキスト、変更差分、およびそれ自身の評決履歴を読むと、44%が現実のレグレッションであり、真の改善の38%を拒絶したサイクルを受け入れた。
成功仕様がアーティファクト自身から検証可能な境界タスクでは、同じ裁判官のミラージュがゼロに消え、そのギャップは登録された閾値内で崩壊し、そのギャップが成功信号のどこにあるかに依存することを示す。
受理判定のみを返す符号のみの変種は、完全なフィードバック(110.0対113.0)と同様の実際の出力を保持し、フィードバックの内容ではなく、ゲートのグラウンド化の利点を突き止めた。
成功信号が転写の外部に存在するオープンエンドの目標に対しては、審査員のスケールアップだけでは不十分である。
関連論文リスト
- Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - What Actually Works for Spacecraft Fault-Tolerant Control: An Honest Settled-Gate Benchmark of Learned and Classical Methods [2.28438857884398]
近年のFTCの研究は、宇宙船のアクチュエーターの故障で高い成功を収めたことを報告している。
我々は、成功がトレーニングで見たことのない欠陥にそれを保持することを意味しているとき、宇宙船が何を指しているのかを尋ねる。
私たちは、落ち着いたゲートの周りに構築されたベンチマークで回答します。
論文 参考訳(メタデータ) (2026-06-24T04:08:39Z) - Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents [11.233308795768465]
VIGILは、端末のコミットメントを独立して測定できる評価フレームワークである。
VIGILのデフォルトプロトコルでは、エージェントはエゴセントリックなRGBのみを観察し、アクション・サクセス・シグナルを受信せず、各エピソードは、隠された世界状態に対して決定論的にチェックされたセマンティック・レポートで終了しなければならない。
これにより、ワールドステートコンプリート(W)とベンチマーク成功(B)の2つのスコアが得られます。
論文 参考訳(メタデータ) (2026-05-09T07:24:07Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。