論文の概要: Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents
- arxiv url: http://arxiv.org/abs/2607.12790v1
- Date: Tue, 14 Jul 2026 14:02:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.165964
- Title: Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents
- Title(参考訳): グレーダーはだれか? 自己改善型LSMエージェントの評価基準と技能の共進化
- Abstract要約: 自己進化型エージェントシステムは、自身のスキルの作成、修正、引退によって改善されるが、そのようなループはすべて隠れた仮定に依存している。
まず、私たちのメトリックループは、完全な進化のライフサイクルの下で小さな検出器の組成を探索します。
第二に、メートル法が存在しないため、ヤードスティックは正確なメートル法が実現したことを回復しており、EmphDouble Ratchetは、ライフサイクル管理されたスキルループによるメトリックの共進化です。
- 参考スコア(独自算出の注目度): 9.989306175511238
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Self-evolving agent systems improve by creating, revising, and retiring their own skills, but every such loop rests on a hidden assumption: a reliable evaluation metric already exists. In many real applications it does not. We make three claims. First, metrics can be \emph{evolved}: our metric loop searches compositions of small drawback detectors under a full evolutionary lifecycle, trained to agree with a ten-item anchored reference set, regularized by consensus over unlabeled outputs, and audited against a held-out anchor it never reads, yielding a transparent, inspectable metric rather than an opaque judge. Second, since no metric exists to beat, the yardstick is recovering what an accurate metric would have enabled, and \emph{Double Ratchet}, our co-evolution of the metric with a lifecycle-managed skill loop, does so: across code generation (MBPP+), enterprise text-to-SQL (Spider~2.0-Snow), and reference-free report generation, it retains 88--110\% of the held-out lift achieved by the same skill loop driven by ground truth or the best available rubric. Third, safety comes from anchor discipline plus outer audits: removing anchor guards collapses the metric into a vacuous detector while removing the lifecycle does not; and when evolved skills gamed the report rubric, an independent judge caught it, one detector repaired it, and a task-aware judge then preferred the evolved outputs over the pre-evolution baseline in 77\% of decided pairs. We argue this failure-expecting architecture is the right default wherever no reliable automatic verifier exists.
- Abstract(参考訳): 自己進化型エージェントシステムは、自身のスキルの作成、修正、引退によって改善されるが、そのようなループはすべて隠れた仮定に依存している。
多くの実アプリケーションではそうではない。
私たちは3つの主張をする。
私たちのメトリックループは、完全な進化ライフサイクルの下で小さな欠点検出器の組成を探索し、10イットのアンカー参照セットに同意するように訓練され、ラベルなしのアウトプットに対するコンセンサスによって正規化され、決して読まないホールドアウトアンカーに対して監査され、不透明な判断ではなく透明で検査可能なメートル法が得られます。
そして、ライフサイクル管理されたスキルループによるメトリックの共進化である \emph{Double Ratchet} は、コード生成(MBPP+)、エンタープライズテキストからSQL(Spider~2.0-Snow)、参照なしレポート生成といった、ライフサイクル管理されたスキルループによるメトリックの共進化を行ないます。
第3に、安全はアンカーの規律と外部監査によるものであり、アンカーガードを外すと、メトリクスを空洞の検出器に分解し、ライフサイクルを除去することができない。そして、進化した技術がレポートのルーリックをゲームしたとき、独立した裁判官がそれをキャッチし、1つの検出器を修理し、タスク認識裁判官は、決定されたペアの77%で、進化前のベースラインよりも進化した出力を優先する。
この失敗を予測できるアーキテクチャは、信頼できる自動検証が存在しないところでは、正しいデフォルトであると我々は主張する。
関連論文リスト
- Beneath the Diff: Diagnosing and Mitigating Algorithmic Mode Collapse in Code-Level Autonomous Research Loops [11.99667127177886]
我々は、反復的なメトリック駆動のコード編集が、ループを超えて一般化する真の改善をもたらすことを示す。
本稿では,カテゴリ被覆再重み付け,永続的な編集メモリ,検証ゲートを組み合わせた軽量化を提案する。
論文 参考訳(メタデータ) (2026-08-31T08:11:19Z) - Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction [6.419341495897254]
3つのコンポーネントに対して25のハンドキュレートされたクレームのエージェントベンチマークで、すべてのツールコールをログします。
ルールベースの障害帰属分類器と、2つのルールがどのツールが呼び出されたかのみをチェックするサイレント障害検出器の2つを構築しました。
論文 参考訳(メタデータ) (2026-08-28T15:25:12Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices [48.36933831982682]
我々はADEPTS機能フレームワークを基盤とした信頼性ベンチマークであるADeptS-Benchを紹介する。
Safetyストリームは、視覚インターフェースに埋め込まれた脅威を伴うペアの良心/悪意のあるタスクを提供する。
曖昧さストリームは、意図が曖昧である場合、エージェントが明確化を求めるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-25T23:21:57Z) - The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents [0.0]
本稿では,ポストホックではなく構造的検証を行うためのエージェント機器を提案する。
組織ごとの書き込みエラー、レンダリングサイズ、あるいは塩漬けのカナリアエチョフロアが破られた場合、実行はすべて無効になる。
長期のエージェントが苦しむたびに、クリーンでシングル変数の結果が報告される。
論文 参考訳(メタデータ) (2026-08-04T15:10:37Z) - TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows [2.435006380732194]
ノイズの多いトレースをトラジェクトリにコンパイルする,スキルガイドシステムであるTraceCompilerを提案する。
あらゆるハードエッジは監査可能な証拠を持ち、あいまいな関係が疑われる。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
論文 参考訳(メタデータ) (2026-08-03T01:05:06Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents [9.989306175511238]
偏見のある裁判官が単にノイズを付加するだけでなく、キュレーターから遠ざかることを示す。
本稿では, コージェネレーション・クロスチェックを用いた参照不要なレポート書記テストにおいて, 因果チャネルを分解し, 因果チャネルを分解し, 因果チャネルを分離する手法を提案する。
論文 参考訳(メタデータ) (2026-07-08T14:08:04Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - The Substrate Collapse: AI Code Generation Invalidates Authorship-Based Knowledge Metrics [0.0]
ソフトウェア工学は、システムの知識がどこにあるのかを、そのコードを作成した人から長い間推測してきた。
本稿では、AIコード生成がそのルーツにおける推論に逆らうことを論じる。
論文 参考訳(メタデータ) (2026-06-18T19:17:24Z) - Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth [24.21103008618097]
思考の連鎖(CoT)は、大規模言語モデルの解釈と監査行動の中心となっている。
ステップレベルとCoTレベルの両方で、地道忠実度ラベルを出力する自動ラベリングパイプラインを開発した。
実験の結果,ほとんどの測定値が近い確率で動作し,予測バイアスが強く,CoTが長くなると劣化することがわかった。
論文 参考訳(メタデータ) (2026-05-24T12:57:01Z) - Silent Collapse in Recursive Learning Systems [24.578102943388256]
トラジェクトリ統計をモニタし、遅い時間スケールの信頼変数を推定する軽量なメタ認知ループを提案する。
MTRは早期警告を提供し、実際のデータにアクセスすることなくサイレント崩壊を積極的に防止する。
論文 参考訳(メタデータ) (2026-05-14T08:59:26Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。