論文の概要: The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents
- arxiv url: http://arxiv.org/abs/2607.07436v1
- Date: Wed, 08 Jul 2026 14:08:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.403032
- Title: The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents
- Title(参考訳): Blind Curator: バイアスのある裁判官が、自己進化エージェントのスキルの引退を容赦なく無効にする方法
- Authors: Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He,
- Abstract要約: 偏見のある裁判官が単にノイズを付加するだけでなく、キュレーターから遠ざかることを示す。
本稿では, コージェネレーション・クロスチェックを用いた参照不要なレポート書記テストにおいて, 因果チャネルを分解し, 因果チャネルを分解し, 因果チャネルを分離する手法を提案する。
- 参考スコア(独自算出の注目度): 9.989306175511238
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: A self-evolving agent retires its bad skills by watching them fail, so what happens when the judge cannot see the failures? Skill retirement is the structural constraint that keeps a growing library from drifting below the no-skill baseline, but its guarantee assumes an unbiased reward, which is false for the LLM judges that reference-free tasks force upon us. We show that a biased judge does not merely add noise; it \emph{silently switches off the curator}. We make this precise with a corrupted-reward analysis and, isolating the causal channel by injecting corruption on top of a deterministic reward, a behavioral study on a reference-free report-writing testbed with a code-generation cross-check. Symmetric noise leaves retirement intact, but \emph{false-pass} bias (failures slipping through as passes) disables contribution-based retirement past a sharp threshold that no amount of data can cross. Separating genuine retirement from cap-eviction churn shows this \emph{mechanism} failure is universal, holding across domains and failure rates and sparing only near-zero-false-pass, verifier-like graders. The downstream \emph{outcome}, though, is regime-dependent: eval quality degrades only where the same corruption also starves skill synthesis, and otherwise holds steady, so the disabled curator is \emph{silent}, surfacing in no aggregate metric. The contribution is a behavioral safety result, not a performance one. A cheap defect-injection audit then tells an operator, before deployment, which side of the threshold their judge occupies.
- Abstract(参考訳): 自己進化するエージェントは、失敗を見て悪いスキルを引退します。
スキルリタイア(Skill retirement)とは、成長するライブラリが非スキルベースラインの下を漂うのを防ぐ構造的な制約である。
バイアスド・ジャッジは単にノイズを付加するだけでなく、キュレーターをオフにする。
本稿では, コージェネレーション・クロスチェックを用いた参照不要なレポート書記テストにおいて, 因果チャネルを分解し, 因果チャネルを分解し, 因果チャネルを分離する手法を提案する。
対称性のあるノイズは、リタイアをそのまま残すが、 \emph{false-pass} バイアス(パスがスリップする)は、データ量が渡ることができないシャープしきい値を超えてコントリビューションベースのリタイアを無効にする。
キャップ・エヴィジョン・チャーンから真のリタイアを分離すると、この 'emph{mechanism} の失敗は普遍的であり、ドメインと失敗率をまたいで保持し、ほぼゼロパスの検証器のようなグレーダーのみを分散させる。
しかし、下流のemph{outcome} は政権に依存している: eval quality は、同一の汚職がスキル合成を飢えさせ、そうでなければ安定に保たれるため、障害キュレーターは \emph{silent} であり、集約計量では表せない。
貢献は行動の安全性の結果であり、パフォーマンスの結果ではありません。
安価な欠陥注入監査では、デプロイ前にオペレータに、審査員が占めるしきい値のどの側かを伝える。
関連論文リスト
- Hypothesis-Driven Skill Optimization for LLM Agents [2.716362160018478]
そこで本研究では,スキルキュレーターとエージェントエグゼキュータの両方を凍結推論エンドポイントとする,フリートレインフレームワークを提案する。
ALFWorldでは、Qwen3.6-27Bで+6.9 SRポイント、Qwen3.6-27Bで+4.0ポイントの改善がなされている。
論文 参考訳(メタデータ) (2026-06-21T04:43:20Z) - Signed Compression Progress on a Sealed Audit is Goodhart-Resistant [0.43830114853179497]
圧縮の進行は本質的な動機付けの長年の提案である。
我々は、本質的な報酬は学習のためだけに支払われるから「信用できる」ことを証明している。
構造コアのリーン4メカニゼーションを提供します。
論文 参考訳(メタデータ) (2026-06-09T20:10:40Z) - AI Alignment via Incentives and Correction [14.986111703734222]
我々は、抑止と執行の法・経済モデルのレンズを通してAIアライメントを研究する。
解決者は、説得力があるが誤った答えを出し、不確実性を隠蔽したり、急激なショートカットを悪用する恩恵を受けることができる。
この相互作用を、主成分が共同補正結果よりも報酬を選択する2エージェントモデルで定式化する。
論文 参考訳(メタデータ) (2026-05-02T23:28:02Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。