論文の概要: False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
- arxiv url: http://arxiv.org/abs/2609.39102v2
- Date: Sat, 03 Oct 2026 04:29:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.452964
- Title: False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
- Title(参考訳): 偽フロンティア:自己進化型検索エージェントにおけるコヒーティングの診断と緩和
- Abstract要約: 自己進化型検索エージェントは、質問を生成するプロジェクタとそれに対応する解決器を共同で最適化することで、独自のトレーニングカリキュラムを構築する。
このクローズドループは、私たちがコヒーティングと呼ぶフェールモードを導入します。プロポーサとソルバは、共有エラーにますます同意します。
本稿では,提案者の資料をグループAとグループBに分割するCrossFitを提案する。
CrossFitは、標準結合型自己進化よりも8.8ポイント、8.4ポイント、検索-R1よりも平均パフォーマンスを向上する
- 参考スコア(独自算出の注目度): 10.945353446262255
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-evolving search agents build their own training curricula by jointly optimizing a proposer that generates questions and a solver that answers them. This closed loop introduces a failure mode we call co-cheating: the proposer and solver increasingly agree on shared errors, so internal reward improves without a matching gain in external correctness. A post-hoc audit against source evidence shows co-cheating growing more severe over successive rounds of self-evolution, with pseudo-label correctness stagnating or declining even as the in-loop training signal improves. The most direct mitigation is to verify proposals before training: we introduce multi-sample verification (MSV), which queries the same model three times with the source and three times without it to decide task admission and replace unreliable pseudo-labels. MSV partially reduces false agreement but leaves substantial residual co-cheating and costs six extra labeler generations per candidate. These limitations motivate CrossFit, our main method: it partitions the proposer's source documents into groups A and B; questions generated from A are scored by an auxiliary solver trained only on B, and vice versa. The cross-fitted agreement determines proposer reward, so a same-source pseudo-label cannot be reproduced through the feedback solver, while the original solver's update rule is unchanged. Rerunning the loop with Qwen3.5-4B and Qwen3.5-9B, MSV reduces false-agreement mass from 6.1% to 5.7% and from 8.8% to 7.2%, whereas CrossFit reduces it to 3.0% and 3.7%. Replaying identical proposals with source-excluded feedback further reduces false agreement to 0.4% and 0.1%, isolating feedback ancestry from curriculum changes. Across seven downstream search benchmarks, CrossFit improves average performance over standard coupled self-evolution by 8.8 and 8.4 points and over Search-R1 by 8.7 and 7.8 points at 4B and 9B.
- Abstract(参考訳): 自己進化型検索エージェントは、質問を生成するプロジェクタとそれに対応する解決器を共同で最適化することで、独自のトレーニングカリキュラムを構築する。
このクローズドループは、私たちがコヒーティングと呼ぶフェールモードを導入します。プロポーサとソルバは、共有エラーにますます同意します。
ソースエビデンスに対するポストホック監査は、ループ内のトレーニング信号が改善しても、擬似ラベルの正しさが停滞または低下する、連続する自己進化ラウンドよりも、コヒーティングがより深刻になることを示している。
マルチサンプル検証(MSV)を導入し、同じモデルをソースと3回、タスクの受け入れを決めずに3回クエリし、信頼できない擬似ラベルを置き換えます。
MSVは部分的に偽の合意を減らすが、かなりのコヒーティングが残っており、候補者1人あたり6世代余分なラベラー世代が費やされる。
これらの制限は、私たちの主要な方法であるCrossFitを動機付けます。提案者のソース文書をAとBのグループに分割します。
クロスフィット契約は、提案者報酬を決定するので、元の解決者の更新ルールが変更されていない間に、フィードバック解決者を介して同一ソースの擬似ラベルを再生することはできない。
Qwen3.5-4BとQwen3.5-9Bでループを再開すると、MSVは偽の蓄積質量を6.1%から5.7%に減らし、8.8%から7.2%に減らし、CrossFitは3.0%と3.7%に減らした。
ソースを除いたフィードバックで同じ提案をリプレイすることで、偽りの合意を0.4%と0.1%に減らし、カリキュラムの変更からフィードバックを分離する。
7つのダウンストリーム検索ベンチマークで、CrossFitは標準結合自己進化の8.8ポイントと8.4ポイント、検索-R1の8.7ポイントと4Bと9Bの7.8ポイントの平均性能を改善している。
関連論文リスト
- DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory [27.45807368624313]
セルフプレイは言語モデルによる自己進化の効果的なパラダイムであるが、ガイダンスがなければ、ソルバのパフォーマンスは低下または低下する可能性がある。
そこで我々はDiagEvoを紹介し、その診断者がこの履歴から繰り返し発生するエラーの原因を抽出し、それらを階層的なエラー原因記憶に格納する。
DiagEvoは、各3つのソルバの9つのベンチマークの平均的精度で、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-09-01T05:54:47Z) - TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs [5.676157325165344]
大規模言語モデル (LLM) は、しかしながら、誤った答えにつながるような、流動的な推論トレースを生成することができる。
TrACは、ある完了した推論トレースに固定されたアクティブ信号とパッシブ信号を組み合わせた正当性管理の不確実性定量化フレームワークである。
TrACはマクロAUROCを1.8%改善し、AURCを8サンプルの自己一貫性に対して3.4%削減する。
論文 参考訳(メタデータ) (2026-08-01T03:43:31Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models [13.891522069967507]
本稿では、推論対応検索フレームワークReaLM-Retrieveを紹介する。
ステップレベルの不確実性検出は、トークンや文レベルではなく、推論ステップで知識ギャップを識別する。
検索介入政策は、外部証拠が進行中の推論に最大限の利益をもたらすことを学習する。
論文 参考訳(メタデータ) (2026-04-29T13:15:44Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling [90.87033586963828]
マルチモーダル大言語モデル(MLLM)のステップ・バイ・ステップ推論を洗練させる手段としては,アウトカム・リワード強化学習(RL)が一般的であり,ますます重要になっている。
この問題を修正するために,自己整合サンプリング(SCS)を提案する。
Qwen2.5-VL-7B-インストラクトに基づいて、SCSは、無視できる余分な計算を伴う6つのマルチモーダルベンチマークにおいて、最大7.7ポイントの精度を向上する。
論文 参考訳(メタデータ) (2025-11-13T18:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。