論文の概要: Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?
- arxiv url: http://arxiv.org/abs/2607.17558v1
- Date: Mon, 20 Jul 2026 05:07:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.503601
- Title: Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?
- Title(参考訳): 検索エージェントの検索改善にフィードバック強化自己蒸留はなぜ有効か?
- Abstract要約: エージェント検索のための自己蒸留アルゴリズムであるFA-SDをインスタンス化する。
モデルが反復的推論と探索の出力テンプレートに頼り、多様に見えるが入力問題に大きく依存しない軌跡を生成することを確認した。
自己学習者はより優れた成績を収めるが,非一貫性な指導信号により学習は本質的に不安定であることを示す。
- 参考スコア(独自算出の注目度): 28.21326355616294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy self-distillation (OPSD) offers a promising approach for training large language models without relying on a separate teacher model. However, its effectiveness on complex agentic tasks remains largely unexplored. In this work, we instantiate Feedback-Augmented Self-Distillation (FA-SD), a self-distillation algorithm for agentic search that leverages successful demonstrations as privileged information. We identify that models can rely on recurring reasoning-and-search output templates, producing trajectories that appear diverse but are largely agnostic to the input question, making the KL-based self-distillation signal uninformative. We term this phenomenon decoding collapse, a failure mode that can be missed by existing evaluation metrics. To understand its underlying cause, we show that although the self-teacher achieves stronger performance, learning remains inherently unstable due to inconsistent supervision signals. We further decompose this inconsistency into model inconsistency and prompt inconsistency, and show that the latter can significantly degrade the quality of the supervision signal, limiting the effectiveness of self-teacher learning. To mitigate this inconsistency, we introduce an exponential moving average (EMA) teacher to stabilize the self-teacher and provide more consistent supervision signals. Although the EMA teacher requires a warm-up phase during which performance may temporarily regress, it ultimately improves model performance by providing more stable supervision.
- Abstract(参考訳): On-policy Self-distillation (OPSD)は、個別の教師モデルに頼ることなく、大規模言語モデルをトレーニングするための有望なアプローチを提供する。
しかし、複雑なエージェント的タスクに対するその効果はほとんど未解明のままである。
本研究では,実演を特権情報として活用するエージェント検索のための自己蒸留アルゴリズムである,フィードバック拡張自己蒸留(FA-SD)をインスタンス化する。
我々は、モデルが反復的推論と探索の出力テンプレートに頼り、多様に見えるが入力問題に大きく依存しない軌跡を生成できるので、KLベースの自己蒸留信号は非形式的であることを確認した。
この現象は、既存の評価指標で見逃せない障害モードであるデコード崩壊(decoding collapse)と呼ばれます。
その根底にある原因を理解するため、自己学習者はより強いパフォーマンスを達成するが、一貫性のない監視信号によって学習は本質的に不安定であることを示す。
さらに、この不整合をモデル不整合と即ち不整合に分解し、後者が教師信号の品質を著しく低下させ、自己学習の有効性を抑えることを示す。
この不整合を緩和するために,自己学習者を安定させる指数移動平均(EMA)教師を導入し,より一貫した監視信号を提供する。
EMAの教師は、一時的にパフォーマンスが後退する可能性のあるウォームアップフェーズを必要とするが、より安定した監視を提供することで、最終的にモデルパフォーマンスを向上させる。
関連論文リスト
- TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs [83.78708832901194]
大規模ビデオ言語モデル(LVLM)は、野生のマルチモーダル感情認識(ER)のようなマルチモーダルタスクにおいて顕著なパフォーマンスを示している。
しかし、現実のデプロイメントは依然として困難であり、テスト時にモダリティが欠落したりうる。
凍結した教師が自己蒸留により適応的な低学級の生徒を指導する手法を提案する。
MELD, DFEW, BAHを0%-50%のモダリティで実験した結果, この統一型適応復元設計はエントロピーベースの適応, RAG, およびパープレキシティベースの生成より一貫して優れていた。
論文 参考訳(メタデータ) (2026-08-18T23:40:28Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Less is More: Early Stopping Rollout for On-Policy Distillation [39.392596318514244]
早期停止ロールアウト(Early Stopping Rollout, ESR)は, ロールアウト生成を第1応答トークンに限定した簡易かつ効果的な蒸留戦略である。
その結果,ESRはモデルサイズ,家族,タスク,トレーニング体制全体にわたって,フルロールアウトのOPD性能を上回っていることがわかった。
論文 参考訳(メタデータ) (2026-05-26T13:49:37Z) - Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning [41.384652481442735]
我々は,一様教師模倣からエントロピー制御された指向性監視へと特権的な自己蒸留を再構成するtextbfDirection-Adaptive Self-Distillation (textbfDASD)を提案する。
6つの数学的推論ベンチマークで、DASDは強力なRLVRと自己蒸留ベースラインよりも優れたマクロAvg@16を達成する。
論文 参考訳(メタデータ) (2026-05-21T10:07:46Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - Can Large Reasoning Models Self-Train? [51.0277533541394]
多数決投票を簡単な自己フィードバック機構として利用し、強化学習において自己学習が持続できるかどうかを検討する。
この基本的なアプローチは、モデルの推論性能だけでなく、次のRLイテレーションでより良い品質フィードバックを生成する能力も改善します。
しかし、我々の分析では、このような自己学習パラダイムの限界も明らかにしています - 自己回帰の長いRLは、報酬のハッキングにつながるため、突然、そして完全なパフォーマンスが崩壊します。
論文 参考訳(メタデータ) (2025-05-27T17:16:00Z) - Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones? [58.80794196076336]
大型言語モデル(LLM)の蒸留は、教師による微調整(SFT)を通して教師モデルの応答を伝達するのが一般的である。
本稿では, 応答と報酬の両方を伝達する新しい蒸留パイプラインを提案する。
本手法は,教師と生徒の両方の反応の固有構造を利用した自己教師機構によって擬似回帰を生成する。
論文 参考訳(メタデータ) (2025-02-26T20:50:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。