論文の概要: ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning
- arxiv url: http://arxiv.org/abs/2608.03972v1
- Date: Tue, 04 Aug 2026 17:40:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.30302
- Title: ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning
- Title(参考訳): ReflectRL:Reflective-to-Direct Reasoningによる黄金陰性軌道からの学習
- Authors: Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua,
- Abstract要約: 欠陥軌跡は, 反射する欠陥軌跡として扱われる場合においても, 貴重な推論信号が得られることを示す。
本報告では,プライバシ教育におけるGolden Negative Trajectoriesから学習する軽量なプラグイン・アンド・プレイフレームワークであるReflectRLを提案する。
- 参考スコア(独自算出の注目度): 84.29802893743991
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy training has emerged as a powerful post-training paradigm for improving the reasoning capabilities of large language models, and is often enhanced by golden trajectories from stronger expert models. However, when the expert fails on harder problems, existing trajectory-guided methods lose their main source of supervision, and these failed trajectories are typically discarded as negative samples. We argue that such failures, which we call Golden Negative Trajectories, can still provide valuable reasoning signals when treated not as demonstrations to imitate, but as flawed trajectories to reflect upon. We identify a Reflection Advantage: for hard problems, reflecting on a flawed trajectory can be easier and more effective than solving the problem directly from scratch. Motivated by this, we propose ReflectRL, a lightweight plug-and-play framework that learns from Golden Negative Trajectories during on-policy training. ReflectRL first uses these trajectories to elicit Reflective Reasoning, then applies Reflective-to-Direct Policy Transition to transfer the acquired reasoning behavior back to Direct Reasoning. Experiments across 9 benchmarks, 4 LLM backbones, and 4 on-policy training methods show that ReflectRL consistently improves reasoning performance with minimal overhead.
- Abstract(参考訳): オンライン政治トレーニングは、大規模な言語モデルの推論能力を改善するための強力なポストトレーニングパラダイムとして現れており、しばしばより強力な専門家モデルからのゴールデントラジェクトリによって強化されている。
しかし、専門家が難しい問題に失敗すると、既存の軌道誘導法は主要な監督源を失い、これら失敗した軌道は一般的に負のサンプルとして破棄される。
我々は、黄金陰性軌道(Golden Negative Trajectories)と呼ばれるそのような失敗は、模倣する実証としてではなく、反射する欠陥のある軌道として扱われるときに、価値ある推論信号を提供することができると論じる。
難しい問題に対して、欠陥のある軌道を反映することは、問題をスクラッチから直接解決するよりも簡単かつ効果的である。
そこで本研究では,プライバシ教育におけるGolden Negative Trajectoriesから学習する軽量なプラグイン・アンド・プレイフレームワークであるReflectRLを提案する。
ReflectRLはまずこれらのトラジェクトリを使用してリフレクティブ推論を求め、次にリフレクティブから直接ポリシー遷移を適用して、取得した推論動作をダイレクト推論に戻す。
9つのベンチマーク、4つのLCMバックボーン、4つのオンライントレーニング手法による実験は、リフレクションRLが最小限のオーバーヘッドで推論性能を一貫して改善していることを示している。
関連論文リスト
- Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR [30.94808389410323]
Trajectory-Guided Reinforcement Learningは、視覚的証拠をきめ細かな推論プロセスに統合するためのポリシーモデルを導く。
複数のマルチモーダル推論ベンチマークの実験は、TGRLが一貫して推論性能を改善することを示した。
論文 参考訳(メタデータ) (2026-03-27T07:18:18Z) - Learn Hard Problems During RL with Reference Guided Fine-tuning [56.56461712665904]
数学的推論のための強化学習(RL)は報酬の分散に悩むことがある。
本稿では,Reference-Guided Fine-Tuning (ReGFT)を導入し,ハード問題に対する正の軌道を合成し,RLの前にトレーニングする。
以上の結果から,ReGFTは報酬空間を効果的に克服し,より強力なRLに基づく数学的推論を解き放つことが示唆された。
論文 参考訳(メタデータ) (2026-03-01T18:41:28Z) - Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing [70.35701681177655]
自己改善は、大きな視覚言語モデルの推論能力を向上するための主流パラダイムとして現れてきた。
本研究では,探索学習による自己改善プロセスにおいて,頭部再バランスを実現するための4つの効率的な戦略を提案する。
我々の手法は視覚的推論能力を常に改善し、バニラ自己改善を平均3.86ポイント上回る。
論文 参考訳(メタデータ) (2025-10-30T13:26:58Z) - First Try Matters: Revisiting the Role of Reflection in Reasoning Models [66.39546876232512]
我々は、モデルがすでに答を生み出しているが、その出力を確定する前に反射し続ける反射行動に焦点を当てる。
分析の結果,反射はおおむね肯定的であり,モデルの初期回答を変えることは滅多にないことがわかった。
本稿では,いくつかの候補解が生成されると推論プロセスが停止し,推論時間のトークン効率を向上させる質問認識早期検索手法を提案する。
論文 参考訳(メタデータ) (2025-10-09T14:57:10Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Learning to Reason under Off-Policy Guidance [40.27817638425237]
textbfLUFFY(textbfLearning to reason textbfUnder otextbfFF-polictextbfY guidance)を導入する。
LUFFYは、模擬と探検のバランスを取るために、オフ・ポリティクスのデモとオン・ポリティクスのロールアウトを組み合わせる。
論文 参考訳(メタデータ) (2025-04-21T08:09:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。