論文の概要: FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
- arxiv url: http://arxiv.org/abs/2609.03241v1
- Date: Thu, 03 Sep 2026 00:47:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.886248
- Title: FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
- Title(参考訳): FlowBalance: オンデマンド推論エクスペリエンスによる検証対象の自己改善
- Authors: Zixun Huang, Kishan Panaganti, Haitao Mi, Leowei Liang,
- Abstract要約: FlowBalanceは、完全応答上の正規化分布を学習する検証器による自己改善手法である。
オンラインの軌跡ごとに、同じポリシーの凍結されたトレーニングタイムビューは、特権付きコンテキストを使用してトークンレベルのログ確率ゲインを生成する。
分析では, 群内コントラスト保存, 最小値逆KL特性, 目標報酬の単調検証, 拒否応答に対する偽陽性自己誘導に対する正確な補正が確立された。
- 参考スコア(独自算出の注目度): 18.64380706071327
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A reasoning model can improve from its own on-policy experience, but this inner loop is fragile: terminal verifiers provide reliable yet sparse supervision, while dense same-model guidance can reinforce false confidence or overconcentrate learning on a narrow solution mode. We introduce FlowBalance, a verifier-grounded self-improvement method that learns a normalized distribution over complete responses. For each on-policy trajectory, a frozen training-time view of the same policy uses privileged context to produce token-level log-probability gains, which are aggregated into a trajectory-level self-guidance score. FlowBalance calibrates this score with the verifier-derived group advantage: guidance is retained on positive-advantage trajectories, reversed on negative-advantage trajectories, and disabled when the rollout group provides no outcome preference. The resulting energy exponentially reweights a reference policy, and profiled trajectory balance fits the normalized target with one log-partition estimate per rollout group. This realizes outcome-calibrated self-guidance via trajectory balance, without a separate token-level imitation loss. Our analysis establishes within-group contrast preservation, a minimum-change reverse-KL characterization, monotonic verifier control of target reward, and an exact correction against false-positive self-guidance on rejected responses. On mathematical reasoning, FlowBalance improves average performance over FlowRL on both Qwen3-4B and Qwen3-8B, while also improving training speed and stability, avoiding direct OPSD's response-length collapse, and exhibiting higher correct-strategy diversity in a controlled AIME24 diagnostic.
- Abstract(参考訳): しかし、この内部ループは脆弱であり、端末検証器は信頼性が高く、疎度な監視を提供する一方、密集した同モデルガイダンスは、狭い解法モードでの学習を過度に強化または強化することができる。
本稿では,完全応答上の正規分布を学習する検証器による自己改善手法であるFlowBalanceを紹介する。
同じ方針の凍結トレーニングタイムビューでは、各オンライントラジェクトリに対して、特権付きコンテキストを使用してトークンレベルのログ確率ゲインを生成し、トラジェクトリレベルの自己ガイダンススコアに集約する。
FlowBalanceはこのスコアを検証者由来のグループの利点で校正する: 正のアドバンテージ・トラジェクトリでガイダンスが保持され、負のアドバンテージ・トラジェトリで逆転され、ロールアウト・グループが結果の優先権を提供しない場合は無効になる。
得られたエネルギーは基準ポリシを指数関数的に再重み付けし、プロファイルされた軌道バランスは正規化された目標にロールアウトグループ当たりの1つの対数分割推定値に適合する。
これにより、異なるトークンレベルの模倣損失を伴わずに、軌道バランスによる結果校正自己誘導を実現する。
分析では, 群内コントラスト保存, 最小値逆KL特性, 目標報酬の単調検証, 拒否応答に対する偽陽性自己誘導に対する正確な補正が確立された。
数学的推論では、FlowBalanceは、Qwen3-4BとQwen3-8Bの両方でのFlowRLに対する平均性能を改善しながら、トレーニング速度と安定性を改善し、直接OPSDの応答長の崩壊を回避し、制御されたAIME24診断において高い精度の多様性を示す。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning [58.088509347353465]
強化学習(Reinforcement Learning, RL)は、言語モデルトレーニングにおいて広く使われている。
我々は,このトレードオフに明確な統計的解釈を与えるゲーム理論の枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-29T00:19:09Z) - ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies [20.452659267550217]
ReGuideは、ガイド付きロールアウトを再利用可能なオンラインリカバリデータとして扱うフレームワークである。
Onmimic Can、Square、Transport、Tool Hang、ReGuideは、基本政治の成功を1.3$--7.7times$で改善し、テストタイムのみの設定でLPBを上回っている。
論文 参考訳(メタデータ) (2026-06-27T14:23:21Z) - Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation [14.043179860831406]
自己蒸留は、モデルのロールアウトをトレーニング信号として使用することにより、大規模言語モデルの推論を改善する。
本稿では,暗黙的な分布アライメントから明示的な軌跡構築まで,自己蒸留を推し進めるTrajectory-Augmented Policy Optimization (TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-17T09:24:19Z) - AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning [13.721410595245894]
国家依存割引は概念的には魅力的だが、真に深いアクター-批判的な実装は、TDエラーの崩壊に向かって退化することができる。
AdaGammaは、状態依存割引の実践的ディープアクター批判的手法であり、状態依存割引関数をリターン整合性目標とともに学習する。
論文 参考訳(メタデータ) (2026-05-07T12:42:46Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Adaptive recurrent flow map operator learning for reaction diffusion dynamics [0.9137554315375919]
我々は,適応的反復学習(DDOL-ART)を軽量な検証マイルストーンを持つ頑健な再帰戦略を用いて行う演算子学習器を開発した。
DDOL-ARTは長いロールアウトで安定なワンステップ演算子を学び、ゼロショットを強いシフトに一般化する。
物理ベースの数値損失演算子学習器(NLOL)よりも、マッチした設定で数倍高速である。
論文 参考訳(メタデータ) (2026-02-10T07:33:13Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。