論文の概要: $T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training
- arxiv url: http://arxiv.org/abs/2609.32791v2
- Date: Fri, 02 Oct 2026 16:25:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.891654
- Title: $T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training
- Title(参考訳): T^5$: 強化中級訓練におけるトーケンレベル思考の双極的訓練
- Abstract要約: 既存のグループ相対法では、コストがかかる。
単一生成軌道からトークンレベルの利点を校正するツインクリティカルな方法であるtfourを提案する。
実験の結果、最先端の批判のない手法と比較して、tfourは平均ベンチマーク性能を7.8%改善し、平均トレーニングステップ時間を63.4%削減した。
- 参考スコア(独自算出の注目度): 38.44142588468548
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reinforcement mid-training lets language models learn internal thoughts from unlabeled text, but efficient token-level credit assignment remains challenging. Existing group-relative methods require costly repeated generation. Learned critics offer single-rollout feedback, but accurate return prediction alone does not ensure reliable policy updates. Our analysis shows how training--inference mismatch and PPO clipping prevent a common offset in advantage estimates from cancelling out, introducing additional update drift. We propose \tfour{}, a twin-critic method that calibrates token-level advantages from a single generated trajectory. After warmup and held-out qualification, the critics provide two advantage estimates, combined using action-dependent weights learned through a conditional-moment saddle-point objective. This objective brings the average advantage at each prefix toward zero, while a signal-retention constraint prevents the correction from erasing the learning signal. Sharing information across text positions avoids repeated sampling of each prefix. Theoretically, we characterize optimal mixing under the signal-retention constraint and establish an upper bound on residual mean-induced drift. Experiments show that, compared with the state-of-the-art critic-free method, \tfour{} improves mean benchmark performance by 7.8\% and reduces mean training-step time by up to 63.4\%.
- Abstract(参考訳): 強化ミッドトレーニングにより、言語モデルはラベルのないテキストから内部思想を学習できるが、効率的なトークンレベルのクレジット割り当ては難しいままである。
既存のグループ相対法では、コストがかかる。
学習した批評家はシングルロールアウトフィードバックを提供するが、正確なリターン予測だけでは信頼性の高いポリシー更新を保証しない。
我々の分析は、トレーニング-推論ミスマッチとPPOクリッピングが、見積もりがキャンセルされ、追加の更新ドリフトを導入することで、共通のオフセットを防ぐ方法を示している。
単一生成軌道からトークンレベルの利点を校正するツインクリティカルな手法である \tfour{} を提案する。
ウォームアップとホールトアウトの資格を得た後、批評家は条件付きモーメント・サドルポイントの目的から学んだ行動依存の重みを使って、2つの利点を見積もった。
この目的は各接頭辞における平均的優位性をゼロにし、信号保持制約は学習信号の消去を防止する。
テキスト位置間で情報を共有することは、各プレフィックスの繰り返しサンプリングを避ける。
理論的には、信号保持制約下での最適混合を特徴付け、残留平均誘起ドリフト上の上限を確立する。
実験によると、最先端の批判のない手法と比較して、 \tfour{} は平均ベンチマーク性能を7.8\%改善し、平均トレーニングステップ時間を63.4\%削減している。
関連論文リスト
- FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience [18.64380706071327]
FlowBalanceは、完全応答上の正規化分布を学習する検証器による自己改善手法である。
オンラインの軌跡ごとに、同じポリシーの凍結されたトレーニングタイムビューは、特権付きコンテキストを使用してトークンレベルのログ確率ゲインを生成する。
分析では, 群内コントラスト保存, 最小値逆KL特性, 目標報酬の単調検証, 拒否応答に対する偽陽性自己誘導に対する正確な補正が確立された。
論文 参考訳(メタデータ) (2026-09-03T00:47:11Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement [27.695600755960736]
自己誘導型フローマッチングポリシであるForesightFlowを紹介した。
それぞれの生成されたアクションチャンクを、学習された成功可能性軌道で拡張する。
候補アクションをスコア付けし、外部の批評家なしで$K$の推論を可能にする。
論文 参考訳(メタデータ) (2026-06-03T14:49:35Z) - What Does Flow Matching Bring To TD Learning? [28.717975688380488]
強化学習(RL)におけるスカラーQ値関数推定にフローマッチングが有効である
これらの結果から, 分布 RL ではその成功は説明されず, リターン分布を明示的にモデル化することで, 性能が低下することを示した。
我々は,この統合プロセスの各ステップにおける値の読み出しと高密度な速度管理に積分を用いることで,2つのメカニズムによるTD学習が向上すると主張している。
論文 参考訳(メタデータ) (2026-03-04T17:51:30Z) - Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning [11.179446105672461]
教師付き微調整と強化学習を組み合わせた多段階効率的な推論手法を提案する。
提案手法は,8Bモデルでは平均28%,32Bモデルでは40%の応答長を減少させる。
より複雑な最先端の効率的な推論手法に比べて、優れたトレードオフを実現する。
論文 参考訳(メタデータ) (2026-01-06T12:31:51Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。