論文の概要: TTPO: Test-Time Policy Optimization
- arxiv url: http://arxiv.org/abs/2608.27448v1
- Date: Thu, 27 Aug 2026 17:58:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.522727
- Title: TTPO: Test-Time Policy Optimization
- Title(参考訳): TTPO:テストタイムポリシー最適化
- Authors: Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen,
- Abstract要約: テストタイムポリシー最適化(TTPO)は、OPSDを介してロールアウトに同意し、Grouped RLと不一致なロールアウトを罰する非対称な目的である。
TTPOは5つの競合レベルのベンチマークでラベル管理されたOPSDと一致し、Qwen3-1.7Bは38.0%から45.2%まで上昇し、思考せずに+25.2%から+36.4%に上昇し、クロスタスクの一般化を示す。
- 参考スコア(独自算出の注目度): 53.81524570216593
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent prominent post-training methods, such as Reinforcement Learning (RL) and On-Policy Self-Distillation (OPSD), have driven rapid progress in mathematical reasoning for large language models, yet their reliance on ground-truth labels precludes test-time training (TTT). Replacing ground truth with majority-vote pseudo-labels is a natural alternative, yet it is fragile: an incorrect vote corrupts the teacher and misleads every token. We observe that this failure mode is asymmetric: rollouts that disagree with the pseudo-label are typically wrong regardless of whether the vote itself is correct. Building on this observation, we propose Test-Time Policy Optimization (TTPO), an asymmetric objective that distills agreeing rollouts via OPSD and penalizes disagreeing rollouts with Grouped RL. Token-level selection further refines both branches: distillation down-weights already-converged positions, while RL penalizes only confident errors. Both updates remain well-grounded even under frequent pseudo-label errors, and majority-vote routing yields tighter self-supervision as the model improves. Without any labels, TTPO matches label-supervised OPSD on five competition-level benchmarks, raises Qwen3-1.7B from 38.0% to 45.2% in TTT, yields +25.2% to +36.4% without thinking, and shows strong cross-task generalization.
- Abstract(参考訳): Reinforcement Learning (RL) や On-Policy Self-Distillation (OPSD) といった最近の卓越したポストトレーニング手法は、大規模な言語モデルに対する数学的推論の急速な進歩を招いているが、地上訓練ラベルへの依存はテストタイムトレーニング(TTT)を妨げている。
多数票の擬似ラベルで根底的な真実を置き換えることは自然な選択肢であるが、それは脆弱である: 不正な投票は教師を腐敗させ、全てのトークンを誤解させる。
疑似ラベルに反するロールアウトは、投票自体が正しいかどうかに関わらず、通常間違っている。
本研究は, OPSDによるロールアウトに同意し, グループRLと不一致なロールアウトを罰する非対称な目的であるテスト時間ポリシー最適化(TTPO)を提案する。
蒸留ダウンウェイトは、既に収束した位置にあるが、RLは自信のあるエラーのみを罰する。
両方の更新は、頻繁に擬似ラベルのエラーの下でも十分に根付いており、多数決のルーティングは、モデルが改善されるにつれて、より厳密な自己スーパービジョンをもたらす。
TTPOはラベル付きOPSDを5つの競合レベルのベンチマークで比較し、Qwen3-1.7Bを38.0%から45.2%に引き上げ、+25.2%から+36.4%の利得を得た。
関連論文リスト
- CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning [6.071121358322323]
emphCoREはトレーニングされていないベースを平均で+21.7ドル、多数投票で$20.4ドルで改善する。
投票ボックスではなくグラフとしてロールアウトグループを扱い、不安定な投票を、余分なロールアウトコストなしで、校正され、格付けされ、自己監督された報酬に変える。
論文 参考訳(メタデータ) (2026-08-10T09:06:03Z) - Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting [4.336665585098371]
テスト時間強化学習 (TTRL) は, 多数決を擬似ラベル信号として用いた数学的推論ベンチマークにおいて, かなりの精度向上を報告している。
textitCorrect-Answer Extinction Windowをターゲットにした3つのメカニズムを持つ軽量フレームワークであるTTRL-Guardを提案する。
3つのモデルと4つのベンチマーク実験により、TTRL-GuardはQwen2.5-7B-InstructとQwen3-4Bで最高平均パス@1を達成し、AIME 2025では+54%改善した。
論文 参考訳(メタデータ) (2026-05-19T06:58:44Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - TEMPO: Scaling Test-time Training for Large Reasoning Models [87.61789183311856]
テストタイムトレーニング(TTT)は、推論時間中にラベルのないテストインスタンスにモデルパラメータを適用する。
TTTフレームワークであるTEMPOを提案する。これは、ラベル付きデータセット上で定期的な批評家の再検討を行い、ラベル付き質問に対するポリシー修正をインターリーブする。
論文 参考訳(メタデータ) (2026-04-21T10:01:04Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - RESTRAIN: From Spurious Votes to Signals -- Self-Driven RL with Self-Penalization [52.01526898310723]
私たちは、ゴールドラベルの欠如を有用な学習信号に変換する自己金型RLフレームワークであるRESTRAINを紹介します。
多数決を急ぐために過剰にコミットする代わりに、RESTRAINは、モデルの全回答分布からのシグナルを利用する。
挑戦的な推論ベンチマークでは、RESTRAINはラベルのないデータのみを使用して大きなゲインを提供する。
論文 参考訳(メタデータ) (2025-10-02T16:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。