論文の概要: Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.03545v2
- Date: Wed, 05 Aug 2026 03:37:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.257702
- Title: Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning
- Title(参考訳): Hi-TTRL:テスト時間強化学習のためのヒントによる合意の調整
- Authors: Kunbin Xu, Xingzuo Li, Xuefeng Bai, Kehai Chen,
- Abstract要約: テスト時間強化学習フレームワークであるHi-TTRLを導入し、サンプリング中のヒントを利用してロールアウトコンセンサス強度を調節する。
複数のデータセットとバックボーンの実験は、Hi-TTRLが標準のTTRLよりも一貫して改善されていることを示している。
- 参考スコア(独自算出の注目度): 22.648368360495315
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test-time reinforcement learning (TTRL) improves the reasoning capabilities of large language models without labeled data by updating the policy with pseudo-labels constructed through majority voting. While effective, the reward signal assigned from majority voting is highly sensitive to consensus strength, defined as the frequency of the most common answer within a rollout group. In TTRL, consensus strength plays a dual role: it reflects both the reliability of the pseudo-label and the distribution of advantages. Low consensus can amplify updates from unreliable pseudo-labels through disproportionately large advantages, whereas high consensus reduces reward contrast and ultimately yields vanishing gradients. In this paper, we introduce Hi-TTRL, a test-time reinforcement learning framework that utilizes hints during sampling to regulate rollout consensus strength. Hi-TTRL first estimates consensus strength from a partial rollout group. When the consensus strength falls outside a target interval, it invokes a Markov chain Monte Carlo (MCMC) hint sampler. The sampler targets the power-transformed prefix distribution and uses finite-step approximate sampling to generate rollout prefixes as hints. By tuning the power exponent, Hi-TTRL generates hints with a sharpened or flattened power target, steering rollout consensus strength toward the target interval. Experiments on multiple datasets and backbones show that Hi-TTRL consistently improves over standard TTRL, with ablations and consensus-steering analyses validating the effectiveness of adaptive hint-guided consensus regulation.
- Abstract(参考訳): テスト時強化学習(TTRL)は、多数決によって構築された擬似ラベルでポリシーを更新することにより、ラベル付きデータなしで大規模言語モデルの推論能力を向上する。
有効ではあるが、過半数投票から割り当てられた報酬信号は、ロールアウトグループ内で最も一般的な回答の頻度として定義されるコンセンサス強度に非常に敏感である。
TTRLでは、コンセンサス強度が二重の役割を担い、擬似ラベルの信頼性と利点の分布の両方を反映している。
低コンセンサスは信頼性の低い擬似ラベルからの更新を、不均等に大きなアドバンテージを通じて増幅することができる一方で、高いコンセンサスは報酬のコントラストを減少させ、最終的に消滅する勾配をもたらす。
本稿では、サンプリング中のヒントを利用してロールアウトコンセンサス強度を調節するテスト時間強化学習フレームワークHi-TTRLを紹介する。
Hi-TTRLはまず、部分ロールアウトグループからコンセンサス強度を推定する。
コンセンサス強度が目標間隔外に落ちると、マルコフ連鎖モンテカルロ(MCMC)ヒントサンプリングを起動する。
サンプリング器は、パワー変換プレフィックス分布をターゲットとし、有限ステップ近似サンプリングを用いてロールアウトプレフィックスをヒントとして生成する。
パワー指数を調整することにより、Hi-TTRLは、目標間隔に向けてロールアウトコンセンサス強度を操る、シャープまたはフラット化されたパワーターゲットのヒントを生成する。
複数のデータセットとバックボーンの実験により、Hi-TTRLは標準TTRLよりも一貫して改善され、アダプティブヒント誘導コンセンサス規制の有効性を検証した。
関連論文リスト
- TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization [18.977861031175756]
TARPOは純粋なRLフレームワークであり、各ステップで離散トークン生成と連続潜在推論を切り替える。
TARPOは、様々なベンチマークで、既存の明示的で潜在的なRLベースラインよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-06-04T08:30:53Z) - Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning [37.981949917083746]
テスト時強化学習(TTRL)は常に擬似ラベルによる推論時にモデルを適応させる。
本稿では,突発的なシグナルを緩和する統合フレームワークであるDebiased and Denoised test-time Reinforcement Learningを提案する。
論文 参考訳(メタデータ) (2026-04-23T06:32:08Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning [12.354777054071379]
テスト時間強化学習は、多数決結果を擬似ラベルとして使用することにより、注釈付きデータへの依存を軽減する。
この投票戦略は、しばしば確認バイアスを引き起こし、スパース報酬に悩まされ、全体的なパフォーマンスが制限される。
これらの問題に対処するために,サブグループ固有のステップワイド信頼度重み付き擬似ラベル推定(SCOPE)を提案する。
論文 参考訳(メタデータ) (2025-12-17T07:21:54Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。