論文の概要: TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2604.00438v1
- Date: Wed, 01 Apr 2026 03:34:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.818202
- Title: TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning
- Title(参考訳): TR-ICRL:インコンテキスト強化学習のためのテスト時間再考
- Authors: Wenxuan Jiang, Yuxin Zuo, Zijian Zhang, Xuecheng Wu, Zining Fan, Wenxuan Liu, Li Chen, Xiaoyu Li, Xuezhi Cao, Xiaolong Jin, Ninghao Liu,
- Abstract要約: In-Context Reinforcement Learning (ICRL)により、大規模言語モデルは、コンテキストウィンドウ内で直接外部の報酬からオンラインで学習することができる。
In-Context Reinforcement Learning (TR-ICRL) のためのテスト時間再考(Test-Time Rethinking for In-Context Reinforcement Learning)を提案する。
- 参考スコア(独自算出の注目度): 39.71731052480912
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In-Context Reinforcement Learning (ICRL) enables Large Language Models (LLMs) to learn online from external rewards directly within the context window. However, a central challenge in ICRL is reward estimation, as models typically lack access to ground-truths during inference. To address this limitation, we propose Test-Time Rethinking for In-Context Reinforcement Learning (TR-ICRL), a novel ICRL framework designed for both reasoning and knowledge-intensive tasks. TR-ICRL operates by first retrieving the most relevant instances from an unlabeled evaluation set for a given query. During each ICRL iteration, LLM generates a set of candidate answers for every retrieved instance. Next, a pseudo-label is derived from this set through majority voting. This label then serves as a proxy to give reward messages and generate formative feedbacks, guiding LLM through iterative refinement. In the end, this synthesized contextual information is integrated with the original query to form a comprehensive prompt, with the answer determining through a final round of majority voting. TR-ICRL is evaluated on mainstream reasoning and knowledge-intensive tasks, where it demonstrates significant performance gains. Remarkably, TR-ICRL improves Qwen2.5-7B by 21.23% on average on MedQA and even 137.59% on AIME2024. Extensive ablation studies and analyses further validate the effectiveness and robustness of our approach. Our code is available at https://github.com/pangpang-xuan/TR_ICRL.
- Abstract(参考訳): In-Context Reinforcement Learning (ICRL)により、Large Language Models (LLM)は、コンテキストウィンドウ内で直接外部の報酬からオンラインで学習することができる。
しかし、ICRLにおける中心的な課題は報酬推定であり、モデルは通常、推論中に接地トルースへのアクセスを欠いている。
この制限に対処するために、推論と知識集約の両方のために設計された新しいICRLフレームワークである、In-Context Reinforcement Learning (TR-ICRL) のテスト時間再考を提案する。
TR-ICRLは、与えられたクエリに対してラベル付けされていない評価セットから、最も関連性の高いインスタンスを最初に検索することで動作する。
ICRLイテレーション毎に、LLMは検索されたインスタンス毎に候補回答のセットを生成する。
次に、この集合から多数決によって擬似ラベルを導出する。
このラベルは、報酬メッセージを与え、形式的なフィードバックを生成し、反復的な改善を通じてLLMを誘導するプロキシとして機能する。
最終的に、この合成されたコンテキスト情報は、元のクエリと統合されて包括的なプロンプトを形成し、回答は多数決の最終ラウンドで決定される。
TR-ICRLは、主流の推論と知識集約的なタスクに基づいて評価され、性能が著しく向上することを示す。
TR-ICRLはQwen2.5-7Bを平均で21.23%、AIME2024では137.59%改善している。
大規模なアブレーション研究と分析により,我々のアプローチの有効性とロバスト性をさらに検証した。
私たちのコードはhttps://github.com/pangpang-xuan/TR_ICRL.comで公開されています。
関連論文リスト
- Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers [55.33468902405567]
本稿では、事前学習とデプロイの両方が好みのフィードバックにのみ依存する新しい学習パラダイム、In-Context Preference-based Reinforcement Learning (ICPRL)を提案する。
ICPRLは、厳密なコンテキスト内一般化を可能にし、完全な報酬管理で訓練されたICRLメソッドに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-09T03:42:16Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains [13.626335241662977]
Reinforcement Learning with Verifiable Rewards (RLVR)-based post-training of Large Language Models (LLMs) は、推論タスクの精度を向上させることが示されている。
直接インセンティブのない中間トークンに対するRLポストトレーニングの効果について検討する。
論文 参考訳(メタデータ) (2025-10-20T23:58:31Z) - Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning [49.35842828047236]
強化学習(Reinforcement Learning, RL)は、特に推論モデルと組み合わせた場合、一般的なトレーニングパラダイムとして現れている。
本稿では,モデルが与えられた(探索,解)ペアに対する批判を生成するための批判強化学習(CRL)を提案する。
textscCritique-Coderは、RLのみのベースラインを異なるベンチマークで一貫して上回ることを示す。
論文 参考訳(メタデータ) (2025-09-26T18:30:49Z) - Reward Is Enough: LLMs Are In-Context Reinforcement Learners [27.916966728955348]
強化学習(Reinforcement Learning、RL)は、シーケンシャルな意思決定問題を解決するための人間設計のフレームワークである。
本研究では,LLM(Large Language Model)推論時間内にRLが出現することを示す。
ICRLプロンプトと呼ばれる新しいマルチラウンドプロンプトフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-21T16:15:01Z) - Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving [26.413753656936688]
大規模言語モデル(LLM)は、正確で検証可能な計算を必要とする数学的推論タスクに苦慮することが多い。
結果に基づく報酬から強化学習(RL)がテキストベースの推論を強化する一方で、エージェントがコード実行のような外部ツールを活用するために自律的に学習する方法を理解することは依然として重要である。
論文 参考訳(メタデータ) (2025-05-12T17:23:34Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z) - Contextualize Me -- The Case for Context in Reinforcement Learning [49.794253971446416]
文脈強化学習(cRL)は、このような変化を原則的にモデル化するためのフレームワークを提供する。
我々は,cRLが有意義なベンチマークや一般化タスクに関する構造化推論を通じて,RLのゼロショット一般化の改善にどのように貢献するかを示す。
論文 参考訳(メタデータ) (2022-02-09T15:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。