論文の概要: TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression
- arxiv url: http://arxiv.org/abs/2603.21663v1
- Date: Mon, 23 Mar 2026 07:42:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.54812
- Title: TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression
- Title(参考訳): TAMTRL:長期圧縮における多段階強化学習のための教師対応リワード・リフォーミング
- Authors: Li Wang, Yandong Wang, Xin Yu, Kui Zhang, Tianhao Peng, Wenjun Wu,
- Abstract要約: マルチTurn Reinforcement Learning(TAMTRL)のための教師対応リワード整形法を提案する。
TAMTRLは、関連する文書を教師の信号として利用し、それらをモデル入力の各ターンに整列させ、正規化確率による報酬を自己監督的に割り当てる。
7つの長文ベンチマークで異なるスケールの複数のモデルを用いた実験は、TAMTRLが強いベースラインを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 24.10525956976745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid progress of large language models (LLMs) has led to remarkable performance gains across a wide range of tasks. However, when handling long documents that exceed the model's context window limit, the entire context cannot be processed in a single pass, making chunk-wise processing necessary. This requires multiple turns to read different chunks and update memory. However, supervision is typically provided only by the final outcome, which makes it difficult to evaluate the quality of memory updates at each turn in the multi-turn training setting. This introduces a temporal credit assignment challenge. Existing approaches, such as LLM-as-a-judge or process reward models, incur substantial computational overhead and suffer from estimation noise. To better address the credit assignment problem in multi-turn memory training, we propose Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning (TAMTRL). TAMTRL leverages relevant documents as teacher signals by aligning them with each turn of model input and assigns rewards through normalized probabilities in a self-supervised manner. This provides fine-grained learning signals for each memory update and improves long-context processing. Experiments with multiple models of varying scales across seven long-context benchmarks show that TAMTRL consistently outperforms strong baselines, demonstrating its effectiveness. Our code is available at https://anonymous.4open.science/r/TAMTRL-F1F8.
- Abstract(参考訳): 大規模言語モデル(LLM)の急速な進歩は、幅広いタスクで顕著なパフォーマンス向上をもたらした。
しかし、モデルのコンテキストウインドウ制限を超える長いドキュメントを扱う場合、コンテキスト全体を単一のパスで処理することはできず、チャンクワイズ処理が必要である。
これは、異なるチャンクを読み、メモリを更新するために複数のターンを必要とする。
しかし、監視は通常、最終的な結果によってのみ提供されるため、マルチターントレーニング設定の各ターンにおけるメモリ更新の品質を評価するのが難しくなる。
これは時間的信用割り当ての問題をもたらす。
LLM-as-a-judgeやプロセス報酬モデルといった既存のアプローチでは、かなりの計算オーバーヘッドが発生し、推定ノイズに悩まされている。
マルチターンメモリトレーニングにおけるクレジット割り当て問題を改善するために,TAMTRL(Teacher-Aligned Reward Reformping for Multi-Turn Reinforcement Learning)を提案する。
TAMTRLは、関連する文書を教師の信号として利用し、それらをモデル入力の各ターンに整列させ、正規化確率による報酬を自己監督的に割り当てる。
これにより、メモリ更新毎にきめ細かい学習信号が提供され、長いコンテキスト処理が改善される。
7つの長文ベンチマークで異なるスケールの複数のモデルを用いた実験により、TAMTRLは強いベースラインを一貫して上回り、その有効性を示している。
私たちのコードはhttps://anonymous.4open.science/r/TAMTRL-F1F8で利用可能です。
関連論文リスト
- MemSifter: Offloading LLM Memory Retrieval via Outcome-Driven Proxy Reasoning [78.46301394559903]
大きな言語モデル(LLM)は、長期化タスクにますます使われています。
現在の手法はコストと精度のトレードオフに直面している。
MemSifterは、メモリ検索プロセスを小さなプロキシモデルにオフロードする新しいフレームワークである。
論文 参考訳(メタデータ) (2026-03-03T02:57:38Z) - Document Reconstruction Unlocks Scalable Long-Context RLVR [60.74632963522131]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLM)の機能強化(長文)のための重要なパラダイムとなっている。
我々は,LLMの長期的文脈能力を高めるための教師なしのアプローチについて検討し,重度の人的アノテーションや教師モデルの監督の必要性を排除した。
提案手法の有効性をRULERとLongBenchv2の2つのベンチマークで検証した。
論文 参考訳(メタデータ) (2026-02-09T03:23:23Z) - Reinforcement Learning for Machine Learning Engineering Agents [52.03168614623642]
強化学習によって改善される弱いモデルによって支援されるエージェントは、はるかに大きいが静的モデルによって支援されるエージェントよりも優れていることを示す。
分散非同期RLフレームワークにおいて,高コストかつ高利回りな動作を増幅するための時間依存性の勾配更新を提案する。
また,早期に失敗するプログラムとほぼ正しくないプログラムを区別し,部分クレジットを提供する環境機器を提案する。
論文 参考訳(メタデータ) (2025-09-01T18:04:10Z) - Intention-Conditioned Flow Occupancy Models [80.42634994902858]
大規模な事前学習は、今日の機械学習研究のやり方を根本的に変えた。
同じフレームワークを強化学習に適用することは、RLの中核的な課題に対処するための魅力的な方法を提供するので、魅力的です。
生成AIの最近の進歩は、高度に複雑な分布をモデリングするための新しいツールを提供している。
論文 参考訳(メタデータ) (2025-06-10T15:27:46Z) - DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding [26.39397960987363]
本稿では,事前学習したトランスモデルに対する簡単な修正を提案する。
まず最初に言語プロンプトと結合するのではなく、マルチモーダルトークンを直接中央に挿入します。
その結果,本手法は,学習と推論の双方において計算コストを削減できることが示唆された。
論文 参考訳(メタデータ) (2025-04-27T18:56:26Z) - Efficient Transfer Learning for Video-language Foundation Models [13.166348605993292]
テキスト表現と視覚表現のアライメントを高めるために,パラメータ効率のよいマルチモーダルパティッシャ・テンポラル・アダプタ (MSTA) を提案する。
我々は,ゼロショット転送,少数ショット学習,ベース・ツー・ノーベル一般化,完全テンポラル学習という4つの課題にまたがるアプローチの有効性を評価する。
論文 参考訳(メタデータ) (2024-11-18T01:25:58Z) - Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF [47.19899163378932]
大規模言語モデル(LLM)におけるマルチターンRLHFに対応するために,Regressing the RELative Future(REFUEL)を導入する。
REFUELは、反復的に収集されたデータセット上の回帰タスクのシーケンスとして、マルチターンRLHF問題をフレーム化している。
我々はLlama-3.1-70B-itを用いて,モデルとの対話においてユーザをシミュレートするアルゴリズムを評価する。
論文 参考訳(メタデータ) (2024-10-06T20:20:22Z) - DataStates-LLM: Lazy Asynchronous Checkpointing for Large Language Models [3.3484462092188005]
モデルと状態シャードを構成するテンソルが、長期間にわたって不変であるという事実を生かして、遅延非同期マルチレベルアプローチを導入する。
その結果、48$times$より高速なチェックポイントと2.2$times$より高速なエンドツーエンドトレーニングを実現した。
論文 参考訳(メタデータ) (2024-06-15T18:30:40Z) - Text Generation with Efficient (Soft) Q-Learning [91.47743595382758]
強化学習(RL)は、任意のタスクメトリクスを報酬としてプラグインすることで、より柔軟なソリューションを提供する。
ソフトQ-ラーニングの観点からテキスト生成のための新しいRL式を導入する。
雑音/負の例から学習し、敵攻撃、即時生成など、幅広いタスクにアプローチを適用する。
論文 参考訳(メタデータ) (2021-06-14T18:48:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。