論文の概要: DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization
- arxiv url: http://arxiv.org/abs/2605.31455v1
- Date: Fri, 29 May 2026 15:49:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.713575
- Title: DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization
- Title(参考訳): DRIFT: 効率的なマルチターン最適化のための分離ロールアウトと重要度重み付きファインチューニング
- Abstract要約: 大規模言語モデルは、マルチターンのインタラクティブな設定にますますデプロイされている。
オンライン強化学習は、マルチターンダイナミックスに効果的に対処できるが、完全な修正軌道を生成するコストのため、非常に高価である。
オフラインの教師付き微調整は効率的だが、分散シフトと行動崩壊に悩まされる。
DRIFTは、KL正規化RL目標が重み付き教師あり学習と等価であるという理論的洞察を運用するフレームワークである。
- 参考スコア(独自算出の注目度): 37.598637850911
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly deployed in multi-turn interactive settings where users or environments can iteratively provide lightweight feedback. Unfortunately, optimizing such behavior presents a sharp dilemma in practice: online reinforcement learning is able to effectively address multi-turn dynamics but is prohibitively expensive due to the cost of generating full correction trajectories at every update, whereas offline supervised fine-tuning (SFT) is efficient but suffers from distribution shift and behavioral collapse. To this end, we novelly propose DRIFT (Decoupled Rollouts and Importance-Weighted Fine-Tuning), a framework that operationalizes the theoretical insight that the KL-regularized RL objective is equivalent to importance-weighted supervised learning. DRIFT decouples rollout from optimization by sampling offline interaction trajectories from a fixed reference policy, deriving return-based importance weights, and optimizing the policy via weighted SFT on the resulting dataset. Empirically, we demonstrate that DRIFT matches or exceeds the performance of multi-turn reinforcement learning baselines while maintaining the training efficiency and simplicity of standard supervised fine-tuning. Code is available at https://github.com/2020-qqtcg/DRIFT.
- Abstract(参考訳): 大規模な言語モデルは、ユーザや環境が軽量なフィードバックを反復的に提供できるマルチターンインタラクティブな設定に、ますます多くデプロイされている。
オンライン強化学習は、マルチターンダイナミクスを効果的に扱えるが、更新毎に完全な修正トラジェクトリを生成するコストがかかるため、非常に高価である。
そこで本研究では,KL正規化RL目標が重要度の高い教師付き学習と等価であるという理論的洞察を運用するフレームワークであるDRIFT(Decoupled Rollouts and Importance-Weighted Fine-Tuning)を提案する。
DRIFTは、固定参照ポリシからオフラインインタラクショントラジェクトリをサンプリングし、リターンベースの重み付けを導出し、結果データセット上で重み付けされたSFTを介してポリシーを最適化することで、最適化からロールアウトを分離する。
実験により、DRIFTは、標準的な微調整の訓練効率と簡易さを維持しつつ、マルチターン強化学習ベースラインの性能に適合または超越することを示した。
コードはhttps://github.com/2020-qqtcg/DRIFTで入手できる。
関連論文リスト
- Dynamic Important Example Mining for Reinforcement Finetuning [53.98969373888718]
強化微調整 (Reinforcement fine-tuning, RFT) は、大型モデルの推論能力を高めるためにますます用いられる。
ほとんどのデータ中心のRFTメソッドは静的またはサンプルの選択に依存しており、サンプルの値がトレーニング中に固定されていることを暗黙的に仮定している。
RFT 全体にわたってデータ利用を適応させる,原則的かつ完全に自動化されたフレームワークである Dynamic important Example Mining (DIEM) を提案する。
論文 参考訳(メタデータ) (2026-08-29T13:12:25Z) - When Learning Hurts: Fixed-Pole RNN for Real-Time Online Training [58.25341036646294]
本研究では,再帰性極の学習がデータに有意な利点をもたらしない理由を解析的に検討し,実時間学習シナリオを実証的に提供する。
固定極ネットワークは、トレーニングの複雑さを低減し、オンラインリアルタイムタスクにより適していることを示す。
論文 参考訳(メタデータ) (2026-02-25T00:15:13Z) - Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning [65.10602992874787]
AutoTrajはツール使用トラジェクトリの修復と報酬によってTIRを自動的に学習するフレームワークである。
実世界のベンチマークの実験では、AutoTrajの有効性が示されている。
論文 参考訳(メタデータ) (2026-01-30T14:42:04Z) - MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving [12.330414519761524]
軌道計画は自動運転における中核的な課題である。
強化学習によるMLLMは、"ロングテール"シナリオに対処する上で、有望であることを示している。
我々は,MLLMが環境フィードバックに基づいて軌道を反復的に洗練できるマルチターンフレームワークMTDriveを提案する。
論文 参考訳(メタデータ) (2026-01-30T12:47:55Z) - On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting [91.38734024438357]
Supervised Fine-Tuning (SFT) と Reinforcement Learning (RL) は、大規模言語モデル(LLM)の能力の強化と振る舞いの整合化のための訓練後パラダイムである。
SFTとRLを統合する既存のアプローチは、確立された応答パターンを乱し、専門家データに過度に適合するリスクに直面することが多い。
動的重み付けによるオン・アンド・オフ・ポリティクス強化学習の制御可能な調和のためのフレームワークであるCHORDを提案する。
論文 参考訳(メタデータ) (2025-08-15T11:20:03Z) - Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle [65.14124923451077]
強化学習(Reinforcement Learning, RL)は、マルチモーダル大言語モデル(MLLM)の推論能力を高めるための効果的なポストトレーニングパラダイムとして登場した。
しかしながら、現在のRLパイプラインは、アドバンテージ・コラプシング(Advantage Collapsing)とロールアウト・サイレンシング(Rollout Silencing)という2つの未解決の問題によって、トレーニングの非効率に悩まされることが多い。
軌道サンプリングとバッチ合成を動的に再構成することにより、RLの微調整効率を向上する、シンプルだが原則化されたフレームワークであるShuffle-R1を提案する。
論文 参考訳(メタデータ) (2025-08-07T17:53:47Z) - Communication-Efficient Wireless Federated Fine-Tuning for Large-Scale AI Models [13.742950928229078]
Low-Rank Adaptation (LoRA) は、完全に微調整された大型モデルではなく、コンパクトで低ランクな行列を訓練することでこれらの問題に対処する。
本稿では,学習性能と通信効率の両方を最適化する無線フェデレーションLoRAファインチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-01T06:15:38Z) - From Imitation to Exploration: End-to-end Autonomous Driving based on World Model [24.578178308010912]
RAMBLEは、意思決定を駆動するエンド・ツー・エンドの世界モデルベースのRL方式である。
複雑な動的トラフィックシナリオを処理できる。
CARLA Leaderboard 1.0では、ルート完了率の最先端のパフォーマンスを達成し、CARLA Leaderboard 2.0では38のシナリオをすべて完了している。
論文 参考訳(メタデータ) (2024-10-03T06:45:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。