論文の概要: When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon
- arxiv url: http://arxiv.org/abs/2606.30445v1
- Date: Mon, 29 Jun 2026 15:17:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.299787
- Title: When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon
- Title(参考訳): LLMポストトレーニングにおけるオンライン模倣学習はいつ役に立つか? : 水平を越えた(ノン)再現性の役割
- Abstract要約: オンラインインタラクションの利点は、設定が実現可能かどうかに大きく依存することを示す。
実現可能性の下では、オフラインILがエキスパートのパフォーマンスとすでに一致していることが実証的に分かります。
本稿では,報酬に対する不特定性の構造的特徴について提案する。
- 参考スコア(独自算出の注目度): 30.903287230763212
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online imitation learning (IL), particularly on-policy distillation, has emerged as a strong LLM post-training approach, often outperforming offline supervised fine-tuning (SFT). Yet a principled understanding of when and why online interaction helps remains unclear. In this work, we challenge the view that error accumulation is the main source of online IL's advantage, and instead show that the benefits of online interaction depend critically on whether the setting is realizable, i.e., whether the student policy class can represent the expert policy. Under realizability, we empirically find that offline IL already matches expert performance. In contrast, in non-realizable (misspecified) settings, we prove that offline IL encounters an information-theoretic bottleneck even when horizon $H=1$, and propose a structural characterization of misspecification relative to the reward, under which online IL provably achieves high performance despite a large distributional mismatch between the expert and student policies.
- Abstract(参考訳): オンライン模倣学習(IL)、特にオンライン蒸留は、強力なLCMポストトレーニングアプローチとして現れ、しばしばオフライン教師あり微調整(SFT)よりも優れている。
しかし、オンラインインタラクションがいつ、なぜ役に立つのかについての原則的な理解はまだ不明だ。
本研究は,オンラインILの利点の主源はエラー蓄積であり,オンラインインタラクションの利点は,設定が実現可能かどうか,すなわち,学生政策クラスが専門家の政策を表現できるかどうかに大きく依存することを示すものである。
実現可能性の下では、オフラインILがエキスパートのパフォーマンスとすでに一致していることが実証的に分かります。
対照的に、非実現可能(誤特定)な設定では、水平線$H=1$の場合でもオフラインILが情報理論上のボトルネックに直面することを証明し、オンラインILが専門家と学生の方針の分散ミスマッチが大きいにもかかわらず、報酬に対する不特定性の構造的特徴を提案する。
関連論文リスト
- When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning [70.72643569128316]
イミテーション学習(Imitation Learning, IL)は、エージェントがデモンストレーションから専門家の行動を再現するように訓練する。
我々は,学習者が専門家の値関数を表現できる場合,統計的に効率的である,インタラクティブなオンラインILアルゴリズムであるOVIを紹介する。
OVIは、オフラインポリシーベース(BC)、インタラクティブポリシーベース(DAgger)、オフライン価値ベースのILメソッドよりも優れており、学習者ネットワークが専門家よりも表現力に乏しい場合に最大である。
論文 参考訳(メタデータ) (2026-07-31T16:52:47Z) - Grounded in Reality: Learning and Deploying Proactive LLM from Offline Logs [72.08224879435762]
textttLearn-to-Askは、プロアクティブな対話エージェントの学習とデプロイのためのシミュレータフリーフレームワークである。
当社のアプローチは,LLMの大規模オンラインAIサービスへの展開を成功に導くものです。
論文 参考訳(メタデータ) (2025-10-29T12:08:07Z) - Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning [26.53136644321385]
シミュレーション学習(Imitation Learning, IL)は、実演から学ぶことによって、連続的な意思決定タスクにおいて専門家の行動を模倣することを目的としている。
累積ペイオフの範囲が制御されるたびに、オフラインILにおいて水平非依存のサンプル複雑性を実現することができることを示す。
決定的,定常的な政策を特化して,オンラインILとオフラインILの差が従来考えられていたよりも小さいことを示す。
論文 参考訳(メタデータ) (2024-07-20T23:31:56Z) - OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning [40.070791824270266]
本研究では,静的な実演データから模倣ポリシーを事前学習し,高速な微調整を行うオフライン・オンライン・イミテーション学習(IL)について検討する。
我々は, ほぼ専門的なポリシーを同時に学習する, $textttOLLIE$ という原則付きオフライン IL 手法を提案する。
経験的に、$textttOLLIE$は、$textbf20$チャレンジタスクのベースラインメソッドを一貫して大幅に上回ります。
論文 参考訳(メタデータ) (2024-05-24T04:57:25Z) - ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles [52.34951901588738]
我々はENsemble-based Offline-To-Online (ENOTO) RLという新しいフレームワークを提案する。
Q-networksの数を増やすことで、オフラインの事前トレーニングとオンラインの微調整を、パフォーマンスを低下させることなくシームレスに橋渡しします。
実験により,ENOTOは既存のオフラインRL手法のトレーニング安定性,学習効率,最終性能を大幅に向上できることが示された。
論文 参考訳(メタデータ) (2023-06-12T05:10:10Z) - MAHALO: Unifying Offline Reinforcement Learning and Imitation Learning
from Observations [43.9636309593499]
我々は、観測からオフライン政策学習(PLfO)と呼ばれる、シーケンシャルな意思決定のための新しいパラダイムについて研究する。
我々は、$textbfM$odality-agnostic $textbfA$dversarial $textbfH$ypothesis $textbfA$daptation for $textbfL$earning from $textbfO$bservation (MAHALO)と呼ばれるオフラインPLfOに対する一般的なアプローチを提示します。
論文 参考訳(メタデータ) (2023-03-30T05:27:46Z) - Curriculum Offline Imitation Learning [72.1015201041391]
オフラインの強化学習タスクでは、エージェントは、環境とのさらなるインタラクションなしに、事前にコンパイルされたデータセットから学ぶ必要がある。
我々は,適応的な近隣政策を模倣する経験的選択戦略を,より高いリターンで活用するテキストカリキュラムオフライン学習(COIL)を提案する。
連続制御ベンチマークでは、COILを模倣ベースとRLベースの両方の手法と比較し、混合データセット上で平凡な振る舞いを学ぶことを避けるだけでなく、最先端のオフラインRL手法と競合することを示します。
論文 参考訳(メタデータ) (2021-11-03T08:02:48Z) - Mitigating Covariate Shift in Imitation Learning via Offline Data
Without Great Coverage [27.122391441921664]
本稿では、エージェントがオンライン環境の相互作用を伴わずに専門家の実証者を模倣することを学習するオフラインImitation Learning(IL)について研究する。
その代わり、学習者は、潜在的に未熟な行動ポリシーから状態-動作-次の状態遷移の静的なオフラインデータセットを提示される。
オフラインデータ(MILO)からモデルベースのILを導入し,理論上も現実的にも,オフラインのIL問題を効率的に解決する。
論文 参考訳(メタデータ) (2021-06-06T18:31:08Z) - OPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement
Learning [107.6943868812716]
エージェントは大量のオフライン体験データにアクセスでき、オンライン環境へのアクセスは極めて限られている。
我々の主な洞察は、様々な行動からなるオフラインデータを提示すると、このデータを活用する効果的な方法は、反復的かつ時間的に拡張された原始的行動の連続的な空間を抽出することである。
オフラインポリシ最適化のメリットに加えて,このようなオフラインプリミティブ学習の実施も,数発の模倣学習の改善に有効であることを示す。
論文 参考訳(メタデータ) (2020-10-26T14:31:08Z) - Explaining Fast Improvement in Online Imitation Learning [44.03882968581369]
オンライン模倣学習(英語: Online mimicion Learning, IL)は、専門家のポリシーとのインタラクションを利用して効率的なポリシー最適化を行うフレームワークである。
オンラインILは多くのアプリケーションで実証的な成功を収めた。
オンラインILにおけるポリシークラスの採用には,政策改善のスピードが向上し,性能バイアスが減少する,という2つのメリットがあることを示す。
論文 参考訳(メタデータ) (2020-07-06T04:37:03Z) - AliExpress Learning-To-Rank: Maximizing Online Model Performance without
Going Online [60.887637616379926]
本稿では,学習からランクへ学習するための評価器・ジェネレータフレームワークを提案する。
コンテキストを含むレコメンデーションを一般化して評価する評価器と、強化学習による評価器スコアを最大化するジェネレータとから構成される。
本手法は, オンラインA/Bテストにおける産業レベルの微調整モデルよりも, 変換率(CR)の面で大幅に向上する。
論文 参考訳(メタデータ) (2020-03-25T10:27:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。