論文の概要: Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback
- arxiv url: http://arxiv.org/abs/2606.30923v1
- Date: Mon, 29 Jun 2026 21:18:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.004028
- Title: Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback
- Title(参考訳): 行動クローニングは必要なすべてではない:ノイズのある専門家のフィードバックに対するオンライン蒸留の最適性
- Authors: Ved Sriraman, Peihan Liu, Daniel Hsu, Adam Block,
- Abstract要約: 理論上、オフラインILは地平線無しで最適であるが、オンライン蒸留のようなオンラインの方法は、監督された微調整のようなオフラインメソッドよりも優れている。
本稿では,このギャップを説明するため,ノイズの多いエキスパートモデルを提案する。
OPDの新たな変種を経由した,ノイズの多い専門家とのオンラインインタラクションは,一般に地平線に依存していることを示す。
- 参考スコア(独自算出の注目度): 12.925021362985989
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Imitation Learning is a natural framework for learning in sequential decision-making systems and has emerged as the dominant paradigm through which we understand language model training. A central puzzle is that, while in theory offline IL can be horizon-free and optimal, in practice online methods such as on-policy distillation often outperform offline methods such as supervised fine-tuning. We propose a noisy expert model to explain this gap, in which the learner only has access to a noisy version of the expert's policy, but wishes to compete against the reward achieved by a clean expert, motivated by the fact that in many applications, e.g. training language models to perform long chains of thought, the expert is often imperfect. In this setting, we show a sharp separation between offline and online IL. Offline learning from noisy trajectories is fundamentally hard: to compete with the clean expert, the sample complexity must grow exponentially, in contradistinction to the clean expert setting where no explicit horizon dependence exists. In contrast, we prove that online interaction with the noisy expert via a novel variant of OPD enables polynomial dependence on the horizon in general. We further show that, under a natural condition on the expert noise distribution, which we show to be necessary for any horizon-free sample complexity, one can obtain such a guarantee, although our proposed algorithm sacrifices statistical efficiency in its dependence on the size of the policy class. Our analysis leads to an alternative loss function that is commonly considered empirically for LM training. We further provide algorithms and lower bounds, and extend our results to the more realistic setting of unknown corruption when the clean expert is deterministic, thereby providing a theoretical foundation for why OPD can outperform SFT when training language models from imperfect teachers.
- Abstract(参考訳): イミテーション・ラーニング(Imitation Learning)は、シーケンシャルな意思決定システムで学ぶための自然なフレームワークであり、言語モデルトレーニングを理解する上で支配的なパラダイムとして登場した。
中心的なパズルは、理論上、オフラインILは地平線無しで最適であるが、実際には、オンライン蒸留のようなオンラインの方法は、監督された微調整のようなオフラインメソッドよりも優れていることである。
このギャップを説明するためのノイズの多いエキスパートモデルを提案し、そこでは、学習者が専門家のポリシーのノイズの多いバージョンにしかアクセスできないが、多くのアプリケーションにおいて、長い思考の連鎖を実行するための言語モデルを訓練することは、しばしば不完全であるという事実から、クリーンな専門家によって達成された報酬と競合することを望んでいる。
この設定では、オフラインとオンラインのILの明確な分離を示す。
ノイズの多い軌道からのオフライン学習は基本的に困難であり、クリーンな専門家と競合するには、明示的な地平線依存が存在しないクリーンな専門家設定とは対照的に、サンプルの複雑さは指数関数的に増加する必要がある。
対照的に、新しい OPD の変種によるノイズのある専門家とのオンライン相互作用は、一般に地平線への多項式依存を可能にすることを証明している。
さらに,提案アルゴリズムは,提案手法が政策クラスのサイズに依存する統計的効率を犠牲にしつつも,地平線のないサンプルの複雑さに必要であるような,専門家の雑音分布の自然な条件下では,そのような保証が得られることを示す。
我々の分析は、LMトレーニングにおいて経験的に考慮される代替損失関数を導出する。
我々はさらにアルゴリズムと下限を提供し、クリーンエキスパートが決定論的であるときに、未知の汚職のより現実的な設定にまで結果を拡張し、不完全な教師から言語モデルを学ぶ際に、OPDがSFTより優れている理由の理論的基盤を提供する。
関連論文リスト
- Efficient Imitation under Misspecification [17.706710359787056]
誤特定下での模倣学習の問題点を考察する。
本稿では,計算効率のよい局所探索手順のみを実行する逆強化学習アルゴリズムを提案する。
我々は,不特定条件下では,学習者が実際に行うことができる良い政策によって到達可能な状態を含むために,局所的な探索を行う一連の状態を拡張することが有益であることを示す。
論文 参考訳(メタデータ) (2025-03-17T13:35:55Z) - The Pitfalls of Imitation Learning when Actions are Continuous [33.44344966171865]
本研究では,連続的な状態・動作制御システムにおいて,専門家のデモレータを模倣する問題について検討する。
指数的安定性と呼ばれる制御理論的性質を満たす力学であっても、任意の滑らかな決定論的模倣ポリシーは必ず誤りを被ることを示す。
論文 参考訳(メタデータ) (2025-03-12T18:11:37Z) - Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning [26.53136644321385]
シミュレーション学習(Imitation Learning, IL)は、実演から学ぶことによって、連続的な意思決定タスクにおいて専門家の行動を模倣することを目的としている。
累積ペイオフの範囲が制御されるたびに、オフラインILにおいて水平非依存のサンプル複雑性を実現することができることを示す。
決定的,定常的な政策を特化して,オンラインILとオフラインILの差が従来考えられていたよりも小さいことを示す。
論文 参考訳(メタデータ) (2024-07-20T23:31:56Z) - RLIF: Interactive Imitation Learning as Reinforcement Learning [56.997263135104504]
我々は,対話型模倣学習と類似するが,さらに実践的な仮定の下で,非政治強化学習によってパフォーマンスが向上できることを実証する。
提案手法は,ユーザ介入信号を用いた強化学習を報奨として利用する。
このことは、インタラクティブな模倣学習において介入する専門家がほぼ最適であるべきだという仮定を緩和し、アルゴリズムが潜在的に最適でない人間の専門家よりも改善される行動を学ぶことを可能にする。
論文 参考訳(メタデータ) (2023-11-21T21:05:21Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Efficient Performance Bounds for Primal-Dual Reinforcement Learning from
Demonstrations [1.0609815608017066]
本稿では,コスト関数の不明な大規模マルコフ決定プロセスについて考察し,限られた専門家による実証から政策を学習する問題に対処する。
既存の逆強化学習法には強力な理論的保証があるが、計算上は高価である。
ラグランジアン双対性を利用して理論と実践のギャップを埋める新しい双線型サドルポイントフレームワークを導入する。
論文 参考訳(メタデータ) (2021-12-28T05:47:24Z) - A Free Lunch from the Noise: Provable and Practical Exploration for
Representation Learning [55.048010996144036]
ある雑音仮定の下では、対応するマルコフ遷移作用素の線型スペクトル特性を自由な閉形式で得られることを示す。
本稿では,スペクトルダイナミクス埋め込み(SPEDE)を提案する。これはトレードオフを破り,雑音の構造を利用して表現学習のための楽観的な探索を完遂する。
論文 参考訳(メタデータ) (2021-11-22T19:24:57Z) - Adversarial Robustness with Semi-Infinite Constrained Learning [177.42714838799924]
入力に対する深い学習は、安全クリティカルなドメインでの使用に関して深刻な疑問を提起している。
本稿では,この問題を緩和するために,Langevin Monte Carlo のハイブリッドトレーニング手法を提案する。
当社のアプローチは、最先端のパフォーマンスと堅牢性の間のトレードオフを軽減することができることを示す。
論文 参考訳(メタデータ) (2021-10-29T13:30:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。