論文の概要: CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies
- arxiv url: http://arxiv.org/abs/2605.04470v1
- Date: Wed, 06 May 2026 03:49:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.63404
- Title: CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies
- Title(参考訳): CRAFT: 運転政策のための対人相互強化ファインチューニング
- Abstract要約: オープンループの模倣学習は、近代的な自動運転ポリシーアーキテクチャを進化させてきたが、クローズループの展開は、ポリシーが引き起こす分散シフトに弱いままである。
本稿では,CRAFT(Counterfactual-to-Interactive Reinforcement Fine-Tuning)について紹介する。
- 参考スコア(独自算出の注目度): 12.435146978333249
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-loop imitation learning has advanced modern autonomous driving policy architectures, but closed-loop deployment remains vulnerable to policy-induced distribution shift. Existing post-training paradigms exhibit fundamental trade-offs: closed-loop RL fine-tuning provides grounded feedback from executed actions but is constrained by the sparsity of informative events, whereas counterfactual fine-tuning provides dense supervision over candidate futures but inherits bias from imperfect future estimates. We introduce Counterfactual-to-Interactive Reinforcement Fine-Tuning (CRAFT), an on-policy framework that formulates closed-loop post-training as proxy-residual optimization. CRAFT uses group-normalized counterfactual advantages as a dense proxy for real closed-loop advantages and aligns this proxy with the closed-loop world through grounded residual correction from interaction-critical events. To stabilize adaptation, CRAFT regularizes the online policy toward an EMA teacher via asymmetric KL self-distillation. Theoretically, CRAFT decomposes the real closed-loop policy gradient into proxy and residual terms under the same visited-state distribution, reducing residual variance with an aligned proxy while mitigating proxy bias through grounded residual approximation. Empirically, CRAFT achieves the strongest closed-loop gains on Bench2Drive across hierarchical planning, vision-language-action, and vocabulary-scoring architectures. Ablations, scaling behavior, stability analyses, and transfer results further validate the complementary roles of dense counterfactual proxy and grounded residual correction. Project page: https://currychen77.github.io/CRAFT.
- Abstract(参考訳): オープンループの模倣学習は、近代的な自動運転ポリシーアーキテクチャを進化させてきたが、クローズループの展開は、ポリシーが引き起こす分散シフトに弱いままである。
クローズドループRL微調整は実行された行動から基礎的なフィードバックを提供するが、情報的事象の分散によって制約される。
本稿では,CRAFT(Counterfactual-to-Interactive Reinforcement Fine-Tuning)について紹介する。
CRAFTは、真の閉ループのアドバンテージのための密集したプロキシとしてグループ正規化された反ファクト的アドバンテージを使用し、このプロキシを相互作用クリティカル事象からの基底的残留補正を通じて閉ループの世界と整合させる。
適応を安定させるために、CRAFTは非対称KL自己蒸留によりEMA教師に対するオンラインポリシーを標準化する。
理論的には、CRAFTは、実際の閉ループポリシー勾配を同じ訪問状態分布の下でプロキシと残留項に分解し、接地された残差近似を通してプロキシバイアスを緩和しながら、整列されたプロキシとの残差を低減させる。
実証的に言えば、CRAFTは階層的計画、視覚-言語-アクション、語彙-スコリングアーキテクチャを通じて、Bench2Drive上で最強のクローズループゲインを達成している。
アブレーション, スケーリング挙動, 安定性解析, 移動結果は, 密集した反事実プロキシと接地された残留補正の相補的役割をさらに検証する。
プロジェクトページ: https://currychen77.github.io/CRAFT
関連論文リスト
- Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models [61.74572554094633]
比クリッピングは流れモデルに不適であると主張する。
本稿では,比クリッピングを分岐近位制約に置き換えるFlow-DPPOを提案する。
実験により,フローDPPOはKL近位効率が向上し,高い報酬が得られることが示された。
論文 参考訳(メタデータ) (2026-06-09T15:59:57Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry [46.0185525503119]
Implicit Drifting Policy (IDP)は、ロボット制御のための一段階の模倣学習フレームワークである。
IDPは、明示的なベクトル場推定なしでポリシー学習にドリフトの訓練時間補正をもたらす。
論文 参考訳(メタデータ) (2026-05-31T08:39:57Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization [58.03221830946145]
我々は、純粋なCL、純粋なFL、ハイブリッドCL-FLトレーニングモードを融合する統合フレームワークであるOmniISRを提案する。
我々は,OmniISRが集中型パラダイムとフェデレーション型パラダイムの両方において,モデル性能を一貫して改善していることを示す。
論文 参考訳(メタデータ) (2026-05-19T04:13:27Z) - Discrete Flow Matching for Offline-to-Online Reinforcement Learning [10.112779201155005]
DRIFTは、オフラインで事前訓練された連続時間マルコフ連鎖(CTMC)ポリシーを更新するオンラインの微調整手法である。
大規模離散的なアクション空間に対して、参照ポリシーロールアウトからサンプリングされたアクションの小さなサブセット上でアクターを更新する候補セット近似を導入する。
離散的動作RLタスクに対する実験により,本手法が全タスクに対して安定したオフライン-オンライン改善を実現することを示す。
論文 参考訳(メタデータ) (2026-05-12T16:44:02Z) - When Valid Signals Fail: Regime Boundaries Between LLM Features and RL Trading Policies [0.30458514384586394]
大規模言語モデル(LLM)は、強化学習(RL)トレーディングエージェントを改善するための連続的な数値的特徴を生成する。
我々は,凍結したLCMがステートレスな特徴抽出器として機能するモジュールパイプラインを構築し,非構造化日報を下流のPPOエージェントが消費する固定次元ベクトルに変換する。
本研究は,分散シフト下での転帰学習における課題と並行して,特徴レベルの妥当性と政策レベルの堅牢性とのギャップを浮き彫りにしている。
論文 参考訳(メタデータ) (2026-04-13T04:53:06Z) - Evaluation as Evolution: Transforming Adversarial Diffusion into Closed-Loop Curricula for Autonomous Vehicles [43.930171390617055]
本研究では,敵対的生成を適応的な進化カリキュラムに変換するクローズドループフレームワークであるAccess as Evolution(E2$)を紹介する。
我々は、トポロジ駆動型サポート選択を利用して重要な相互作用エージェントを特定し、トポロジカルアンチョリングを導入し、プロセスの安定化を図る。
実験的に、$E2$はnuScenesデータセットで9.01%、nuPlanデータセットで最大21.43%の衝突故障発見を改善する。
論文 参考訳(メタデータ) (2026-04-08T01:34:05Z) - Bayesian Conservative Policy Optimization (BCPO): A Novel Uncertainty-Calibrated Offline Reinforcement Learning with Credible Lower Bounds [1.2183405753834562]
オフライン強化学習(RL)は、ログ化された遷移の固定バッチから決定ポリシーを学ぶことを目的としている。
本稿では,不確実性を即興的に保守的な政策改善に変換する統一的な枠組みであるEmphBayesian conservative Policy Optimization (BCPO)を提案する。
BCPOは環境/価値モデルよりも階層的なベイズ的後縁を維持し、アクション値に基づいてエンフレッシブルな下界(LCB)を構築し、明示的なKL正規化の下でポリシー更新を行う。
論文 参考訳(メタデータ) (2026-03-06T01:46:02Z) - Score-Guided Proximal Projection: A Unified Geometric Framework for Rectified Flow Editing [1.0312968200748118]
Rectified Flowモデルは最先端の世代品質を実現するが、正確なタスクのためにそれらを制御することは依然として困難である。
現在のアプローチは「幾何学的ロック」に苦しむ逆法に基づくガイダンスに分岐する
Score-Guided Proximal Projectionは,決定論的最適化と縮尺サンプリングのギャップを埋める統一フレームワークである。
論文 参考訳(メタデータ) (2026-03-05T23:44:45Z) - Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing [37.86964394689924]
本稿では,システムプロンプトルーティングによる適応型社会アライメントのための統合フレームワークであるConsensus Clustering LinUCB Bandit(CCLUB)を紹介する。
CCLUBは保守的なコンセンサスクラスタリング機構を採用しており、セマンティックに近づいたがリスク分散したコンテキストにおける安全でない一般化を効果的に防いでいる。
理論的解析により,CCLUBのほぼ最適性能を示すサブ線形後悔保証が得られる。
論文 参考訳(メタデータ) (2026-03-04T08:00:16Z) - Coverage Improvement and Fast Convergence of On-policy Preference Learning [67.36750525893514]
言語モデルアライメントのためのオンラインのオンラインプライオリティ学習アルゴリズムは、オフラインのアルゴリズムよりも大幅に優れている。
我々は,サンプリング政策の包括的範囲が政治訓練を通じてどのように進展するかを分析する。
一般機能クラス設定における報奨蒸留のための原則的オンライン方式を開発した。
論文 参考訳(メタデータ) (2026-01-13T10:46:06Z) - GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping [63.33669214116784]
GRPO-Guardは、既存のGRPOフレームワークのシンプルで効果的な拡張である。
PPOクリッピングが有害な更新を適切に制限することを保証するため、バランスとステップ一貫性の重要度を回復する。
重いKL正則化に頼ることなく、暗黙の過最適化を実質的に緩和する。
論文 参考訳(メタデータ) (2025-10-25T14:51:17Z) - Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning [56.47948583452555]
固定ステップのEulerスキームによるフローマッチング推論プロセスの離散化は,最適輸送から変化するJordan-Kinderlehrer-Otto原理と整合する,というキーインサイトに基づいて,SWFP(Stepwise Flow Policy)フレームワークを紹介した。
SWFPは、大域的な流れを、プロキシメート分布間の小さな漸進的な変換の列に分解する。
この分解は、小さな流れブロックのカスケードを介して事前訓練された流れを微調整する効率的なアルゴリズムを導き、大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-10-17T07:43:51Z) - TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning [79.59753528758361]
両足のVLAを促進するために、豊富な車輪付きヒューマノイドデータを活用するクロス・エボディメント・フレームワークであるTrajBoosterを提案する。
私たちのキーとなる考え方は、形態素に依存しないインターフェースとして、エンドエフェクタ・トラジェクトリを使用することです。
以上の結果から,TrajBoosterは既存の車輪付きヒューマノイドデータにより,二足歩行ヒューマノイドVLAの性能を効率的に向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-09-15T12:25:39Z) - Where is the Grass Greener? Revisiting Generalized Policy Iteration for
Offline Reinforcement Learning [81.15016852963676]
オフラインRL体制における最先端のベースラインを、公正で統一的で高分解能なフレームワークの下で再実装する。
与えられたベースラインが、スペクトルの一方の端で競合する相手よりも優れている場合、他方の端では決してしないことを示す。
論文 参考訳(メタデータ) (2021-07-03T11:00:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。