論文の概要: Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry
- arxiv url: http://arxiv.org/abs/2606.01098v1
- Date: Sun, 31 May 2026 08:39:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.204298
- Title: Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry
- Title(参考訳): 入射ドリフト政策:条件付きエキスパート幾何学によるワンステップアクション生成
- Authors: Zemin Yang, Yaoyu He, Yiming Zhong, Yuhao Zhang, Xinge Zhu, Yao Mu, Qingqiu Huang, Yuexin Ma,
- Abstract要約: Implicit Drifting Policy (IDP)は、ロボット制御のための一段階の模倣学習フレームワークである。
IDPは、明示的なベクトル場推定なしでポリシー学習にドリフトの訓練時間補正をもたらす。
- 参考スコア(独自算出の注目度): 46.0185525503119
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative action policies based on diffusion or flow matching excel in behavior cloning, yet their iterative sampling is prohibitive for high-frequency robot control. While recent one-step formulations alleviate this latency, they inevitably discard the intermediate trajectory evolution that provides crucial action correction. Directly recovering this mechanism by explicitly estimating a training-time drifting field is mathematically ill-posed due to extreme conditional demonstration sparsity. We introduce Implicit Drifting Policy (IDP), a one-step imitation learning framework that brings the training-time correction of Drifting into policy learning without explicit vector field estimation. IDP extracts a conditional expert geometry from the local variation of observation-similar expert actions, and compares it against a global reference geometry to isolate condition-specific constraints. This local geometric structure adaptively weights a scalar potential objective. Combined with an expert-proximal terminal evaluation, IDP directly enforces manifold constraints on the one-step generator during training. Extensive evaluations across 2D, 3D, and real-world manipulation tasks show IDP effectively maintains adherence to valid action manifolds, improving upon explicit drifting methods and achieving competitive performance with strong one-step baselines.
- Abstract(参考訳): 行動クローニングにおける拡散やフローマッチングに基づく生成的行動ポリシーは優れているが、その反復的サンプリングは高周波ロボット制御では禁止されている。
最近の一段階の定式化は、この遅延を緩和するが、重要な作用補正を提供する中間軌道の進化を必然的に破棄する。
トレーニング時間ドリフト場を明示的に推定することにより、このメカニズムを直接回復することは、極端に条件付きデモンストレーションの空間性のために数学的に悪影響を及ぼす。
本稿では,一段階の模倣学習フレームワークであるImplicit Drifting Policy(IDP)を紹介する。
IDPは、観測類似の専門家行動の局所的変動から条件付き専門家の幾何を抽出し、それをグローバル参照幾何と比較し、条件固有の制約を分離する。
この局所幾何学構造はスカラーポテンシャルの目的を適応的に重み付けする。
IDPは、エキスパート-近位端末評価と組み合わせて、トレーニング中に1ステップのジェネレータに多様体制約を直接適用する。
2D, 3D, 実世界の操作タスクにわたる広範囲な評価の結果, IDP は有効なアクション多様体への付着を効果的に維持し, 明示的なドリフト法を改善し, 強力なワンステップベースラインで競争性能を達成することができた。
関連論文リスト
- MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation [65.068801413044]
連続的なテスト時間適応は、非定常な未ラベルのターゲットストリームにソース予測モデルを適用する。
ドメインに依存しない構造をドメイン固有のテクスチャから切り離す。
論文 参考訳(メタデータ) (2026-05-18T01:52:12Z) - Real-Time Evaluation of Autonomous Systems under Adversarial Attacks [0.29360071145551064]
本研究は,実世界の交差点運転データに基づくオフライン軌道学習および対向ロバストネス評価フレームワークを提案する。
我々は、MLP(Multi-Layer Perceptron)ベースの行動クローン(BC)、トランスフォーマーベースのオブジェクトトークン化BC、逆強化学習(IRL)の3つの学習パラダイムを訓練し比較する。
予測時間ロバスト性は、複数の交叉シナリオをまたいだ勾配に基づく逆摂動に対して、訓練されたポリシーを適用することによって評価される。
論文 参考訳(メタデータ) (2026-05-05T08:30:18Z) - Evaluation as Evolution: Transforming Adversarial Diffusion into Closed-Loop Curricula for Autonomous Vehicles [43.930171390617055]
本研究では,敵対的生成を適応的な進化カリキュラムに変換するクローズドループフレームワークであるAccess as Evolution(E2$)を紹介する。
我々は、トポロジ駆動型サポート選択を利用して重要な相互作用エージェントを特定し、トポロジカルアンチョリングを導入し、プロセスの安定化を図る。
実験的に、$E2$はnuScenesデータセットで9.01%、nuPlanデータセットで最大21.43%の衝突故障発見を改善する。
論文 参考訳(メタデータ) (2026-04-08T01:34:05Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Score-Guided Proximal Projection: A Unified Geometric Framework for Rectified Flow Editing [1.0312968200748118]
Rectified Flowモデルは最先端の世代品質を実現するが、正確なタスクのためにそれらを制御することは依然として困難である。
現在のアプローチは「幾何学的ロック」に苦しむ逆法に基づくガイダンスに分岐する
Score-Guided Proximal Projectionは,決定論的最適化と縮尺サンプリングのギャップを埋める統一フレームワークである。
論文 参考訳(メタデータ) (2026-03-05T23:44:45Z) - Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning [22.17044827069627]
安定なアクターによって生成される高価値なアクションに置き換える,プラグアンドプレイのトレーニングサンプル置換器を提案する。
実験の結果、PARはパフォーマンスを継続的に改善し、基礎的なTD3+BCと組み合わせることで最先端にアプローチすることがわかった。
論文 参考訳(メタデータ) (2026-02-07T08:44:27Z) - RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation [7.500999283386335]
残留フローステアリング(Residual Flow Steering、RFS)は、事前訓練された生成ポリシーを適用するためのデータ効率の強化学習フレームワークである。
RFSは、残留動作と潜時雑音分布を協調的に最適化することにより、事前訓練されたフローマッチングポリシーを操る。
シミュレーションと実世界の両方の設定において, RFS が効率よく微調整できることを示す。
論文 参考訳(メタデータ) (2026-02-02T08:11:57Z) - Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving [54.46325690390831]
本稿では,事前学習したE2E運転エージェントのロバスト性と安全性を高めるための汎用フレームワークとして,モデルベースポリシー適応(MPA)を提案する。
MPAは、ジオメトリ一貫性のあるシミュレーションエンジンを用いて、まず様々な対物軌道を生成する。
MPAは拡散ベースのポリシーアダプタを訓練し、基本方針の予測を洗練させ、Q値モデルを多段階に分けて長期的な結果を評価する。
論文 参考訳(メタデータ) (2025-11-26T17:01:41Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。