論文の概要: Improving Diffusion Planners by Self-Supervised Action Gating with Energies
- arxiv url: http://arxiv.org/abs/2603.02650v1
- Date: Tue, 03 Mar 2026 06:36:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-04 21:38:10.668499
- Title: Improving Diffusion Planners by Self-Supervised Action Gating with Energies
- Title(参考訳): エネルギーを用いた自己監督行動ゲーティングによる拡散プランナの改良
- Abstract要約: 遅延整合性信号を用いて動的に不整合プランをペナライズする自己教師行動ゲーティング(SAGE)を提案する。
SAGEは、オフライン状態シーケンスにJEPAエンコーダと、短地平線遷移のための動作条件付き潜在予測器をトレーニングする。
テスト時に、SAGEは各サンプル候補に潜伏予測誤差によって与えられるエネルギを割り当て、この実現可能性スコアと値推定を組み合わせて選択アクションを選択する。
- 参考スコア(独自算出の注目度): 31.430422680816907
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion planners are a strong approach for offline reinforcement learning, but they can fail when value-guided selection favours trajectories that score well yet are locally inconsistent with the environment dynamics, resulting in brittle execution. We propose Self-supervised Action Gating with Energies (SAGE), an inference-time re-ranking method that penalises dynamically inconsistent plans using a latent consistency signal. SAGE trains a Joint-Embedding Predictive Architecture (JEPA) encoder on offline state sequences and an action-conditioned latent predictor for short horizon transitions. At test time, SAGE assigns each sampled candidate an energy given by its latent prediction error and combines this feasibility score with value estimates to select actions. SAGE can integrate into existing diffusion planning pipelines that can sample trajectories and select actions via value scoring; it requires no environment rollouts and no policy re-training. Across locomotion, navigation, and manipulation benchmarks, SAGE improves the performance and robustness of diffusion planners.
- Abstract(参考訳): 拡散プランナーはオフラインの強化学習において強力なアプローチであるが、値誘導選択が良いスコアのトラジェクトリを好んだ場合に失敗し、環境力学と局所的に矛盾し、不安定な実行をもたらす。
遅延整合性信号を用いて動的に不整合性プランをペナルライズする推論時再ランク法である自己教師行動ゲーティング・ウィズ・エネルギス(SAGE)を提案する。
SAGEは、オフライン状態シーケンスにJEPAエンコーダと、短地平線遷移のための動作条件付き潜在予測器をトレーニングする。
テスト時に、SAGEは各サンプル候補に潜伏予測誤差によって与えられるエネルギを割り当て、この実現可能性スコアと値推定を組み合わせて選択アクションを選択する。
SAGEは既存の拡散計画パイプラインに統合することができ、トラジェクトリをサンプリングし、値スコアリングを通じてアクションを選択することができる。
移動、ナビゲーション、操作ベンチマーク全体にわたって、SAGEは拡散プランナーのパフォーマンスと堅牢性を改善している。
関連論文リスト
- One Diffusion Model, Two Roles: Guided Trajectory Planning and Safety-Critical Scenario Generation in Closed-Loop Simulation [4.570068778162319]
本研究では,1つの事前学習拡散交通モデルが,自律走行開発ループにおいて2つの補完的な役割を果たすことを示す。
計画面では,単一ストリームデュアルストリーム(SSDS)拡散変換器デコーダを導入する。
我々は,制御可能なシナリオジェネレータと同じ拡散モデルを用いて,クローズドループ評価のためのリアルなロングテール駆動インタラクションを生成する。
論文 参考訳(メタデータ) (2026-09-04T09:22:54Z) - SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - Shift & Drift: A Zero-Shot Benchmark for Generalizable and Robust Autonomous Driving Motion Planning [60.888463449435484]
シフト・アンド・ドリフト(Shift & Drift)は、分散シフトの2つの重要な軸にまたがる、厳密なストレス-テスト運動プランナーのための新しいデュアルトラックベンチマークである。
擬似学習手法は,IDベンチマークにおいて高いスコアを得るが,時間的に相関したアクティベーションノイズを受けると持続的なドリフトに悩まされることを示す。
本研究は, 模擬忠実度と閉ループレジリエンスのトレードオフを実証的に明らかにし, 信頼性の高い展開に向けた進捗を評価するための厳密なベンチマークをコミュニティに提供する。
論文 参考訳(メタデータ) (2026-07-08T18:23:48Z) - ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control [54.267632784131415]
ReactiveBFMは、ヒューマノイドのためのリアルタイムループ計画制御フレームワークである。
定期的なプレフィックスサンプリングカリキュラムを通じて、致命的な累積露光バイアスを軽減する。
これは、テキスト条件付きクローズドループ運動の膨大なレパートリーにおいて、前例のない物理的機敏さを示す。
論文 参考訳(メタデータ) (2026-06-29T14:27:27Z) - G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance [44.0166619948181]
自律運転において、拡散に基づくプランナーは、密集した対話的な交通におけるロバストな動き計画のための有望なパラダイムとして現れてきた。
既存のガイダンスは、通常、スパースでエンティティ中心の幾何学的クエリやポストホックの洗練に依存し、インタラクティブなシーンにおいて限られた認識と脆弱なパフォーマンスをもたらす。
G2DP(GuidedGrid-Guided Planning)は,経路時マップによる確率的将来の占領指導を融合させることにより,時間的費用の変動を図っている。
nuPlanの最先端のパフォーマンスを達成し、リアクティブトランスファーにおいて、最強の模倣学習ベースラインを+7.2ポイント上回る。
論文 参考訳(メタデータ) (2026-06-24T16:38:55Z) - FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning [63.80677039120727]
FlowR2Aは、スコアリングに基づく手法の厳密な監督と、単一の生成モデルによるアンカーベースの手法の提案を統一する。
ソフトプログレッシブ目標に対するハードセーフティ制約のバランスをとるために, 微粒度毎の報奨条件と報奨雑音の増大を導入する。
生成形式は、報酬誘導と固定サンプリングによる制御可能なテスト時間サンプリングをサポートし、高品質な提案を生成する。
論文 参考訳(メタデータ) (2026-06-23T07:21:36Z) - Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving [5.572022450868073]
Diffusion Forcing Planner (DFP) は、歴史誘導制御によって駆動される拡散ベースの計画フレームワークである。
DFPは全軌道を歴史、現在、将来のセグメントに分解し、各セグメントに独立したノイズレベルを割り当てる。
論文 参考訳(メタデータ) (2026-06-09T15:56:41Z) - TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment [52.570581883709345]
本稿では,報酬を人間レベルの報酬分布マッチングに置き換えるトラジェクティブマッチングポリシバランス最適化(TMPO)を提案する。
TMPOは最先端の手法に対する生成的多様性を9.1%向上させ、下流および効率の指標で競合性能を達成する。
大規模フロープレフィックスのマルチトラックトレーニング時間を短縮するため、TMPOはDynamic Tree Smplingモデルを導入し、動的にスケジュールされたステップでトラジェクトリがdenoisingとブランチを共有する。
論文 参考訳(メタデータ) (2026-05-09T04:41:02Z) - Encoding Predictability and Legibility for Style-Conditioned Diffusion Policy [1.1549572298362782]
効率性と透明な動きのバランスを取ることは、人間とロボットのコラボレーションにおける中核的な課題である。
本稿では,事前学習した拡散モデルに対して,妥当性と効率を両立させるモジュラーフレームワークであるStyle-Conditioned Diffusion Policy (SCDP)を提案する。
操作作業やナビゲーション作業におけるSCDPの評価を行い,不明瞭な環境下での可視性を向上するとともに,可視性が不要な場合の最適効率を保っていることを示す。
論文 参考訳(メタデータ) (2026-03-17T10:55:44Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Planning as Descent: Goal-Conditioned Latent Trajectory Synthesis in Learned Energy Landscapes [0.8703455323398351]
Planning as Descent (PaD)は、オフラインの目標条件強化学習のためのフレームワークである。
PaDは潜在軌道全体にわたってゴール条件エネルギー関数を学習し、低エネルギーを実現可能でゴール一貫性のある未来に割り当てる。
この結果から,軌道の評価と洗練の学習が,直接政策学習の強力な代替手段となることが示唆された。
論文 参考訳(メタデータ) (2025-12-19T17:49:13Z) - Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making [48.998030470623384]
オフラインの意思決定は、さらなるインタラクションを伴わずに、固定データセットからの信頼性の高い振る舞いを必要とする。
i)タスク整列軌道を多様に生成するプランナー,(ii)システム力学との整合性を強制するダイナミクスモデル,(iii)タスク目標に整合した動作を選択するランサーモジュールからなる構成モデルに基づく拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-09T06:26:02Z) - Bayesian Active Inference for Intelligent UAV Anti-Jamming and Adaptive Trajectory Planning [5.620125209890186]
本稿では, 逆ジャミング条件下でのUAV動作のための階層的軌道計画手法を提案する。
このアプローチは、専門家が作成したデモと確率的生成モデルを組み合わせて、高レベルなシンボル計画、低レベルなモーションポリシー、無線信号フィードバックを符号化する。
配備中、UAVは妨害を予測し、ジャムマーをローカライズし、ジャムマーの位置を事前に知ることなくその軌道に適応するためのオンライン推論を行う。
論文 参考訳(メタデータ) (2025-12-05T13:38:52Z) - The Cognitive Bandwidth Bottleneck: Shifting Long-Horizon Agent from Planning with Actions to Planning with Schemas [56.62286434195321]
本稿では2つの異なる行動表現の有効性を体系的に研究する。
本稿では,その違いを質的に理解するための概念的枠組みとして,認知的帯域幅の観点を提案する。
より有能なPwSエージェントを構築するための実用的なガイドを提供する。
論文 参考訳(メタデータ) (2025-10-08T14:47:40Z) - TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning [63.73629127832652]
本稿では,TDに基づく潜在予測表現を教師なしRLに活用するTD-JEPAを紹介する。
TD-JEPAは、明示的な状態とタスクエンコーダ、ポリシー条件付きマルチステップ予測器、パラメータ化されたポリシーのセットを潜時空間で直接訓練する。
実証的には、TD-JEPAは13のデータセットにわたる移動、ナビゲーション、操作のタスクにおいて、最先端のベースラインをマッチまたは上回る。
論文 参考訳(メタデータ) (2025-10-01T10:21:18Z) - Predictive Planner for Autonomous Driving with Consistency Models [5.966385886363771]
軌道予測と計画は、自動運転車が動的環境下で安全かつ効率的に走行するために不可欠である。
近年の拡散型生成モデルはマルチエージェント軌道生成において有望であるが,その遅いサンプリングは高周波計画タスクには適さない。
我々は,エゴ車両の航法目標に基づいて,エゴと周辺エージェントの共同分布からサンプルを採取する予測プランナを構築するために,一貫性モデルを活用する。
論文 参考訳(メタデータ) (2025-02-12T00:26:01Z) - Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree [20.855596726996712]
トラジェクトリー・アグリゲーション・ツリー(TAT)は、歴史的および現在のトラジェクトリーに基づく動的ツリーのような構造である。
TATは、拡散プランナーの元々のトレーニングやサンプリングパイプラインを変更することなく、デプロイできる。
以上の結果から,信頼できない軌道からのリスクに抵抗し,100ドル以上の作業で拡散プランナーの性能向上を保証し,試料品質に対する許容許容限界を示し,3倍以上の加速で計画が可能であることが示唆された。
論文 参考訳(メタデータ) (2024-05-28T06:57:22Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Modular Deep Reinforcement Learning for Continuous Motion Planning with
Temporal Logic [59.94347858883343]
本稿では,マルコフ決定過程(MDP)をモデルとした自律動的システムの運動計画について検討する。
LDGBA と MDP の間に組込み製品 MDP (EP-MDP) を設計することである。
モデルフリー強化学習(RL)のためのLDGBAベースの報酬形成と割引スキームは、EP-MDP状態にのみ依存する。
論文 参考訳(メタデータ) (2021-02-24T01:11:25Z) - Active Inference and Behavior Trees for Reactive Action Planning and
Execution in Robotics [2.040132783511305]
本研究では,動的環境における動的行動計画と実行のための活性推論と行動木(BT)の組み合わせを提案する。
提案手法により、部分的に観測可能な初期状態を扱うことができ、予期せぬ事態に対する古典的なBTの堅牢性を向上させることができる。
論文 参考訳(メタデータ) (2020-11-19T10:24:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。