論文の概要: Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.09336v1
- Date: Fri, 10 Jul 2026 12:17:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.447414
- Title: Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning
- Title(参考訳): 効率的なオフライン強化学習のためのショートカット軌道計画
- Authors: Guanquan Wang, Yoshimasa Tsuruoka,
- Abstract要約: Shortcut Trajectory Planning (STP) は、ショートカットモデルを効率的な軌道生成器として組み込んだオフラインモデルに基づく強化学習フレームワークである。
STPは、高速な生成計画のためのトレーニングパイプラインを簡素化しながら、強力なパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 8.985173544901796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion-based trajectory planners have shown strong performance in offline reinforcement learning, but their iterative denoising process often incurs high inference cost. Consistency-based planners reduce the number of sampling steps, yet they typically rely on a two-stage teacher--student distillation pipeline that increases training cost and may introduce instability. We propose Shortcut Trajectory Planning (STP), an offline model-based reinforcement learning framework that incorporates shortcut models as efficient trajectory generators. STP trains a conditional shortcut trajectory model in a single stage, supports adjustable one-step and few-step inference through step-size conditioning, and selects candidate plans using a critic augmented with feasibility-aware correction. Across standard D4RL benchmarks, including locomotion, navigation, manipulation, and dexterous control tasks, STP achieves strong performance while simplifying the training pipeline for fast generative planning.
- Abstract(参考訳): 拡散に基づく軌道プランナーは、オフラインの強化学習において高い性能を示したが、反復的復調処理はしばしば高い推論コストを発生させる。
一貫性に基づくプランナーはサンプリングステップの数を減らしますが、通常は2段階の教師-学生蒸留パイプラインに依存しています。
我々は,ショートカットモデルを効率的な軌道生成器として組み込んだオフラインモデルに基づく強化学習フレームワークであるショートカット軌道計画(STP)を提案する。
STPは、1段階の条件付きショートカット軌跡モデルを訓練し、ステップサイズ条件付けにより調整可能なワンステップと数ステップの推論をサポートし、ファシビリティ・アウェア・リコメンデーションを付加した批評家を用いて候補プランを選択する。
移動、ナビゲーション、操作、厳密な制御タスクを含む標準のD4RLベンチマークでは、STPは高速な生成計画のためのトレーニングパイプラインを簡素化しながら、強力なパフォーマンスを実現している。
関連論文リスト
- Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning [27.992471782191014]
Bootstrapped Flow Q-Learning(BFQ)は、トレーニングと推論の両方で正確なシングルステップアクション生成を可能にする、新しいフレームワークである。
マルチステップの denoising を排除し、学習手順が大幅に高速で、よりシンプルで、より堅牢になる。
大規模なD4RL評価の結果,BFQは計算コストを大幅に削減し,性能を向上した。
論文 参考訳(メタデータ) (2026-06-09T09:12:12Z) - Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance [47.605498477489306]
補助的な訓練対象を持つ高度な微調整法は、性能を改善し、収束ステップの数を減らすことができる。
本稿では,事前学習したVLAモデルが,標準的な教師付き微調整における性能向上や適応コストの低減に失敗するケースに対して,新しいアプローチを提案する。
論文 参考訳(メタデータ) (2026-03-26T17:14:57Z) - PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models [51.43746425777865]
大規模言語モデル(LLM)は、しばしばグローバル戦略を定式化する能力に欠けており、長い水平タスクにおけるエラーの伝播につながる。
PILOTは,大規模モデルの戦略的監視を本質的な潜伏誘導に内部化するためのフレームワークである。
論文 参考訳(メタデータ) (2026-01-07T12:38:56Z) - Improved Training Technique for Shortcut Models [12.527716901034694]
ショートカットモデルは、生成モデリングのための有望で非敵対的なパラダイムである。
ショートカットモデルは、1つのトレーニングされたネットワークから1ステップ、数ステップ、および複数ステップのサンプリングをサポートする。
本稿では,ショートカットモデルを後退させた5つのコア問題に対処する。
論文 参考訳(メタデータ) (2025-10-24T08:35:04Z) - Consistency Trajectory Planning: High-Quality and Efficient Trajectory Optimization for Offline Model-Based Reinforcement Learning [16.126373530332245]
本稿では,新しいオフラインモデルに基づく強化学習手法であるConsistency Trajectory Planning (CTP)を紹介する。
CTPは、政策品質を著しく低下させることなく、高速で単一ステップの軌道生成をサポートする。
論文 参考訳(メタデータ) (2025-07-13T08:31:11Z) - Fast T2T: Optimization Consistency Speeds Up Diffusion-Based Training-to-Testing Solving for Combinatorial Optimization [83.65278205301576]
雑音レベルから与えられたインスタンスの最適解への直接写像を学習し、最小限のショットで高品質な生成を容易にすることを提案する。
これは、サンプル間の差を最小限に抑える最適化一貫性トレーニングプロトコルによって達成される。
The Traveling Salesman Problem (TSP) と Maximal Independent Set (MIS) は、ソリューションの品質と効率の両方に関して、Fast T2Tの優位性を実証している。
論文 参考訳(メタデータ) (2025-02-05T07:13:43Z) - Efficient Stagewise Pretraining via Progressive Subnetworks [53.00045381931778]
一般的な見方では、レイヤのドロップのような段階的なドロップ戦略は、スタック方式のアプローチと比べて効果がない。
本稿では, 適切な設計で, 戦略の廃止は, 積み重ね手法よりも競争力があることを示すことによって, この概念に挑戦する。
本稿では,各ステップでランダムサブネットワークのみを選択し,訓練し,段階的に拡大するランダムパートトレーニング(RAPTR)を提案する。
論文 参考訳(メタデータ) (2024-02-08T18:49:09Z) - Online Convolutional Re-parameterization [51.97831675242173]
2段階のパイプラインであるオンライン畳み込み再パラメータ化(OREPA)は、複雑なトレーニング時間ブロックを単一の畳み込みに絞ることで、巨大なトレーニングオーバーヘッドを低減することを目的としている。
最先端のre-paramモデルと比較して、OREPAはトレーニング時間のメモリコストを約70%削減し、トレーニング速度を約2倍向上させることができる。
また、オブジェクト検出とセマンティックセグメンテーションの実験を行い、下流タスクに一貫した改善を示す。
論文 参考訳(メタデータ) (2022-04-02T09:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。