論文の概要: Geometric Distributional Control: Learning Progress with Partial Structural Knowledge
- arxiv url: http://arxiv.org/abs/2609.06331v1
- Date: Sun, 06 Sep 2026 01:39:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 05:57:40.933169
- Title: Geometric Distributional Control: Learning Progress with Partial Structural Knowledge
- Title(参考訳): 幾何学的分布制御:部分的構造的知識による学習の進歩
- Authors: Tong Wu,
- Abstract要約: 予測的最適化とモデルベース制御は、動的、パラメータ、目的、オンライン計画モデルが指定されたときに強力である。
強化学習はこの要件を緩和することができるが、シーケンシャルなデータと相互作用から長い水平値の信号を推測する必要がある。
この中間体制は、自動運転、倉庫ロボット、交通制御、配送ドローンを含むシステムで一般的である。
幾何分布制御(GDC)はこの部分的知識設定のために設計されており、制御を実現可能性と進歩に分解する。
- 参考スコア(独自算出の注目度): 6.099441855983951
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-time control often sits between two limiting regimes. Predictive optimization and model-based control are powerful when dynamics, parameters, objectives, and online planning models are specified; reinforcement learning can relax this requirement, but must infer long-horizon value signals from sequential data and interaction, making training slow, high-variance, and hard to scale in large action spaces. This middle regime is common in systems including autonomous driving, warehouse robotics, traffic control, and delivery drones: partial geometry, physics, rules, or constraints are known, yet the local direction of task progress remains uncertain. Geometric Distributional Control (GDC) is designed for this partial-knowledge setting. It factorizes control into feasibility and progress: known geometry, rules, constraints, and response maps define an executable scaffold, while progress-weighted feasible data learns the missing directional signal on that scaffold. The learned score acts as a Bellman-like local value-gradient, selecting actions that make progress without requiring global Bellman recursion, a fully specified planner, or a black-box policy that absorbs both feasibility and preference. This knowledge can be lightweight and partial, such as simple dynamics, safety filters, local maps, constraint projectors, or lower-level response maps; it need not encode full dynamics or a long-horizon objective. Offline, GDC fits a progress-tilted distribution from short known-feasible snippets with weak signed progress certificates. Online, its score is projected through the scaffold and applied in receding-horizon feedback. We prove that this score descends a data-induced soft progress value and validate GDC on structured multilevel optimization and SUMO route-progress driving, where it improves over known-only solvers and learning baselines while preserving scaffold-enforced feasibility.
- Abstract(参考訳): リアルタイム制御は、しばしば2つの制限された体制の間に位置する。
強化学習は、この要件を緩和することができるが、逐次的なデータと相互作用から長い水平値信号を推論し、トレーニングを遅く、高分散し、大規模なアクション空間でスケールし難いものにしなければならない。
この中間体制は、自律走行、倉庫ロボット、交通制御、配送ドローンを含むシステムで一般的であり、部分幾何学、物理、規則、制約が知られているが、タスク進行の局部的な方向は未だ不明である。
幾何分布制御(GDC)はこの部分的知識設定のために設計されている。
既知の幾何学、規則、制約、応答マップは実行可能な足場を定義し、進捗重み付け可能なデータは足場に欠けている方向信号を学ぶ。
学習したスコアはベルマンのような局所的な値勾配として機能し、グローバルなベルマン再帰、完全に指定されたプランナー、あるいは実現可能性と嗜好の両方を吸収するブラックボックスポリシーを必要とせずに進行するアクションを選択する。
この知識は、単純なダイナミクス、安全フィルタ、ローカルマップ、制約プロジェクタ、低レベルの応答マップなど、軽量で部分的なものになり得る。
オフラインでは、GDCは、署名されたプログレス証明書の弱い短い既知の可能なスニペットのプログレスタイル分布に適合する。
オンライン上では、スコアは足場を通して投影され、後退-水平フィードバックに適用される。
このスコアは, 足場強化実現性を維持しつつ, 既知解法と学習ベースラインを改良し, 構造化多重レベル最適化とSUMO経路プログレッシブ駆動におけるGDCの有効性を示す。
関連論文リスト
- RAVEN: Reinforcement-Adaptive Visibility-Graph Planning for Robust Humanoid Navigation with Collision-Free MPC [11.923992019929495]
本稿では,ロバストなヒューマノイドナビゲーションのための階層型強化学習フレームワークであるRAVENを提案する。
RAVENは、障害物インフレーションと関連するグラフパラメータを変更することで、可視グラフプランナーの幾何学的構成にRLを適用する。
その結果、障害物近傍でのオーバーシュートを低減し、狭い通路でのロバスト性を向上し、遅延と騒音下でのより信頼性の高い航法が示された。
論文 参考訳(メタデータ) (2026-07-17T07:23:54Z) - Position: Weight Space Should Be a First-Class Generative AI Modality [67.10702320971893]
本稿では、モデルチェックポイントを第一級データモダリティとして扱うべきであると論じる。
重み空間における生成的モデリングは、コア機械学習プリミティブとして標準化されるべきである、と論じている。
私たちのゴールは、コミュニティの既定の考え方を、タスクごとのモデルの最適化から、学習した重量分布からモデルのサンプリングにシフトさせることです。
論文 参考訳(メタデータ) (2026-05-18T16:38:26Z) - Hierarchical Motion Planning and Control under Unknown Nonlinear Dynamics via Predicted Reachability [2.857551605623957]
未知の非線形力学の下での自律的な運動計画には、目標に向かってナビゲートしながら学習システムの特性が必要である。
我々は,事前のシステム知識を限定したオンライン動作合成を可能にする階層的計画制御フレームワークを開発した。
論文 参考訳(メタデータ) (2026-03-31T23:36:11Z) - Adapting Reinforcement Learning for Path Planning in Constrained Parking Scenarios [6.734318562862061]
駐車場におけるリアルタイム経路計画のためのDeep Reinforcement Learningフレームワークを提案する。
古典的なプランナーとは異なり、我々の解は理想的で構造化された知覚を必要としない。
テスト時には、ポリシーは各ステップで1つのフォワードパスを通じてアクションを生成します。
論文 参考訳(メタデータ) (2026-01-30T04:35:49Z) - Self-Supervised Path Planning in Unstructured Environments via Global-Guided Differentiable Hard Constraint Projection [5.665217514922631]
本研究では,非構造化環境における自律ナビゲーションのためのディープラーニングエージェントをデプロイするための自己教師型フレームワークを提案する。
データ不足を軽減するため,手動ラベリングを使わずに高密度の監視信号を提供するG-APF(Global-Guided Artificial Potential Field)を構築した。
20,000のシナリオからなるテストセットのベンチマークでは、88.75%の成功率を示し、強化された運用安全性を実証している。
論文 参考訳(メタデータ) (2026-01-27T08:37:21Z) - Hybrid DQN-TD3 Reinforcement Learning for Autonomous Navigation in Dynamic Environments [1.241204035960416]
本稿では、離散的なサブゴール選択のための高レベルなディープQネットワーク(DQN)と、連続的な動作のための低レベルなツイン遅延Deep Deterministic Policy Gradient(TD3)コントローラを組み合わせた階層的パス計画制御フレームワークを提案する。
我々は、安全でない動きを防止できるLiDARベースの安全ゲートとともに、実用的な報酬形成スキーム(方向、距離、障害物回避、動作の平滑性、衝突罰、時間罰、進行)を設計する。
論文 参考訳(メタデータ) (2025-10-30T16:12:01Z) - Test-Time Graph Search for Goal-Conditioned Reinforcement Learning [56.13800388912632]
オフライン目標条件強化学習(GCRL)は、テスト時にユーザが指定した目標に到達するポリシーを訓練する。
GCRLタスクを解決するための軽量な計画手法であるTTGS(Test-Time Graph Search)を導入する。
TTGSは任意の状態空間距離やコスト信号を受け入れ、データセット状態の上に重み付きグラフを構築し、凍結ポリシーが実行する一連のサブゴールを高速に検索する。
論文 参考訳(メタデータ) (2025-10-08T17:20:53Z) - TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning [79.59753528758361]
両足のVLAを促進するために、豊富な車輪付きヒューマノイドデータを活用するクロス・エボディメント・フレームワークであるTrajBoosterを提案する。
私たちのキーとなる考え方は、形態素に依存しないインターフェースとして、エンドエフェクタ・トラジェクトリを使用することです。
以上の結果から,TrajBoosterは既存の車輪付きヒューマノイドデータにより,二足歩行ヒューマノイドVLAの性能を効率的に向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-09-15T12:25:39Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Action-Quantized Offline Reinforcement Learning for Robotic Skill
Learning [68.16998247593209]
オフライン強化学習(RL)パラダイムは、静的な行動データセットを、データを収集したポリシーよりも優れたパフォーマンスのポリシーに変換するためのレシピを提供する。
本稿では,アクション量子化のための適応型スキームを提案する。
IQL,CQL,BRACといった最先端のオフラインRL手法が,提案手法と組み合わせることで,ベンチマークのパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2023-10-18T06:07:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。