論文の概要: Revisiting Temporal Regularization for Smooth Control in Deep Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.07910v1
- Date: Tue, 06 Oct 2026 07:53:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.877007
- Title: Revisiting Temporal Regularization for Smooth Control in Deep Reinforcement Learning
- Title(参考訳): 深層強化学習における平滑化制御のための時間正規化の再検討
- Abstract要約: 深層強化学習ポリシーは、物理ロボットへの展開を妨げる非平滑な動作振動を生み出すことができる。
既存のアーキテクチャとペナルティに基づくアプローチは、状態入力の変化に対する感受性を直接的に減少させることで空間的滑らかさを求める。
本稿では,時間的ペナルティと線形上昇を組み合わせた時空間平滑性(CATS)のみを用いた行動条件を提案する。
- 参考スコア(独自算出の注目度): 7.536387580547838
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep Reinforcement Learning policies can produce nonsmooth action oscillations that hinder deployment on physical robots. Existing architectural and penalty-based approaches seek spatial smoothness by directly reducing sensitivity to changes in state inputs, but their broad constraints can degrade task performance as stronger smoothing is pursued. Temporal regularization instead constrains action differences along observed transitions, but has been considered unable to provide the spatial smoothness needed under observation noise. We revisit this assumption by proving that the temporal penalty bounds the expected action differences between current states sharing a next state, revealing a spatial effect that empirically extends to spatial smoothness. Building on this finding, we propose Conditioning for Action using only Temporal Smoothness (CATS), which combines a temporal penalty with linear ramp-up. We highlight temporal regularization's ability to provide spatial smoothness while better preserving task performance than explicit spatial regularization. Through linear ramp-up, CATS allows the policy to learn rewarding behavior before progressively smoothing its actions, improving return preservation and both temporal and spatial smoothness. Experiments in both simulation and the real world show that CATS substantially reduces action oscillation without degrading task performance, with little computational overhead.
- Abstract(参考訳): 深層強化学習ポリシーは、物理ロボットへの展開を妨げる非平滑な動作振動を生み出すことができる。
既存のアーキテクチャとペナルティに基づくアプローチは、状態入力の変化に対する感受性を直接的に低下させることで空間的滑らかさを求めるが、その広範な制約は、より強い滑らか化が追求されるにつれてタスク性能を低下させる可能性がある。
時間的規則化は、観測された遷移に沿って行動の違いを制約するが、観測ノイズの下で必要な空間的滑らかさを提供することはできないと考えられている。
この仮定は、時間的ペナルティが次の状態を共有する状態間の期待される動作差を束縛していることを証明し、空間的滑らか性に経験的に拡張する空間的効果を明らかにすることによって再検討する。
そこで本研究では,時間的ペナルティと線形上昇を組み合わせた時空間平滑性(CATS)のみを用いた行動条件を提案する。
時間的正則化は空間的滑らかさを提供すると同時に,明示的な空間的正則化よりもタスク性能を保ちながら強調する。
線形上昇を通じてCATSは報酬行動の学習を可能にし、その行動が徐々に円滑になる前に報酬行動の学習を可能にし、リターン保存を改善し、時間的および空間的滑らかさを両立させる。
シミュレーションと実世界の両方の実験から、CATSはタスク性能を劣化させることなく、計算オーバーヘッドが少なく、動作の振動を著しく低減することが示された。
関連論文リスト
- Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing [78.44034844227868]
テキスト駆動型人間の動作編集は、自然言語の指示に従って既存の動作シーケンスを変更することを目的としている。
変化と不変性 (Change and Invariance Motion Editing, CIME) は、変化と不変性を空間的ポーズと時間的リズム次元に包括的に分離する統合フレームワークである。
MotionFixとSTANCE調整データセットの実験は、CIMEがアライメントと構造的忠実さの編集において最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-08-17T01:54:44Z) - Towards Physically Consistent 4D Scene Reconstruction for Closed-loop Autonomous Driving Simulation [19.055975606481635]
高忠実なストリートシーンの再構築は、エンドツーエンドの自動運転シミュレーションにおいて重要である。
既存の3DGSメソッドとその4D拡張は、両方を同時に達成できない。
空間的識別性を回復するための直交射影勾配(OPG)を提案する。
論文 参考訳(メタデータ) (2026-05-20T11:09:53Z) - F2F-AP: Flow-to-Future Asynchronous Policy for Real-time Dynamic Manipulation [62.06267255986041]
非同期推論はロボット操作における主要なパラダイムとして現れている。
本稿では,予測対象の流れを利用して将来の観測を合成する新しい枠組みを提案する。
本手法は複雑な動的操作タスクにおける応答性と成功率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-02T17:57:15Z) - Sparse Autoencoders as a Steering Basis for Phase Synchronization in Graph-Based CFD Surrogates [6.396157607535812]
グラフベースのサロゲートモデルは、高忠実度CFDソルバに代わる高速な代替手段を提供するが、その不透明な潜在空間と制限された制御性は、安全クリティカルな設定での使用を制限する。
凍結サロゲートの潜伏空間を操作することにより, 位相ドリフトをポストホックで補正できるかどうかを問う。
本稿では、適切な表現と適切な介入機構を組み合わせた事前学習グラフベースのCFDモデルのための位相ステアリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-28T07:03:44Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - JAWS: Enhancing Long-term Rollout of Neural Operators via Spatially-Adaptive Jacobian Regularization [0.0]
Jacobian-Adaptive Weighting for Stability (JAWS)は、これらの制限を軽減するために設計された確率的正規化戦略である。
空間的不確実性を伴う最大Aポストエリオーリ(MAP)推定として演算子学習をフレーミングすることにより、JAWSは局所的な物理的複雑さに基づいて正規化強度を動的に変調する。
実験により、この空間適応型プリコンディショナーが有効スペクトルプレコンディショナーとして機能し、高周波不安定性を扱う際のベースオペレータの負担を軽減することが示されている。
論文 参考訳(メタデータ) (2026-03-04T06:15:09Z) - Spatially-Aware Adaptive Trajectory Optimization with Controller-Guided Feedback for Autonomous Racing [74.83272587893508]
本稿では,NURBSに基づく軌道表現,CMA-ESグローバル軌道最適化,コントローラ誘導空間フィードバックを組み合わせた自律レースライン最適化フレームワークを提案する。
シミュレーションでは,最大静的加速度をパラメータ化したコントローラと比較して17.38%のラップタイム短縮を実現している。
高摩擦から低摩擦まで様々なタイヤ化合物で試験された実ハードウェアでは、摩擦を明示的にパラメータ化することなく、7.60%のラップタイムの改善が得られる。
論文 参考訳(メタデータ) (2026-02-17T15:10:44Z) - Enhancing Control Policy Smoothness by Aligning Actions with Predictions from Preceding States [7.3193427091420675]
先行状態からの予測を伴う行動調整による行動平滑化(ASAP)
ASAPは、遷移によって引き起こされた類似状態にあるものとの作用を調整し、二階差分をペナル化して高周波発振を抑制することで作用発振を緩和する。
GymnasiumおよびIsaac-Lab環境での実験は、ASAPが既存の方法よりもスムーズな制御とポリシー性能を向上させることを示した。
論文 参考訳(メタデータ) (2026-01-26T13:34:34Z) - On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization [0.0]
各種段差系における均一な凸性および滑らか性の下でのグラディエントDescentの追跡性能を解析した。
本研究では,ドリフトによる追従誤差を大幅に増幅し,追従能力に明らかなペナルティを与えることを示す。
これらの結果は、動的環境における運動量の経験的不安定性に対する決定的な理論的根拠を与える。
論文 参考訳(メタデータ) (2026-01-18T03:27:21Z) - Self-Supervised Class-Agnostic Motion Prediction with Spatial and Temporal Consistency Regularizations [53.797896854533384]
クラスに依存しない動き予測法は点雲全体の動きを直接予測する。
既存のほとんどのメソッドは、完全に教師付き学習に依存しているが、ポイントクラウドデータの手作業によるラベル付けは、手間と時間を要する。
3つの簡単な空間的・時間的正則化損失を導入し,自己指導型学習プロセスの効率化を図る。
論文 参考訳(メタデータ) (2024-03-20T02:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。