論文の概要: Redesigning Regularization for Effective Policy Smoothing
- arxiv url: http://arxiv.org/abs/2606.13169v1
- Date: Thu, 11 Jun 2026 10:40:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.726115
- Title: Redesigning Regularization for Effective Policy Smoothing
- Title(参考訳): 効果的な政策平滑化のための規則化の再設計
- Authors: Taisuke Kobayashi, Naoto Yamanaka,
- Abstract要約: 本稿では,強化学習におけるポリシー機能を効果的にスムーズにするための新しい正規化設計を提案する。
四足歩行ロボットのシミュレート・トゥ・リアル強化学習に適用することにより, 目標速度指令の急激な変化に対して円滑な動きが有効であることを実証した。
- 参考スコア(独自算出の注目度): 2.492300648514128
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper proposes a novel regularization design to effectively smooth policy functions in reinforcement learning. While regularization that enhances ``global'' Lipschitz continuity was initially considered, it has been limited to ``local'' Lipschitz continuity due to a tradeoff between smoothness and expressiveness. However, it has become apparent that the original implementation is cumbersome and does not provide sufficient smoothing, leading to a preference for simpler implementations. This stems from a discrepancy between theory and implementation, and a more appropriate implementation can expect to facilitate smoothing. Therefore, this paper identifies three reasons why the original implementation does not function adequately and provide remedies for them. This modified regularization performs well across multiple tasks and algorithms, successfully achieving smooth motion while improving control performance. Furthermore, by applying it to sim-to-real reinforcement learning for a quadruped robot, it is demonstrated that smooth motion provides robustness against sudden changes in target velocity commands.
- Abstract(参考訳): 本稿では,強化学習におけるポリシー機能を効果的にスムーズにするための新しい正規化設計を提案する。
当初は「グローバル」リプシッツ連続性を高める正規化が検討されたが、滑らかさと表現性のトレードオフにより「ローカル」リプシッツ連続性に制限されている。
しかし、オリジナルの実装が煩雑で、十分なスムーズ化を提供していないことが明らかになり、より単純な実装が好まれるようになった。
これは理論と実装の相違に起因しており、より適切な実装は円滑化を促進することを期待できる。
そこで本研究では,オリジナルの実装が適切に機能しない3つの理由を特定し,その対策について述べる。
この修正された正規化は、複数のタスクやアルゴリズムにまたがってうまく機能し、スムーズな動作を実現し、制御性能を改善した。
さらに, 4足歩行ロボットに対する実力強化学習に適用することにより, 目標速度コマンドの急激な変化に対して, 滑らかな動きが頑健であることを実証した。
関連論文リスト
- Adaptive state-action abstractions via rate-distortion [52.25810164390199]
強化学習は、複雑なタスクの単純なバージョンを構築するための複数のテクニックを提供する。
本稿では,抽象化自体によって引き起こされる誤りに匹敵する学習エラーが生じたら,抽象化を洗練させるという原理を提案する。
論文 参考訳(メタデータ) (2026-06-04T13:10:18Z) - Universal Smoothness via Bernstein Polynomials: A Constructive Approximation Approach for Activation Functions [16.856453018275467]
ディープニューラルネットワークの有効性は、非線形活性化関数の設計に大きく依存している。
提案手法は厳密な連続微分可能性と1の非拡張リプシッツ定数を保証する。
このアプローチは、標準画像分類ベンチマークにおける最先端のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-04T13:38:16Z) - AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping [63.33669214116784]
GRPO-Guardは、既存のGRPOフレームワークのシンプルで効果的な拡張である。
PPOクリッピングが有害な更新を適切に制限することを保証するため、バランスとステップ一貫性の重要度を回復する。
重いKL正則化に頼ることなく、暗黙の過最適化を実質的に緩和する。
論文 参考訳(メタデータ) (2025-10-25T14:51:17Z) - Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning [56.47948583452555]
固定ステップのEulerスキームによるフローマッチング推論プロセスの離散化は,最適輸送から変化するJordan-Kinderlehrer-Otto原理と整合する,というキーインサイトに基づいて,SWFP(Stepwise Flow Policy)フレームワークを紹介した。
SWFPは、大域的な流れを、プロキシメート分布間の小さな漸進的な変換の列に分解する。
この分解は、小さな流れブロックのカスケードを介して事前訓練された流れを微調整する効率的なアルゴリズムを導き、大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-10-17T07:43:51Z) - Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking [29.920087317401396]
ジェネレーティブ・ビヘイビア・クローン(Generative Behavior Cloning)は、ロボット学習のためのシンプルで効果的なフレームワークである。
拡散政策の一貫性と反応性を高めるための2つの新しい手法を提案する。
提案手法は,多種多様なシミュレーションおよび実世界のロボット操作タスクにおいて,GBCの性能を大幅に向上させる。
論文 参考訳(メタデータ) (2025-10-14T11:16:34Z) - Gradient-Variation Online Learning under Generalized Smoothness [56.38427425920781]
勾配変分オンライン学習は、オンライン関数の勾配の変化とともにスケールする後悔の保証を達成することを目的としている。
ニューラルネットワーク最適化における最近の取り組みは、一般化された滑らかさ条件を示唆し、滑らかさは勾配ノルムと相関する。
ゲームにおける高速収束と拡張逆最適化への応用について述べる。
論文 参考訳(メタデータ) (2024-08-17T02:22:08Z) - Certified Robustness via Dynamic Margin Maximization and Improved Lipschitz Regularization [40.2635560771494]
我々は、弱い方向に沿ってモデルのリプシッツ定数を規則化しながら、出力(ロジット)空間のマージンを増大させる頑健なトレーニングアルゴリズムを開発する。
境界の相対的精度は過剰な正規化を防ぎ、決定境界をより直接的に操作することができる。
MNIST, CIFAR-10 および Tiny-ImageNet データセットを用いた実験により,提案アルゴリズムが最先端技術と比較して競争力に向上した結果が得られることを確認した。
論文 参考訳(メタデータ) (2023-09-29T20:07:02Z) - Topological Regularization via Persistence-Sensitive Optimization [10.29838087001588]
機械学習と統計学において重要なツールである正規化は、オーバーフィッティングを減らすために正規化に依存している。
本稿では、永続性に敏感な単純化の上に構築され、必要な変更を永続性ダイアグラムに変換して、ドメインの大規模なサブセットの変更に変換する手法を提案する。
このアプローチは、より速く、より正確な位相正規化を可能にします。
論文 参考訳(メタデータ) (2020-11-10T18:19:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。