論文の概要: Implicit Action Chunking for Smooth Continuous Control
- arxiv url: http://arxiv.org/abs/2605.19592v1
- Date: Tue, 19 May 2026 09:35:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:09.253188
- Title: Implicit Action Chunking for Smooth Continuous Control
- Title(参考訳): スムース連続制御のためのインプシットアクションチャンキング
- Authors: Bosun Liang, Shuo Pei, Zirui Chen, Chuanzhi Fan, Chen Sun, Yuankai Wu, Huachun Tan, Yong Wang,
- Abstract要約: 本稿では、スムーズな連続制御のための暗黙のアクションチャンキングフレームワークであるDWSを提案する。
明示的な方法とは異なり、DWSはアクション空間を拡張することなく時間的コヒーレンスを強制する。
DeepMind Control Suiteや産業エネルギー管理タスクなどのベンチマーク実験は、DWSが最先端(SOTA)ベースラインを上回っていることを示している。
- 参考スコア(独自算出の注目度): 18.59026740882408
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning often produces high-frequency oscillatory control signals that undermine the safety and stability required for physical deployment. Explicit action chunking addresses this by predicting fixed-horizon trajectories but scales the policy output dimension proportionally with the horizon length, leading to optimization difficulties and incompatibility with standard step-wise interaction. To overcome these challenges, this paper proposes Dual-Window Smoothing (DWS), an implicit action chunking framework for smooth continuous control. Unlike explicit methods, DWS enforces temporal coherence without expanding the action space. It uses a dual-window design: an execution window that ensures physical smoothness through deterministic modulation, and a value window that aligns temporal-difference targets over the horizon to correct critic bias caused by open-loop execution. DWS also includes a lightweight actor-side temporal regularizer based on first-order action differences to promote global continuity. This design effectively bridges the gap between temporal abstraction and reactive step-wise control. Experiments on benchmarks including the DeepMind Control Suite and industrial energy management tasks show that DWS outperforms state-of-the-art (SOTA) baselines. In complex vision-based autonomous driving tasks, DWS achieves smoother control, safer behavior with reduced jitter, and attains a 100% success rate.
- Abstract(参考訳): 強化学習はしばしば、物理展開に必要な安全性と安定性を損なう高周波発振制御信号を生成する。
明示的なアクションチャンキングは、固定水平軌道の予測によってこの問題に対処するが、政策出力の寸法は水平線長に比例して拡大し、最適化の困難さと標準ステップワイド相互作用との不整合をもたらす。
これらの課題を克服するために、スムーズな連続制御のための暗黙のアクションチャンキングフレームワークであるDWS(Dual-Window Smoothing)を提案する。
明示的な方法とは異なり、DWSはアクション空間を拡張することなく時間的コヒーレンスを強制する。
デュアルウィンドウの設計は、決定論的変調による物理的滑らかさを保証する実行ウィンドウと、水平線上の時間差目標を整列して、オープンループ実行による批判バイアスを補正する値ウィンドウである。
DWSはまた、グローバルな連続性を促進するために、一階アクション差に基づく軽量アクター側時間正規化器も備えている。
この設計は、時間的抽象化とリアクティブなステップワイズコントロールのギャップを効果的に埋める。
DeepMind Control Suiteや産業エネルギー管理タスクなどのベンチマーク実験は、DWSが最先端(SOTA)ベースラインを上回っていることを示している。
複雑な視覚に基づく自律運転タスクでは、DWSはよりスムーズな制御、ジッタの低減による安全な動作を実現し、100%の成功率を達成する。
関連論文リスト
- AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward [11.066720921275648]
視覚言語アクション(VLA)モデルは、ロボット操作に非常に有望である。
厳格な産業用ロボットへの展開は、コンプライアンスと応答性の本質的にのトレードオフのため、依然として困難である。
本稿では、このトレードオフを解決するために、速度フィードフォワード項をVLAポリシーに統合することの重要性を示す。
論文 参考訳(メタデータ) (2026-03-17T07:50:00Z) - Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes [37.92248202525651]
本稿では,低レベルの物理的実行から高レベルのユーザ意図理解を分離するためのDual-Stage Intent-Aware (DS-IA)フレームワークを提案する。
試験の結果、DS-IAは58.56%(ベースラインを28%以上上回る)のエクサクトマッチ(EM)を達成し、無効命令の拒否率を87.04%に改善した。
論文 参考訳(メタデータ) (2026-03-17T07:38:39Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Mind the Gap: Learning Implicit Impedance in Visuomotor Policies via Intent-Execution Mismatch [7.078279704479455]
本稿では,学習目標を「インテント・クローン(マスター・コマンド)」にシフトさせるデュアルステート・コンディショニング・フレームワークを提案する。
マスター意図を予測することによって、我々の政策は「仮想平衡点」を生成することを学び、暗黙のインピーダンス制御を効果的に実現した。
これは、低コストハードウェアのための最小限の動作クローニングフレームワークを示し、明示的な力センシングに頼ることなく、力知覚と動的補償を可能にする。
論文 参考訳(メタデータ) (2026-02-09T15:18:12Z) - TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control [15.534182843429043]
大規模なVision-Language-Action(VLA)モデルはセマンティックな一般化を提供するが、高い推論遅延に悩まされる。
本稿では,高頻度動作から意味論的推論を分離する階層型フレームワークであるTIDALを提案する。
TIDALは、二重周波数アーキテクチャを用いて拡散ベースのVLAのためのバックボーンに依存しないモジュールとして動作する。
論文 参考訳(メタデータ) (2026-01-21T12:43:11Z) - Hybrid DQN-TD3 Reinforcement Learning for Autonomous Navigation in Dynamic Environments [1.241204035960416]
本稿では、離散的なサブゴール選択のための高レベルなディープQネットワーク(DQN)と、連続的な動作のための低レベルなツイン遅延Deep Deterministic Policy Gradient(TD3)コントローラを組み合わせた階層的パス計画制御フレームワークを提案する。
我々は、安全でない動きを防止できるLiDARベースの安全ゲートとともに、実用的な報酬形成スキーム(方向、距離、障害物回避、動作の平滑性、衝突罰、時間罰、進行)を設計する。
論文 参考訳(メタデータ) (2025-10-30T16:12:01Z) - Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。