論文の概要: SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2607.04609v1
- Date: Mon, 06 Jul 2026 02:32:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.011013
- Title: SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies
- Title(参考訳): SEAM:視覚・言語・行動政策のための行動・絡み合い運動のスムーズな実行
- Authors: Dijia Zhan, Xuemiao Xu, Jinyi Li, Jie Tang,
- Abstract要約: 固定長アクションチャンクを実行するVLA(Vision-Language-Action)ポリシーは、マルチモーダル分岐を示す。
フローマッチングVLAのトレーニング不要な推論時間であるSEAM(Smooth Execution of Action-Chunked Motion)を提案する。
pi_0.5のLIBERO-10では、SEAMは境界ジャークを28%減らし、チャンク遷移の不連続を27%減らし、ベースラインレベルのタスク成功を保ち、無誘導ベースライン付近でデノジングループコストを抑える。
- 参考スコア(独自算出の注目度): 26.372187124257362
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) policies that execute fixed-length action chunks can exhibit multimodal bifurcation: a cross-chunk inconsistency in which adjacent chunks generated from independent Gaussian latents can converge to incompatible trajectory modes, producing abrupt discontinuities at chunk boundaries. Existing remedies either require backpropagation through the policy at each denoising step, rely on rejection sampling, or require retraining, each trading computational cost or task reliability for smoother transitions. We propose SEAM (Smooth Execution of Action-Chunked Motion), a training-free inference-time method for flow matching VLAs. SEAM exploits a simple synchronous-execution insight: after the robot consumes the executed prefix, the previous chunk's unexecuted tail is already available as an analytic consistency reference. Its core mechanism, Velocity-guided Loss Steering (VLS), derives a time-dependent target from this tail and applies a closed-form correction after each Euler step without backpropagating through the policy network. On LIBERO-10 with pi_0.5, SEAM reduces boundary jerk by 28%, reduces chunk transition discontinuity by 27%, preserves baseline-level task success, and keeps denoising-loop cost near the unguided baseline.
- Abstract(参考訳): 固定長のアクションチャンクを実行するVLA(Vision-Language-Action)ポリシーは、マルチモーダル分岐(multimodal bifurcation)を示すことができる。
既存の救済策は、各段階の政策によるバックプロパゲーションを必要とするか、拒絶サンプリングに依存するか、または再訓練を必要とするか、それぞれの取引計算コストまたはよりスムーズな移行のためのタスク信頼性を必要とする。
フローマッチングVLAのトレーニング不要な推論時間であるSEAM(Smooth Execution of Action-Chunked Motion)を提案する。
SEAMは単純な同期実行の洞察を利用する:ロボットが実行されたプレフィックスを消費した後、以前のチャンクの未実行テールは分析一貫性参照として既に利用可能である。
その中心となるメカニズムであるVLS(Velocity-guided Loss Steering)は、このテールから時間依存的なターゲットを導き、ポリシーネットワークをバックプロパゲートすることなく、各Eulerステップの後にクローズドフォーム補正を適用する。
pi_0.5のLIBERO-10では、SEAMは境界ジャークを28%減らし、チャンク遷移の不連続を27%減らし、ベースラインレベルのタスク成功を保ち、無誘導ベースライン付近でデノジングループコストを抑える。
関連論文リスト
- VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon [40.99993238069073]
VLA-Correctorは、アクションチャンクされたビジョン・ランゲージ・アクションポリシーのための軽量な修正推論フレームワークである。
VLAのバックボーンを再訓練することなく、異なるVLAモデルに統合することができる。
これは、実行とポリシー呼び出し頻度の間の静的な地平線によって課されるトレードオフを緩和する。
論文 参考訳(メタデータ) (2026-07-02T07:18:53Z) - Denoising Tells When to Replan: Denoising-Variance Adaptive Chunking for Flow-Based Robot Policies [18.476299874941592]
アクションチャンキングはフローベースのロボットポリシーの一般的な推論戦略となっている。
本研究では,予測チャンクから実行すべきアクション数を適応的に決定するテストタイム手法であるDVACを提案する。
LIBERO、RoboTwin、CALVIN、および実世界の操作実験により、DVACはスケジュール変更頻度を減らしながらタスク成功を改善することが示された。
論文 参考訳(メタデータ) (2026-06-02T16:26:32Z) - DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors [57.944744187489185]
外部修正をネイティブなアンマスクに置き換えるDiscreteRTCを提案する。
DiscreteRTCは、非同期のインペインティングのために0行のコードを実装するのが簡単で、スクラッチから生成したアクションに比べてわずか0.7倍の計算速度で推論が高速で、フローベースのRTCに比べて実世界の動的ピックタスクの成功率が50%向上した。
論文 参考訳(メタデータ) (2026-04-27T23:04:03Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation [36.801575461006664]
モバイル操作における中心的な課題は、実行中に反応性を維持しながら、可塑性アクションモデルを保存することである。
AnchorVLAは移動操作のための拡散型VLAポリシーであり、サンプリングが可算解多様体の近傍で始まると、広範囲な denoising は不要である、というコア洞察に基づいて構築されている。
論文 参考訳(メタデータ) (2026-04-02T03:29:04Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - FAST-DIPS: Adjoint-Free Analytic Steps and Hard-Constrained Likelihood Correction for Diffusion-Prior Inverse Problems [2.9506605740700107]
トレーニングなし拡散の先行は、しばしば、繰り返し導関数や、保守的なステップサイズを持つ内部最適化/MCMCループに依存する。
本研究では、これらの内部ループをハードな測定空間実現可能性制約で置き換える訓練不要な解法を提案する。
実験はPSNR/SSIM/LPIPSと最大19.5$times$のスピードアップで、手書きのアジョイントや内部MCMCを使わずに、競争力のあるPSNR/SSIM/LPIPSを実現する。
論文 参考訳(メタデータ) (2026-03-02T08:17:26Z) - Learning Native Continuation for Action Chunking Flow Policies [40.56048312294812]
アクションチャンキングにより、VLA(Vision Language Action)モデルがリアルタイムで実行されるが、単純なチャンク実行はしばしばチャンク境界で不連続を示す。
本稿では,アクションチャンクフローに基づくVLAポリシーのトレーニング時間継続手法であるLegotoを提案する。
レガートはよりスムーズな軌道を発生し、実行中にスムーズなマルチモーダルスイッチングを減少させる。
論文 参考訳(メタデータ) (2026-02-13T14:56:06Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。