論文の概要: Retrieve in Time, Correct in Frequency
- arxiv url: http://arxiv.org/abs/2608.04527v1
- Date: Wed, 05 Aug 2026 06:58:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.768178
- Title: Retrieve in Time, Correct in Frequency
- Title(参考訳): 周波数で正しい時間で検索する
- Authors: Yuze Fan, Yue Cao, Pengjie Gao, Haojia Gao, Guangqiu Guo, Ziyue Zhang, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang,
- Abstract要約: トレーニング不要なテスト時間補正フレームワークであるRTCF(Retrieve in Time, Correct in Frequency)を紹介する。
RTCFは、どのアクションのどの部分を転送するかを、どのエクスペリエンスから取得するかを分離する。
総成功率は86.4%から88.4%に上昇し、LIBERO-Longは61.6%から68.6%に向上した。
- 参考スコア(独自算出の注目度): 14.108343620177314
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frozen vision-language-action (VLA) policies generate temporally extended action chunks, but long-horizon manipulation remains vulnerable to accumulated execution error and visual aliasing across task stages. Successful rollouts provide useful corrective evidence, yet current frame retrieval can return progress-misaligned actions,while direct replay or time-domain fusion can overwrite the reactive structure of the policy proposal. We introduce Retrieve in Time, Correct in Frequency (RTCF), a training-free test-time correction framework that improves frozen VLA performance with low model-side overhead.RTCF separates which experience to retrieve from which part of its action to transfer. Progressive Memory Alignment (PMA) causally aligns the growing visual execution history with complete successful trajectories through incrementally updated monotonic frontiers, jointly identifying a relevant memory and the current aligned memory position without stage labels. From the aligned action chunk,RTCF transfers a coefficient-wise-clipped low-frequency residual on motion channels. Higher-frequency components and gripper decisions remain inherited from the frozen policy. Across four LIBERO suites and 2,000 episodes per condition, RTCF raises aggregate success from 86.4% to 88.4% and improves LIBERO-Long from 61.6% to 68.6%.These gains require no parameter updates, repeated VLA inference, or additional GPU resources: correction can be performed on the client CPU after a single policy invocation, and the median latencies sum to only 10.99 ms per action chunk
- Abstract(参考訳): 凍結視覚言語アクション(VLA)ポリシーは、時間的に拡張されたアクションチャンクを生成するが、長い水平操作は、タスクステージ全体にわたって蓄積された実行エラーや視覚的エイリアスに対して脆弱である。
成功したロールアウトは有効な修正エビデンスを提供するが、現在のフレーム検索はプログレスミス対応のアクションを返すことができ、ダイレクトリプレイやタイムドメイン融合はポリシー提案のリアクティブ構造を上書きすることができる。
トレーニング不要なテスト時間補正フレームワークであるRetrieve in Time, Correct in Frequency (RTCF)を紹介した。
プログレッシブメモリアライメント(PMA)は、成長する視覚的実行履歴を段階的に更新されたモノトニックフロンティアを通じて完全に成功した軌跡と因果的に整列し、ステージラベルなしで関連するメモリと現在のアライメントされたメモリ位置を共同で識別する。
一致した動作チャンクからRTCFは、移動チャネル上で係数的にクラッピングされた低周波残差を伝達する。
高速コンポーネントとグリップ決定は、凍結されたポリシーから継承されている。
4つのLIBEROスイートと2000エピソードのうち、RTCFは86.4%から88.4%に、LIBERO-Longは61.6%から68.6%に改善されている。
これらのゲインは、パラメータ更新、繰り返しVLA推論、追加のGPUリソースを必要としない:単一のポリシーの実行後にクライアントCPUで修正を行うことができ、中央のレイテンシはアクションチャンク当たり10.99msに制限される。
関連論文リスト
- CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation [15.532709298240215]
視覚言語アクション(VLA)ポリシーは、オープンループアクションチャンクを通じて長距離移動操作を実行する。
本稿では、個別に訓練されたフリーズされた行動条件付き世界モデルを用いて実行を検証するCheckVLAを提案する。
RoboCasa365では、一般的なトレーニングレシピと一致した呼び出し予算の下で、CheckVLAの平均成功率は36.1%であり、定期的なリプランでは27.6%である。
論文 参考訳(メタデータ) (2026-07-29T11:31:33Z) - TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning [11.149498165285491]
Vision-Language-Action(VLA)ポリシーは、$_0.5$やOpenVLAのような多くのタスクでうまく機能するが、リアクティブであることが多い。
このようなタスクは、メモリだけでなく、動的に認識される信念の更新も必要である、と我々は主張する。
論文 参考訳(メタデータ) (2026-07-09T09:24:30Z) - SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies [26.372187124257362]
固定長アクションチャンクを実行するVLA(Vision-Language-Action)ポリシーは、マルチモーダル分岐を示す。
フローマッチングVLAのトレーニング不要な推論時間であるSEAM(Smooth Execution of Action-Chunked Motion)を提案する。
pi_0.5のLIBERO-10では、SEAMは境界ジャークを28%減らし、チャンク遷移の不連続を27%減らし、ベースラインレベルのタスク成功を保ち、無誘導ベースライン付近でデノジングループコストを抑える。
論文 参考訳(メタデータ) (2026-07-06T02:32:10Z) - TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL [72.7712729541565]
自己回帰(AR)ビデオ拡散モデルにより、ビデオチャンクをキャッシュされたビジュアルコンテキストでチャンクで合成することで、低レイテンシなストリーミング生成を可能にする。
1つのグローバルプロンプトは、どのサブイベントを各チャンクで実現すべきかを指定しないが、ステップワイズプロンプトにナビゲート的に切り替えると、しばしば遅延反応、ブレンドステップセマンティクス、プロンプト遷移間のエラー伝播につながる。
我々は、時間分解とステップ条件付き実行を協調的に最適化し、時間分解可能なARビデオ生成のためのプランナー-実行型強化学習フレームワークであるTempActでこれらの課題に対処する。
論文 参考訳(メタデータ) (2026-06-26T12:19:28Z) - VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models [73.99344788183949]
VLA-Proは、クロスタスクの一般化を強化するために設計されたプラグイン・アンド・プレイのフレームワークである。
タスク関連手続き記憶をトレーニング時に保存し、推論中にこれらの記憶を転送する。
RoboTwin、RLBench、および実世界の操作タスクの実験は、VLA-Proがクロスタスクの一般化を一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-05-28T08:14:08Z) - DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors [57.944744187489185]
外部修正をネイティブなアンマスクに置き換えるDiscreteRTCを提案する。
DiscreteRTCは、非同期のインペインティングのために0行のコードを実装するのが簡単で、スクラッチから生成したアクションに比べてわずか0.7倍の計算速度で推論が高速で、フローベースのRTCに比べて実世界の動的ピックタスクの成功率が50%向上した。
論文 参考訳(メタデータ) (2026-04-27T23:04:03Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation [16.28432866472846]
我々は、状態レベルのメモリを通じて凍結したビジョン・ランゲージ・アクションポリシーをアップグレードする、トレーニング不要の時間的修正であるTempoFitを紹介する。
私たちの重要な洞察は、プレフィックスアテンションK/Vが、すでにモデルネイティブで、コンテンツ順応可能なランタイム状態を形成しています。
LIBERO-LONGでは、TempoFitは、ほぼリアルタイムのレイテンシを維持しながら、最大4.0%の成功率で、トレーニング済みの強いバックボーンを改善している。
論文 参考訳(メタデータ) (2026-03-08T14:17:25Z) - Real-Time Execution of Action Chunking Flow Policies [49.1574468325115]
本稿では,アクションインタラクションシステムの非同期実行を可能にする新しい推論時アルゴリズムを提案する。
これは、再トレーニングなしでボックスから実行する拡散またはVLAベースのシステムに適用できる。
その結果、RTCは高速で、性能が高く、推論操作に対して一意に堅牢であることがわかった。
論文 参考訳(メタデータ) (2025-06-09T01:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。