論文の概要: ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning
- arxiv url: http://arxiv.org/abs/2607.12992v1
- Date: Tue, 14 Jul 2026 17:43:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.23801
- Title: ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning
- Title(参考訳): ChunkFlow: 継続的一貫性を持ったチャンク型政策学習を目指して
- Abstract要約: ChunkFlowは、チャンクポリシーのためのSeam対応のトレーニング・アンド・エグゼクティブフレームワークである。
各チャンクを凍結し、編集可能で、将来のゾーンに分割し、実行時に決定論的重複を適用し、シームと第1、第2の連続性損失で生の予測を訓練する。
CALVIN、LIBERO、および実際のロボットの実験では、低レイテンシ推論による成功-安定トレードオフが改善されている。
- 参考スコア(独自算出の注目度): 5.727608625370017
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language action (VLA) models increasingly adopt chunked action heads to satisfy real-time constraints; however, this introduces boundary jitter: overlapping regions between consecutive chunks often yield inconsistent predictions, degrading temporal coherence and the task success rate. Existing methods, such as inference-time blending, merely reweight mismatched proposals without correcting underlying errors, leading to residual accumulation under biased or noisy histories. We propose ChunkFlow, a seam-aware training-and-execution framework for chunked policies that aligns chunk structure with boundary execution. It partitions each chunk into frozen, editable, and future zones, applies deterministic overlap blending at execution, and trains raw predictions with seam and first- and second-order continuity losses. History corruption and scheduled sampling improve robustness to executed-history errors, while an AWAC fine-tuning stage adapts the policy without removing these structural regularizers. Under mild smoothness assumptions, pre-blending seam discrepancies provably decay with increasing overlap. Experiments on CALVIN, LIBERO, and real robots show an improved success-stability trade-off with low-latency inference. Project page: https://cytoderm-ai.github.io/chunkflow.
- Abstract(参考訳): 視覚言語行動(VLA)モデルは、リアルタイムな制約を満たすためにチャンクされたアクションヘッドを採用する傾向にあるが、これは境界ジッタを導入する: 連続チャンク間の重複領域は、しばしば矛盾した予測をもたらし、時間的コヒーレンスを低下させ、タスク成功率を低下させる。
推論時ブレンディングのような既存の手法は、根底にある誤りを訂正することなく、単にミスマッチした提案を再重み付けするだけであり、バイアスやノイズのある歴史の下での残留的な蓄積につながる。
チャンク構造とバウンダリ実行を整合させるチャンクポリシのためのシーム対応のトレーニング・アンド・エグゼクティブフレームワークであるChunkFlowを提案する。
各チャンクを凍結し、編集可能で、将来のゾーンに分割し、実行時に決定論的重複を適用し、シームと第1、第2の連続性損失で生の予測を訓練する。
履歴の破損とスケジュールされたサンプリングは、実行された履歴エラーに対する堅牢性を改善する一方、AWACの微調整段階は、これらの構造的正則化を除去することなくポリシーを適応する。
緩やかな滑らかさの仮定の下では、プレブレーディングのシームの相違は、重なりが増すにつれて確実に崩壊する。
CALVIN、LIBERO、および実際のロボットの実験では、低レイテンシ推論による成功-安定トレードオフが改善されている。
プロジェクトページ: https://cytoderm-ai.github.io/chunkflow.com
関連論文リスト
- SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies [26.372187124257362]
固定長アクションチャンクを実行するVLA(Vision-Language-Action)ポリシーは、マルチモーダル分岐を示す。
フローマッチングVLAのトレーニング不要な推論時間であるSEAM(Smooth Execution of Action-Chunked Motion)を提案する。
pi_0.5のLIBERO-10では、SEAMは境界ジャークを28%減らし、チャンク遷移の不連続を27%減らし、ベースラインレベルのタスク成功を保ち、無誘導ベースライン付近でデノジングループコストを抑える。
論文 参考訳(メタデータ) (2026-07-06T02:32:10Z) - SUNTA: Hierarchical Video Prediction with Surprise-based Chunking [26.31264097587371]
チャンキングは予測エラーによって駆動されるべきであり、より直接的に、より長い範囲のコンテキストが必要な場合を示す。
本研究では,サプライズをベースとしたNested Temporal Abstraction (SUNTA) を提案する。
2次元および3次元環境における映像予測タスクの実験は、SUNTAがベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-07-02T12:27:54Z) - FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows [18.746098727212544]
FlowBenderは3D再構成のための新しい拡散流モデルである。
FlowBenderは、標準的な教師付きアライメントトレーニングよりも一貫して優れています。
微分可能な演算子に対して、FlowBenderのいくつかの変種を提案する。
論文 参考訳(メタデータ) (2026-06-18T15:56:07Z) - Unbiased Gradient Estimation for Event Binning via Functional Backpropagation [64.88399635309918]
バックプロパゲーション中に弱微分を合成することにより任意の双対関数の非バイアス勾配推定のための新しいフレームワークを提案する。
自己監督型光流ではECEが9.4%,SLAMでは5.1%低下し,事象に基づく視覚知覚において大きなメリットが示された。
論文 参考訳(メタデータ) (2026-02-13T04:05:03Z) - Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows [11.159970460746164]
実世界のインタラクション予算の制限と多モードなアクション分布のため、厳密な操作ポリシーの現実世界の微調整は困難である。
正規化フロー(NF)を用いたサンプル効率の良いオフポリチック微調整フレームワークSOFT-FLOWを提案する。
これは、可能性に基づくマルチモーダルな生成ポリシーと、実際のロボットハードウェアにおけるチャンクレベルの価値学習を組み合わせた最初の実証である。
論文 参考訳(メタデータ) (2026-02-10T09:28:20Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - BayesTTA: Continual-Temporal Test-Time Adaptation for Vision-Language Models via Gaussian Discriminant Analysis [41.09181390655176]
CLIPのような視覚言語モデル(VLM)は、強いゼロショット認識を実現するが、実世界のシナリオに共通する時空間的な分散シフトの下で大幅に劣化する。
テスト分布が時間とともに徐々に変化するCT-TTA(textitContinal-Temporal Test-Time Adaptation)として、この実践的問題を定式化する。
我々は、時間的に一貫した予測を実行し、視覚表現を動的に調整する、ベイズ適応フレームワークであるtextitBayesTTAを提案する。
論文 参考訳(メタデータ) (2025-07-11T14:02:54Z) - Fast constrained sampling in pre-trained diffusion models [80.99262780028015]
任意の制約下で高速で高品質な生成を可能にするアルゴリズムを提案する。
我々の手法は、最先端のトレーニングフリー推論手法に匹敵するか、超越した結果をもたらす。
論文 参考訳(メタデータ) (2024-10-24T14:52:38Z) - An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuning [55.467047686093025]
このような忘れを緩和するための一般的なアプローチは、微調整中に以前のタスクからサンプルをリハーサルすることである。
側方損傷のリハーサルを優先するサンプリング手法である textttbf mix-cd を提案する。
我々の手法は計算効率が高く、実装が容易で、計算制約のある設定においていくつかの主要な連続学習手法より優れています。
論文 参考訳(メタデータ) (2024-02-12T22:32:12Z) - Towards Continual Learning Desiderata via HSIC-Bottleneck
Orthogonalization and Equiangular Embedding [55.107555305760954]
本稿では,レイヤワイドパラメータのオーバーライトや決定境界の歪みに起因する,概念的にシンプルで効果的な手法を提案する。
提案手法は,ゼロの指数バッファと1.02倍の差が絶対的に優れていても,競争精度が向上する。
論文 参考訳(メタデータ) (2024-01-17T09:01:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。