論文の概要: Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2607.02092v1
- Date: Thu, 02 Jul 2026 12:30:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.827224
- Title: Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies
- Title(参考訳): Guided Action Flow:Q-Guided Inference for Flow-Matching Vision-Language-Action Policies
- Authors: Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang,
- Abstract要約: フローマッチング視覚言語アクションポリシーは、反復輸送プロセスを通じてロボットアクションチャンクを生成する。
本稿では,SmolVLA ポリシーを凍結したまま維持する推論時フレームワークである Guided Action Flow において,この機会について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Flow-matching vision-language-action policies generate robot action chunks through an iterative transport process, creating an opportunity for test-time guidance without retraining the base policy. We study this opportunity in Guided Action Flow, an inference-time framework that keeps a pretrained SmolVLA policy frozen and uses a learned action-chunk critic to guide its reverse-time flow sampler. The critic is trained from real success and failure rollouts, can condition on task-description features from the frozen SmolVLA language pathway, and is used only through action gradients during sampling. We evaluate the approach on LIBERO manipulation tasks. A single-task critic improves success from 68.0% to 82.0% on one seed window and from 82.0% to 86.0% on another. A multi-family task-description critic improves validation success from 46.0% to 56.0%, while the locked held-out test gain is positive but modest, from 65.0% to 67.5%. These results support the feasibility of Q-guided inference for frozen flow-matching VLA policies, while showing that critic generalization and uncertainty-aware guidance remain the central bottlenecks.
- Abstract(参考訳): フローマッチング型視覚言語アクションポリシーは、反復輸送プロセスを通じてロボットアクションチャンクを生成し、基本ポリシーを再訓練することなく、テストタイムガイダンスの機会を生み出す。
本稿では,SmolVLA ポリシーを凍結したまま維持する推論時フレームワークである Guided Action Flow において,この機会について検討する。
批評家は実際の成功と失敗のロールアウトからトレーニングされ、凍結したSmolVLA言語経路からのタスク記述の特徴を条件付けすることができ、サンプリング中のアクション勾配によってのみ使用される。
LIBERO操作タスクに対するアプローチを評価する。
シングルタスクの批評家は、1つのシードウィンドウで68.0%から82.0%に、もう1つのシードウィンドウで82.0%から86.0%に改善する。
マルチファミリータスク記述批評家は、検証成功率を46.0%から56.0%に改善し、ロックされたホールトアウトテストのゲインは65.0%から67.5%に改善する。
これらの結果は,凍結流マッチングVLAポリシーに対するQ誘導推論の実現性を支持し,批判的一般化と不確実性認識誘導が中心的ボトルネックであることを示す。
関連論文リスト
- QPILOTS: Efficient Test-Time Q-Steering for Flow Policies [20.217020870532686]
QPILOTSは、元のポリシーを変更せずに、推論時にデノナイジングプロセスを操る方法である。
標準のオフライン-オンラインRLベンチマークでは、QPILOTSが最高の集計性能を達成し、50タスクで平均90%の成功率に達する。
論文 参考訳(メタデータ) (2026-06-11T18:22:03Z) - Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies [14.519898493996891]
本稿では,Q-Guided Value-Gradient Matching (Q-VGM) を法外強化学習(RL)法として提案する。
Q-VGMは、生成モデルにおけるフローアライメントの値勾配ビューであるVGG-Flowを活用することで問題を回避している。
LIBEROでは、Q-VGMが75.0%から92.5%に、RoboTwin 2.0では76.4%から87.2%に、実際の2つのテーブルトップタスクでは40.0%から67.5%に上昇している。
論文 参考訳(メタデータ) (2026-06-06T07:10:25Z) - Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement [27.695600755960736]
自己誘導型フローマッチングポリシであるForesightFlowを紹介した。
それぞれの生成されたアクションチャンクを、学習された成功可能性軌道で拡張する。
候補アクションをスコア付けし、外部の批評家なしで$K$の推論を可能にする。
論文 参考訳(メタデータ) (2026-06-03T14:49:35Z) - Trust Region Q Adjoint Matching [54.05514246126841]
本稿では,経路空間KLを予め訓練されたフローポリシーで適応的に制御する安定なオフポリチック微調整アルゴリズムであるTrust Region Q-Adjoint Matching (TRQAM)を紹介する。
TRQAMは、オフラインRLとオフライン-オフラインRLの両方において、常に先行技術を上回っている。
論文 参考訳(メタデータ) (2026-05-26T14:28:43Z) - Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization [51.11398557420066]
我々は、推論時ポリシー最適化としてジェイルブレイクを改定するフレームワークであるMetisを紹介する。
メティスは比較手法の中でも89.2%で最強のアタック成功率(ASR)を達成している。
冗長な探索を最適化に置き換えることで、Metisはトークンコストを平均8.2倍、最大11.4倍に削減する。
論文 参考訳(メタデータ) (2026-05-11T06:45:00Z) - EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models [57.75717492488268]
VLA(Vision-Language-Action)モデルは、大きな言語モデルを活用することで高度なロボット操作を行う。
Supervised Finetuning (SFT) では、タスク毎の数百のデモ、厳格に軌跡を記憶すること、デプロイメント条件がトレーニングから逸脱したときに適応できないことなどが求められている。
EVOLVE-VLA(EVOLVE-VLA)は、VLAが最小またはゼロのタスク固有のデモで環境相互作用を通じて継続的に適応できるテストタイムトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-12-16T18:26:38Z) - LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model [99.71684530652942]
LLaVA-Critic-R1は高い評価を受けた批評家としてだけでなく、競争政策モデルとしても現れることを示す。
テスト時に自己批判を適用すると、5つの代表的な推論タスクに対して平均+13.8%の改善が得られる。
その結果,評価と生成の両面において優れた統一モデルが得られることがわかった。
論文 参考訳(メタデータ) (2025-08-31T03:08:02Z) - QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA [46.65999744568314]
本稿では,モノリシック報酬を解釈可能な原理固有評価に分解するQA-LIGNを紹介する。
ランマ-3.1-8B-インストラクションの適用により、QA-LIGNは攻撃成功率を最大68.7%まで下げる一方で、偽拒絶率0.67%を維持している。
論文 参考訳(メタデータ) (2025-06-09T18:24:57Z) - Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization [74.78433600288776]
HKVE (Hierarchical Key-Value Equalization) は、勾配最適化結果を選択的に受け入れる革新的なジェイルブレイクフレームワークである。
HKVEは既存の手法を20.43%,21.01%,26.43%のマージンで大幅に上回った。
論文 参考訳(メタデータ) (2025-03-14T17:57:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。