論文の概要: Optimal Transport Q-Learning for Flow Policy Steering and Acceleration
- arxiv url: http://arxiv.org/abs/2607.06262v1
- Date: Tue, 07 Jul 2026 13:29:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.534836
- Title: Optimal Transport Q-Learning for Flow Policy Steering and Acceleration
- Title(参考訳): フローポリシーステアリングと高速化のための最適輸送Qラーニング
- Abstract要約: 拡散と流れのポリシーは最近、ロボットアプリケーションで顕著な性能を示している。
高品質なポリシーパフォーマンスには、高速な推論と高品質なデモも必要です。
本研究は,ロボットの経験を生かして,最適下フローベースの政策を微調整し,促進する問題に対処する。
- 参考スコア(独自算出の注目度): 13.392974018091676
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion and flow policies have recently demonstrated remarkable performance in robotic applications by accurately capturing multimodal robot trajectory distributions, especially in the context of vision language action (VLA) models. However, high quality policy performance also requires fast inference and high quality demonstrations, which are often hard to get. Lack of these leads to suboptimal policy behaviors and failure under distribution shifts. In this work we address the problem of fine-tuning and accelerating suboptimal flow-based policies using the robot's experience through RL post-training. We introduce Optimal Transport Q-Learning (OTQL), a new method for finetuning flow policies using advantage weighted conditional optimal transport flow matching. OTQL can finetune and accelerate flows with an interaction budget of 50-60 episodes while avoiding computationally expensive distillation in simulation and real-world robot tasks. Our results show that OTQL post-trains flow policies using the robot's own experience, increasing average success percentage of single-task policies from 36% to 86% and of a pre-trained VLA from 38% to 76% while reducing the number of inference steps per action generation by 70%.
- Abstract(参考訳): 拡散と流れのポリシーは、特に視覚言語行動(VLA)モデルにおいて、マルチモーダルなロボット軌道分布を正確に捉えることで、ロボットアプリケーションにおいて顕著な性能を示している。
しかし、高品質なポリシーパフォーマンスには、高速な推論と高品質なデモが必要です。
これらの欠如は、分布シフトの下での最適な政策行動と失敗につながる。
本研究では,RLポストトレーニングを通じてロボットの経験を生かして,最適なフローベースポリシーを微調整し,促進する問題に対処する。
最適輸送Qラーニング (OTQL) は, 最適条件付き最適輸送フローマッチングを用いたフローポリシーを微調整する新しい手法である。
OTQLは、シミュレーションや実世界のロボットタスクにおいて、計算コストのかかる蒸留を避けながら、50~60エピソードのインタラクション予算でフローを微調整し、加速することができる。
この結果から,OTQLはロボット自身の経験を生かしてフローポリシを後処理し,シングルタスクポリシの平均成功率は36%から86%,事前学習VLAは38%から76%に増加し,アクション生成毎の推論ステップ数を70%削減した。
関連論文リスト
- Dynamic Multi-Depot Vehicle Routing with Online Requests: Event-Driven Transformer--DRL and Rolling-Horizon Benchmarking [0.0]
MaskedとTransformerのポリシーは、振る舞いのクローニングとポリシーの最適化によって訓練される。
学習されたポリシーは動的挿入と時間制限された圧延ホライズンと比較される。
ルーティング効率、サービスの応答性、安定性、オンライン計算に最高の方法はひとつもなかった。
論文 参考訳(メタデータ) (2026-08-13T22:05:56Z) - Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning [50.738952715864116]
表現的連続制御ポリシは、シミュレーションされた実ロボット制御のための模倣学習のスケーリングにおける進歩のバックボーンを形成する。
テスト時に完全にポリシー最適化を行うRLアルゴリズムであるQGF(Q-Guided Flow)を提案する。
実証的には、QGFはシングルタスクおよびゴール条件のオフラインRLベンチマークにおいて、以前のテスト時間RLメソッドよりも優れている。
論文 参考訳(メタデータ) (2026-06-09T16:45:57Z) - EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models [84.73890225707264]
提案するEXPO-FTは,事前学習したVLAポリシーの安定かつサンプル効率の良いRL微調整システムである。
本システムは,オンラインロボットデータの平均19.1分以内の全ての評価課題に対して,完全なタスク性能(30/30の成功)を実現する。
我々は、ロボット工学におけるVLAモデルのより広範なRLファインタニング導入を促進することを目的とした、オープンソースのロバスト性をリリースする。
論文 参考訳(メタデータ) (2026-05-25T06:31:03Z) - Aligning Flow Map Policies with Optimal Q-Guidance [50.514994916864275]
フローマップポリシは、任意のサイズのジャンプを学習することで、高速なアクション生成のために設計されている。
FLOW MAP Q-GUIDANCE (FMQ) は, 批判誘導型信頼領域制約の下でオフラインフローマップポリシーを適用するのに最適な, 原則付きクローズドフォーム学習ターゲットである。
FMQは、オフラインからオフラインまでのRLにおける最先端のパフォーマンスを達成し、平均成功率に対して21.3%の相対的な改善により、以前のワンステップポリシーMVPを上回っている。
論文 参考訳(メタデータ) (2026-05-12T17:12:29Z) - One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies [18.743330791557522]
ワンステップフローポリシー (One-Step Flow Policy, OFP) は、教師の訓練を受けずに高忠実でシングルステップのアクション生成を行うための自己蒸留フレームワークである。
56の多様なシミュレートされた操作タスクに対する評価は、一段階のOFPが最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2026-03-12T21:58:12Z) - Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation [65.13627721310613]
平均速度ポリシー(MVP)は、平均速度場をモデル化し、最速のワンステップアクション生成を実現するための新しい生成ポリシー関数である。
MVPはRoomimicとOGBenchのいくつかの困難なロボット操作タスクに対して、最先端の成功率を達成する。
論文 参考訳(メタデータ) (2026-02-14T14:44:06Z) - Multi-Objective Adaptive Rate Limiting in Microservices Using Deep Reinforcement Learning [10.766410192517164]
APIレート制限は、システムの安定性とサービス品質を保証する重要なメカニズムとして現れています。
トークンバケットやスライディングウィンドウといった従来のレート制限アルゴリズムは、動的トラフィックパターンやさまざまなシステム負荷に適応するのに苦労する。
本稿では,システムスループットとサービスレイテンシを動的にバランスする深層強化学習に基づく適応率制限戦略を提案する。
論文 参考訳(メタデータ) (2025-11-05T08:22:42Z) - VFP: Variational Flow-Matching Policy for Multi-Modal Robot Manipulation [3.986404588605909]
可変フローマッチングポリシー(VFP)は、タスクレベルとトラジェクトリレベルの両方のマルチモーダリティをキャプチャするフローマッチングポリシーである。
VFPは、標準的なフローベースベースラインよりもタスク成功率を49%向上させる。
論文 参考訳(メタデータ) (2025-08-03T07:23:02Z) - FlowTS: Time Series Generation via Rectified Flow [67.41208519939626]
FlowTSは、確率空間における直線輸送を伴う整流フローを利用するODEベースのモデルである。
非条件設定では、FlowTSは最先端のパフォーマンスを達成し、コンテキストFIDスコアはStockとETThデータセットで0.019と0.011である。
条件設定では、太陽予測において優れた性能を達成している。
論文 参考訳(メタデータ) (2024-11-12T03:03:23Z) - FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning [74.25049012472502]
FLaReは、堅牢な事前訓練された表現、大規模なトレーニング、勾配安定化技術を統合する大規模な強化学習フレームワークである。
提案手法は,タスク完了に向けた事前訓練されたポリシーを整列し,これまで実証され,全く新しいタスクや実施状況において,最先端(SoTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-09-25T03:15:17Z) - Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation [72.24964965882783]
強化学習(RL)はロボットナビゲーションにおいて有望なアプローチであり、ロボットは試行錯誤を通じて学習することができる。
現実世界のロボットタスクは、しばしばまばらな報酬に悩まされ、非効率な探索と準最適政策に繋がる。
本稿では,RLに基づくロボットナビゲーションにおいて,報酬関数を変更せずにサンプル効率を向上させる新しい手法であるConfidence-Controlled Exploration (CCE)を紹介する。
論文 参考訳(メタデータ) (2023-06-09T18:45:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。