論文の概要: Bilinear Flow Policy: Distributional Extrapolation for Goal-Conditioned Visuomotor Imitation
- arxiv url: http://arxiv.org/abs/2610.05765v1
- Date: Mon, 05 Oct 2026 04:11:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 02:36:53.482623
- Title: Bilinear Flow Policy: Distributional Extrapolation for Goal-Conditioned Visuomotor Imitation
- Title(参考訳): バイリニアフローポリシー:ゴールコンディション型ビジュモータ模倣のための分布外挿法
- Abstract要約: 本稿では,バイリニアフローとトランスダクティブ検索を組み合わせたビジュモータポリシであるバイリニアフローポリシーを紹介する。
目に見えない目標のために、BFPは"アンカー"トレーニングの例を検索し、この親しみやすいアンカーと残留項として、目に見えないペアをトランスダクティブに再構成する。
適切な仮定の下での双線形流の場合、見知らぬ目標における行動分布誤差は、問題依存因子までの分布内フローマッチング誤差によって境界づけられていることを証明する。
- 参考スコア(独自算出の注目度): 12.908247655354309
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Goal-conditioned imitation learning (GCIL) with flow matching is a promising framework that can represent multimodal behaviors while adapting to diverse, user-specified goals, yet often fails when goals lie outside the demonstration support. To extrapolate to such unseen goals without collapsing multimodality - a problem we call distributional extrapolation - we introduce Bilinear Flow Policy (BFP), a generative visuomotor policy that combines transductive retrieval with a bilinear conditional flow. Given an unseen observation-goal pair, BFP retrieves an "anchor" training example and transductively reformulates the unseen pair as this familiar anchor plus a residual term. For this decomposition to guide action prediction, the residual must compactly encode how the current observation-goal pair differs from the anchor, and the anchor must be chosen so that this difference is predictive of the corresponding action distribution. BFP achieves this with pretrained visual features and a novel learned anchor-selection algorithm. The novel bilinear flow then models how the anchor and the residual jointly determine the multimodal action distribution. We prove that, for bilinear flow under suitable assumptions, action distribution error at unseen goals is bounded by the in-distribution flow-matching error up to problem-dependent factors. Across five manipulation tasks in simulation, BFP achieves 2.63x the out-of distribution success rate of a GCIL policy and 1.36x that of the strongest extrapolation-targeted baseline. On two real-world tasks, BFP improves over GCIL by 32%. Finally, our theory yields practical, pre deployment diagnostics for predicting which trained policies will extrapolate well and to which unseen goal.
- Abstract(参考訳): フローマッチングを備えた目標条件付き模倣学習(GCIL)は、多様なユーザ指定の目標に適応しながらマルチモーダルな振る舞いを表現できる有望なフレームワークである。
マルチモーダル性(分布外挿と呼ばれる問題)を損なうことなく,このような不明瞭な目標を外挿するために,双線形流れと双線型条件流を組み合わせた生成的ビジュモータ政策である双線形フローポリシー(BFP)を導入する。
目に見えない観察目標ペアが与えられた後、BFPは"アンカー"トレーニングの例を検索し、この親しみやすいアンカーと残留項ととして、目に見えないペアをトランスダクティブに再構成する。
この分解により動作予測が導かれるためには、残余は現在の観測目標対がアンカーとどのように異なるかをコンパクトに符号化し、この差が対応する動作分布の予測値となるようにアンカーを選択する必要がある。
BFPは、事前訓練された視覚的特徴と、新しい学習されたアンカー選択アルゴリズムでこれを達成している。
新たな双線型流は、アンカーと残余がマルチモーダルな作用分布を共同で決定する方法をモデル化する。
適切な仮定の下での双線形流の場合、見知らぬ目標における行動分布誤差は、問題依存因子までの分布内フローマッチング誤差によって境界づけられていることを証明する。
シミュレーションにおける5つの操作タスクのうち、BFPはGCILポリシーの配布成功率の2.63倍、最強の外挿対象ベースラインの1.36倍を達成する。
2つの実世界のタスクにおいて、BFPはGCILよりも32%改善されている。
最後に、我々の理論は、どの訓練済みポリシーがうまく外挿され、どの未確認の目標を達成できるかを予測するための実用的で事前デプロイメント診断をもたらす。
関連論文リスト
- Refinement-based Flow Policy Optimization [6.752424962104772]
Refinement-Based Flow Policy Optimization (RFPO)は、オンライン強化学習におけるフローポリシーをトレーニングするための新しいフレームワークである。
RFPOは、目標分布からの直接サンプルを必要とせず、Q-guidanceをポリシーに組み込む。
RFPOはモード崩壊なしで複雑なマルチモーダル構造を捕捉する。
論文 参考訳(メタデータ) (2026-09-14T06:56:33Z) - Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models [61.74572554094633]
比クリッピングは流れモデルに不適であると主張する。
本稿では,比クリッピングを分岐近位制約に置き換えるFlow-DPPOを提案する。
実験により,フローDPPOはKL近位効率が向上し,高い報酬が得られることが示された。
論文 参考訳(メタデータ) (2026-06-09T15:59:57Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - A Mutual Information Lower Bound for Multimodal Regression Active Learning [9.04041860173466]
Mutual Information Lower Bound (MI-LB) は、Mixture Network アンサンブルのクローズドフォーム近似である。
我々は,MI-LBがマルチモーダルシステムを備えたベンチマークで評価されたベースラインのすべてに一致または打ち勝つことを示す。
論文 参考訳(メタデータ) (2026-05-14T14:50:47Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - SENTINEL: Stagewise Integrity Verification for Pipeline Parallel Decentralized Training [54.8494905524997]
分散トレーニングは、信頼できない、地理的に分散したノードで実行される場合、重大なセキュリティリスクをもたらす。
重複のないパイプライン並列性(PP)トレーニングの検証機構であるSENTINELを提案する。
実験では、モデル収束と性能を維持しながら、最大176人の労働者を持つ信頼できない分散環境における最大4BパラメータLSMのトレーニングを成功させた。
論文 参考訳(メタデータ) (2026-03-03T23:51:10Z) - Binary Flow Matching: Prediction-Loss Space Alignment for Robust Learning [23.616336786063552]
フローマッチングは、生成モデリングの強力なフレームワークとして登場した。
速度に基づく目的と結合した場合に発生する潜在構造ミスマッチを同定する。
信号空間に対する目的の再調整が特異重み付けを排除していることを示す。
論文 参考訳(メタデータ) (2026-02-11T02:02:30Z) - Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies [4.249024052507976]
本稿では, 直接的対象サンプルを使わずに, 拡散・流動モデルの訓練問題に厳密に対処する, 逆流マッチング (RFM) の統一フレームワークを提案する。
逆推論の観点を採用することで、中間雑音サンプルが与えられた後部平均推定問題としてトレーニング対象を定式化する。
このクラスでは,既存の雑音予測法と勾配探索法が2つの具体例であることを示す。
論文 参考訳(メタデータ) (2026-01-13T01:58:24Z) - Inference-Time Alignment for Diffusion Models via Doob's Matching [16.416975860645724]
拡散モデルの推論時間アライメントは,ベーススコアネットワークを再学習することなく,事前学習した拡散モデルを目標分布に適応することを目的としている。
本稿では,Doobの$h$-transformをベースとしたガイダンス推定フレームワークであるDoobのマッチングについて紹介する。
2-ワッサーシュタイン距離における生成分布の非漸近収束を保証する。
論文 参考訳(メタデータ) (2026-01-10T10:28:06Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z) - Predicting Deep Neural Network Generalization with Perturbation Response
Curves [58.8755389068888]
トレーニングネットワークの一般化能力を評価するための新しいフレームワークを提案する。
具体的には,一般化ギャップを正確に予測するための2つの新しい尺度を提案する。
PGDL(Predicting Generalization in Deep Learning)のNeurIPS 2020コンペティションにおけるタスクの大部分について、現在の最先端の指標よりも優れた予測スコアを得る。
論文 参考訳(メタデータ) (2021-06-09T01:37:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。