論文の概要: Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- arxiv url: http://arxiv.org/abs/2512.01809v2
- Date: Fri, 05 Dec 2025 21:56:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-09 13:50:38.455386
- Title: Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- Title(参考訳): 騒音をよく聞く: 生成的ロボット制御の神話を解き放つ
- Abstract要約: 我々は、一般的な行動クローニングベンチマークに基づいて、一般的な生成制御ポリシー(GCP)を評価する。
GCPは、マルチモダリティを捉えたり、より複雑な観察から行動へのマッピングを表現する能力にその成功を負わないことが分かりました。
この結果から,GCPの分布適合成分は一般的に信じられているほど健全ではないことが示唆された。
- 参考スコア(独自算出の注目度): 26.71643888212995
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative models, like flows and diffusions, have recently emerged as popular and efficacious policy parameterizations in robotics. There has been much speculation as to the factors underlying their successes, ranging from capturing multi-modal action distribution to expressing more complex behaviors. In this work, we perform a comprehensive evaluation of popular generative control policies (GCPs) on common behavior cloning (BC) benchmarks. We find that GCPs do not owe their success to their ability to capture multi-modality or to express more complex observation-to-action mappings. Instead, we find that their advantage stems from iterative computation, as long as intermediate steps are supervised during training and this supervision is paired with a suitable level of stochasticity. As a validation of our findings, we show that a minimum iterative policy (MIP), a lightweight two-step regression-based policy, essentially matches the performance of flow GCPs, and often outperforms distilled shortcut models. Our results suggest that the distribution-fitting component of GCPs is less salient than commonly believed, and point toward new design spaces focusing solely on control performance. Project page: https://simchowitzlabpublic.github.io/much-ado-about-noising-project/
- Abstract(参考訳): フローや拡散のような生成モデルは、最近、ロボット工学において人気があり、効果的なポリシーパラメータ化として現れている。
成功の背景には、マルチモーダルな行動分布の取得からより複雑な振る舞いの表現まで、多くの憶測がある。
本研究では,共通行動クローニング(BC)ベンチマークを用いて,一般的な生成制御ポリシ(GCP)を包括的に評価する。
GCPは、マルチモダリティを捉えたり、より複雑な観察から行動へのマッピングを表現する能力にその成功を負わないことが分かりました。
その代わりに、トレーニング中に中間ステップが監督され、この監視が適切な確率レベルとペアリングされる限り、それらの利点は反復計算に起因していることが分かる。
この結果の検証として,2段階回帰に基づく軽量なポリシーである最小反復ポリシー (MIP) がフローGCPの性能と本質的に一致し,蒸留ショートカットモデルを上回る結果が得られた。
この結果から,GCPの分布適合成分は一般的に信じられているほど健全ではないことが示唆され,制御性能にのみ焦点をあてた新しい設計空間をめざす。
プロジェクトページ:https://simchowitzlabpublic.github.io/much-ado-about-noising-project/
関連論文リスト
- Large Discrete Policy: Advancing Explicit Behavior Modeling with Stochastic Iterative Scoring [77.17706435067372]
大規模ポリシー(LDiP)は、物理的に妥当な候補の大きな語彙から行動を選択する、完全に独立した行動モデリングフレームワークである。
摂動作用ではなく、LDiPは反復的なスコアリングによって表現性を向上する。
エンド・ツー・エンドの計画、クローズドループ・ドライブ、ロボット操作、ビジョン・ランゲージ・アクション・セッティングを通じて、LDiPは強い離散的かつ連続的なベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-09-07T05:12:52Z) - Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? [78.81308700607651]
アクションチャンキングは単一のアクションではなく、複数のアクションを予測し、実行する。
非マルコフ表現率の増大と、マルコフポリシーと比較して複合誤差の低減による作用チャンキングの利点が示された。
本稿では,アンサンブルを明示的にインスタンス化することで,アクションチャンキングのメリットを増幅するポリシークラスを提案する。
論文 参考訳(メタデータ) (2026-08-03T17:32:45Z) - Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs [53.412166189410904]
低ランクマルコフ決定過程(MDPs)の下で広く採用されているRLオーラクルの階層を確立するために,教師付き学習を計算プロキシとして利用する。
本研究の目的は,政策評価にのみ依存する新しい楽観的アクター批判アルゴリズムを提案することである。
提案アルゴリズムは,従来の計算コストの高い計画や最適化オーラクルを回避しつつ,既存のサンプル複雑度保証よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-02T04:46:54Z) - Step-level Optimization for Efficient Computer-use Agents [51.29573359027217]
我々は、強力なコンピュータ利用エージェントは、実際は高価で遅いと論じている。
本稿では,コンピュータ利用エージェントのためのイベント駆動ステップレベルカスケードを提案する。
論文 参考訳(メタデータ) (2026-04-29T19:59:36Z) - Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate [16.68699018207298]
大規模言語モデル(LLM)における推論を改善するためのマルチエージェントの議論が示されている。
2段階の微調整パイプラインを通して,マルチエージェントの議論を単一のLLMに蒸留するフレームワークを開発した。
内部化モデルは、最大93%のトークンを使用して、明示的なマルチエージェントの議論パフォーマンスにマッチするか、超過します。
論文 参考訳(メタデータ) (2026-04-27T18:06:03Z) - PPGuide: Steering Diffusion Policies with Performance Predictive Guidance [28.698103923760172]
PPGuideは、事前訓練された拡散ポリシーを、推論時に障害モードから切り離す。
注意ベースのマルチインスタンス学習を使用して、ポリシーのロールアウトからどの観察-アクションチャンクが成功か失敗かを自動的に見積もる。
提案したPPGuideを,RobomimicベンチマークとMimicGenベンチマークから,さまざまなタスクセットで検証した。
論文 参考訳(メタデータ) (2026-03-11T17:10:16Z) - Agentic Test-Time Scaling for WebAgents [65.5178428849495]
CATTS(Confidence-Aware Test-Time Scaling)を提案する。
CATTSは、WebArena-LiteとGoBrowseのパフォーマンスをReact上で最大9.1%改善し、均一なスケーリングよりも最大2.3倍少ないトークンを使用する。
論文 参考訳(メタデータ) (2026-02-12T18:58:30Z) - Emergent temporal abstractions in autoregressive models enable hierarchical reinforcement learning [61.380634253724594]
次トーケン予測に基づく大規模自己回帰モデルの構築と強化学習(RL)による微調整
自己回帰モデルの内部表現を動作させ,探索することにより,この問題を克服できることを示す。
論文 参考訳(メタデータ) (2025-12-23T18:51:50Z) - Scalable Offline Model-Based RL with Action Chunks [60.80151356018376]
モデルに基づく強化学習が、オフラインRLにおける複雑で長期のタスクに対処するためのスケーラブルなレシピを提供するかどうかを検討する。
我々はこのレシピを textbfModel-based RL with Action Chunks (MAC) と呼ぶ。
MAC はオフラインモデルベース RL アルゴリズムの中で,特に長期的タスクにおいて,最高の性能を発揮することを示す。
論文 参考訳(メタデータ) (2025-12-08T23:26:29Z) - Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking [29.920087317401396]
ジェネレーティブ・ビヘイビア・クローン(Generative Behavior Cloning)は、ロボット学習のためのシンプルで効果的なフレームワークである。
拡散政策の一貫性と反応性を高めるための2つの新しい手法を提案する。
提案手法は,多種多様なシミュレーションおよび実世界のロボット操作タスクにおいて,GBCの性能を大幅に向上させる。
論文 参考訳(メタデータ) (2025-10-14T11:16:34Z) - Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition [52.232968183793986]
General Policy Composition (GPC) は、複数の事前学習されたポリシーの分布スコアを組み合わせることで、パフォーマンスを向上させる訓練のない手法である。
GPCは、さまざまなタスクセットにおけるパフォーマンスと適応性を一貫して改善します。
論文 参考訳(メタデータ) (2025-10-01T16:05:53Z) - GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning [34.25769740497309]
GenPOは、正確な拡散反転を利用して、可逆なアクションマッピングを構築する、生成ポリシー最適化フレームワークである。
GenPOは、大規模な並列化トレーニングと実世界のロボット展開の可能性を解き放ち、拡散ポリシーをオンプレミスのRLにうまく統合する最初の方法である。
論文 参考訳(メタデータ) (2025-05-24T15:57:07Z) - IMLE Policy: Fast and Sample Efficient Visuomotor Policy Learning via Implicit Maximum Likelihood Estimation [3.7584322469996896]
IMLEポリシーは、Implicit Maximum Likelihood Estimation (IMLE)に基づく新しい行動クローニング手法である
複雑なマルチモーダルな振る舞いを学ぶ上で、ベースラインメソッドのパフォーマンスに合わせるために、最小限のデモから効果的に学習し、平均で38%のデータを必要とします。
シミュレーションおよび実環境における多様な操作タスクに対するアプローチを検証し、データ制約下で複雑な振る舞いをキャプチャする能力を示す。
論文 参考訳(メタデータ) (2025-02-17T23:22:49Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - Distributionally Robust Models with Parametric Likelihood Ratios [123.05074253513935]
3つの単純なアイデアにより、より広いパラメトリックな確率比のクラスを用いてDROでモデルを訓練することができる。
パラメトリック逆数を用いてトレーニングしたモデルは、他のDROアプローチと比較して、サブポピュレーションシフトに対して一貫して頑健であることがわかった。
論文 参考訳(メタデータ) (2022-04-13T12:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。