論文の概要: Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models
- arxiv url: http://arxiv.org/abs/2607.10781v1
- Date: Sun, 12 Jul 2026 14:17:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.528291
- Title: Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models
- Title(参考訳): エネルギーガイダンスは必要か? 世界モデル駆動のためのトレーニングフリーノームインジェクション
- Authors: Xiyan Su, Frank Diermeyer, Markus Lienkamp,
- Abstract要約: 大きなビデオ拡散バックボーン上に構築されたドライビングワールドモデルは、現実的なシーンを生成するが、制御が難しい。
我々は, Open-Sora 2.0 MM-DiT のバックボーン上に構築された世界モデルを, サンプリング時にエネルギー誘導を注入することにより, 対物目標のブレーキに操舵できることを実証した。
生成したビデオは、後骨の関節の自覚を通して、まだ操舵軌跡をたどっていないことが判明した。
- 参考スコア(独自算出の注目度): 5.2605916208792225
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Driving world models built on large video-diffusion backbones generate realistic scenes but are hard to control: enforcing a traffic norm typically means retraining the backbone or conditioning it on hand-built layouts. We ask whether controllability requires training at all. Our experiment shows that a rectified-flow driving world model, which jointly generates future video and a planned ego trajectory, can have its planned trajectory steered entirely at sampling time by differentiable energy functions that encode driving norms, without knowledge-specific retraining of the diffusion backbone. Concretely, we demonstrate that a world model built on Open-Sora 2.0 MM-DiT backbone can be steered to brake at a counterfactual target by injecting energy guidance at sampling time. However, we find that the generated video does not yet follow the steered trajectory through the backbone's joint self-attention and identify the cross-stream coupling as a crucial requirement for end-to-end-controllable rollouts.
- Abstract(参考訳): 大きなビデオ拡散バックボーン上に構築されたドライビングワールドモデルは、現実的なシーンを生成するが、制御が難しい。
制御性にはトレーニングがまったく必要かどうかを問う。
実験により,将来的なビデオとエゴ軌道を共同で生成する修正フロー駆動世界モデルにおいて,その計画された軌道を,拡散バックボーンの知識に依存せず,駆動ノルムを符号化する微分可能エネルギー関数によって,サンプリング時に完全に制御できることが示唆された。
具体的には,Open-Sora 2.0 MM-DiTのバックボーン上に構築された世界モデルを用いて,サンプリング時にエネルギー誘導を注入することにより,非現実的ターゲットでのブレーキを制御できることを実証する。
しかし, 生成したビデオは, 後骨の関節の自己注意を通した操舵軌道をまだ追随していないことが判明し, クロスストリーム結合をエンド・ツー・エンド・コントロール可能なロールアウトの必須条件として同定した。
関連論文リスト
- UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation [23.675212404889805]
世界行動モデル(WAM)は、自律運転における行動一般化を改善する強力な可能性を示している。
既存のカスケードまたはデュアルDiTは、アクション予測からビデオイマジネーションを分離する。
マスク変調トランス上に構築された統合ビデオアクションモデルであるUNIVERSEを提案する。
論文 参考訳(メタデータ) (2026-07-06T14:18:18Z) - DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving [19.231942908215174]
本稿では、事前学習したビデオ拡散変換器を自己回帰型ビデオアクションポリシーに適応させる駆動ワールドアクションモデルDriveWAMを提案する。
DriveWAMは、ビデオストリームとアクションストリームを統合された時間トークンシーケンスに編成し、それらをジョイントフローマッチングの目的の下でトレーニングする。
NAVSIMとPhysicalAI-Autonomous-Vehiclesベンチマークの実験は、DriveWAMが強力な計画性能を発揮することを示している。
論文 参考訳(メタデータ) (2026-05-27T14:36:26Z) - MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving [62.43744546817599]
視覚言語-アクション(VLA)モデルは、エンドツーエンドのモーションプランナーとして有効であるが、クローズドループ設定で評価すると不安定である。
本稿では, VLAモデルの潜在空間における動的駆動シナリオの, リアクティブでマルチエージェントなロールアウトのための新しいフレームワークMAPLEを提案する。
MAPLEはBench2Driveで最先端の駆動性能を実現し、堅牢なE2E自動運転システムのためのスケーラブルでクローズループなマルチエージェントプレイを実演する。
論文 参考訳(メタデータ) (2026-05-13T23:35:14Z) - DriveVA: Video Action Models are Zero-Shot Drivers [23.675212404889805]
現実のシナリオは目に見えない条件下での堅牢なパフォーマンスを必要とするため、一般化は自動運転における中心的な課題である。
近年のワールドモデルに基づく計画手法は、シーン理解とマルチモーダルな将来予測において強力な能力を示している。
本稿では,新しい自律運転世界モデルであるDriveVAを提案する。
論文 参考訳(メタデータ) (2026-04-05T17:43:16Z) - MAD: Motion Appearance Decoupling for efficient Driving World Models [94.40548866741791]
本稿では,一般的な映像モデルを制御可能な運転世界モデルに変換する,効率的な適応フレームワークを提案する。
鍵となるアイデアは、外見合成からモーションラーニングを分離することである。
私たちのMAD-LTXモデルであるLTXへのスケーリングは、すべてのオープンソース競合より優れています。
論文 参考訳(メタデータ) (2026-01-14T12:52:23Z) - WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance [17.295532380360992]
WorldForgeは3つの密結合モジュールからなるトレーニング不要の推論時間フレームワークである。
我々のフレームワークはプラグアンドプレイとモデル非依存であり、様々な3D/4Dタスクに適用可能である。
論文 参考訳(メタデータ) (2025-09-18T16:40:47Z) - Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention [61.3281618482513]
高品質なマルチビュー駆動ビデオの合成を目的とした,新しいネットワークであるCogDrivingについて紹介する。
CogDriving は Diffusion Transformer アーキテクチャと holistic-4D attention module を活用し、次元間の同時結合を可能にする。
CogDrivingは、nuScenesバリデーションセットで強力なパフォーマンスを示し、FVDスコア37.8を達成し、リアルなドライビングビデオを生成する能力を強調している。
論文 参考訳(メタデータ) (2024-12-04T18:02:49Z) - Trace and Pace: Controllable Pedestrian Animation via Guided Trajectory
Diffusion [83.88829943619656]
本研究では,現実的な歩行者軌跡生成手法と,ユーザ定義目標を達成するために制御可能なフルボディアニメーションを提案する。
我々のガイド付き拡散モデルでは,対象とする経路,速度,特定社会集団による軌道の制約が可能である。
本稿では,アニメーションコントローラのRLトレーニング中に学習した値関数を用いて,拡散を誘導し,特定のシナリオに適した軌道を生成することを提案する。
論文 参考訳(メタデータ) (2023-04-04T15:46:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。