論文の概要: Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features
- arxiv url: http://arxiv.org/abs/2608.06008v1
- Date: Thu, 06 Aug 2026 13:13:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.766717
- Title: Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features
- Title(参考訳): Adaptive-WAM:中間映像拡散特徴を用いた品質誘導早期実行計画
- Abstract要約: 計画性能はテストされたビデオノイズレベルにはほとんど反応しないが、強い軌道は中間層からすでに復号化されている。
Wan2.2-5Bバックボーン上に構築された品質対応マルチエグジットプランナであるAdaptive-WAMを紹介する。
- 参考スコア(独自算出の注目度): 4.996631858286914
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large video diffusion models provide rich spatiotemporal priors for autonomous driving, but existing world-action models often inherit the cost of iterative future-video generation even though deployment only requires an ego trajectory. We ask a more basic question: how much of a video diffusion model must be executed to make a reliable driving decision? Through a controlled study of video denoising timesteps and Diffusion Transformer (DiT) depth, we find that planning performance is largely insensitive to the tested video-noise levels, whereas strong trajectories can already be decoded from intermediate layers. Based on this observation, we introduce Adaptive-WAM, a quality-aware multi-exit planner built on a Wan2.2-5B backbone. Trajectory diffusion heads are attached to selected DiT blocks, and a lightweight trajectory-quality scorer terminates inference once the best trajectory decoded so far satisfies a quality threshold; otherwise, computation continues from the cached hidden state to a deeper exit. The deployed planner therefore avoids the iterative classifier-free denoising loop and VAE decoding required for future-video synthesis, while dynamically allocating backbone depth according to trajectory quality. On NAVSIM, the adaptive single-trajectory planner achieves 90.8 PDMS; a separate fixed-exit variant reaches 92.6 PDMS with 64 proposals. It further obtains 89.9 EPDMS on NAVSIM v2, yielding the best reported results among the compared front-view video world-model planners. Without target-domain fine-tuning, Adaptive-WAM transfers to nuScenes with 0.88 m average L2 error and a 0.08\% collision rate. On an A100, adaptive routing improves PDMS from 90.62 to 90.79 while averaging 170 ms end-to-end planning latency, approximately 10\% below the 190 ms fixed block-15 planner and 47\% below the 320 ms fixed full-depth planner. Code will be released.
- Abstract(参考訳): 大規模なビデオ拡散モデルは、自律運転に豊富な時空間前兆を提供するが、既存のワールドアクションモデルは、デプロイがエゴ軌道のみを必要とするにもかかわらず、反復的な将来のビデオ生成のコストを継承することが多い。
信頼性の高い運転判断を行うためには、どの程度の動画拡散モデルを実行する必要があるのか?
映像復調時間ステップと拡散変圧器 (DiT) 深度を制御した研究により, 計画性能はテストされたビデオノイズレベルに大きく依存せず, 強い軌道はすでに中間層から復号化されていることがわかった。
本稿では,Wan2.2-5Bバックボーン上に構築された品質対応マルチエグジットプランナであるAdaptive-WAMを紹介する。
選択されたDiTブロックに軌道拡散ヘッドが取り付けられ、これまでデコードされた最良の軌道が品質閾値を満たすと、軽量な軌道品質スコアラが推論を終了する。
そのため、配置したプランナーは、後部骨の深さを軌道品質に応じて動的にアロケートしながら、将来のビデオ合成に必要な繰り返し分類器フリーなデノナイジングループやVAEデコードを避けることができる。
NAVSIMでは、適応的な単軌道プランナーが90.8 PDMSを達成する。
さらに、NAVSIM v2上で89.9 EPDMSを取得し、比較されたフロントビュービデオワールドモデルプランナーの中で最高の報告結果を得た。
ターゲット領域の微調整がなければ、Adaptive-WAM は平均 L2 エラー 0.88m の衝突率 0.08 % の nuScene に転送される。
A100では、適応的なルーティングがPDMSを90.62から90.79に改善し、190msの固定ブロック-15プランナーの約10倍、320msの固定フル深度プランナーの47倍の170msの終端計画遅延を平均化する。
コードはリリースされる。
関連論文リスト
- AlphaRoute: Large Language Models as Semantic Optimizers for Multi-Objective Routing [0.0]
超大規模統合(VLSI)グローバルルーティングは3次元グリッド間の信号ネット割り当てを必要とするNPハード最適化問題である。
従来のオーバーフローは、複雑な混雑トポロジに失敗する静的なペナルティスケジュールに依存しているため、AlphaRouteを提示する。
SHAPをベースとしたオーバーフロー分解法を導入し,3次元迷路ルーティングによる目的部分グラフ抽出を誘導する。
論文 参考訳(メタデータ) (2026-07-22T05:27:55Z) - DRIFT: Drift and Aggregation for Motion Planning [20.309189828710362]
DRIFTは1ステップのドリフトをコンパクトな軌跡空間内でのドリフトとシーン認識型提案アグリゲーションを組み合わせた固定深度軌道プランナーである。
軽量アグリゲーションヘッドはこれらの特徴をシーン、ナビゲーション、エゴステート情報と統合し、最終軌道を直接予測する。
その出力は、専門家軌道の模倣と、乾燥可能なポリゴンの外側のウェイポイントをペナライズする地図由来境界正規化器で訓練されている。
論文 参考訳(メタデータ) (2026-07-16T02:43:13Z) - PARE: Pruning and Adaptive Routing for Efficient Video Generation [71.54959622788608]
ビデオ拡散変換器(DiT)は高品質なビデオを生成するが、広いブロック、深いアーキテクチャ、反復的なサンプリングのためにかなりの計算を必要とする。
最近の手法では、幅、深さ、サンプリングのステップを圧縮することでコストを削減するが、通常は個々の入力に適応できない固定されたアーキテクチャにコミットする。
本稿では,構造対応プルーニングと入力適応ルーティングを併用して,幅と深さを共同で圧縮するPAREを提案する。
論文 参考訳(メタデータ) (2026-05-26T17:43:25Z) - Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers [12.948398661304184]
Diffusion-APOは、ビデオ拡散モデルと人間の意図を一致させる軌跡認識アルゴリズムである。
オンラインランキング、半オンラインアンカー、オフラインリファインメント、蒸留対応ドリフト補正を統合した統一かつモジュール化されたRLHFフレームワークを導入する。
本研究では,Diffusion-APOが視覚的品質と指示の基準線を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-08T09:37:46Z) - HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving [51.268878540511054]
我々は階層的拡散政策を備えたエンドツーエンドの計画フレームワークであるHADを提案する。
我々は,NAVSIMとHUGSIMの両方でHADが新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-04T04:12:47Z) - A Two-stage Transformer Framework for Temporal Localization of Distracted Driver Behaviors [0.0]
ドライバー監視シナリオに適した時間的行動ローカライゼーションフレームワークを開発し,評価する。
我々のアプローチは、ビデオMAEに基づく特徴抽出とAMA(Augmented Self-Mask Attention)検出器を組み合わせた2段階のパイプラインに従う。
実験結果から、モデルキャパシティと効率の明確なトレードオフが明らかになった。
論文 参考訳(メタデータ) (2026-03-22T04:09:47Z) - DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving [65.7087560656003]
エンドツーエンドの自動運転のための生成拡散モデルは、しばしばモード崩壊に悩まされる。
強化学習を利用して低品質モードを制約し,優れた軌道探索を行うDiffusionDriveV2を提案する。
これにより、そのコアであるガウス混合モデル固有の多重モード性を維持しながら、全体的な出力品質が大幅に向上する。
論文 参考訳(メタデータ) (2025-12-08T17:29:52Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z) - Hierarchical Patch Diffusion Models for High-Resolution Video Generation [50.42746357450949]
我々は,階層的な方法で,コンテキスト情報を低スケールから高スケールのパッチに伝播する深層文脈融合を開発する。
また,ネットワーク容量の増大と,粗い画像の細部への演算を行う適応計算を提案する。
得られたモデルは、クラス条件のビデオ生成において66.32の最先端FVDスコアと87.68のインセプションスコアを新たに設定する。
論文 参考訳(メタデータ) (2024-06-12T01:12:53Z) - Consistency Trajectory Models: Learning Probability Flow ODE Trajectory of Diffusion [56.38386580040991]
Consistency Trajectory Model (CTM) は Consistency Models (CM) の一般化である
CTMは、対戦訓練とスコアマッチング損失を効果的に組み合わせることで、パフォーマンスを向上させる。
CMとは異なり、CTMのスコア関数へのアクセスは、確立された制御可能/条件生成メソッドの採用を合理化することができる。
論文 参考訳(メタデータ) (2023-10-01T05:07:17Z) - Optimizing Anchor-based Detectors for Autonomous Driving Scenes [22.946814647030667]
本稿では、自律走行シーンにおける一般的なアンカーベース検出器のモデル改善と推定時間最適化について要約する。
高性能RCNN-RSおよびRetinaNet-RS検出フレームワークに基づいて,群衆シーンの小さな物体をよりよく検出するために,検出器に適応するための一連のフレームワークの改善について検討した。
論文 参考訳(メタデータ) (2022-08-11T22:44:59Z) - StreamYOLO: Real-time Object Detection for Streaming Perception [84.2559631820007]
将来を予測する能力を備えたモデルを提供し、ストリーミング知覚の結果を大幅に改善する。
本稿では,複数の速度を駆動するシーンについて考察し,VasAP(Velocity-Awared streaming AP)を提案する。
本手法は,Argoverse-HDデータセットの最先端性能を実現し,SAPとVsAPをそれぞれ4.7%,VsAPを8.2%改善する。
論文 参考訳(メタデータ) (2022-07-21T12:03:02Z) - Convex Hull Prediction for Adaptive Video Streaming by Recurrent Learning [38.574550778712236]
本稿では,コンテンツ認識凸船体予測の深層学習に基づく手法を提案する。
再帰的畳み込みネットワーク(RCN)を用いて,映像の複雑さを暗黙的に解析し,その凸殻を予測する。
提案するモデルでは, 最適凸殻の近似精度が向上し, 既存の手法と比較して, 競争時間の節約が期待できる。
論文 参考訳(メタデータ) (2022-06-10T05:11:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。