Fugu-MT 論文翻訳(概要): WcDT: World-centric Diffusion Transformer for Traffic Scene Generation

論文の概要: WcDT: World-centric Diffusion Transformer for Traffic Scene Generation

arxiv url: http://arxiv.org/abs/2404.02082v3
Date: Fri, 04 Oct 2024 01:10:29 GMT
ステータス: 翻訳完了
システム内更新日: 2024-12-03 19:03:41.657575
Title: WcDT: World-centric Diffusion Transformer for Traffic Scene Generation
Title（参考訳）: WcDT:交通シーン生成のための世界中心拡散変圧器
Authors: Chen Yang, Yangfan He, Aaron Xuxiang Tian, Dong Chen, Jianhui Wang, Tianyu Shi, Arsalan Heydarian,
Abstract要約: 本稿では,拡散確率モデルと変圧器の相補的強度を利用して,自律走行軌道生成のための新しい手法を提案する。提案するフレームワークは,WcDT(World-Centric Diffusion Transformer)と呼ばれ,軌道生成過程全体を最適化する。提案手法は,現実的かつ多様な軌道を生成する上で,優れた性能を示すことを示す。
参考スコア（独自算出の注目度）: 13.616763172038846
License: http://creativecommons.org/licenses/by/4.0/
Abstract: In this paper, we introduce a novel approach for autonomous driving trajectory generation by harnessing the complementary strengths of diffusion probabilistic models (a.k.a., diffusion models) and transformers. Our proposed framework, termed the "World-Centric Diffusion Transformer"(WcDT), optimizes the entire trajectory generation process, from feature extraction to model inference. To enhance the scene diversity and stochasticity, the historical trajectory data is first preprocessed into "Agent Move Statement" and encoded into latent space using Denoising Diffusion Probabilistic Models (DDPM) enhanced with Diffusion with Transformer (DiT) blocks. Then, the latent features, historical trajectories, HD map features, and historical traffic signal information are fused with various transformer-based encoders that are used to enhance the interaction of agents with other elements in the traffic scene. The encoded traffic scenes are then decoded by a trajectory decoder to generate multimodal future trajectories. Comprehensive experimental results show that the proposed approach exhibits superior performance in generating both realistic and diverse trajectories, showing its potential for integration into automatic driving simulation systems. Our code is available at \url{https://github.com/yangchen1997/WcDT}.
Abstract（参考訳）: 本稿では,拡散確率モデル(拡散モデル)と変圧器の相補的強度を利用して,自律走行軌道生成のための新しいアプローチを提案する。 We proposed framework, called the "World-Centric Diffusion Transformer" (WcDT)。シーンの多様性と確率性を高めるため、過去の軌跡データをまず"Agent Move Statement"に前処理し、Diffusion with Transformer (DiT)ブロックで拡張したDenoising Diffusion Probabilistic Models (DDPM)を用いて遅延空間に符号化する。そして、遅延特徴、履歴軌跡、HDマップ特徴、および過去の交通信号情報を様々なトランスフォーマーベースのエンコーダで融合させ、交通シーンにおけるエージェントと他の要素との相互作用を強化する。符号化されたトラフィックシーンは、トラジェクトリデコーダによってデコードされ、マルチモーダルな将来のトラジェクトリを生成する。総合的な実験結果から,提案手法は現実的かつ多様な軌道を生成する上で優れた性能を示し,自動走行シミュレーションシステムへの統合の可能性を示している。私たちのコードは \url{https://github.com/yangchen 1997/WcDT} で利用可能です。

関連論文リスト

Future Optical Flow Prediction Improves Robot Control & Video Generation [100.87884718953099]
本稿では,VLM(Vision-Language Model)と拡散アーキテクチャを組み合わせた新しい光フロー予測モデルFOFPredを紹介する。我々のモデルは、高度にスケーラブルだが非構造化のソースである、Webスケールの人間活動データに基づいて訓練されている。言語駆動設定下でのロボット操作とビデオ生成による評価は、FOFPredのクロスドメインの汎用性を確立する。
論文参考訳（メタデータ） (2026-01-15T18:49:48Z)
InfGen: Scenario Generation as Next Token Group Prediction [49.54222089551598]
InfGenは、エージェント状態とトラジェクトリを自動回帰的に出力するシナリオ生成フレームワークである。実験により、InfGenは現実的で多様性があり、適応的な交通行動を生み出すことが示された。
論文参考訳（メタデータ） (2025-06-29T16:18:32Z)
VideoGAN-based Trajectory Proposal for Automated Vehicles [1.693200946453174]
本稿では,鳥眼視(BEV)の交通シナリオのビデオに基づいて訓練された生成ネットワーク(GAN)が,統計的に正確な軌跡を生成できるかどうかを検討する。そこで本研究では,ビデオ生成モデルのトレーニングデータとして,低解像度のBEV占有グリッドビデオを使用するパイプラインを提案する。我々は,20ms未満の推論時間で,100GPU時間以内のトレーニングで最高の結果を得た。
論文参考訳（メタデータ） (2025-06-19T10:57:44Z)
TransDiffuser: End-to-end Trajectory Generation with Decorrelated Multi-modal Representation for Autonomous Driving [16.338107803841257]
エンド・ツー・エンドの自律運転のためのエンコーダ・デコーダに基づく生成軌道計画モデルであるTransDiffuserを提案する。 TransDiffuserはNAVSIMベンチマークで94.85のPDMSを達成した。
論文参考訳（メタデータ） (2025-05-14T12:10:41Z)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [56.424032454461695]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。 Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。 Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文参考訳（メタデータ） (2025-03-25T15:19:56Z)
TIDE : Temporal-Aware Sparse Autoencoders for Interpretable Diffusion Transformers in Image Generation [34.73820805875123]
TIDE (Temporal-aware Sparse Autoencoders for Interpretable Diffusion transformErs) は,DiTアクティベーション層内の時間的再構築を段階的に促進する新しいフレームワークである。 TIDEはスパースオートエンコーダ(SAE)とスパースボトルネック層を使用して、解釈可能かつ階層的な特徴を抽出する。提案手法は,1e-3の平均2乗誤差(MSE)とコサイン類似度(0.97。
論文参考訳（メタデータ） (2025-03-10T08:35:51Z)
ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer [95.80384464922147]
ACDiTはブロックワイド条件拡散変換器である。トークン単位の自己回帰とフルシーケンス拡散のフレキシブルな関係を提供する。本稿では,映像生成タスクにおける自己回帰ベースラインの中で,ACDiTが最良であることを示す。
論文参考訳（メタデータ） (2024-12-10T18:13:20Z)
DragTraffic: Interactive and Controllable Traffic Scene Generation for Autonomous Driving [10.90477019946728]
DragTrafficは、条件付き拡散に基づく、汎用的でインタラクティブで制御可能なトラフィックシーン生成フレームワークである。我々は回帰モデルを用いて、一般的な初期解と条件拡散モデルに基づく改良プロセスを提供し、多様性を保証する。実世界の運転データセットの実験によると、DragTrafficは信頼性、多様性、自由度で既存の手法より優れている。
論文参考訳（メタデータ） (2024-04-19T04:49:28Z)
SceneDM: Scene-level Multi-agent Trajectory Generation with Consistent Diffusion Models [10.057312592344507]
本研究では,SceneDMと呼ばれる拡散モデルに基づく新しいフレームワークを提案する。 SceneDMはSim Agents Benchmarkで最先端の結果を得る。
論文参考訳（メタデータ） (2023-11-27T11:39:27Z)
A Diffusion-Model of Joint Interactive Navigation [14.689298253430568]
本稿では,交通シナリオを生成する拡散に基づくDJINNを提案する。我々のアプローチは、過去、現在、未来からのフレキシブルな状態観察のセットに基づいて、全てのエージェントの軌跡を共同で拡散させる。本稿では,DJINNが様々な条件分布からの直接的テスト時間サンプリングを柔軟に行う方法を示す。
論文参考訳（メタデータ） (2023-09-21T22:10:20Z)
Complexity Matters: Rethinking the Latent Space for Generative Modeling [65.64763873078114]
生成的モデリングにおいて、多くの成功したアプローチは、例えば安定拡散のような低次元の潜在空間を利用する。本研究では, モデル複雑性の観点から潜在空間を再考することにより, 未探索の話題に光を当てることを目的としている。
論文参考訳（メタデータ） (2023-07-17T07:12:29Z)
Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion [88.45326906116165]
運動不確定性拡散(MID)の逆過程として軌道予測タスクを定式化する新しい枠組みを提案する。我々は,履歴行動情報と社会的相互作用を状態埋め込みとしてエンコードし,トランジトリの時間的依存性を捉えるためにトランスフォーマーに基づく拡散モデルを考案する。スタンフォード・ドローンやETH/UCYデータセットなど,人間の軌道予測ベンチマーク実験により,本手法の優位性を実証した。
論文参考訳（メタデータ） (2022-03-25T16:59:08Z)
Domain Generalization for Vision-based Driving Trajectory Generation [9.490923738117772]
都市環境における自律走行車のための視覚に基づく走行軌道生成のための領域一般化手法を提案する。逆学習手法を用いて、軌道生成器をデコーダとして訓練する。本稿では,提案手法と最新トラジェクトリ生成法,および最近の領域一般化法との比較を行った。
論文参考訳（メタデータ） (2021-09-22T07:49:07Z)
PnP-DETR: Towards Efficient Visual Analysis with Transformers [146.55679348493587]
近年、DeTRはトランスフォーマーを用いたソリューションビジョンタスクの先駆者であり、画像特徴マップを直接オブジェクト結果に変換する。最近の変圧器を用いた画像認識モデルとTTは、一貫した効率向上を示す。
論文参考訳（メタデータ） (2021-09-15T01:10:30Z)
Multi-Modal Fusion Transformer for End-to-End Autonomous Driving [59.60483620730437]
画像表現とLiDAR表現を注目で統合する,新しいマルチモードフュージョントランスフォーマであるTransFuserを提案する。本手法は, 衝突を76%低減しつつ, 最先端駆動性能を実現する。
論文参考訳（メタデータ） (2021-04-19T11:48:13Z)
TransMOT: Spatial-Temporal Graph Transformer for Multiple Object Tracking [74.82415271960315]
映像内の物体間の空間的・時間的相互作用を効率的にモデル化するソリューションであるTransMOTを提案する。 TransMOTは従来のTransformerよりも計算効率が高いだけでなく、トラッキング精度も向上している。提案手法は、MOT15、MOT16、MOT17、MOT20を含む複数のベンチマークデータセット上で評価される。
論文参考訳（メタデータ） (2021-04-01T01:49:05Z)
Spatial-Channel Transformer Network for Trajectory Prediction on the Traffic Scenes [2.7955111755177695]
本稿では,注意機能付き軌道予測のための空間チャネル変換器ネットワークを提案する。エージェント間の社会的相互作用を測定するために、チャネルワイズモジュールが挿入される。このネットワークは,交通現場における実世界の軌道予測データセットにおいて,有望な結果が得られることがわかった。
論文参考訳（メタデータ） (2021-01-27T15:03:42Z)
Haar Wavelet based Block Autoregressive Flows for Trajectories [129.37479472754083]
歩行者等の軌道予測は,自律型エージェントの性能向上に不可欠である。本稿では分割結合を利用した新しいハールウェーブレットに基づくブロック自己回帰モデルを提案する。実世界の2つのデータセット上で、多種多様な正確な軌跡を生成するアプローチの利点について説明する。
論文参考訳（メタデータ） (2020-09-21T13:57:10Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。