論文の概要: MoCAR: Motion-code Coordinate-aware AutoRegression for Continuous Trajectory Forecasting
- arxiv url: http://arxiv.org/abs/2610.06210v1
- Date: Mon, 05 Oct 2026 12:22:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 17:52:33.684244
- Title: MoCAR: Motion-code Coordinate-aware AutoRegression for Continuous Trajectory Forecasting
- Title(参考訳): MoCAR: 連続軌跡予測のためのモーションコードコーディネート対応オートレグレッション
- Abstract要約: MoCARは、座標対応連続潜時空間における次の符号予測として軌道予測をキャストする。
歴史的動作符号は教師が強制する接頭辞として使用され、将来の符号は自己回帰的に生成される。
MoCARは単純な単一ステージアーキテクチャでトップレベルのパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 12.149955561557528
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive generation is natural for language, where predicted tokens can be directly reused as the next prediction state, but trajectory forecasting lacks such a clean token: motion is continuous, multimodal, and expressed in local coordinate frames that evolve with the predicted trajectory. We present MoCAR (Motion-code Coordinate-aware AutoRegression), a decoder-only framework that casts trajectory forecasting as next-code prediction in a coordinate-aware continuous latent space. MoCAR learns a continuous motion-code space from endpoint-normalized trajectory segments, where each code jointly captures local trajectory geometry and the reference-frame transition induced by that segment. Historical motion codes are used as a teacher-forced prefix, future codes are generated autoregressively under temporal, map, agent, and mode interactions, and predicted codes persist in latent memory while decoded endpoints update the local scene context. This enables rollout without trajectory-space re-tokenization, trajectory queries, goal candidates, or proposal-and-refinement pipelines. On Argoverse (AV) benchmarks, MoCAR achieves top-tier performance with a simple single-stage architecture, transfers strongly from AV2 to AV1 in zero-shot evaluation, and improves on turn-heavy scenarios. Ablations confirm that the learned continuous motion-code space, latent alignment, weak KL regularization, and joint tokenizer-predictor optimization are essential for stable latent autoregression.
- Abstract(参考訳): 自己回帰生成は言語にとって自然なものであり、予測されたトークンを次の予測状態として直接再利用することができるが、軌道予測にはそのようなクリーンなトークンが欠けている: 動きは連続的でマルチモーダルであり、予測された軌道と共に進化する局所座標フレームで表現される。
我々は、座標対応連続潜伏空間において、軌道予測を次コード予測とするデコーダのみのフレームワークであるMotion-code Coordinate-aware AutoRegressionを提案する。
MoCARは、終端正規化された軌道セグメントから連続的なモーションコード空間を学習し、各コードは、そのセグメントによって誘導される局所軌道幾何学と参照フレーム遷移を共同でキャプチャする。
過去の動作コードは教師に強制されたプレフィックスとして使用され、将来のコードは時間的、地図、エージェント、モードの相互作用の下で自動回帰的に生成され、予測されたコードは遅延メモリに保持され、デコードされたエンドポイントはローカルシーンコンテキストを更新する。
これにより、トラジェクトリスペースの再トークン化、トラジェクトリクエリ、ゴール候補、プロポーザル・アンド・リファインメントパイプラインなしでロールアウトできる。
Argoverse(AV)ベンチマークでは、単純な単一ステージアーキテクチャでトップレベルのパフォーマンスを実現し、ゼロショット評価でAV2からAV1に強く移行し、ターンヘビーなシナリオを改善する。
アブレーションは、学習された連続運動符号空間、潜時アライメント、弱いKL正規化、および共振器・予測器最適化が安定な潜時自己回帰に不可欠であることを確認した。
関連論文リスト
- Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - Recall to Predict: Grounding Motion Forecasting in Interpretable Motion Bank [9.873160019979602]
総合的な「モーションバンク」における予測を基盤としたエンドツーエンドの差別化可能なフレームワークを提案する。
空白のスレートから経路を回帰するのではなく、新しいアンカー検索層を用いて動的に明示的な動きを復元する。
提案手法では,Argoverse 2 および Open Motion データセット上での競合するマルチモーダル精度を実現しつつ,標準潜時クエリの "ブラックボックス" を排除している。
論文 参考訳(メタデータ) (2026-05-02T11:31:26Z) - TrajLoom: Dense Future Trajectory Generation from Video [17.78215938363174]
本稿では,過去の映像から将来の軌跡や軌跡を予測するフレームワークを提案する。
最先端手法と比較して,提案手法は24フレームから81フレームまでの予測地平線を延長する。
予測された軌道は、下流のビデオ生成と編集を直接サポートする。
論文 参考訳(メタデータ) (2026-03-23T22:10:58Z) - GC-GAT: Multimodal Vehicular Trajectory Prediction using Graph Goal Conditioning and Cross-context Attention [0.0]
レーングラフに基づく動き予測モデルを提案し、まずまずグラフに基づく目標提案を予測し、その後、複数のコンテキスト要素にまたがってそれらを融合する。
我々はnuScenesの動作予測データセットについて評価し、最先端の結果を得た。
論文 参考訳(メタデータ) (2025-04-15T12:53:07Z) - Bench2Drive-R: Turning Real World Data into Reactive Closed-Loop Autonomous Driving Benchmark by Generative Model [63.336123527432136]
我々は,リアクティブ閉ループ評価を可能にする生成フレームワークであるBench2Drive-Rを紹介する。
既存の自動運転用ビデオ生成モデルとは異なり、提案された設計はインタラクティブなシミュレーションに適したものである。
我々は、Bench2Drive-Rの生成品質を既存の生成モデルと比較し、最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-12-11T06:35:18Z) - AMP: Autoregressive Motion Prediction Revisited with Next Token Prediction for Autonomous Driving [59.94343412438211]
本稿では,GPT方式の次のトークン動作予測を動作予測に導入する。
同種単位-ワードからなる言語データとは異なり、運転シーンの要素は複雑な空間的・時間的・意味的な関係を持つ可能性がある。
そこで本稿では,情報集約と位置符号化スタイルの異なる3つの因子化アテンションモジュールを用いて,それらの関係を捉えることを提案する。
論文 参考訳(メタデータ) (2024-03-20T06:22:37Z) - Think Twice before Driving: Towards Scalable Decoders for End-to-End
Autonomous Driving [74.28510044056706]
既存のメソッドは通常、分離されたエンコーダ-デコーダパラダイムを採用する。
本研究は,この問題を2つの原則で緩和することを目的としている。
まず、エンコーダの特徴に基づいて、粗い将来の位置と行動を予測する。
そして、その位置と動作を条件に、将来のシーンを想像して、それに従って運転した場合にその影響を確認する。
論文 参考訳(メタデータ) (2023-05-10T15:22:02Z) - Learning Spatio-Temporal Transformer for Visual Tracking [108.11680070733598]
本稿では,エンコーダ・デコーダ変換器をキーコンポーネントとする新しいトラッキングアーキテクチャを提案する。
メソッド全体がエンドツーエンドであり、コサインウィンドウやバウンディングボックススムーシングのような後処理ステップは不要である。
提案されたトラッカーは、Siam R-CNNよりも6倍速いリアルタイム速度を実行しながら、5つのチャレンジングな短期および長期ベンチマークで最先端のパフォーマンスを実現します。
論文 参考訳(メタデータ) (2021-03-31T15:19:19Z) - Trajectory saliency detection using consistency-oriented latent codes
from a recurrent auto-encoder [0.0]
軌道は、プログレッシブな動的サリエンシー検出をサポートする最良の方法です。
与えられた文脈に関連する共通の動きパターンを共有する通常の軌跡から逸脱した場合、軌跡は有能である。
本手法は,鉄道駅で取得した歩行者軌跡の公開データセットから得られた複数のシナリオにおいて,既存の手法に勝ることを示す。
論文 参考訳(メタデータ) (2020-12-17T13:29:11Z) - Exploring Dynamic Context for Multi-path Trajectory Prediction [33.66335553588001]
動的コンテキストネットワーク(DCENet)という新しいフレームワークを提案する。
本フレームワークでは,エージェント間の空間的コンテキストを自己注意型アーキテクチャを用いて探索する。
学習した空間的時間的文脈に基づいて、各エージェントに対する将来の軌跡のセットを条件付きで予測する。
論文 参考訳(メタデータ) (2020-10-30T13:39:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。