論文の概要: DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion
- arxiv url: http://arxiv.org/abs/2606.00153v1
- Date: Fri, 29 May 2026 04:56:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.070191
- Title: DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion
- Title(参考訳): DiffCrossGait:潜在拡散による2次元3次元クロスプラットフォーム歩行認識のための軌道レベルアライメント
- Authors: Zhiyang Lu, Ming Cheng,
- Abstract要約: クロスモーダルな2D-3D歩行認識は、2Dシルエットと3D LiDARレンジビュー表現のドメインの相違によって阻害される。
DiffCrossGaitを提案する。これは、同一性関連潜伏拡散空間における軌跡レベルのアライメントとして、クロスモーダルマッチングを再構成する。
- 参考スコア(独自算出の注目度): 5.766298616867406
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-modal 2D-3D gait recognition is impeded by inherent domain discrepancies between 2D silhouette and 3D LiDAR range-view representations. While prior methods align only final embeddings, we propose DiffCrossGait, which reformulates cross-modal matching as trajectory-level alignment in an identity-relevant latent diffusion space, rather than assuming full equivalence between 2D and 3D observations. By driving both modalities with shared Gaussian noise within a latent space, we enable continuous alignment throughout the generative evolution. We introduce a Tri-Phase Alignment Strategy that exploits varying noise intensities to enforce identity anchoring, dynamics consistency, and cross-modal structural recoverability, thereby constraining both modalities to share denoising dynamics and bottleneck structure, which promotes modality-invariant gait features. Crucially, our framework decouples generative alignment from the discriminative backbone; the diffusion mechanism serves exclusively as a training objective, ensuring high inference efficiency by eliminating the computational overhead of iterative denoising. Extensive experiments on the SUSTech1K and FreeGait benchmarks demonstrate that DiffCrossGait achieves state-of-the-art performance.
- Abstract(参考訳): クロスモーダルな2D-3D歩行認識は、2Dシルエットと3D LiDARレンジビュー表現のドメインの相違によって阻害される。
DiffCrossGaitは,2次元と3次元の観測の完全同値性を仮定するよりも,個人性関連潜伏拡散空間における軌道レベルのアライメントとして,クロスモーダルマッチングを再構成する。
両方のモダリティを共振空間内で共有ガウスノイズで駆動することにより、生成的進化を通して連続的なアライメントを可能にする。
本稿では, 雑音強度の多様さを活用し, 同一性アンカー, ダイナミックス一貫性, クロスモーダルな構造回復性を実現し, 両モードの両モードを制約し, 偏極力学とボトルネック構造を共用し, モダリティ不変の歩行特性を促進させる手法を提案する。
この拡散機構は, 反復的復調の計算オーバーヘッドを排除し, 高い推論効率を確保するために, 学習目標としてのみ有効である。
SUSTech1KとFreeGaitベンチマークの大規模な実験は、DiffCrossGaitが最先端のパフォーマンスを達成することを示した。
関連論文リスト
- Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection [2.08058961865456]
ゼロショット3D異常検出は、ターゲットカテゴリからのトレーニングデータにアクセスすることなく、異常を識別することを目的としている。
既存の手法は主に幾何学的手がかりを主に捉える多視点表現に3D観測を投影することに依存している。
本稿では,補助カテゴリからのRGBモダリティをクロスモーダルガイダンスとして活用する2段階統合フレームワークAlign3D-ADを提案する。
論文 参考訳(メタデータ) (2026-05-07T08:24:44Z) - Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo [54.58078274676216]
イベントカメラは、そのような制限を伴わない高ダイナミックレンジの代替視覚表現を提供する。
本稿では, Bi-CMPStereoについて紹介する。
提案手法は,対象の標準空間内のステレオ表現を微調整し,各モダリティをイベント領域とフレーム領域の両方に投影することにより相補表現を統合する。
論文 参考訳(メタデータ) (2026-04-16T17:59:58Z) - Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model [62.889356203346985]
本稿では,モダリティ競合を処理する世界モデル拡張VLAフレームワークである Dual-STream diffusion (DUST) を提案する。
DUSTは標準のVLAベースラインと暗黙のワールドモデリングメソッドよりも最大6%向上する。
Franka Research 3による実世界のタスクでは、DUSTは成功率のベースラインを13%上回っている。
論文 参考訳(メタデータ) (2025-10-31T16:32:12Z) - WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance [17.295532380360992]
WorldForgeは3つの密結合モジュールからなるトレーニング不要の推論時間フレームワークである。
我々のフレームワークはプラグアンドプレイとモデル非依存であり、様々な3D/4Dタスクに適用可能である。
論文 参考訳(メタデータ) (2025-09-18T16:40:47Z) - TrajDiff: Diffusion Bridge Network with Semantic Alignment for Trajectory Similarity Computation [39.42796455901991]
そこで我々はTrajDiffという新しい軌道類似性計算フレームワークを提案する。
具体的には、TrajDiffは、アダプティブフュージョンを備えたクロスアテンションとアテンションスコアマスク機構に依存している。
3つの公開データセットに対する大規模な実験は、TrajDiffが一貫して最先端のベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-06-18T21:52:07Z) - Learning to Align and Refine: A Foundation-to-Diffusion Framework for Occlusion-Robust Two-Hand Reconstruction [50.952228546326516]
単眼画像からの両手再建は、複雑でダイナミックな手の位置が原因で、永続的な課題に直面している。
既存のアプローチはそのようなアライメントの問題に悩まされ、しばしば不整合と侵入の成果物をもたらす。
本稿では,視覚基礎モデルからの2次元事前ガイダンスを正確に整合させる2段階のファンデーション・ツー・ディフュージョンフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-22T14:42:27Z) - A Lesson in Splats: Teacher-Guided Diffusion for 3D Gaussian Splats Generation with 2D Supervision [65.33043028101471]
本稿では,2次元監視のみを用いた3次元画像調和拡散モデルの学習フレームワークを提案する。
既存の3D生成モデルは、大規模な3Dデータセットが不足しているため、完全に3Dの監視に依存している。
論文 参考訳(メタデータ) (2024-12-01T00:29:57Z) - Exploring Latent Cross-Channel Embedding for Accurate 3D Human Pose
Reconstruction in a Diffusion Framework [6.669850111205944]
単眼の3次元ポーズ推定は、2Dから3Dへの再投射過程で生じる固有の深さの曖昧さによって重要な課題を提起する。
拡散モデルの最近の進歩は、再投射のあいまいさに対処するために構造的事前を組み込むことが約束されている。
本稿では,3次元座標の接合レベル特徴と2次元投影との相関関係の解明を目的とした,新しいクロスチャネル埋め込みフレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-18T09:53:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。