論文の概要: VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
- arxiv url: http://arxiv.org/abs/2604.12159v1
- Date: Tue, 14 Apr 2026 00:35:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 19:11:32.171112
- Title: VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
- Title(参考訳): VidTAG:グローバルスケールでのシークエンス予測によるGPS位置情報対応ビデオ
- Authors: Parth Parag Kulkarni, Rohit Gupta, Prakash Chandra Chhipa, Mubarak Shah,
- Abstract要約: ビデオジオローカライゼーションの課題は、ビデオの起源の正確なGPS座標を決定し、その軌跡をマッピングすることである。
自己教師機能と言語対応機能の両方を用いてフレーム・ツー・GPS検索を行う,デュアルエンコーダ・フレームワークであるVidTAGを提案する。
提案手法は,ビデオの微粒化を可能とし,今後の研究の基盤となる。
- 参考スコア(独自算出の注目度): 46.71012068113612
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The task of video geolocalization aims to determine the precise GPS coordinates of a video's origin and map its trajectory; with applications in forensics, social media, and exploration. Existing classification-based approaches operate at a coarse city-level granularity and fail to capture fine-grained details, while image retrieval methods are impractical on a global scale due to the need for extensive image galleries which are infeasible to compile. Comparatively, constructing a gallery of GPS coordinates is straightforward and inexpensive. We propose VidTAG, a dual-encoder framework that performs frame-to-GPS retrieval using both self-supervised and language-aligned features. To address temporal inconsistencies in video predictions, we introduce the TempGeo module, which aligns frame embeddings, and the GeoRefiner module, an encoder-decoder architecture that refines GPS features using the aligned frame embeddings. Evaluations on Mapillary (MSLS) and GAMa datasets demonstrate our model's ability to generate temporally consistent trajectories and outperform baselines, achieving a 20% improvement at the 1 km threshold over GeoCLIP. We also beat current State-of-the-Art by 25% on global coarse grained video geolocalization (CityGuessr68k). Our approach enables fine-grained video geolocalization and lays a strong foundation for future research. More details on the project webpage: https://parthpk.github.io/vidtag_webpage/
- Abstract(参考訳): ビデオジオローカライゼーションの課題は、ビデオの起源の正確なGPS座標を決定し、その軌道をマッピングすることである。
既存の分類に基づくアプローチは、都市レベルの粗い粒度で運用されており、細かな詳細を把握できないが、画像検索手法は、コンパイルが不可能な広範な画像ギャラリーを必要とするため、グローバルスケールでは実用的ではない。
対照的に、GPS座標のギャラリーの構築は簡単で安価である。
自己教師機能と言語対応機能の両方を用いてフレーム・ツー・GPS検索を行う,デュアルエンコーダ・フレームワークであるVidTAGを提案する。
映像予測における時間的矛盾に対処するために,フレーム埋め込みを整列するTempGeoモジュールと,フレーム埋め込みを整列させてGPS機能を洗練するエンコーダデコーダアーキテクチャGeoRefinerモジュールを導入する。
Mapillary (MSLS) と GAMA データセットの評価は,GeoCLIP よりも 1 km の閾値で20% 向上し,時間的に一貫した軌道とアウトパフォーマンスのベースラインを生成するモデルの能力を示している。
私たちはまた、グローバルな粗い粒度のビデオジオローカライゼーション(CityGuessr68k)で現在のState-of-the-Artを25%上回った。
提案手法は,ビデオの微粒化を可能とし,今後の研究の基盤となる。
プロジェクトのWebページの詳細は: https://parthpk.github.io/vidtag_webpage/
関連論文リスト
- CityGuessr: City-Level Video Geo-Localization on a Global Scale [54.371452373726584]
本稿では, 都市, 州, 国, 大陸を階層的に予測することを目的とした, グローバルな地平化の新たな課題を提案する。
この問題を解決するためのモデルをトレーニングするために、世界中をカバーした大規模なビデオデータセットは存在しない。
我々は、世界中の166都市から68,269の動画からなる新しいデータセット、CityGuessr68kを紹介した。
論文 参考訳(メタデータ) (2024-11-10T03:20:00Z) - GAReT: Cross-view Video Geolocalization with Adapters and Auto-Regressive Transformers [53.80009458891537]
クロスビュービデオのジオローカライゼーションは、ストリートビュービデオからGPSトラジェクトリを空中ビュー画像と整列させることを目的としている。
現在のCVGL法では、現実のシナリオでは一般的に欠落しているカメラとオドメトリーのデータを使用する。
本稿では,カメラやオドメトリーデータを必要としないCVGLのフルトランスフォーマ方式であるGAReTを提案する。
論文 参考訳(メタデータ) (2024-08-05T21:29:33Z) - G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models [40.69217368870192]
我々は、レトリーバル拡張世代(RAG)に基づく世界規模の地理的ローカライゼーションのための新しい枠組みを提案する。
G3は、ジオアライメント、ジオディバーシフィケーション、ジオビジュアライゼーションの3つのステップから構成される。
2つの確立されたデータセットの実験は、他の最先端手法と比較してG3の優位性を検証する。
論文 参考訳(メタデータ) (2024-05-23T15:37:06Z) - GeoCLIP: Clip-Inspired Alignment between Locations and Images for
Effective Worldwide Geo-localization [61.10806364001535]
世界規模のジオローカライゼーションは、地球上のどこでも撮影された画像の正確な位置を特定することを目的としている。
既存のアプローチは、地球を離散的な地理的細胞に分割し、問題を分類タスクに変換する。
画像と対応するGPS位置のアライメントを強制する新しいCLIPにインスパイアされた画像-GPS検索手法であるGeoCLIPを提案する。
論文 参考訳(メタデータ) (2023-09-27T20:54:56Z) - A Gis Aided Approach for Geolocalizing an Unmanned Aerial System Using
Deep Learning [0.4297070083645048]
本稿では,GPS信号の劣化や拒否時にUASをジオローカライズする手法を提案する。
UASは、プラットフォームが飛ぶとリアルタイム画像を取得することができる、下向きのカメラをプラットフォーム上に備えているので、ジオローカライゼーションを実現するために、最新のディープラーニング技術を適用します。
我々は,OpenStreetMap (OSM) からGIS情報を抽出し,意味的に一致した特徴をビルディングクラスとランドスケープクラスに分割する。
論文 参考訳(メタデータ) (2022-08-25T17:51:15Z) - GAMa: Cross-view Video Geo-localization [68.33955764543465]
我々は、文脈的手がかりを提供する画像ではなく、地上ビデオに焦点を当てている。
クリップレベルでは、短いビデオクリップと対応する空中画像が一致し、後に長いビデオの動画レベルのジオローカライズを得るために使用される。
提案手法は,トップ1リコール率19.4%,45.1%@1.0マイルを達成する。
論文 参考訳(メタデータ) (2022-07-06T04:25:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。