論文の概要: Rethinking Pre-Training and Augmentation for Zero-Shot Cross-City Object Detection
- arxiv url: http://arxiv.org/abs/2608.24154v1
- Date: Tue, 25 Aug 2026 07:16:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.855288
- Title: Rethinking Pre-Training and Augmentation for Zero-Shot Cross-City Object Detection
- Title(参考訳): ゼロショットクロスシティ検出のための事前学習と拡張の再考
- Authors: Long Hoang Pham, Quoc Pham-Nam Ho, Huy-Hung Nguyen, Duong Nguyen-Ngoc Tran, Ngoc Doan-Minh Huynh, Cu Quoc Le, Hoang-Khang Nguyen, Hyung-Min Jeon, Chi Dai Tran, Son Hong Phan, Duong Khac Vu, Trinh Le Ba Khanh, Jae Wook Jeon,
- Abstract要約: 本研究では,2つのコア柱を中心に構築された物体検出のための新しいトレーニングパイプラインを提案する。
我々のフレームワークは、限られたGPUメモリ(16GB)を使用しながら都市間分散ギャップを橋渡しします。
最適化されたRF-DETR-HRとRF-DETR-Grayworldは、ベースラインに対して+24.29の実質的な増加をもたらす。
- 参考スコア(独自算出の注目度): 14.031215272664538
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Real-world deployment of traffic surveillance systems is bottlenecked by geographic domain shift, in which models trained in one city underperform when applied to an unseen target city. Conventional domain adaptation relies on hyperparameter-sensitive architectures or direct profiling of target data. Both are fundamentally precluded in privacy-conscious ecosystems that require completely blind training and evaluation loops. In this setting, we explore the effects of pre-training and augmentation in addressing the domain shift problem. Specifically, we propose a new modular training pipeline for object detection structured around two core orthogonal pillars: (1) a multi-dataset pre-training strategy featuring a class-agnostic objectness distillation to decouple structural vehicle geometry from semantic taxonomies, and (2) a domain-resilient augmentation stream featuring a novel Grayworld transformation that forces global attention heads to strip volatile chromatic shortcuts in favor of robust shape priors. When evaluated with the real-time transformer-based detector RF-DETR, our framework bridges cross-city distribution gaps while using limited GPU memory (16GB). Our optimized variants, RF-DETR-HR and RF-DETR-Grayworld, deliver a substantial empirical gain of +24.29 over the baseline, achieving 1st place (47.53 mAP) on the AI City Challenge Track 6 leaderboard. Code and data are available at: \href{https://github.com/SKKUAutoLab/aic26_cross_city}{SKKUAutoLab/aic26\_cross\_city}.
- Abstract(参考訳): 交通監視システムの現実的な展開は、地理的領域シフトによってボトルネックを受けており、ある都市で訓練されたモデルは、目に見えないターゲット都市に適用された場合、過小評価される。
従来のドメイン適応は、ハイパーパラメータ感受性アーキテクチャやターゲットデータの直接プロファイリングに依存している。
どちらも、完全に盲目的なトレーニングと評価ループを必要とする、プライバシーに配慮したエコシステムに根ざしている。
そこで本研究では,ドメインシフト問題に対する事前学習と拡張の効果について検討する。
具体的には,2つの正方形柱を中心に構築された物体検出のための新しいモジュラートレーニングパイプラインを提案する。(1) 構造体形状を意味分類から切り離すためのクラス非依存的対象性蒸留を特徴とするマルチデータセット事前学習戦略,(2) グローバルアテンションヘッドを不安定な彩色ショートカットに置き換える新しいグレイワールド変換を特徴とするドメインレジリエントな拡張ストリーム。
実時間変圧器を用いたRF-DETRを用いて評価すると,我々は限られたGPUメモリ(16GB)を使用しながら,都市間分布ギャップを橋渡しする。
最適化されたRF-DETR-HRとRF-DETR-Grayworldは、ベースラインで+24.29の実質的な増加をもたらし、AIシティチャレンジトラック6のリーダーボードで1位(47.53 mAP)を達成した。
コードとデータは以下の通りである。 \href{https://github.com/SKKUAutoLab/aic26_cross_city}{SKKUAutoLab/aic26\_cross\_city}。
関連論文リスト
- Learning-Based Hierarchical Scene Graph Matching for Robot Localization Leveraging Prior Maps [0.17398560678845076]
シーングラフは、セマンティックエンティティとその関係の階層として環境の構造をエンコードする。
これら2つの相補的表現を一致させることで、既知の構造的先行に対してロボット観測を接地することでSLAMのドリフト補正が可能になる。
ここでは、階層内および階層間関係を符号化する意味的動機付けされたエッジタイプを用いて、両方のグラフを拡大する、学習されたエンドツーエンドの微分可能なパイプラインを示す。
論文 参考訳(メタデータ) (2026-04-30T13:05:57Z) - Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation [22.876516699004814]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、高レベルの言語命令を正確で安全で長期の空間行動に基礎付けるという、中核的な課題を提示している。
露骨なトポロジカルマップは、そのようなタスクにおいて堅牢な空間記憶を提供するための重要な解決策であることが証明されている。
既存のトポロジカルプランニング手法は、"Granularity Rigidity"問題に悩まされている。
本研究では,動的トポロジカルナビゲーションのためのフレームワークであるDGNavを提案する。
論文 参考訳(メタデータ) (2026-01-29T14:06:23Z) - Wireless Traffic Prediction with Large Language Model [54.07581399989292]
TIDESは、無線トラフィック予測のための空間時間相関をキャプチャする新しいフレームワークである。
TIDESは過剰なトレーニングオーバーヘッドを発生させることなく、ドメイン固有のパターンへの効率的な適応を実現する。
この結果から,将来の6Gシステムにおいて,空間認識をLCMベースの予測器に統合することが,スケーラブルでインテリジェントなネットワーク管理の鍵であることが示唆された。
論文 参考訳(メタデータ) (2025-12-19T04:47:40Z) - CrossEarth-Gate: Fisher-Guided Adaptive Tuning Engine for Efficient Adaptation of Cross-Domain Remote Sensing Semantic Segmentation [32.405967784469304]
CrossEarth-Gateはリモートセンシング(RS)データにおける多面的なドメインギャップに対処する。
このツールボックスで動作するフィッシャー誘導適応選択機構を開発した。
提案手法は,RSセマンティックセグメンテーションのための16のクロスドメインベンチマークにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2025-11-25T13:41:59Z) - A Geometry-Aware Message Passing Neural Network for Modeling Aerodynamics over Airfoils [61.60175086194333]
空気力学は航空宇宙工学の重要な問題であり、しばしば翼のような固体物と相互作用する流れを伴う。
本稿では, 固体物体上の非圧縮性流れのモデル化について考察する。
ジオメトリを効果的に組み込むため,メッシュ表現に翼形状を効率よく,かつ効率的に統合するメッセージパッシング方式を提案する。
これらの設計選択は、純粋にデータ駆動の機械学習フレームワークであるGeoMPNNにつながり、NeurIPS 2024 ML4CFDコンペティションで最優秀学生賞を受賞し、総合で4位となった。
論文 参考訳(メタデータ) (2024-12-12T16:05:39Z) - Boosting Cross-Domain Point Classification via Distilling Relational Priors from 2D Transformers [59.0181939916084]
従来の3Dネットワークは主に局所幾何学的詳細に焦点を当て、局所幾何学間の位相構造を無視する。
そこで本稿では,大規模画像上においてよく訓練されたトランスフォーマーから前駆体を抽出する,新しい先駆体蒸留法を提案する。
PointDA-10とSim-to-Realデータセットの実験は、提案手法が点クラウド分類におけるUDAの最先端性能を一貫して達成していることを検証する。
論文 参考訳(メタデータ) (2024-07-26T06:29:09Z) - TridentAdapt: Learning Domain-invariance via Source-Target Confrontation
and Self-induced Cross-domain Augmentation [0.0]
主な課題は、仮想データから恩恵を受けるために、入力のドメインに依存しない表現を学ぶことである。
本稿では,対立ソースとターゲット制約を同時に満たすために,共有機能エンコーダを強制するトリデント型アーキテクチャを提案する。
また、フォワードパス中に自己誘導型クロスドメインデータ拡張を可能にする新しいトレーニングパイプラインも導入する。
論文 参考訳(メタデータ) (2021-11-30T11:25:46Z) - Stagewise Unsupervised Domain Adaptation with Adversarial Self-Training
for Road Segmentation of Remote Sensing Images [93.50240389540252]
リモートセンシング画像からの道路セグメンテーションは、幅広い応用可能性を持つ課題である。
本稿では,この領域における領域シフト(DS)問題に対処するため,RoadDAと呼ばれる新たな段階的ドメイン適応モデルを提案する。
2つのベンチマーク実験の結果、RoadDAはドメインギャップを効率的に減らし、最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2021-08-28T09:29:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。