論文の概要: Bridge: Basis-Driven Causal Inference Marries VFMs for Domain Generalization
- arxiv url: http://arxiv.org/abs/2604.26820v1
- Date: Wed, 29 Apr 2026 15:48:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.473023
- Title: Bridge: Basis-Driven Causal Inference Marries VFMs for Domain Generalization
- Title(参考訳): Bridge: ベース駆動の因果推論がドメインの一般化のためにVFMを結婚
- Abstract要約: 本稿では,textbftextitBridgeというドメイン一般化のための新しいBasis駆動フレームワークを提案する。
フロントドア調整のための低ランクベースを学習することで、textbftextitBridgeは共同創設者の効果をブロックし、刺激的な相関を発生させる。
textbftextitBridgeは差別的(DINOv2/3, SAMなど)と生成的(安定拡散など)の両方とシームレスに統合できる。
- 参考スコア(独自算出の注目度): 12.808064959739655
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Detectors often suffer from degraded performance, primarily due to the distributional gap between the source and target domains. This issue is especially evident in single-source domains with limited data, as models tend to rely on confounders (e.g., illumination, co-occurrence, and style) from the source domain, leading to spurious correlations that hinder generalization. To this end, this paper proposes a novel Basis-driven framework for domain generalization, namely \textbf{\textit{Bridge}}, that incorporates causal inference into object detection. By learning the low-rank bases for front-door adjustment, \textbf{\textit{Bridge}} blocks confounders' effects to mitigate spurious correlations, while simultaneously refining representations by filtering redundant and task-irrelevant components. \textbf{\textit{Bridge}} can be seamlessly integrated with both discriminative (e.g., DINOv2/3, SAM) and generative (e.g., Stable Diffusion) Vision Foundation Models (VFMs). Extensive experiments across multiple domain generalization object detection datasets, i.e., Cross-Camera, Adverse Weather, Real-to-Artistic, Diverse Weather Datasets, and Diverse Weather DroneVehicle (our newly augmented real-world UAV-based benchmark), underscore the superiority of our proposed method over previous state-of-the-art approaches. The project page is available at: https://mingbohong.github.io/Bridge/.
- Abstract(参考訳): 検出器は、主にソースとターゲットドメイン間の分散的なギャップのために、劣化したパフォーマンスに悩まされることが多い。
この問題は、モデルがソースドメインの共創者(例えば、照明、共起、スタイル)に依存する傾向があるため、限られたデータを持つ単一ソースドメインでは特に顕著であり、一般化を妨げている。
そこで本研究では,因果推論をオブジェクト検出に組み込んだ,新しい領域一般化フレームワークであるtextbf{\textit{Bridge}}を提案する。
フロントドア調整のための低ランクベースを学ぶことで、 \textbf{\textit{Bridge}}は、余分なコンポーネントとタスク非関連コンポーネントをフィルタリングすることで、表現を同時に洗練しながら、余分な相関を緩和するために、共同創設者の効果をブロックする。
\textbf{\textit{Bridge}}は差別的(例えば、DINOv2/3、SAM)と生成的(例えば、安定拡散)視覚基盤モデル(VFM)の両方とシームレスに統合できる。
複数の領域一般化オブジェクト検出データセット、すなわちクロスカメラ、逆気象、リアル・トゥ・アーティスティック、ディヴァース・ウェザー・データセット、およびディヴァース・ウェザー・ドローン(我々の新しい拡張現実UAVベースのベンチマーク)にわたる広範囲な実験は、提案手法が従来の最先端アプローチよりも優れていることを裏付けている。
プロジェクトページは、https://mingbohong.github.io/Bridge/.com/で公開されている。
関連論文リスト
- RT-SDGOD: Real-Time Single-Domain Generalized Object Detection [29.73970506841414]
リアルタイムの制約の下では、気象や画像の変動は大きな分布シフトを引き起こし、検出器を著しく劣化させる。
RT-SDGOD(Real-Time Single-Domain Generalized Object Detection)を導入する。
提案手法は,複数の未確認対象領域にまたがる既存手法よりも優れた一般化性能を実現する。
論文 参考訳(メタデータ) (2026-06-08T11:39:18Z) - Rethinking Representations for Cross-Domain Infrared Small Target Detection: A Generalizable Perspective from the Frequency Domain [26.03122882760887]
クロスドメインIRSTDのための空間-スペクトル協調認識ネットワークを提案する。
我々は、一般化可能な目標認識を導出するための位相修正モジュール(PRM)を開発した。
我々は、位置情報を保持するために、スキップ接続に注意機構(OAM)を用いる。
論文 参考訳(メタデータ) (2026-04-02T11:54:28Z) - DiveUp: Learning Feature Upsampling from Diverse Vision Foundation Models [11.659303031631723]
DiveUpは、マルチVFMリレーショナルガイダンスを導入することで、単一モデル依存から脱却する新しいフレームワークである。
本稿では,局所的中心-質量場 (COM) として定式化され,固有幾何学的構造を抽出する普遍的関係特徴表現を提案する。
DiveUpは統一されたエンコーダに依存しないフレームワークである。
論文 参考訳(メタデータ) (2026-03-13T20:20:22Z) - Towards Single-Source Domain Generalized Object Detection via Causal Visual Prompts [37.886574666175065]
単一ソースのドメイン一般化オブジェクト検出はコンピュータビジョンにおける最先端の研究トピックである。
Causal Visual Prompts 法は、視覚的プロンプトと横断的アテンションを統合することで、刺激的な特徴からバイアスを緩和する。
Causalは15.9-31.4%のアップで最先端の性能を実現している。
論文 参考訳(メタデータ) (2025-10-22T11:24:52Z) - Unified Unsupervised Anomaly Detection via Matching Cost Filtering [113.43366521994396]
教師なし異常検出(UAD)は、通常のトレーニングデータのみを用いて画像レベルの異常と画素レベルの異常を識別することを目的としている。
UADモデルの異常コスト量を補正するための汎用的なポストホック精錬フレームワークであるUnified Cost Filtering (UCF) を提案する。
論文 参考訳(メタデータ) (2025-10-03T03:28:18Z) - LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation [54.690154688667086]
拡散モデルは高品質な出力を生成するのに優れているが、データスカースドメインでは課題に直面している。
サンプルからサンプルへの変換のための半教師付きフレームワークであるLatent Aligned Diffusion Bridges (LADB)を提案する。
論文 参考訳(メタデータ) (2025-09-10T14:23:07Z) - A Plug-and-Play Method for Rare Human-Object Interactions Detection by Bridging Domain Gap [50.079224604394]
textbfContext-textbfEnhanced textbfFeature textbfAment (CEFA) と呼ばれる新しいモデルに依存しないフレームワークを提案する。
CEFAは機能アライメントモジュールとコンテキスト拡張モジュールで構成される。
本手法は, 稀なカテゴリにおけるHOIモデルの検出性能を向上させるために, プラグアンドプレイモジュールとして機能する。
論文 参考訳(メタデータ) (2024-07-31T08:42:48Z) - UniMix: Towards Domain Adaptive and Generalizable LiDAR Semantic Segmentation in Adverse Weather [55.95708988160047]
LiDARセマンティックセグメンテーション(LSS)は自動運転において重要な課題である。
事前のLSS法は、晴れた天候下で同じ領域内のデータセットを調査・評価した。
LSSモデルの適応性と一般化性を高める普遍的手法UniMixを提案する。
論文 参考訳(メタデータ) (2024-04-08T02:02:15Z) - Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object Detector [72.05791402494727]
本稿では,CD-FSODを用いたクロスドメイン小ショット検出法について検討する。
最小限のラベル付き例で、新しいドメインのための正確なオブジェクト検出器を開発することを目的としている。
論文 参考訳(メタデータ) (2024-02-05T15:25:32Z) - Diffusion-Based Particle-DETR for BEV Perception [94.88305708174796]
Bird-Eye-View (BEV)は、自律走行車(AV)における視覚知覚のための最も広く使われているシーンの1つである。
近年の拡散法は、視覚知覚のための不確実性モデリングに有望なアプローチを提供するが、BEVの広い範囲において、小さな物体を効果的に検出することができない。
本稿では,BEVにおける拡散パラダイムと最先端の3Dオブジェクト検出器を組み合わせることで,この問題に対処する。
論文 参考訳(メタデータ) (2023-12-18T09:52:14Z) - Domain-aware Triplet loss in Domain Generalization [0.0]
ドメインシフトは、テストとトレーニングデータの分布の相違によって引き起こされる。
ドメイン一般化のためのドメイン認識三重項損失を設計し、モデルが類似のセマンティックな特徴をクラスタリングするのを助ける。
本アルゴリズムは,埋め込み空間におけるドメイン情報を分散するように設計されている。
論文 参考訳(メタデータ) (2023-03-01T14:02:01Z) - Divide and Contrast: Source-free Domain Adaptation via Adaptive
Contrastive Learning [122.62311703151215]
Divide and Contrast (DaC) は、それぞれの制限を回避しつつ、両方の世界の善良な端を接続することを目的としている。
DaCは、ターゲットデータをソースライクなサンプルとターゲット固有なサンプルに分割する。
さらに、ソースライクなドメインと、メモリバンクベースの最大平均離散性(MMD)損失を用いて、ターゲット固有のサンプルとを整合させて、分散ミスマッチを低減する。
論文 参考訳(メタデータ) (2022-11-12T09:21:49Z) - Grounding Visual Representations with Texts for Domain Generalization [9.554646174100123]
相互モダリティの監督は、ドメイン不変の視覚表現の接地に成功することができる。
提案手法は,5つのマルチドメインデータセットの平均性能を1位に評価する。
論文 参考訳(メタデータ) (2022-07-21T03:43:38Z) - Low-confidence Samples Matter for Domain Adaptation [47.552605279925736]
ドメイン適応(DA)は、知識をラベルの豊富なソースドメインから関連するがラベルの少ないターゲットドメインに転送することを目的としている。
低信頼度サンプルの処理による新しいコントラスト学習法を提案する。
提案手法を教師なしと半教師付きの両方のDA設定で評価する。
論文 参考訳(メタデータ) (2022-02-06T15:45:45Z) - Unsupervised and self-adaptative techniques for cross-domain person
re-identification [82.54691433502335]
非重複カメラにおける人物再識別(ReID)は難しい課題である。
Unsupervised Domain Adaptation(UDA)は、ソースで訓練されたモデルから、IDラベルアノテーションなしでターゲットドメインへの機能学習適応を実行するため、有望な代替手段です。
本稿では,新しいオフライン戦略によって生成されたサンプルのトリプレットを利用する,UDAベースのReID手法を提案する。
論文 参考訳(メタデータ) (2021-03-21T23:58:39Z) - Anomaly Detection with Domain Adaptation [5.457279006229213]
この問題を解決するために,不変表現異常検出(IRAD)を提案する。
抽出は、ソース固有のエンコーダやジェネレータと共に訓練されたクロスドメインエンコーダによって達成される。
我々は、桁画像データセット(MNIST、USPS、SVHN)とオブジェクト認識データセット(Office-Home)に基づいて、IRADを広範囲に評価する。
論文 参考訳(メタデータ) (2020-06-05T21:05:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。