論文の概要: Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection
- arxiv url: http://arxiv.org/abs/2607.07192v1
- Date: Wed, 08 Jul 2026 09:27:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.343441
- Title: Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection
- Title(参考訳): 未知領域検出のためのプロトタイプアンコール型一般化マニフォールド回帰
- Authors: Zihao Zhang, Aming Wu, Yang Li, Yahong Han,
- Abstract要約: 単一ソースドメイン上でトレーニングされた検出器を複数の未確認領域に転送することを目的としたシングルドメイン一般化オブジェクト検出(Single-DGOD)について検討する。
既存の手法は主に、トレーニング分布を拡大するために、データ拡張やテキストプロンプトといったシミュレーション駆動の戦略に依存している。
本稿では, 未知領域の一般化を多様体回帰問題として定式化する, Visual-Text Dual Chain-of-Thought (MR-DCoT) を用いたマニフォールド回帰を提案する。
- 参考スコア(独自算出の注目度): 58.25418970608328
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we study Single-Domain Generalized Object Detection (Single-DGOD), which aims to transfer a detector trained on a single source domain to multiple unseen domains. Existing methods mainly rely on simulation-driven strategies, such as data augmentation or textual prompts, to enlarge the training distribution. However, finite simulations can hardly cover the dynamic variations of real-world scenarios, often causing overfitting to synthetic styles and limited robustness to complex structural degradations. Inspired by the manifold hypothesis, we argue that semantic features, despite diverse visual changes, should lie on a compact and stable low-dimensional manifold. Therefore, robust generalization requires rectifying deviant samples back to this semantic manifold, rather than exhaustively simulating external perturbations. To this end, we propose Manifold Regression with Visual-Text Dual Chain-of-Thought (MR-DCoT), which formulates unknown-domain generalization as a manifold regression problem. MR-DCoT first uses a Visual-Text Dual Chain-of-Thought module to combine VLM-guided semantic evolution with diffusion-based structural perturbation, generating structured off-manifold hard examples. It then introduces Class-Specific Prototype Anchoring to learn a rectification operator that projects deviant features toward the source semantic manifold. By integrating outlier generation and semantic correction into a closed loop, MR-DCoT effectively narrows the distribution gap and improves robustness under unseen shifts. Extensive experiments on three complementary benchmarks, including adverse-weather detection, real-to-art generalization, and zero-shot semantic segmentation, demonstrate the effectiveness and versatility of our method.
- Abstract(参考訳): 本稿では、単一ソースドメイン上でトレーニングされた検出器を複数の未確認領域に転送することを目的としたシングルドメイン一般化オブジェクト検出(Single-DGOD)について検討する。
既存の手法は主に、トレーニング分布を拡大するために、データ拡張やテキストプロンプトといったシミュレーション駆動の戦略に依存している。
しかし、有限シミュレーションは実世界のシナリオの動的変動をほとんどカバーできず、しばしば合成スタイルに過度に適合し、複雑な構造劣化に対するロバスト性に制限される。
多様体の仮説に触発されて、多様な視覚的変化にもかかわらず、意味的特徴はコンパクトで安定な低次元多様体上に存在するべきであると論じる。
したがって、ロバストな一般化は、外部摂動を徹底的にシミュレートするのではなく、この意味多様体に戻すデファイアント標本の修正を必要とする。
そこで我々は, 未知領域の一般化を多様体回帰問題として定式化する, Visual-Text Dual Chain-of-Thought (MR-DCoT) を用いた多様体回帰法を提案する。
MR-DCoTはまずVisual-Text Dual Chain-of-Thoughtモジュールを使用して、VLM誘導のセマンティック進化と拡散に基づく構造摂動を組み合わせ、構造化されたオフマンフォールドハード例を生成する。
続いてClass-Specific Prototype Anchoringを導入し、ソースセマンティック多様体に向けて逸脱した特徴を投影する修正演算子を学ぶ。
外乱発生と意味的補正を閉ループに統合することにより、MR-DCoTは分散ギャップを効果的に狭め、目に見えないシフトの下で堅牢性を向上させる。
提案手法の有効性と汎用性を示すために, 悪天候検出, 実技一般化, ゼロショットセマンティックセマンティックセグメンテーションを含む3つの相補的ベンチマーク実験を行った。
関連論文リスト
- Towards Generalized Image Manipulation Localization via Score-based Model [38.03898206912958]
IMLにスコアベース生成モデルを導入する新しいフレームワークであるDiffIMLを提案する。
この定式化の下では、拡散モデルは学習したスコア関数の効果的な数値解法として機能する。
8つの非生成的および3つの生成的ベンチマークの実験は、DiffIMLが一貫して最先端の手法より優れていることを示した。
論文 参考訳(メタデータ) (2026-05-16T08:39:54Z) - One CT Unified Model Training Framework to Rule All Scanning Protocols [32.68329101435685]
NICT(Non-ideal Measurement Computed Tomography)はCTの臨床的使用を拡大している。
ほとんどの方法はペアデータを必要とするが、これは避けられない臓器の動きによる非現実的な要求である。
サブマニフォールド間のギャップを埋めるために,不確実誘導マニフォールド平滑化(UMS)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-16T09:26:32Z) - Improving Deepfake Detection with Reinforcement Learning-Based Adaptive Data Augmentation [60.04281435591454]
CRDA(Curriculum Reinforcement-Learning Data Augmentation)は、マルチドメインの偽造機能を段階的にマスターするための検出器を導く新しいフレームワークである。
私たちのアプローチの中心は、強化学習と因果推論を統合することです。
提案手法は検出器の一般化性を大幅に向上し,複数のクロスドメインデータセット間でSOTA法より優れている。
論文 参考訳(メタデータ) (2025-11-10T12:45:52Z) - Filling the Gaps: A Multitask Hybrid Multiscale Generative Framework for Missing Modality in Remote Sensing Semantic Segmentation [28.992992584085787]
マルチモーダル学習は、通常の単調モデルと比較して大きな性能向上を示した。
現実のシナリオでは、センサーの故障と悪天候のためにマルチモーダル信号が欠落する可能性がある。
本稿では,これらの制約に対処するために,GEMMNet(Generative-Enhanced MultiModal Learning Network)を提案する。
論文 参考訳(メタデータ) (2025-09-14T05:40:35Z) - Geometrically Regularized Transfer Learning with On-Manifold and Off-Manifold Perturbation [0.0]
MAADAは、敵の摂動をオン・マニフォールドとオフ・マニフォールドに分解する新しいフレームワークである。
また,MAADAは,教師なし設定と少数ショット設定の両方において,既存の敵・適応手法を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-05-21T07:13:09Z) - Let Synthetic Data Shine: Domain Reassembly and Soft-Fusion for Single Domain Generalization [68.41367635546183]
単一ドメインの一般化は、単一のソースからのデータを使用して、さまざまなシナリオで一貫したパフォーマンスでモデルをトレーニングすることを目的としている。
モデル一般化を改善するために合成データを活用した学習フレームワークDRSFを提案する。
論文 参考訳(メタデータ) (2025-03-17T18:08:03Z) - Dual adversarial and contrastive network for single-source domain generalization in fault diagnosis [1.9389881806157316]
本稿では,単一ソース領域の一般化故障診断のための二重対角コントラストネットワーク(DAC)を提案する。
DACの主な考え方は、多様なサンプル特徴を生成し、ドメイン不変の特徴表現を抽出することである。
テネシー・イーストマン・プロセスと連続旋回タンク・リアクターの実験は、DACが目に見えないモードで高い分類精度を達成することを示した。
論文 参考訳(メタデータ) (2024-07-19T02:06:41Z) - DIFFormer: Scalable (Graph) Transformers Induced by Energy Constrained
Diffusion [66.21290235237808]
本稿では,データセットからのインスタンスのバッチを進化状態にエンコードするエネルギー制約拡散モデルを提案する。
任意のインスタンス対間の対拡散強度に対する閉形式最適推定を示唆する厳密な理論を提供する。
各種タスクにおいて優れた性能を有する汎用エンコーダバックボーンとして,本モデルの適用性を示す実験を行った。
論文 参考訳(メタデータ) (2023-01-23T15:18:54Z) - GSMFlow: Generation Shifts Mitigating Flow for Generalized Zero-Shot
Learning [55.79997930181418]
Generalized Zero-Shot Learningは、目に見えないクラスから見えないクラスに意味的な知識を移すことで、目に見えないクラスと見えないクラスの両方から画像を認識することを目的としている。
生成モデルの利点を生かして、見学したクラスから学んだ知識に基づいて、現実的な見知らぬサンプルを幻覚させることは、有望な解決策である。
本研究では,複数の条件付きアフィン結合層からなるフローベース生成フレームワークを提案する。
論文 参考訳(メタデータ) (2022-07-05T04:04:37Z) - Learning Invariant Representations and Risks for Semi-supervised Domain
Adaptation [109.73983088432364]
半教師付きドメイン適応(Semi-DA)の設定の下で不変表現とリスクを同時に学習することを目的とした最初の手法を提案する。
共同で textbfLearning textbfInvariant textbfRepresentations と textbfRisks の LIRR アルゴリズムを導入する。
論文 参考訳(メタデータ) (2020-10-09T15:42:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。