論文の概要: Prompt-Driven Simulation with Feature Perturbation for Cross-Domain Few-Shot Object Detection
- arxiv url: http://arxiv.org/abs/2608.01348v1
- Date: Sun, 02 Aug 2026 16:11:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.1718
- Title: Prompt-Driven Simulation with Feature Perturbation for Cross-Domain Few-Shot Object Detection
- Title(参考訳): 特徴摂動を用いたプロンプト駆動シミュレーションによるクロスドメインFew-Shotオブジェクト検出
- Authors: Linhai Zhuo, Junxi Cai, Tianwen Qian, Qingping Zheng, Yang Liu,
- Abstract要約: PSP-FSODは、プロンプト駆動型ドメインシミュレーションと機能摂動正規化を統合した、原則化されたフレームワークである。
PSP-FSODは高品質なドメイン多様性の監視を行い、ドメイン不変表現を学習する。
- 参考スコア(独自算出の注目度): 8.13477193884434
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Data augmentation, which simulates diverse visual variations to expand the source distribution and induce synthetic domain shifts, is a simple yet effective strategy for mitigating severe domain shifts and limited labeled target data in cross-domain few-shot object detection (CD-FSOD). Existing approaches rely on conventional data augmentation, such as Color-Jitter, Mosaic, and background-centric adaptation (e.g., Domain-RAG), which are limited in modeling complex domain shifts and often lead to suboptimal performance. In this paper, we propose PSP-FSOD, a principled framework that integrates prompt-driven domain simulation with feature perturbation regularization to improve generalization in CD-FSOD. To enable controllable domain synthesis, we design a prompt-driven strategy that leverages the visual grounding capability of large VLMs to jointly model foreground and background variations, generating semantically consistent yet domain-diverse training samples. Moreover, we adopt a grounding-aware generation scheme that guides object placement and alleviates semantic-spatial misalignment, thereby improving foreground adaptation. To ensure training stability and robustness, we further introduce a noise-induced feature perturbation mechanism that injects Gaussian noise into multi-scale intermediate features with distribution correction, encouraging consistent predictions under perturbations and reducing reliance on domain-specific cues. Extensive experiments demonstrate that PSP-FSOD produces high-quality domain-diverse supervision and learns domain-invariant representations, consistently improving performance across CD-FSOD benchmarks.
- Abstract(参考訳): データ拡張は、多種多様な視覚的変化をシミュレートし、ソースの分布を拡大し、合成ドメインシフトを誘導するものであり、クロスドメイン小ショットオブジェクト検出(CD-FSOD)において、厳しいドメインシフトと限定されたラベル付きターゲットデータを緩和するための、単純かつ効果的な戦略である。
既存のアプローチでは、Color-JitterやMosaic、バックグラウンド中心の適応(Domain-RAGなど)といった、複雑なドメインシフトのモデリングに限られる従来のデータ拡張に頼っています。
本稿では,CD-FSODの一般化を改善するために,プロンプト駆動型ドメインシミュレーションと機能摂動正規化を統合した原則的フレームワークであるPSP-FSODを提案する。
制御可能なドメイン合成を実現するために,大規模なVLMの視覚的接地機能を利用して,前景と背景の変動を協調的にモデル化し,意味論的に一貫性のあるドメイン-多様性のトレーニングサンプルを生成するプロンプト駆動型戦略を設計する。
さらに,オブジェクトの配置を誘導し,意味空間的ミスアライメントを緩和し,フォアグラウンド適応を改善するグラウンド・アウェア・ジェネレーション・スキームを採用する。
トレーニング安定性とロバスト性を確保するため,マルチスケールの中間特徴にガウス雑音を注入して分布補正を行い,摂動下での一貫した予測を奨励し,領域固有の手がかりへの依存を低減できるノイズ誘導型特徴摂動機構を導入する。
大規模な実験により、PSP-FSODは高品質なドメイン多様性の監視を行い、領域不変表現を学習し、CD-FSODベンチマークのパフォーマンスを継続的に改善することを示した。
関連論文リスト
- Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection [58.25418970608328]
単一ソースドメイン上でトレーニングされた検出器を複数の未確認領域に転送することを目的としたシングルドメイン一般化オブジェクト検出(Single-DGOD)について検討する。
既存の手法は主に、トレーニング分布を拡大するために、データ拡張やテキストプロンプトといったシミュレーション駆動の戦略に依存している。
本稿では, 未知領域の一般化を多様体回帰問題として定式化する, Visual-Text Dual Chain-of-Thought (MR-DCoT) を用いたマニフォールド回帰を提案する。
論文 参考訳(メタデータ) (2026-07-08T09:27:15Z) - DOME: Learning Transferable Domain Variables from Sparse Supervision for Test-Time Adaptation [61.70497741321102]
テスト時適応は、未ラベルのストリーミングデータのみを使用して、テストドメインのシフトにモデルを合わせることを目的としている。
既存のほとんどの手法は、実世界の領域シフトの多次元的およびサンプル固有の性質を無視して、単一の大域領域分布を暗黙的に推論する。
本稿では,サンプルのドメインをゼロショットで明示的にモデル化するドメインエンコーダDOMEを提案する。
論文 参考訳(メタデータ) (2026-06-02T03:24:03Z) - OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation [100.36917520403227]
本稿では,8つの代表領域にまたがる共有範囲画像表現において,LiDARスキャンを生成する統一テキスト条件拡散フレームワークを提案する。
パブリックな統合ベンチマークがなければ、実世界のスキャンと物理ベース気象シミュレーションとシステマティックビームリダクションを組み合わせた8ドメインデータセットを構築する。
論文 参考訳(メタデータ) (2026-05-13T17:42:20Z) - VFM$^{4}$SDG: Unveiling the Power of VFMs for Single-Domain Generalized Object Detection [33.39250067795076]
現実のシナリオでは、天気、照明、撮像条件の連続的な変化は、大きなドメインシフトを引き起こす。
一般化オブジェクト検出(SDGOD)のための二元学習フレームワークを提案する。
符号化段階では,オブジェクト・バックグラウンドとインスタンス間モデリングの堅牢性を高めるために,クロスドメイン安定優先蒸留を提案する。
復号段階では,セマンティック・コンテキスト優先型クエリ拡張を提案する。
論文 参考訳(メタデータ) (2026-04-23T10:04:36Z) - FOUND: Fourier-based von Mises Distribution for Robust Single Domain Generalization in Object Detection [46.14695068852788]
オブジェクト検出のための単一ドメインの一般化は、対象ドメインに効果的に一般化できる単一のソースドメイン上でモデルをトレーニングすることを目的としている。
本稿では、von Mises-Fisher(vMF)分布とフーリエ変換をCLIP誘導パイプラインに統合することにより、オブジェクト検出を強化する新しいフレームワークを提案する。
提案手法はCLIPのセマンティックアライメントの利点を保全するだけでなく,機能多様性とドメイン間の構造的整合性も強化する。
論文 参考訳(メタデータ) (2025-11-13T14:28:10Z) - Simulating Distribution Dynamics: Liquid Temporal Feature Evolution for Single-Domain Generalized Object Detection [58.25418970608328]
Single-Domain Generalized Object Detection (Single-DGOD)は、あるソースドメインで訓練された検出器を複数の未知のドメインに転送することを目的としている。
シングルDGODの既存の方法は通常、データの多様性を拡大するために離散的なデータ拡張や静的摂動法に依存している。
そこで本研究では,ソース領域から潜伏分布のシミュレーションに至るまでの機能の進化をシミュレートする手法を提案する。
論文 参考訳(メタデータ) (2025-11-13T03:10:39Z) - Feature-Space Planes Searcher: A Universal Domain Adaptation Framework for Interpretability and Computational Efficiency [7.889121135601528]
現在の教師なし領域適応法は微調整特徴抽出器に依存している。
領域適応フレームワークとしてFPS(Feature-space Planes Searcher)を提案する。
FPSは最先端の手法と比較して,競争力や性能に優れることを示す。
論文 参考訳(メタデータ) (2025-08-26T05:39:21Z) - Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation [37.724608645202466]
ドメイン一般化セマンティック(DGSS)は、目に見えない環境でのドメインシフトがモデルパフォーマンスを著しく損なう可能性があるため、重要な課題である。
本稿では,既存のセグメンテーションネットワークの一般化を促進する確率的拡散アライメントフレームワークPDAFを紹介する。
実験は、多様で挑戦的な都市シーンにおけるPDAFの有効性を検証する。
論文 参考訳(メタデータ) (2025-07-28T22:27:58Z) - Let Synthetic Data Shine: Domain Reassembly and Soft-Fusion for Single Domain Generalization [68.41367635546183]
単一ドメインの一般化は、単一のソースからのデータを使用して、さまざまなシナリオで一貫したパフォーマンスでモデルをトレーニングすることを目的としている。
モデル一般化を改善するために合成データを活用した学習フレームワークDRSFを提案する。
論文 参考訳(メタデータ) (2025-03-17T18:08:03Z) - Towards Full-scene Domain Generalization in Multi-agent Collaborative Bird's Eye View Segmentation for Connected and Autonomous Driving [49.03947018718156]
協調的な知覚の訓練と推論の段階で利用される統合されたドメイン一般化フレームワークを提案する。
また、システム内ドメインアライメント機構を導入し、コネクテッドおよび自律走行車間のドメインの差を減らし、潜在的に排除する。
論文 参考訳(メタデータ) (2023-11-28T12:52:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。