論文の概要: Reward-Guided Semantic Evolution for Test-time Adaptive Object Detection
- arxiv url: http://arxiv.org/abs/2605.04531v1
- Date: Wed, 06 May 2026 06:17:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.670198
- Title: Reward-Guided Semantic Evolution for Test-time Adaptive Object Detection
- Title(参考訳): テスト時間適応物体検出のための逆ガイド型セマンティック進化
- Abstract要約: Grounding DINOのような視覚言語モデル(VLM)を用いたオープン語彙オブジェクト検出は、テスト時間分布シフト時の性能劣化に悩まされる。
Reward-Guided Semantic Evolution (RGSE) は、テスト時にテキストの埋め込みを直接洗練するトレーニング不要のフレームワークである。
- 参考スコア(独自算出の注目度): 82.2968697030677
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary object detection with vision-language models (VLMs) such as Grounding DINO suffers from performance degradation under test-time distribution shifts, primarily due to semantic misalignment between text embeddings and shifted visual embeddings of region proposals. While recent test-time adaptive object detection methods for VLM-based either rely on costly backpropagation or bypass semantic misalignment via external memory, none directly and efficiently align text and vision in a training-free manner. To address this, we propose Reward-Guided Semantic Evolution (RGSE), a training-free framework that directly refines the text embeddings at test time. Inspired by evolutionary search, RGSE treats text embedding adaptation as a semantic search process: it perturbs text embeddings as candidate variants, evaluates them via cosine similarity with current and historical high-confidence visual proposals as a reward signal, and fuses them into a refined embedding through reward-weighted averaging. Without any backpropagation, RGSE achieves state-of-the-art performance across multiple detection benchmarks while adding minimal computational overhead. Our code will be open source upon publication.
- Abstract(参考訳): Grounding DINOのような視覚言語モデル(VLM)を用いたオープンボキャブラリオブジェクト検出は、主にテキストの埋め込みと領域提案の視覚的埋め込みとのセマンティックなミスアライメントによって、テスト時間分布シフトによる性能劣化に悩まされる。
VLMベースの最近のテスト時間適応型オブジェクト検出手法は、コストのかかるバックプロパゲーションや、外部メモリによるセマンティックなミスアライメントに依存するが、直接的かつ効率的にテキストとビジョンをトレーニングなしで調整することはない。
これを解決するために、テスト時にテキスト埋め込みを直接洗練するトレーニングフリーフレームワークであるReward-Guided Semantic Evolution (RGSE)を提案する。
RGSEは、テキスト埋め込み適応をセマンティック検索プロセスとして扱い、テキスト埋め込みを候補変種として摂動し、コサイン的類似性を通じて、現在の高信頼度ビジュアルプロポーザルを報酬信号として評価し、報酬重み付き平均化を通じてそれらを洗練された埋め込みに融合する。
バックプロパゲーションがなければ、RGSEは複数の検出ベンチマークで最先端のパフォーマンスを達成でき、計算オーバーヘッドは最小限に抑えられる。
私たちのコードは公開後オープンソースになります。
関連論文リスト
- LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting [118.93173826110815]
高精度検出のための低ランク近似に基づく新しいパラメータ化テキスト形状法を提案する。
異なるテキストの輪郭間の固有形状相関を利用して、形状表現の一貫性とコンパクト性を実現する。
我々は、LRANet++と呼ばれるエンドツーエンドテキストスポッティングフレームワークを構築するために、拡張検出モジュールを軽量な認識ブランチに統合する。
論文 参考訳(メタデータ) (2025-11-08T03:08:03Z) - Reproducibility, Replicability, and Insights into Visual Document Retrieval with Late Interaction [22.41501622100226]
Visual Document Retrieval (VDR)は、文書イメージを直接エンコードして検索することに焦点を当てた、新たな研究分野である。
近年のVDRの進歩はColPaliによって導入され、遅延相互作用機構による検索効率を大幅に改善した。
本研究は,視覚的文書検索の文脈におけるクエリ・パッチマッチングに着目して,遅延インタラクションの具体的な貢献について検討する。
論文 参考訳(メタデータ) (2025-05-12T16:37:47Z) - Mind the Gap: A Generalized Approach for Cross-Modal Embedding Alignment [0.0]
Retrieval-Augmented Generation (RAG) システムは、意味的ギャップによって異なるテキストモダリティ間でコンテキストを検索する。
本稿では,これらのギャップを効率的に埋める汎用投影法を提案する。
私たちのアプローチでは、トレーニングや推論に最小限のリソースを必要とするため、スピード、正確性、データ効率を重視しています。
論文 参考訳(メタデータ) (2024-10-30T20:28:10Z) - LOGO: Video Text Spotting with Language Collaboration and Glyph Perception Model [20.007650672107566]
ビデオテキストスポッティング(VTS)は、ビデオ内のテキストインスタンスを同時にローカライズ、認識、追跡することを目的としている。
最近の方法では、最先端の画像テキストスポッターのゼロショット結果を直接追跡する。
特定のデータセット上の微調整トランスフォーマーベースのテキストスポッターにより、パフォーマンスが向上する可能性がある。
論文 参考訳(メタデータ) (2024-05-29T15:35:09Z) - Fine-grained Visual-Text Prompt-Driven Self-Training for Open-Vocabulary
Object Detection [87.39089806069707]
オープン語彙検出(VTP-OVD)のための微粒なビジュアルテキストプロンプト駆動型自己学習パラダイムを提案する。
適応段階では、学習可能なテキストプロンプトを用いて細粒度アライメントを可能とし、補助的なピクセルワイズ予測タスクを解決する。
実験の結果,COCO の未確認クラスでは,31.5% mAP など,オープン語彙オブジェクト検出の最先端性能が得られた。
論文 参考訳(メタデータ) (2022-11-02T03:38:02Z) - Real-Time Scene Text Detection with Differentiable Binarization and
Adaptive Scale Fusion [62.269219152425556]
セグメンテーションに基づくシーンテキスト検出手法はシーンテキスト検出分野において大きな注目を集めている。
本稿では,二項化処理をセグメンテーションネットワークに統合する分散二項化(DB)モジュールを提案する。
アダプティブ・スケール・フュージョン (ASF) モジュールは, 異なるスケールの特徴を適応的に融合させることにより, スケールのロバスト性を向上させる。
論文 参考訳(メタデータ) (2022-02-21T15:30:14Z) - Towards Weakly-Supervised Text Spotting using a Multi-Task Transformer [21.479222207347238]
テキストスポッティングのための変換器ベースのアプローチであるTextTranSpotter(TTS)を紹介する。
TTSは、完全に管理された設定と弱い設定の両方で訓練される。
TextTranSpotterは、完全に教師された方法でトレーニングされ、複数のベンチマークで最先端の結果を表示する。
論文 参考訳(メタデータ) (2022-02-11T08:50:09Z) - A Correspondence Variational Autoencoder for Unsupervised Acoustic Word
Embeddings [50.524054820564395]
そこで本稿では,変数分割音声セグメントを固定次元表現にマッピングするための教師なしモデルを提案する。
結果として得られる音響単語の埋め込みは、低リソース言語とゼロリソース言語のための検索、発見、インデックスシステムの基礎を形成することができる。
論文 参考訳(メタデータ) (2020-12-03T19:24:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。