論文の概要: TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
- arxiv url: http://arxiv.org/abs/2606.28077v2
- Date: Mon, 29 Jun 2026 02:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.07077
- Title: TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
- Title(参考訳): TextDS: 分散シフトによるシーンテキスト検出のためのパラメータ効率の良い表現アライメント
- Authors: Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang,
- Abstract要約: 分散シフト下でのシーンテキスト検出のための効率的なフレームワークであるTextDSを提案する。
まず,視覚基礎モデルを用いたデータ効率の良いデュアルエンコーダの設計を提案する。
第2に,段階的低ランク化を行うSWLoRA(Step-wise LoRA adaptation)を導入する。
第3に,画像劣化下での評価におけるギャップに対処するために,悪条件シーンテキスト検出データセットを構築した。
- 参考スコア(独自算出の注目度): 17.372067847674455
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In real-world deployments, scene text detectors inevitably face distribution shifts beyond the training distribution. Prior work often depends on large-scale scene-text pretraining, yet evaluation under cross-domain changes and real-world imaging degradations remains limited. We propose TextDS, an efficient framework for scene text detection under distribution shifts. First, we propose a data-efficient dual-encoder design with visual foundation models, eliminating the reliance on large-scale scene-text pretraining. Second, we introduce Step-wise LoRA adaptation (SWLoRA), which performs progressive low-rank refinement with a dynamic early-exit mechanism for effective feature adaptation. Third, we propose Common Subspace Fusion (CSF) to align and fuse the two branches in a shared subspace while retaining complementary, shift-robust information. Finally, we construct adverse-condition scene text detection datasets to address the gap in evaluating under imaging degradation. Experiments show that TextDS achieves competitive performance in scene text detection, demonstrating robustness across domains and adverse imaging conditions with only 4.9M trainable parameters.
- Abstract(参考訳): 実世界の展開では、シーンテキスト検出器は必然的に、トレーニング分布を超えた分散シフトに直面している。
先行研究は、大規模なシーンテキスト事前学習に依存することが多いが、クロスドメインの変更や実世界の画像劣化による評価は限られている。
分散シフト下でのシーンテキスト検出のための効率的なフレームワークであるTextDSを提案する。
まず,視覚基盤モデルを用いたデータ効率の良いデュアルエンコーダの設計を提案する。
次に,ステップワイドロラ適応(SWLoRA)を導入し,機能適応を効果的に行う動的早期退避機構を用いて,プログレッシブな低ランク化を実現する。
第3に,相補的,シフト・ロバストな情報を保持しつつ,2つの枝を共有部分空間で整列して融合させるコモン・サブスペース・フュージョン(CSF)を提案する。
最後に,画像劣化下での評価におけるギャップに対処するために,悪条件シーンテキスト検出データセットを構築した。
実験の結果、TextDSはシーンテキストの検出において競争力を発揮し、4.9Mのトレーニング可能なパラメータしか持たず、領域間の堅牢性や悪い撮像条件を実証している。
関連論文リスト
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment [68.91073792449201]
そこで本研究では,テキストの正確かつ完全な出現を促すトレーニング不要な方法であるTextGuiderを提案する。
具体的には,多モード拡散変換器(MM-DiT)モデルにおける注意パターンを解析し,特に画像に描画することを意図したテキスト関連トークンについて検討する。
テスト時間テキストレンダリングでは,OCR精度とCLIPスコアが大幅に向上し,高い結果が得られた。
論文 参考訳(メタデータ) (2025-12-10T06:18:30Z) - Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations [56.816929931908824]
マルチモーダルデータにおける意味的協調操作の検出の先駆者となった。
本稿では,RamDG(Retrieval-Augmented Manipulation Detection and Grounding)フレームワークを提案する。
我々のフレームワークは既存の手法よりも優れており、SAMMの精度は最先端の手法に比べて2.06%高い。
論文 参考訳(メタデータ) (2025-09-16T04:18:48Z) - Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval [24.544672733180196]
画像と領域レベルでのドメイン適応を考慮した統合テキストベースの人物検索パイプラインを提案する。
提案手法はCUHK-PEDES, ICFG-PEDES, RSTPReidデータセットに対して, 最先端の処理結果を得た。
論文 参考訳(メタデータ) (2025-07-14T12:03:04Z) - Enhancing Scene Text Detectors with Realistic Text Image Synthesis Using
Diffusion Models [63.99110667987318]
DiffTextは、前景のテキストと背景の本質的な特徴をシームレスにブレンドするパイプラインです。
テキストインスタンスが少なくなると、生成したテキストイメージはテキスト検出を支援する他の合成データを一貫して上回ります。
論文 参考訳(メタデータ) (2023-11-28T06:51:28Z) - Harnessing the Power of Multi-Lingual Datasets for Pre-training: Towards
Enhancing Text Spotting Performance [15.513912470752041]
様々な領域への適応能力は、実環境にデプロイする際のシーンテキストスポッティングモデルに不可欠である。
本稿では,ドメイン適応型シーンテキストスポッティングの問題,すなわちマルチドメインソースデータを用いたモデルトレーニングについて検討する。
その結果,複数の領域にまたがるテキストスポッティングベンチマークにおいて,中間表現が有意な性能を発揮する可能性が明らかとなった。
論文 参考訳(メタデータ) (2023-10-02T06:08:01Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - ContourNet: Taking a Further Step toward Accurate Arbitrary-shaped Scene
Text Detection [147.10751375922035]
本研究では,シーンテキストの偽陽性と大規模分散を効果的に処理するContourNetを提案する。
本手法は,両方向の応答値の高い予測を出力するだけで,これらの偽陽性を効果的に抑制する。
論文 参考訳(メタデータ) (2020-04-10T08:15:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。