論文の概要: TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
- arxiv url: http://arxiv.org/abs/2606.28077v2
- Date: Mon, 29 Jun 2026 02:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.07077
- Title: TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
- Title(参考訳): TextDS: 分散シフトによるシーンテキスト検出のためのパラメータ効率の良い表現アライメント
- Abstract要約: 分散シフト下でのシーンテキスト検出のための効率的なフレームワークであるTextDSを提案する。
まず,視覚基礎モデルを用いたデータ効率の良いデュアルエンコーダの設計を提案する。
第2に,段階的低ランク化を行うSWLoRA(Step-wise LoRA adaptation)を導入する。
第3に,画像劣化下での評価におけるギャップに対処するために,悪条件シーンテキスト検出データセットを構築した。
- 参考スコア(独自算出の注目度): 17.372067847674455
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In real-world deployments, scene text detectors inevitably face distribution shifts beyond the training distribution. Prior work often depends on large-scale scene-text pretraining, yet evaluation under cross-domain changes and real-world imaging degradations remains limited. We propose TextDS, an efficient framework for scene text detection under distribution shifts. First, we propose a data-efficient dual-encoder design with visual foundation models, eliminating the reliance on large-scale scene-text pretraining. Second, we introduce Step-wise LoRA adaptation (SWLoRA), which performs progressive low-rank refinement with a dynamic early-exit mechanism for effective feature adaptation. Third, we propose Common Subspace Fusion (CSF) to align and fuse the two branches in a shared subspace while retaining complementary, shift-robust information. Finally, we construct adverse-condition scene text detection datasets to address the gap in evaluating under imaging degradation. Experiments show that TextDS achieves competitive performance in scene text detection, demonstrating robustness across domains and adverse imaging conditions with only 4.9M trainable parameters.
- Abstract(参考訳): 実世界の展開では、シーンテキスト検出器は必然的に、トレーニング分布を超えた分散シフトに直面している。
先行研究は、大規模なシーンテキスト事前学習に依存することが多いが、クロスドメインの変更や実世界の画像劣化による評価は限られている。
分散シフト下でのシーンテキスト検出のための効率的なフレームワークであるTextDSを提案する。
まず,視覚基盤モデルを用いたデータ効率の良いデュアルエンコーダの設計を提案する。
次に,ステップワイドロラ適応(SWLoRA)を導入し,機能適応を効果的に行う動的早期退避機構を用いて,プログレッシブな低ランク化を実現する。
第3に,相補的,シフト・ロバストな情報を保持しつつ,2つの枝を共有部分空間で整列して融合させるコモン・サブスペース・フュージョン(CSF)を提案する。
最後に,画像劣化下での評価におけるギャップに対処するために,悪条件シーンテキスト検出データセットを構築した。
実験の結果、TextDSはシーンテキストの検出において競争力を発揮し、4.9Mのトレーニング可能なパラメータしか持たず、領域間の堅牢性や悪い撮像条件を実証している。
関連論文リスト
- Mitigating Memorization in Text-to-Image Diffusion via Region-Aware Prompt Augmentation and Multimodal Copy Detection [53.789057575175065]
領域認識型prompt Augmentation(RAPTA)とAttention-Driven Multimodal Copy Detection(ADMCD)を示す。
RAPTAはオブジェクト検出器を使用して、正常な領域を見つけ、それらを意味論的に接地したプロンプトの変種に変換する。
ADMCDは、ローカルパッチ、グローバルセマンティック、テクスチャキューを軽量トランスフォーマーで集約し、融合表現を生成する。
実験により、RAPTAは高い合成品質を維持しながら過度な適合を減少させ、ADMCDはコピーを確実に検出し、単一モードの指標より優れることが示された。
論文 参考訳(メタデータ) (2026-03-13T15:16:27Z) - TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment [68.91073792449201]
そこで本研究では,テキストの正確かつ完全な出現を促すトレーニング不要な方法であるTextGuiderを提案する。
具体的には,多モード拡散変換器(MM-DiT)モデルにおける注意パターンを解析し,特に画像に描画することを意図したテキスト関連トークンについて検討する。
テスト時間テキストレンダリングでは,OCR精度とCLIPスコアが大幅に向上し,高い結果が得られた。
論文 参考訳(メタデータ) (2025-12-10T06:18:30Z) - Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations [56.816929931908824]
マルチモーダルデータにおける意味的協調操作の検出の先駆者となった。
本稿では,RamDG(Retrieval-Augmented Manipulation Detection and Grounding)フレームワークを提案する。
我々のフレームワークは既存の手法よりも優れており、SAMMの精度は最先端の手法に比べて2.06%高い。
論文 参考訳(メタデータ) (2025-09-16T04:18:48Z) - Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval [24.544672733180196]
画像と領域レベルでのドメイン適応を考慮した統合テキストベースの人物検索パイプラインを提案する。
提案手法はCUHK-PEDES, ICFG-PEDES, RSTPReidデータセットに対して, 最先端の処理結果を得た。
論文 参考訳(メタデータ) (2025-07-14T12:03:04Z) - Enhancing Scene Text Detectors with Realistic Text Image Synthesis Using
Diffusion Models [63.99110667987318]
DiffTextは、前景のテキストと背景の本質的な特徴をシームレスにブレンドするパイプラインです。
テキストインスタンスが少なくなると、生成したテキストイメージはテキスト検出を支援する他の合成データを一貫して上回ります。
論文 参考訳(メタデータ) (2023-11-28T06:51:28Z) - Harnessing the Power of Multi-Lingual Datasets for Pre-training: Towards
Enhancing Text Spotting Performance [15.513912470752041]
様々な領域への適応能力は、実環境にデプロイする際のシーンテキストスポッティングモデルに不可欠である。
本稿では,ドメイン適応型シーンテキストスポッティングの問題,すなわちマルチドメインソースデータを用いたモデルトレーニングについて検討する。
その結果,複数の領域にまたがるテキストスポッティングベンチマークにおいて,中間表現が有意な性能を発揮する可能性が明らかとなった。
論文 参考訳(メタデータ) (2023-10-02T06:08:01Z) - TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution [17.95994419104427]
TextDiffは、シーンテキストイメージの超解像度に適した拡散ベースのフレームワークである。
公開ベンチマークデータセット上での最先端(SOTA)パフォーマンスを実現する。
提案するMDDモジュールは,SOTA法により生成されたテキストエッジを効果的にシャープするプラグイン・アンド・プレイである。
論文 参考訳(メタデータ) (2023-08-13T11:02:16Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - Domain Adaptive Scene Text Detection via Subcategorization [45.580559833129165]
ドメイン適応型シーンテキストの検出について検討する。
我々は、ネットワーク過度に適合し、ノイズの多い擬似ラベルを緩和する、サブカテゴリ対応の自己学習技術であるSCASTを設計する。
SCASTは、複数の公開ベンチマークで一貫して優れた検出性能を達成する。
論文 参考訳(メタデータ) (2022-12-01T09:15:43Z) - Text Detection & Recognition in the Wild for Robot Localization [1.52292571922932]
テキスト文字列とバウンディングボックスを同時に出力するエンド・ツー・エンドシーンテキストスポッティングモデルを提案する。
我々の中心的な貢献は、不規則かつ隠蔽されたテキスト領域を適切にキャプチャするために、エンドツーエンドのテキストスポッティングフレームワークを利用することである。
論文 参考訳(メタデータ) (2022-05-17T18:16:34Z) - ContourNet: Taking a Further Step toward Accurate Arbitrary-shaped Scene
Text Detection [147.10751375922035]
本研究では,シーンテキストの偽陽性と大規模分散を効果的に処理するContourNetを提案する。
本手法は,両方向の応答値の高い予測を出力するだけで,これらの偽陽性を効果的に抑制する。
論文 参考訳(メタデータ) (2020-04-10T08:15:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。