論文の概要: One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting
- arxiv url: http://arxiv.org/abs/2607.27902v1
- Date: Thu, 30 Jul 2026 09:17:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.482602
- Title: One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting
- Title(参考訳): MLLMベースのシーンテキストスポッティングのための強化最適化ビジュアルトークングラウンド
- Abstract要約: シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
本研究では,個々のテキストインスタンスを単一のアンカー視覚トークンでルーティングする視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
- 参考スコア(独自算出の注目度): 51.09550363815034
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scene text spotting requires high-precision alignment between textual recognition and spatial localization. While visual-token grounding has emerged as a promising formulation for Multimodal Large Language Models (MLLMs), the previous multi-patch paradigm often introduces redundant noise and localization ambiguity, particularly for dense or small text instances. To address this, we propose Single-Patch Text Spotting (SPaTS), a vision-centric framework that routes each text instance through a single anchor visual token and then recovers geometry via full-image refinement. To accurately identify this anchor without oracle labels, we introduce Single-Patch Selective Optimization (SPaSO), a reinforcement learning framework that optimizes discrete visual-token selection using patch-level rewards. To further improve representation robustness and localization precision, we introduce Directional Embedding Alignment (DEA) to suppress unstable norm bias by decoupling feature magnitude and direction, and Patch-Enhanced Decoding (PED) to fuse the routed anchor with language semantics and cross-attend over the full-image feature map for geometry-aware boundary regression beyond coordinate-space surrogates. Extensive experiments demonstrate that SPaTS consistently and significantly outperforms both frontier closed-source MLLMs and OCR MLLMs. Code will be released soon.
- Abstract(参考訳): シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
マルチモーダル・大規模言語モデル (MLLM) の有望な定式化としてビジュアルトーケングラウンドが登場したが、従来のマルチパッチパラダイムでは、特に高密度または小サイズのテキストインスタンスにおいて、冗長なノイズとローカライゼーションの曖昧さがしばしば導入されている。
そこで本研究では,視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
このアンカーをオラクルラベルなしで正確に識別するために、パッチレベルの報酬を用いて個別の視覚選択を最適化する強化学習フレームワークであるSingle-Patch Selective Optimization (SPaSO)を導入する。
特徴量と方向を疎結合して不安定なノルムバイアスを抑えるためにDEA(Directional Embedding Alignment)を導入し、コーディネート空間のサロゲートを超越した幾何学的境界回帰のための全像特徴マップに対して、ルート付きアンカーを言語意味と相互接続で融合させるPED(Patch-Enhanced Decoding)を導入する。
大規模な実験により、SPaTSはフロンティアのクローズドソースMLLMとOCRのMLLMの両方を一貫して、著しく上回っていることが示された。
コードはまもなくリリースされる。
関連論文リスト
- ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models [22.803631190636313]
我々は、マルチモーダル理解を入力で解決したアライメント問題として再キャストするパラダイムであるTimageを紹介する。
この研究は、意図的な入力再構成をマルチモーダル推論を強化するための強力なアーキテクチャニュートラルレバーとして位置づけている。
論文 参考訳(メタデータ) (2026-06-18T08:40:41Z) - Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models [84.78794648147608]
永続的な幾何学的異常であるモダリティギャップが残っている。
このギャップを埋める以前のアプローチは、過度に単純化された等方的仮定によってほとんど制限されている。
固定フレームモダリティギャップ理論(英語版)を提案し、モダリティギャップを安定バイアスと異方性残差に分解する。
次に、トレーニング不要なモダリティアライメント戦略であるReAlignを紹介します。
論文 参考訳(メタデータ) (2026-02-02T13:59:39Z) - Boosting Point-supervised Temporal Action Localization via Text Refinement and Alignment [66.80402022104074]
本稿では,視覚記述からテキスト特徴を効果的に活用し,意味的に豊かな視覚特徴を補完するテキスト認識・アライメント(TRA)フレームワークを提案する。
これは、PTR(Point-based Text Refinement Module)とPMA(Point-based Multimodal Alignment Module)の2つの新しいモジュールを設計することで実現される。
論文 参考訳(メタデータ) (2026-02-01T14:35:46Z) - SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment [8.657941729790599]
本稿では,パッチの冗長性と曖昧性に体系的に対処するセマンティック・エンハンスト・パッチ・スライミング(SEPS)フレームワークを紹介する。
提案手法では,密文と疎文の両方から統合されたセマンティクスを統合するための2段階の機構を用いて,視覚的パッチを識別する。
Flickr30KとMS-COCOデータセットの実験は、SEPSが優れたパフォーマンスを達成することを検証する。
論文 参考訳(メタデータ) (2025-11-03T09:41:32Z) - Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection [65.29550320117526]
我々はFinGrainedADという新しいフレームワークを提案し、異常なローカライゼーション性能を改善する。
実験により、提案されたFinGrainedADは、数ショット設定で全体的なパフォーマンスが優れていることが示された。
論文 参考訳(メタデータ) (2025-10-30T13:09:00Z) - Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs [88.68484904214142]
Patch-as-Decodable Token (PaDT)を導入し、テキストと多様な視覚出力を生成する。
PaDTの中心は、クエリイメージのビジュアルパッチ埋め込みから派生したVisual Reference Tokens (VRT)である。
MLLMモデルと比較しても,PaDTは最先端の性能を一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-10-02T12:23:57Z) - Visual Semantic Description Generation with MLLMs for Image-Text Matching [7.246705430021142]
本稿では,マルチモーダル大言語モデル(MLLM)を視覚的意味論として活用することにより,モダリティギャップを橋渡しする新しいフレームワークを提案する。
提案手法は,(1)視覚特徴とVSDを融合して画像表現の言語表現性を高めることによるインスタンスレベルのアライメント,(2)カテゴリレベルのアライメントを確保するためのVSDクラスタリングによるプロトタイプレベルのアライメントを組み合わせたものである。
論文 参考訳(メタデータ) (2025-07-11T13:38:01Z) - Scale-wise Bidirectional Alignment Network for Referring Remote Sensing Image Segmentation [12.893224628061516]
リモートセンシング画像セグメンテーション(RRSIS)の目的は、自然言語表現を用いて、空中画像内の特定のピクセルレベル領域を抽出することである。
本稿では,これらの課題に対処するため,SBANet(Scale-wise Bidirectional Alignment Network)と呼ばれる革新的なフレームワークを提案する。
提案手法は,RRSIS-DとRefSegRSのデータセットにおける従来の最先端手法と比較して,優れた性能を実現する。
論文 参考訳(メタデータ) (2025-01-01T14:24:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。