論文の概要: Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution
- arxiv url: http://arxiv.org/abs/2608.04525v1
- Date: Wed, 05 Aug 2026 06:57:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.767684
- Title: Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution
- Title(参考訳): Scene Text Image Super-Resolutionのための連成連続離散生成
- Authors: Axi Niu, Knag Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang,
- Abstract要約: Scene Text Image Super- resolution (STISR) は、劣化した入力から文字の意味を保ちながら、視覚的に可視な外観を回復することを目的としている。
本稿では,STISRを連成連続離散生成として定式化する統合フレームワークであるDualTSRを提案する。
条件付きフローマッチングは連続した画像ラテントを復元し、吸収状態の離散拡散はテキストトークンを再構成する。
- 参考スコア(独自算出の注目度): 51.31474187379532
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scene text image super-resolution (STISR) aims to recover visually plausible appearance while preserving character semantics from degraded inputs. Existing STISR systems often rely on externally generated priors or separate image and text models, resulting in error propagation and costly multi-stage inference. We present DualTSR, a unified framework that formulates STISR as coupled continuous-discrete generation. Conditional flow matching restores continuous image latents, while absorbing-state discrete diffusion reconstructs text tokens. Both processes share a multimodal transformer backbone, allowing the evolving image and text states to interact throughout generation without an external OCR prior at inference. On CTR-TSR, DualTSR achieves the best FID, LPIPS, ACC, and NED among the compared methods at both X2 and X4. On an aligned RealCE subset, it obtains the best FID, ACC, and NED with competitive LPIPS. Compared with DiffTSR at X4, DualTSR improves ACC by 12.78 percentage points while reducing the parameter count from 1.23B to 203M and end-to-end latency from 13.3s to 132ms. These results establish DualTSR as an accurate and efficient method for STISR.
- Abstract(参考訳): Scene Text Image Super- resolution (STISR) は、劣化した入力から文字の意味を保ちながら、視覚的に可視な外観を回復することを目的としている。
既存のSTISRシステムは、しばしば外部で生成された先行モデルや画像とテキストの分離に依存し、エラーの伝播とコストのかかる多段階推論をもたらす。
本稿では,STISRを連成連続離散生成として定式化する統合フレームワークであるDualTSRを提案する。
条件付きフローマッチングは連続した画像ラテントを復元し、吸収状態の離散拡散はテキストトークンを再構成する。
どちらのプロセスもマルチモーダルトランスフォーマーのバックボーンを共有しており、進化する画像とテキスト状態は、推論に先立って外部のOCRを使わずに、世代を通して相互作用することができる。
CTR-TSRでは、X2とX4の比較手法の中で、DualTSRは最高のFID、LPIPS、ACC、NEDを達成している。
整列されたRealCEサブセットでは、競合するLPIPSを持つ最高のFID、ACC、NEDが得られる。
X4のDiffTSRと比較して、DualTSRはACCを12.78ポイント改善し、パラメータ数を1.23Bから203Mに、エンドツーエンドのレイテンシを13.3sから132msに短縮した。
これらの結果は、DualTSRをSTISRの正確かつ効率的な方法として確立する。
関連論文リスト
- Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution [80.28905986756685]
DiMOO-SRは光リアル画像超解法のための多モード離散拡散フレームワークである。
広く使われている実世界のSRベンチマークの実験では、DiMOO-SRはいくつかの並列デコードステップで競合する知覚品質を達成する。
論文 参考訳(メタデータ) (2026-07-20T07:01:01Z) - LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning [44.00535468968033]
リモートセンシング画像変化キャプション(RSICC)は、ペア化されたリモートセンシング画像(RSI)間の意味的変化の記述を生成する
LBTCapは、双方向トランスフォーマー上に構築された軽量RSICCフレームワークで、ペアリングされたRSIの効率的な処理のために、事前および変更後の機能を共同でモデル化する。
LBTCapは、パラメータをはるかに少なくし、推論速度を著しく高くしながら、最先端の手法の精度と一致または緊密に接近していることを示す実験である。
論文 参考訳(メタデータ) (2026-07-03T13:38:38Z) - DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution [52.962204748003394]
Scene Text Image Super-Resolutionは、低解像度のテキスト画像における高解像度の詳細を復元することを目的としている。
しかし、既存の手法は、しばしば外部光学文字認識(OCR)モデルに依存している。
両問題に対処する統合エンドツーエンドフレームワークであるDualTSRを紹介する。
論文 参考訳(メタデータ) (2026-03-15T03:50:47Z) - Few-Step Diffusion via Score identity Distillation [67.07985339442703]
拡散蒸留は, テキスト・ツー・イメージ(T2I)拡散モデルを促進するための有望な戦略として浮上している。
既存の方法は、高分解能T2I拡散モデルを蒸留する際に、実像や教師合成画像に頼っている。
教師のCFGを無効にし、偽スコアネットワークでテキストコンディショニングを除去するZero-CFGと、偽スコアネットワークで否定的なCFGを適用するAnti-CFGの2つの新しいガイダンス戦略を提案する。
論文 参考訳(メタデータ) (2025-05-19T03:45:16Z) - Improving Consistency in Diffusion Models for Image Super-Resolution [28.945663118445037]
拡散法における2種類の矛盾を観測する。
セマンティックとトレーニング-推論の組み合わせを扱うために、ConsisSRを導入します。
本手法は,既存拡散モデルにおける最先端性能を示す。
論文 参考訳(メタデータ) (2024-10-17T17:41:52Z) - Audio-visual Multi-channel Recognition of Overlapped Speech [79.21950701506732]
本稿では,音声とマルチチャンネルの重なり合う音声認識システムについて述べる。
実験により,提案したマルチチャネルAVSRシステムは,音声のみのASRシステムを最大6.81% (26.83%) ,22.22% (56.87%) の絶対単語誤り率 (WER) で比較した。
論文 参考訳(メタデータ) (2020-05-18T10:31:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。