論文の概要: Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance
- arxiv url: http://arxiv.org/abs/2606.30458v1
- Date: Mon, 29 Jun 2026 15:24:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.312739
- Title: Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance
- Title(参考訳): 低解像度サーベイランスにおけるロバストテキスト-画像検索のためのクロスリゾリューション・セマンティック・トランスファー
- Abstract要約: Cross-Resolution Semantic Transfer (CRST)はCLIPスタイルの3つのモジュールを持つフレームワークである。
実験により、CRSTは高解像度の精度を犠牲にすることなく混合分解能検索を安定化させながら、平均5.7%と5.3%で超低解像度のランク1とmAPを改善することが示された。
- 参考スコア(独自算出の注目度): 62.560024755525546
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image person re-identification (TIPR) retrieves target persons using natural language descriptions. However, existing methods largely overlook resolution variance in real-world surveillance. They characterize cross-resolution TIPR through two coupled failure modes: Evidence Reliability Collapse (ERC), where degraded visual tokens become unreliable for grounding fine-grained text, and Ranking Distribution Drift (RDD), where mixed-resolution galleries distort similarity neighborhoods and destabilize retrieval rankings. To address this challenge, we propose Cross-Resolution Semantic Transfer (CRST), a CLIP-style framework with three modules: resolution-conditioned reasoning, text-guided refinement and CR-RDA. Resolution-conditioned reasoning estimates token reliability to suppress corrupted evidence. Text-guided refinement injects semantic priors to recover discriminative cues. CR-RDA transfers HR neighborhood geometry to stabilize LR ranking under mixed resolutions. Experiments on CUHK-PEDES, ICFG-PEDES, and RSTPReid show that CRST improves ultra-low-resolution Rank-1 and mAP on average by 5.7% and 5.3%, while stabilizing mixed-resolution retrieval without sacrificing high-resolution accuracy.The code will be made publicly available.
- Abstract(参考訳): TIPR(Text-to-image person re-identification)は、自然言語記述を用いて対象者を検索する。
しかし、既存の手法は現実世界の監視における解像度のばらつきを概ね見落としている。
Evidence Reliability Collapse (ERC) は、劣化した視覚トークンが、きめ細かいテキストのグラウンド化には信頼性が低下するものであり、Randing Distribution Drift (RDD) は、混合解像度ギャラリーが類似した近傍を歪ませ、検索ランクを不安定にする。
この課題に対処するために、CLIPスタイルの3つのモジュールを持つCLIPスタイルのフレームワークであるCRST(Cross-Resolution Semantic Transfer)を提案する。
分解条件推論は、破損した証拠を抑えるためにトークンの信頼性を推定する。
テキスト誘導精製は、識別的手がかりを回復するためにセマンティック先行を注入する。
CR-RDAはHR近傍の幾何を混合分解能下でLRランクを安定化させる。
CUHK-PEDES、ICFG-PEDES、RSTPReidの実験では、CRSTは超低解像度のランク1とmAPを平均5.7%と5.3%改善し、高精度の精度を犠牲にすることなく混合解像度検索を安定化する。
関連論文リスト
- PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution [51.96078493242164]
PRISMは単一ステップ拡散ベースのText-SRフレームワークである。
PRISMはミリ秒レベルの推論で最先端の性能を達成する。
論文 参考訳(メタデータ) (2026-05-13T05:31:06Z) - Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution [59.71803719801537]
CODSRは、画像超解像のための制御可能なワンステップ拡散ネットワークである。
拡散過程に高忠実度条件を与えるLQ誘導型特徴変調モジュールを提案する。
そこで我々は,知覚の豊かさを効果的に向上させるために,領域適応型事前活性化法を開発した。
論文 参考訳(メタデータ) (2025-12-16T03:56:02Z) - SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning [59.013863248600046]
本稿では,空間的に再焦点を絞ったテキストコンディショニングを推論時に洗練する超解像フレームワークを提案する。
第二に,非接地画素に対するテキストの影響を選択的に回避し,幻覚を防ぐ空間的自由誘導機構を導入する。
論文 参考訳(メタデータ) (2025-10-26T05:03:55Z) - Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models [0.026861992804651083]
本稿では拡散生成集合から最も信頼できるSRサンプルを特定するための堅牢なフレームワークを提案する。
本稿では,意味的類似性に基づいてSR信頼性を定量化するハイブリッド尺度TWSを提案する。
アウトプットを人間の期待と意味的正しさに合わせることで、この研究は生成的SRにおける信頼性の新たなベンチマークを定めている。
論文 参考訳(メタデータ) (2025-06-25T21:00:44Z) - Text-guided Explorable Image Super-resolution [14.83045604603449]
ゼロショットテキスト誘導超解像に対する2つのアプローチを提案する。
提案手法はテキストプロンプトによって提供される意味的意味に合致する多様な解をもたらすことを示す。
論文 参考訳(メタデータ) (2024-03-02T08:10:54Z) - Learning Resolution-Adaptive Representations for Cross-Resolution Person
Re-Identification [49.57112924976762]
低解像度(LR)クエリIDイメージと高解像度(HR)ギャラリーイメージとの整合性を実現する。
実際のカメラとの違いにより、クエリ画像が分解能の低下に悩まされることがしばしばあるため、これは困難かつ実用的な問題である。
本稿では,問合せ画像の解像度に適応する動的計量を用いて,HRとLRの画像を直接比較するためのSRフリーなパラダイムについて検討する。
論文 参考訳(メタデータ) (2022-07-09T03:49:51Z) - Robust Reference-based Super-Resolution via C2-Matching [77.51610726936657]
超解像(Ref-SR)は、最近、高分解能(HR)参照画像を導入して、低分解能(LR)入力画像を強化するための有望なパラダイムとして登場した。
既存のRef-SR法は主に暗黙の対応に頼り、参照画像からHRテクスチャを借用し、入力画像の情報損失を補う。
本稿では,C2-Matchingを提案する。
論文 参考訳(メタデータ) (2021-06-03T16:40:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。