論文の概要: ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement
- arxiv url: http://arxiv.org/abs/2608.28784v1
- Date: Fri, 28 Aug 2026 18:45:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.744356
- Title: ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement
- Title(参考訳): ClearText-Video: 大規模テキスト中心のビデオデータセットによるビデオ修復とシーンテキストの強化
- Abstract要約: 本稿では、テキスト中心のビデオ理解を研究するためのシーンテキスト対応ベンチマークであるClearText-Video(CTVid)を紹介する。
CTVidには4,639の現実世界のテキスト中心のビデオ、550K以上のフレーム、1.6Mの人間認証されたシーンテキストアノテーション、220K以上の空間的/時間的質問応答ペアが含まれている。
我々はCTVid上で18の代表的な修復法と16の最先端MLLMを評価した。
- 参考スコア(独自算出の注目度): 7.6045854520855904
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) have recently made strong progress in visual--linguistic understanding. However, their performance on text-centric video reasoning remains highly sensitive to input quality. Real-world user-provided videos often contain motion blur, compression artifacts, noise, and low-resolution text, which impair reliable text reading and downstream reasoning. Whether MLLMs can robustly read and reason about real-world scene text under diverse quality conditions remains a fundamental open question. We introduce ClearText-Video (CTVid), a large-scale, scene-text-aware benchmark for studying text-centric video understanding under controlled quality variation. CTVid contains 4,639 real-world text-rich egocentric videos, 550K+ frames, 1.6M human-verified scene-text annotations, and 220K+ spatial/temporal question--answer pairs in Chinese and English. For each high-quality video, CTVid provides content-matched Degraded-Quality and Restored-Quality variants, supporting two task families: Text-Centric Video Restoration and Multi-Quality VideoQA. We evaluate 18 representative restoration methods and 16 state-of-the-art MLLMs on CTVid. The results show that visual enhancement does not guarantee textual fidelity or downstream reasoning gains: blur is more damaging than low resolution, restored videos can alter the textual evidence used by MLLMs, and OCR-only pipelines remain far below direct multimodal reasoning. CTVid exposes the gap between video restoration and text-grounded understanding, providing a rigorous foundation for restoration-aware, quality-robust text-centric video systems.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は近年,視覚言語理解において大きな進歩を遂げている。
しかし、テキスト中心のビデオ推論の性能は、入力品質に非常に敏感なままである。
現実世界のユーザーが提供するビデオは、しばしばモーションボケ、圧縮アーティファクト、ノイズ、低解像度のテキストを含む。
MLLMが様々な品質条件下で現実世界のシーンテキストをしっかり読み書きできるかどうかという根本的な疑問が残る。
ClearText-Video(CTVid)は,テキスト中心の映像理解を品質変化の制御下で研究するための大規模・シーンテキスト対応のベンチマークである。
CTVidには、4,639の現実世界のテキスト中心の動画、550K以上のフレーム、1.6Mの人間認証されたシーンテキストアノテーション、220K以上の空間的・時間的質問対が中国語と英語で答えられる。
高品質ビデオごとに、CTVidはコンテンツマッチングされた劣化品質と復元品質のバリエーションを提供し、テキスト中心のビデオ復元とマルチ品質ビデオQAの2つのタスクファミリをサポートする。
我々はCTVid上で18の代表的な修復法と16の最先端MLLMを評価した。
その結果、視覚的強調はテキストの忠実さや下流の推論の利得を保証していないことが明らかとなった。ボケは低解像度よりも傷つきやすく、復元されたビデオはMLLMが使用するテキストのエビデンスを変化させることができ、OCRのみのパイプラインは直接マルチモーダル推論よりはるかに低いままである。
CTVidは、ビデオの復元とテキストによる理解のギャップを露呈し、復元を意識した高品質なテキスト中心のビデオシステムのための厳格な基盤を提供する。
関連論文リスト
- TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval [5.527227553079524]
無人航空機(UAV)は、リアルタイムで高解像度のデータ収集のための強力なプラットフォームとなっている。
これらのビデオから関連コンテンツの効率的な検索は、都市管理、緊急対応、セキュリティ、災害救助の応用に不可欠である。
我々は,2,864本の動画と14,320本の細粒度,セマンティックなキャプションを含むDVTMDデータセットを構築した。
論文 参考訳(メタデータ) (2025-10-11T11:38:01Z) - VidText: Towards Comprehensive Evaluation for Video Text Understanding [56.121054697977115]
VidTextは、ビデオテキスト理解の総合的かつ詳細な評価のためのベンチマークである。
さまざまな現実世界のシナリオをカバーし、多言語コンテンツをサポートする。
ビデオレベル、クリップレベル、インスタンスレベルのタスクを備えた階層的評価フレームワークを導入している。
論文 参考訳(メタデータ) (2025-05-28T19:39:35Z) - MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios [66.59827827146262]
我々は,ビデオOCRアプリケーションシナリオを包括的に含むMME-VideoOCRベンチマークを紹介する。
ベンチマークは、解像度、アスペクト比、持続時間が異なる1,464本のビデオと、2000本の細心の注意を払って、手動で注釈付けされた質問回答ペアで構成されている。
MME-VideoOCRを用いて18種類のMLLMを評価し,最高の性能モデル(Gemini-2.5 Pro)でさえ73.7%の精度で達成できることを示した。
論文 参考訳(メタデータ) (2025-05-27T15:27:46Z) - The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning [89.64905703368255]
ゼロショットビデオキャプションのためのプログレッシブな多粒性テキストプロンプト戦略を提案する。
提案手法は,名詞句,名詞句のシーングラフ,全文を含む3つの異なる記憶バンクを構築する。
論文 参考訳(メタデータ) (2025-03-31T03:00:19Z) - HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models [63.65066762436074]
HiTVideoは、テキストからビデオ生成タスクにおける既存のビデオトークンの潜在的な制限を解決することを目的としている。
マルチレイヤの離散トークンフレームワークを備えた3D因果VAEを使用し、ビデオコンテンツを階層的に構造化されたコードブックにエンコードする。
論文 参考訳(メタデータ) (2025-03-14T15:36:39Z) - Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues [8.797350517975477]
ビデオテキストベースの視覚的質問応答 (Video TextVQA) は、あるビデオにおいて、共同でテキストによる推論と視覚情報によって質問に答えることを目的とした実践的なタスクである。
画像からビデオへ生成するTextVQAフレームワークをより良く拡張するTEA(stands for textbfTrack thbfE bftextA languageser'')手法を提案する。
論文 参考訳(メタデータ) (2024-12-17T03:06:12Z) - MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval [53.417646562344906]
Video Moment Retrieval (VMR) は、自然言語クエリが与えられた未トリミング長ビデオ内の特定の時間セグメントをローカライズすることを目的としている。
既存の方法は、しばしば不十分なトレーニングアノテーションに悩まされる。つまり、文は通常、単語の多様性が制限された前景の顕著なビデオ内容のごく一部と一致する。
この本質的なモダリティの不均衡は、視覚情報のかなりの部分がテキストと一致しないまま残されている。
本研究では,MLLMをビデオナレーターとして用いて,ビデオのテキスト記述を多用し,モダリティの不均衡を緩和し,時間的局所化を促進させる。
論文 参考訳(メタデータ) (2024-06-25T18:39:43Z) - TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment [42.557643515992005]
ビデオの理解は、相当量のWebビデオテキストデータが利用できるにもかかわらず、依然として課題である。
ビデオ理解のための大規模言語モデル(LLM)を拡張する新しいアプローチであるテキストオンリー・プレアライメント(TOPA)を導入する。
論文 参考訳(メタデータ) (2024-05-22T18:35:10Z) - Towards A Better Metric for Text-to-Video Generation [102.16250512265995]
生成モデルは高品質のテキスト、画像、ビデオの合成において顕著な能力を示した。
新たな評価パイプラインであるText-to-Video Score(T2VScore)を導入する。
本尺度は,(1)テキスト記述における映像の忠実度を精査するテキスト・ビデオ・アライメント,(2)ビデオ品質,(2)ビデオ全体の製作口径を専門家の混合で評価するビデオ品質の2つの重要な基準を統合した。
論文 参考訳(メタデータ) (2024-01-15T15:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。