論文の概要: Decoupling semantics from vision: A framework for faithful visual-text compression evaluation
- arxiv url: http://arxiv.org/abs/2608.01848v1
- Date: Mon, 03 Aug 2026 07:56:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.390257
- Title: Decoupling semantics from vision: A framework for faithful visual-text compression evaluation
- Title(参考訳): 視覚から意味を分離する:忠実な視覚テキスト圧縮評価のためのフレームワーク
- Authors: Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng,
- Abstract要約: VTCの品質を忠実に評価するMLLMの能力を分離する新たな評価フレームワークを導入する。
テキスト依存をなくすことで,評価結果がVTCの品質を純粋に反映していることが保証される。
- 参考スコア(独自算出の注目度): 5.942515516844501
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent visual-text compression (VTC) methods, typified by DeepSeek-OCR, report impressive high token compression ratios for long-context modeling tasks by leveraging text-to-image rendering. However, existing evaluation protocols heavily rely on downstream task performance. Such evaluation metrics fail to accurately measure text preservation due to the strong inherent linguistic priors of Multimodal Large Language Models (MLLMs). In this work, we introduce a new evaluation framework that decouples MLLMs' capabilities to faithfully assess VTC quality. Within this framework, we further introduce the ZeroSense Benchmark to ensure low semantic correlation of testing samples. By eliminating textual dependencies, our benchmark guarantees that the evaluation results are purely reflective of VTC quality, unaffected by the semantic inference capabilities of downstream models. Extensive experiments across multiple datasets demonstrate that VTC quality and downstream task accuracy diverge significantly, highlighting the necessity of our decoupled evaluation framework.
- Abstract(参考訳): 近年,DeepSeek-OCRに代表されるビジュアルテキスト圧縮(VTC)法では,テキスト・ツー・イメージ・レンダリングを利用した長文モデリングタスクにおいて,高いトークン圧縮比が顕著に報告されている。
しかし、既存の評価プロトコルはダウンストリームタスクのパフォーマンスに大きく依存している。
このような評価基準は,MLLM(Multimodal Large Language Models)の強い言語的前提により,テキストの保存を正確に測定することができない。
本稿では,VTC品質を忠実に評価するMLLMの能力を分離した新たな評価フレームワークを提案する。
このフレームワークでは、テストサンプルのセマンティックな相関を低くするため、ZeroSense Benchmarkをさらに導入する。
テキスト依存を除去することにより,評価結果がVTCの品質を純粋に反映し,下流モデルのセマンティック推論能力の影響を受けないことを確認した。
複数のデータセットにわたる大規模な実験により、VTCの品質と下流タスクの精度が著しく変化していることが示され、分離された評価フレームワークの必要性が強調された。
関連論文リスト
- Employing Vision-Language Models for Face Image Quality Assessment [0.023141219541346198]
顔画像品質評価(FIQA)はバイオメトリックパイプラインにおいて重要な制御ステップである。
最先端のFIQA法は高い実用性を達成するが、通常「ブラックボックス」として機能する
ゼロショット環境でFIQAを実行することにより,このギャップを埋めるため,市販のビジョンランゲージモデル(VLM)の可能性を検討する。
論文 参考訳(メタデータ) (2026-05-17T14:57:52Z) - ZeroSense:How Vision matters in Long Context Compression [5.942515516844501]
VTCの品質を忠実に評価するMLLMの能力を分離する新たな評価フレームワークを導入する。
文脈依存をなくすことで,評価結果がVTCの品質を純粋に反映していることが保証される。
論文 参考訳(メタデータ) (2026-03-12T12:11:48Z) - Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs [80.03370593724422]
Out-of-Distribution (OOD) は未知のクラスからサンプルを識別する。
現在の手法では、否定的なテキストとIDラベルを比較するなど、OOD検出中にモード内距離を組み込むことが多い。
テキストおよび視覚的視点から一貫したモーダル距離拡張を体系的に利用するフレームワークであるInterNegを提案する。
論文 参考訳(メタデータ) (2026-03-03T05:44:47Z) - Gloss-Free Sign Language Translation: An Unbiased Evaluation of Progress in the Field [18.404620610035174]
手話翻訳は、視覚的な手話ビデオを自動的に音声言語テキストに変換することを目的としている。
近年は急速に進歩しているが、性能改善の真の源泉はよく不明である。
本稿では,最近のGloss-free SLTモデルについて,統一フレームワークにおける重要なコントリビューションを再実装した総合的研究を行う。
論文 参考訳(メタデータ) (2026-02-18T08:40:31Z) - Visual CoT Makes VLMs Smarter but More Fragile [79.32638667101817]
チェーン・オブ・ソート(CoT)技術は視覚言語モデル(VLM)における推論を著しく向上させた
Visual CoTは、興味のある領域のトリミングや注釈付けなどの明示的なビジュアル編集を推論プロセスに統合する。
視覚摂動下での視覚的CoTロバスト性の最初の体系的評価について述べる。
論文 参考訳(メタデータ) (2025-09-28T10:19:59Z) - Benchmark Granularity and Model Robustness for Image-Text Retrieval [44.045767657945895]
データセットの粒度とクエリの摂動が検索性能とロバスト性にどのように影響するかを示す。
よりリッチなキャプションは、特にテキスト・ツー・イメージタスクにおいて、検索を継続的に強化することを示す。
本研究は, モデル頑健性の変化とキャプション粒度と感度摂動のデータセット依存的関係に着目した。
論文 参考訳(メタデータ) (2024-07-21T18:08:44Z) - Multi-Modal Prompt Learning on Blind Image Quality Assessment [65.0676908930946]
画像品質評価(IQA)モデルは意味情報から大きな恩恵を受け、異なる種類のオブジェクトを明瞭に扱うことができる。
十分な注釈付きデータが不足している従来の手法では、セマンティックな認識を得るために、CLIPイメージテキスト事前学習モデルをバックボーンとして使用していた。
近年のアプローチでは、このミスマッチに即時技術を使って対処する試みがあるが、これらの解決策には欠点がある。
本稿では、IQAのための革新的なマルチモーダルプロンプトベースの手法を提案する。
論文 参考訳(メタデータ) (2024-04-23T11:45:32Z) - Exploring Precision and Recall to assess the quality and diversity of LLMs [82.21278402856079]
我々はtextscLlama-2 や textscMistral のような大規模言語モデル (LLM) のための新しい評価フレームワークを提案する。
このアプローチにより、コーパスの整合を必要とせず、生成したテキストの品質と多様性を微妙に評価できる。
論文 参考訳(メタデータ) (2024-02-16T13:53:26Z) - Evaluating and Improving Factuality in Multimodal Abstractive
Summarization [91.46015013816083]
そこで我々は,CLIPBERTScoreを提案する。
ゼロショットにおけるこの2つの指標の単純な組み合わせは、文書要約のための既存の事実度指標よりも高い相関性が得られることを示す。
本分析は,CLIPBERTScoreとそのコンポーネントの信頼性と高い相関性を示す。
論文 参考訳(メタデータ) (2022-11-04T16:50:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。