論文の概要: Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
- arxiv url: http://arxiv.org/abs/2509.06996v2
- Date: Wed, 17 Sep 2025 13:47:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-09-18 14:28:52.493053
- Title: Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
- Title(参考訳): Visibleはまだ読めない: システム全体にわたる視覚言語モデルの体系的な盲点
- Abstract要約: 先進視覚言語モデル(VLM)がこのレジリエンスを共有しているかどうかを検討する。
我々は、異なる筆記システムにまたがる2つの心理物理学的なベンチマークを構築した。
クリーンテキスト上での強いパフォーマンスにもかかわらず、現代のVLMはこれらの摂動の下で深刻な低下を見せている。
- 参考スコア(独自算出の注目度): 25.47053654117902
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Writing is a universal cultural technology that reuses vision for symbolic communication. Humans display striking resilience: we readily recognize words even when characters are fragmented, fused, or partially occluded. This paper investigates whether advanced vision language models (VLMs) share this resilience. We construct two psychophysics inspired benchmarks across distinct writing systems, Chinese logographs and English alphabetic words, by splicing, recombining, and overlaying glyphs to yield ''visible but unreadable'' stimuli for models while remaining legible to humans. Despite strong performance on clean text, contemporary VLMs show a severe drop under these perturbations, frequently producing unrelated or incoherent outputs. The pattern suggests a structural limitation: models heavily leverage generic visual invariances but under rely on compositional priors needed for robust literacy. We release stimuli generation code, prompts, and evaluation protocols to facilitate transparent replication and follow up work. Our findings motivate architectures and training strategies that encode symbol segmentation, composition, and binding across scripts, and they delineate concrete challenges for deploying multimodal systems in education, accessibility, cultural heritage, and security.
- Abstract(参考訳): 執筆は、象徴的なコミュニケーションのためのビジョンを再利用する普遍的な文化技術である。
文字が断片化されたり、融合されたり、あるいは部分的に隠されたりしても、私たちは言葉を容易に認識できます。
本稿では,先進視覚言語モデル(VLM)がこのレジリエンスを共有しているかどうかを検討する。
我々は,異なる筆記システム,中国語のロググラフ,英語のアルファベット語のベンチマークを2つ構築し,グリフをスプライシング,再結合,オーバーレイすることで,人間に可視性を維持しながらモデルに対して「可視だが読めない」刺激を与える。
クリーンテキスト上での強いパフォーマンスにもかかわらず、現代のVLMはこれらの摂動の下で深刻な低下を示し、しばしば無関係または不整合な出力を生成する。
このパターンは構造的制限を示唆している:モデルは一般的な視覚的不変性を大いに活用するが、堅牢なリテラシーに必要な構成的事前に依存している。
透明な複製と追従作業を容易にするための刺激生成コード、プロンプト、評価プロトコルをリリースする。
本研究は, 記号のセグメンテーション, 構成, およびスクリプト間のバインディングを符号化するアーキテクチャとトレーニング戦略を動機付け, 教育, アクセシビリティ, 文化遺産, セキュリティにマルチモーダルシステムを展開する上での具体的な課題を整理した。
関連論文リスト
- Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding [96.81411333150213]
本稿では,最上位のMLLMが個別の意味空間をどのようにナビゲートするかを評価するためのベンチマークを紹介する。
モデルは基本的なシンボル認識に失敗することが多いが、複雑な推論タスクに成功している。
この作業は、より厳格で人間指向のインテリジェントなシステムを開発するためのロードマップを提供する。
論文 参考訳(メタデータ) (2026-03-19T04:08:20Z) - LogoDiffuser: Training-Free Multilingual Logo Generation and Stylization via Letter-Aware Attention Control [6.75235033060142]
マルチモーダル拡散変換器を用いて多言語ロゴデザインを合成する学習自由手法を提案する。
テキストプロンプトの代わりに、ターゲット文字を画像として入力し、言語によらず頑健な文字構造制御を可能にする。
本手法は,多言語ロゴ生成における最先端性能を実現する。
論文 参考訳(メタデータ) (2026-03-10T14:57:46Z) - Reading $\
eq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models [16.13083848552738]
視覚言語モデルは画像中のテキストを読むのにほぼ完璧な精度を達成するが、大部分はタイポグラフィー・ブラインドである。
フォントファミリ,サイズ,スタイル,色認識を26種,スクリプト4種,難易度3種で評価することにより,このギャップを系統的に検討した。
視覚言語理解におけるタイポグラフィーギャップの解消を支援するため,評価フレームワーク,データ,微調整レシピをリリースする。
論文 参考訳(メタデータ) (2026-03-09T15:31:47Z) - Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning [1.6234264741872295]
VLM(Vision-Language Models)は、標準のビジョン言語ベンチマークにおいて強力なパフォーマンスを実現している。
視覚的単語パズルは、暗黙的な視覚的手がかりの発見、仮説の生成と修正、エビデンスを非文学的概念にマッピングする必要があるため、難解な代替手段として提案する。
我々は、この複雑な視覚的理解の形式を評価するために設計された多言語ベンチマークであるEye-Qを紹介する。
論文 参考訳(メタデータ) (2026-01-06T20:27:29Z) - See the Text: From Tokenization to Visual Reading [63.10220471118435]
SeeTokはテキストを画像(ビジュアルテキスト)としてレンダリングし、事前訓練されたマルチモーダル計算を利用して解釈する。
3つの異なる言語タスクの中で、SeeeTokはサブワードトークンをマッチまたはオーバーし、トークンを4.43倍少なくし、FLOPを70.5%削減する。
SeeTokは、象徴的なトークン化から人間のような視覚的な読み方へとシフトし、より自然で認知的にインスパイアされた言語モデルへと一歩前進する。
論文 参考訳(メタデータ) (2025-10-21T17:34:48Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models [93.46875303598577]
視覚言語モデル(VLM)は、マルチモーダル情報処理において急速に進歩しているが、競合する信号の整合性は未解明のままである。
この研究は、VLMがASCIIアートをどう処理するかを考察する。
論文 参考訳(メタデータ) (2025-04-02T10:47:07Z) - Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training [68.41837295318152]
拡散に基づくテキスト・ツー・イメージモデルでは、多様性と美学の素晴らしい成果が示されているが、視覚的なテキストで画像を生成するのに苦労している。
既存のバックボーンモデルには、ミススペル、テキスト生成の失敗、中国語テキストのサポートの欠如といった制限がある。
本稿では,英語と中国語の視覚テキスト生成にバックボーンモデルを活用するための一連の手法を提案する。
論文 参考訳(メタデータ) (2024-10-06T10:25:39Z) - Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization [52.935150075484074]
非言語的なイメージを外国語のような個別のトークン列に変換するために、よく設計されたビジュアルトークン化器を導入する。
結果として得られる視覚トークンは、単語に相応しいハイレベルな意味論を含み、画像から変化する動的シーケンス長もサポートする。
この統合によりLaVITは、マルチモーダルコンテンツの理解と生成を同時に行うための印象的な汎用インターフェースとして機能する。
論文 参考訳(メタデータ) (2023-09-09T03:01:38Z) - Visually-Situated Natural Language Understanding with Contrastive
Reading Model and Frozen Large Language Models [24.456117679941816]
Contrastive Reading Model (Cream)は、Large Language Models (LLM)の言語画像理解能力を高めるために設計された、新しいニューラルネットワークである。
我々のアプローチは、視覚と言語理解のギャップを埋め、より洗練されたドキュメントインテリジェンスアシスタントの開発の道を開く。
論文 参考訳(メタデータ) (2023-05-24T11:59:13Z) - Probing Contextual Language Models for Common Ground with Visual
Representations [76.05769268286038]
我々は、マッチングと非マッチングの視覚表現を区別する上で、テキストのみの表現がいかに効果的かを評価するための探索モデルを設計する。
以上の結果から,言語表現だけでは,適切な対象カテゴリから画像パッチを検索する強力な信号が得られることがわかった。
視覚的に接地された言語モデルは、例えば検索においてテキストのみの言語モデルよりわずかに優れているが、人間よりもはるかに低い。
論文 参考訳(メタデータ) (2020-05-01T21:28:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。