論文の概要: When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
- arxiv url: http://arxiv.org/abs/2603.22368v1
- Date: Mon, 23 Mar 2026 05:34:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.104106
- Title: When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
- Title(参考訳): 視覚が問題にならなかったとき--ミスリーディングデータ可視化による視覚言語モデルの評価
- Authors: Harsh Nishant Lalai, Raj Sanjay Shah, Hanspeter Pfister, Sashank Varma, Grace Guo,
- Abstract要約: 視覚言語モデル (VLM) は, 推論誤りの微粒な分類法を基礎とした, 誤解を招くビジュアル・キャプション・ペアについて評価する。
我々は、現実世界の視覚化と、人間が書いたキュレートされた誤解を招くキャプションを組み合わせたベンチマークを開発する。
- 参考スコア(独自算出の注目度): 29.03749623289173
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Visualizations help communicate data insights, but deceptive data representations can distort their interpretation and propagate misinformation. While recent Vision Language Models (VLMs) perform well on many chart understanding tasks, their ability to detect misleading visualizations, especially when deception arises from subtle reasoning errors in captions, remains poorly understood. Here, we evaluate VLMs on misleading visualization-caption pairs grounded in a fine-grained taxonomy of reasoning errors (e.g., Cherry-picking, Causal inference) and visualization design errors (e.g., Truncated axis, Dual axis, inappropriate encodings). To this end, we develop a benchmark that combines real-world visualization with human-authored, curated misleading captions designed to elicit specific reasoning and visualization error types, enabling controlled analysis across error categories and modalities of misleadingness. Evaluating many commercial and open-source VLMs, we find that models detect visual design errors substantially more reliably than reasoning-based misinformation, and frequently misclassify non-misleading visualizations as deceptive. Overall, our work fills a gap between coarse detection of misleading content and the attribution of the specific reasoning or visualization errors that give rise to it.
- Abstract(参考訳): 可視化はデータの洞察を伝達するのに役立つが、偽のデータ表現は解釈を歪め、誤情報を伝達する。
近年の視覚言語モデル(VLM)は多くのチャート理解タスクでよく機能するが、特に字幕の微妙な推論誤りから誤認が生じた場合に、誤解を招く可視化を検出する能力はいまだによく理解されていない。
ここでは, 推論誤り(例えば, チェリーピッキング, 因果推論)と可視化設計誤り(例えば, トランシット軸, デュアル軸, 不適切なエンコーディング)の微粒な分類に根ざした, 視覚的捕獲対の誤解を招くVLMを評価する。
そこで,本研究では,現実の可視化と人間が作成した誤読キャプションを組み合わせることで,特定の推論や視覚化エラーのタイプを抽出し,エラーカテゴリ間の制御分析と誤読のモダリティを実現するベンチマークを開発した。
多くの商用およびオープンソースのVLMを評価すると、モデルが推論に基づく誤情報よりも視覚的設計ミスをかなり確実に検出し、非誤解の可視化を欺くものとしてしばしば誤分類することがわかった。
全体的な研究は、誤解を招くコンテンツの粗い検出と、それを引き起こす特定の推論や視覚化エラーの帰結とのギャップを埋める。
関連論文リスト
- Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models [25.564425023762045]
現在の視覚言語モデル(VLM)は、基本的なデータ可視化理解タスクに苦戦している。
VLMの失敗は、データビジュアライゼーションにおける視覚情報のエンコード方法、視覚と言語モジュール間の情報転送方法、言語モジュール内での情報処理方法の制限に起因するか?
我々は,データ可視化理解タスクのスイートであるFUGUを開発した。
論文 参考訳(メタデータ) (2025-10-02T18:29:07Z) - Is this chart lying to me? Automating the detection of misleading visualizations [74.26574031329689]
誤解を招くビジュアライゼーションは、ソーシャルメディアやウェブ上での誤報の強力な原動力だ。
Misvizは、12種類のミスリーダーで注釈付けされた2,604の現実世界の視覚化のベンチマークである。
Misviz-synthは、Matplotlibを使って生成され、実世界のデータテーブルに基づいて81,814の可視化データからなる合成データセットである。
論文 参考訳(メタデータ) (2025-08-29T14:36:45Z) - The Perils of Chart Deception: How Misleading Visualizations Affect Vision-Language Models [11.500090488046899]
VLM(Vision-Language Models)は、特に専門家でないユーザによって可視化の解釈に使用されるようになっている。
本研究では,8種類のミスリードチャートを対象とする10種類のモデルから16,000以上の応答を解析した。
本研究は,視覚的誤報に対するVLMの堅牢な保護の必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-08-13T11:11:18Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models [2.526146573337397]
眼科診断に触発された新しい評価手法を提案する。
合成画像のプロシージャ生成を用いて視覚特性の制御を行う。
この診断は、系統的なストレステストときめ細かい故障解析を可能にする。
論文 参考訳(メタデータ) (2025-06-05T12:43:10Z) - Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios [69.00444996464662]
RIV-CoT(Retrieval-based Interleaved Visual Chain-of-Thought法)を提案する。
実験の結果, RIV-CoTの解答精度は3.1%向上し, バニラCoTの解答精度は4.6%向上した。
論文 参考訳(メタデータ) (2025-01-08T18:31:16Z) - Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning [90.13978453378768]
生成したチャートキャプションに事実誤りを包括的に分類する。
大規模な人間のアノテーションの取り組みは、様々なチャートキャプションモデルによって作られたキャプションのエラーパターンと頻度に関する洞察を提供する。
分析の結果,GPT-4Vを含む最先端モデルでさえ,事実不正確なキャプションを頻繁に生成していることが判明した。
論文 参考訳(メタデータ) (2023-12-15T19:16:21Z) - Visual Perturbation-aware Collaborative Learning for Overcoming the
Language Prior Problem [60.0878532426877]
本稿では,視覚的摂動校正の観点から,新しい協調学習手法を提案する。
具体的には、異なる摂動範囲で2種類のキュレートされた画像を構築するための視覚コントローラを考案する。
2つの診断VQA-CPベンチマークデータセットの実験結果は、その効果を明らかに示している。
論文 参考訳(メタデータ) (2022-07-24T23:50:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。