論文の概要: Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities
- arxiv url: http://arxiv.org/abs/2607.27747v1
- Date: Thu, 30 Jul 2026 06:37:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.424289
- Title: Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities
- Title(参考訳): LVLMは視覚的錯覚の真相を明らかにすることができるか? : 知覚と推論能力の分析
- Abstract要約: 本稿では,視覚錯覚を診断ツールとして活用して,大規模視覚言語モデルの評価を行う。
視覚錯覚は、人間の視覚システムが客観的信号を誤解釈する現象である。
IllusionReasoningに基づいて、幅広いLVLMの推論能力が要求されるほど進歩していないことを示す。
- 参考スコア(独自算出の注目度): 16.963382096640064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision Language Models have integrated reasoning capabilities, elevating cognitive performance to new levels. However, existing evaluations either focus solely on perception or rely on specific domains such as maths or coding. Evaluation for reasoning capabilities that align with an open-world environment is still required, especially one that considers perception and reasoning jointly. To bridge this gap, we propose to evaluate LVLMs by exploiting visual illusions as a diagnostic tool. Visual illusions are phenomena in which the human visual system misinterprets objective signals, resulting in an understanding that deviates from reality. We constructed IllusionReasoning, a benchmark of illusion images collected from the real world, incorporating diverse annotated question-answer pairs. Based on IllusionReasoning, we show that the reasoning capabilities of a wide range of LVLMs are not as advanced as claimed. Our work provides new insights into LVLMs and offers future direction for optimisation.
- Abstract(参考訳): 大きなビジョン言語モデルには、認知性能を新たなレベルに引き上げる統合推論機能がある。
しかし、既存の評価は知覚のみに焦点を当てるか、数学やコーディングのような特定の領域に依存している。
オープンワールド環境と整合する推論能力の評価は依然として必要であり、特に認識と推論を共同で検討する。
このギャップを埋めるために,視覚錯覚を診断ツールとして活用してLVLMを評価することを提案する。
視覚錯覚は、人間の視覚システムが客観的な信号を誤解釈し、現実から逸脱する理解をもたらす現象である。
我々はIllusionReasoningを構築した。IllusionReasoningは実世界から収集した錯視画像のベンチマークであり、多様な注釈付き質問応答ペアを組み込んだものである。
IllusionReasoningに基づいて、幅広いLVLMの推論能力が要求されるほど進歩していないことを示す。
我々の研究はLVLMに関する新たな洞察を提供し、最適化の今後の方向性を提供します。
関連論文リスト
- Toward Cognitive Supersensing in Multimodal Large Language Model [67.15559571626747]
我々は,MLLMに人間のような視覚的特徴を付与する訓練パラダイムであるCognitive Supersensingを紹介する。
実験では、CogSense-BenchでCognitive Supersensingを訓練したMLLMが、最先端のベースラインを大きく上回った。
私たちはCogSense-Benchとモデルウェイトをオープンソースにします。
論文 参考訳(メタデータ) (2026-02-02T02:19:50Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - Do Large Vision-Language Models Distinguish between the Actual and Apparent Features of Illusions? [12.157632635072435]
人間は視覚錯覚に敏感で、感覚や認知の過程を研究する貴重な道具として機能する。
大規模視覚言語モデル(LVLM)のような機械が視覚錯覚に類似した感受性を示すかどうかの研究が始まっている。
論文 参考訳(メタデータ) (2025-06-06T05:47:50Z) - Do you see what I see? An Ambiguous Optical Illusion Dataset exposing limitations of Explainable AI [4.58733012283457]
本稿では,視覚のあいまいさを喚起する視覚錯覚の新たなデータセットについて紹介する。
我々は、一般化可能な視覚概念、特に視線方向と眼の手がかりを、モデル精度に大きな影響を及ぼす微妙だが影響のある特徴として識別する。
本研究は,視覚学習における概念の重要性を浮き彫りにし,人間と機械の視界の偏りと整合を研究する基盤を提供するものである。
論文 参考訳(メタデータ) (2025-05-27T12:22:59Z) - Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios [69.00444996464662]
RIV-CoT(Retrieval-based Interleaved Visual Chain-of-Thought法)を提案する。
実験の結果, RIV-CoTの解答精度は3.1%向上し, バニラCoTの解答精度は4.6%向上した。
論文 参考訳(メタデータ) (2025-01-08T18:31:16Z) - IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models [56.34742191010987]
現在のビジュアル言語モデル(VLM)は印象的なイメージ理解を示すが、視覚錯覚に苦慮している。
我々はIllusionBenchを紹介した。IllusionBenchは、古典的な認知錯覚と現実のシーン錯覚を含む包括的視覚錯覚データセットである。
我々は従来のパターンに似ているが現実に異なるトラップイリュージョンを設計し、SOTAモデルの問題を強調する。
論文 参考訳(メタデータ) (2025-01-01T14:10:25Z) - Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs [52.497823009176074]
LVLM(Large Vision-Language Models)はしばしば、幻覚として知られる事実情報を誤認する応答を生成する。
視覚的知覚の向上とLVLMの推論能力の向上を目的とした学習自由度手法であるVisual Description Grounded Decoding (VDGD)を紹介した。
論文 参考訳(メタデータ) (2024-05-24T16:21:59Z) - Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models [71.93366651585275]
大規模言語モデル(LLM)は、言語理解と様々な推論タスクにおいて印象的な性能を示した。
本稿では,LLMの空間的推論を視覚的に行うために,VoT(Visual-of-Thought)を提案する。
VoTはLLMの空間的推論能力を著しく向上させる。
論文 参考訳(メタデータ) (2024-04-04T17:45:08Z) - IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models [21.589318022339317]
IllusionVQA: 難解な錯視と難解なシーンのデータセットを提示する。
人間の評価は、人間が理解と局在において91.03%と100%の精度を達成することを明らかにしている。
論文 参考訳(メタデータ) (2024-03-23T23:06:32Z) - Analyzing and Mitigating Object Hallucination in Large Vision-Language Models [110.12460299261531]
大規模視覚言語モデル(LVLM)は、人間の言語で視覚情報を理解する際、顕著な能力を示した。
LVLMは依然として物体幻覚に悩まされており、画像に実際に存在しない物体を含む記述を生成するという問題である。
そこで我々は,LVLMの幻覚を再現するアルゴリズム LVLM Hallucination Revisor (LURE) を提案する。
論文 参考訳(メタデータ) (2023-10-01T18:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。