論文の概要: Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.08841v1
- Date: Sat, 09 May 2026 09:52:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.9246
- Title: Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
- Title(参考訳): 視覚言語モデルにおける古典的幻覚理解のための幻覚前処理と反幻覚プロンプト
- Abstract要約: VLM(Vision-Language Models)は、視覚的錯覚に対する体系的な偏見を示し、実際の視覚的差異を知覚するのではなく、記憶された事実を思い出させる。
本稿では,CVPR 2026 における第5回 DataCV Challenge Task 1 のトレーニングフリーフレームワークについて述べる。
私たちのソリューションは,第1位のソリューションのわずか0.47%という,この課題において2位を確保しました。
- 参考スコア(独自算出の注目度): 11.342804429826936
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) exhibit systematic bias toward visual illusions, recalling memorized facts rather than perceiving actual visual differences. This paper presents a training-free framework for the 5th DataCV Challenge Task 1 at CVPR 2026, addressing this perception-versus-memory conflict through three complementary strategies:(1) illusion-aware image preprocessing that weakens illusion-inducing context via type-specific transformations (edge extraction, color isolation, morphological processing, and reference-line overlay), (2) anti-illusion prompt engineering guiding VLMs toward qualitative visual comparison, and (3) multi-vote ensemble that further improves robustness. Our method achieves 90.48% accuracy on the official 630-image test set using Claude (claude-opus-4-6) with 5-vote majority ensemble, and 98.41% on a human-verified subset. The approach requires no finetuning, relying solely on visual manipulation and prompt design. Our solution secured 2nd place in the challenge, only 0.47% behind the 1st-place solution. Code is available at https://github.com/jasminezz/sf-illusion-aware-vlm.git.
- Abstract(参考訳): VLM(Vision-Language Models)は、視覚的錯覚に対する体系的な偏見を示し、実際の視覚的差異を知覚するのではなく、記憶された事実を思い出させる。
本稿では, CVPR 2026 の第5回 DataCV Challenge Task 1 のトレーニングフリー・フレームワークについて,(1) 錯覚を意識した画像前処理, (2) 色分離, 形態的処理, 基準線オーバーレイ) による錯覚誘発コンテキストの弱化, (2) 定性的な視覚的比較に向けて VLM を誘導するアンチイリュージョン, (3) マルチボイト・アンサンブルの3つの相補的戦略を用いて, この知覚と記憶の対立に対処する。
本手法はClaude (Claude-opus-4-6) を用いた公式 630-image test set の90.48%の精度で5-vote 多数アンサンブル, 98.41%の精度を実現した。
このアプローチは微調整を必要とせず、視覚的な操作と迅速な設計にのみ依存する。
私たちのソリューションは,第1位のソリューションのわずか0.47%という,この課題において2位を確保しました。
コードはhttps://github.com/jasminezz/sf-illusion-aware-vlm.gitで入手できる。
関連論文リスト
- Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective [76.02772556944073]
環境錯覚は自然に存在するが、現実の運転環境では見過ごされている現象である。
視覚的知覚を妨害し、シーンの誤解を招き、自動運転システムに深刻な安全リスクをもたらす。
最初のベンチマークであるLanEvil++を導入し、環境錯覚下での車線知覚の堅牢性を評価する。
論文 参考訳(メタデータ) (2026-07-07T03:15:00Z) - Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions [2.9521041993295607]
視覚言語モデル(VLM)は、古典的な光学錯視に直面した場合、体系的なバイアスを示す。
モデルトレーニングなしでこの障害モードに対処するツール誘導推論フレームワークを提案する。
我々は3つの経験的観察を報告し、さらなる調査を保証していると信じている。
論文 参考訳(メタデータ) (2026-03-31T08:35:10Z) - Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions [38.42074629749954]
VLM(Large Vision-Language Models)は、しばしばオリジナルの画像で古典的な視覚錯覚に「正しく」答えるが、錯覚因子が逆転すると同じ反応を持続する。
VLMは視覚的変化を認識するのか、単に記憶されたパターンを思い出すだけなのか?
本稿では,段階的な摂動と一致した視覚制御を備えた制御可能なビジュアルイリュージョンフレームワークであるVI-Probeを紹介する。
論文 参考訳(メタデータ) (2026-01-29T18:59:24Z) - Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology [87.65242416688146]
TreeBenchは、ビジュアルグラウンド推論の診断ベンチマークである。
TreeVGRは、強化学習と共同でローカライゼーションと推論を監督する訓練パラダイムである。
論文 参考訳(メタデータ) (2025-07-10T17:59:58Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking [31.356290235986332]
視覚言語モデル(VLM)は、セマンティックなタスクでは優れているが、中心となる人間の能力には優れている。
HC-Benchは、隠れテキスト、オブジェクト、イリュージョンを備えた112の画像のベンチマークである。
本稿では,余剰な視覚ノイズを排除し,99%の精度を解放するSemVink(Semantic Visual Thinking)を提案する。
論文 参考訳(メタデータ) (2025-06-03T12:33:47Z) - IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models [56.34742191010987]
現在のビジュアル言語モデル(VLM)は印象的なイメージ理解を示すが、視覚錯覚に苦慮している。
我々はIllusionBenchを紹介した。IllusionBenchは、古典的な認知錯覚と現実のシーン錯覚を含む包括的視覚錯覚データセットである。
我々は従来のパターンに似ているが現実に異なるトラップイリュージョンを設計し、SOTAモデルの問題を強調する。
論文 参考訳(メタデータ) (2025-01-01T14:10:25Z) - Aligning Modalities in Vision Large Language Models via Preference
Fine-tuning [67.62925151837675]
本研究では,幻覚の問題をアライメント問題とみなし,好みのチューニングで対処する。
具体的には,AIモデルを用いたフィードバックデータを生成するPOVIDを提案する。
提案手法は,好ましくないデータを生成するための2段階のアプローチである。
広範ベンチマークを用いた実験では、幻覚を減らすだけでなく、標準ベンチマークでのモデル性能を向上させることができ、従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-02-18T00:56:16Z) - HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models [69.52245481329899]
本稿では,画像コンテキスト推論評価のためのベンチマークであるHalusionBenchを紹介する。
このベンチマークは、1129の質問と組み合わせた346の画像で構成されており、すべて人間の専門家によって細心の注意を払って作成されている。
HallusionBenchの評価では、15種類のモデルをベンチマークし、最先端のGPT-4Vによって達成された31.42%の質問対精度を強調した。
論文 参考訳(メタデータ) (2023-10-23T04:49:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。