論文の概要: MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- arxiv url: http://arxiv.org/abs/2607.18673v1
- Date: Tue, 21 Jul 2026 03:43:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.303061
- Title: MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- Title(参考訳): MissingBench-Verified: 視覚言語モデルによる物体部品の欠落検出能力の検証
- Abstract要約: MissingBench-Verifiedは、特定の、実用的なシナリオを評価するために設計されたベンチマークである。
外部のツールエビデンスがモデルの視覚的知覚と明確に矛盾している場合でも、一貫性のある、重要な失敗率を観察します。
ツールアシスト検証、自律的な視覚的推論、推論期間の延長、より簡単なデータセットの微調整など、既存の緩和戦略は無視できる改善を提供する。
- 参考スコア(独自算出の注目度): 10.608824155356377
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Language Models (VLMs) are well known for hallucinating non-existent objects in images. Objects with missing parts present a unique challenge for VLMs, stemming from both real-world knowledge bias and the scarcity of such images in training data. We present MissingBench-Verified, a benchmark designed to evaluate a specific and practically relevant scenario: when vision-language models fail to recognize that an essential component of an object has been removed. Across ten leading models, we observe consistent and significant failure rates that persist even when external tool evidence explicitly contradicts the model's visual perception. We further ask whether granting models access to image processing tools (e.g., cropping, contrast adjustment) enables autonomous inspection to resolve these failures. We find that existing mitigation strategies, including tool-assisted verification, autonomous visual reasoning, longer reasoning durations, and fine-tuning on an easier dataset, provide negligible improvement, indicating that this failure mode cannot be addressed through current prompting or post-hoc correction techniques. Our findings highlight a fundamental limitation of current VLM for inspection and monitoring tasks and underscore the need for architectural or training-level interventions that enable models to override internal expectations when confronted with contradictory evidence.
- Abstract(参考訳): 視覚言語モデル(VLM)は、画像に存在しない物体を幻覚させることでよく知られている。
欠落した部分を持つオブジェクトは、実世界の知識バイアスとトレーニングデータにおけるそのようなイメージの不足から生まれた、VLMにとってユニークな課題である。
MissingBench-Verifiedは、視覚言語モデルがオブジェクトの本質的なコンポーネントが削除されたことを認識できない場合に、特定の、実用的なシナリオを評価するために設計されたベンチマークである。
10つの主要なモデルにまたがって、外部ツールの証拠がモデルの視覚的知覚と明確に矛盾しても持続する一貫性のある、重大な失敗率を観察します。
さらに、画像処理ツール(例えば、収穫、コントラスト調整)へのアクセスをモデルに与えることで、自律的な検査がこれらの障害を解決することができるかどうかを問う。
ツールアシスト検証,自律視覚推論,より長い推論時間,より簡単なデータセットの微調整など,既存の緩和策が無視できる改善を提供し,現在のプロンプトやポストホック補正技術によってこの障害モードに対処できないことを示す。
本研究は,現状の VLM のタスクの検査・監視における基本的な限界を浮き彫りにして,矛盾する証拠に直面すると,モデルが内部の期待を覆すようなアーキテクチャやトレーニングレベルの介入の必要性を浮き彫りにしている。
関連論文リスト
- Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models [33.564453692157095]
不確実性は、モデルが失敗する可能性を示すだけでなく、なぜ不確実かも診断すべきである。
そこで本研究では,障害発生源の予測に前世代の信号が有効かどうかを検証し,障害発生モードを解消するための統一的なフレームワークを提案する。
我々の主な発見は、認識関連障害が視覚的トーケン表現によって最もよく捉えられるのに対して、認識後に残る障害は、素早い条件で隠された状態によってよりよく捉えられることである。
論文 参考訳(メタデータ) (2026-07-06T05:11:45Z) - Advancing Creative Physical Intelligence in Large Multimodal Models [62.56522271769017]
MM-CreativityBenchは、視覚的にリッチで物理的に制約のある環境において、手頃なグラウンドで使用されるクリエイティブツールのベンチマークである。
筆者らの実験では、現在のLMMは、生成能力の欠如によるものではなく、基底探索を維持できないため、しばしば短くなることが示されている。
この障害モードを動機として,創造的ツールの使用を優先学習問題とするアライメント(アライメント,アライメント,アライメント)を提案する。
論文 参考訳(メタデータ) (2026-05-25T23:59:02Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Are vision language models robust to uncertain inputs? [5.249651874118556]
より新しい視覚言語モデルでは、従来のモデルに比べて頑健性が向上したが、それでも厳密な指示に従う傾向にあることを示す。
ImageNetのような自然なイメージでは、パイプラインの変更なしにこの制限を克服することができる。
モデルの内部不確実性を明らかにするために,キャプションの多様性に基づく新しいメカニズムを提案する。
論文 参考訳(メタデータ) (2025-05-17T03:16:49Z) - Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy [53.07517728420411]
低レベル視覚タスクにおける幻覚に焦点を当てた最初のインストラクションデータベースを提案する。
低レベル視覚タスクにおけるモデルの知覚と理解能力を向上させるための自己認識障害除去(SAFEQA)モデルを提案する。
低レベルの視覚課題に対する総合的な実験を行い、提案手法がこれらの課題におけるモデルの自己認識を著しく向上し、幻覚を低減させることを示す。
論文 参考訳(メタデータ) (2025-03-26T16:05:01Z) - Unsupervised Model Diagnosis [49.36194740479798]
本稿では,ユーザガイドを使わずに,意味論的対実的説明を生成するために,Unsupervised Model Diagnosis (UMO)を提案する。
提案手法は意味論における変化を特定し可視化し,その変化を広範囲なテキストソースの属性と照合する。
論文 参考訳(メタデータ) (2024-10-08T17:59:03Z) - Evaluation and Comparison of Visual Language Models for Transportation Engineering Problems [16.49637074299509]
我々は、視覚に基づく輸送工学タスクのための最先端のビジョン言語モデル(VLM)について検討した。
画像分類作業は渋滞検出と亀裂識別を伴い, 物体検出ではヘルメット違反が同定された。
我々はこれらのVLMモデルの性能を評価するために、CLIP、BLIP、OWL-ViT、Llava-Next、およびクローズソースGPT-4oといったオープンソースモデルを適用した。
論文 参考訳(メタデータ) (2024-09-03T20:24:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。