論文の概要: Fine-Grained Multi Image Object Hallucination Benchmark
- arxiv url: http://arxiv.org/abs/2608.30653v1
- Date: Mon, 31 Aug 2026 11:53:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.377351
- Title: Fine-Grained Multi Image Object Hallucination Benchmark
- Title(参考訳): 微粒化マルチイメージオブジェクト幻覚ベンチマーク
- Abstract要約: 我々は、微細なマルチイメージオブジェクト幻覚ベンチマークであるMIOHを紹介する。
29モデルの評価により, GPT-5やGemini-2.5-Proのような最先端システムでさえ, 異なる故障パターンを示すことが明らかとなった。
MIOHは、より信頼性の高いマルチモーダルAIシステムを開発する上で、重要な評価ツールである。
- 参考スコア(独自算出の注目度): 24.355918575761606
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) are increasingly deployed in multi-image scenarios requiring complex reasoning across visual contexts. However, current MLLMs remain fundamentally limited by object hallucination-generating plausible yet factually inconsistent descriptions about objects. Existing benchmarks, designed primarily for single-image settings or providing only high-level multi-image assessments, cannot systematically diagnose how visual complexity and reasoning demands trigger hallucination. To address this gap, we introduce MIOH, a fine-grained multi-image object hallucination benchmark that systematically evaluates object hallucination across four foundational tasks (existence, counting, attribute, position) through three multi-image reasoning patterns (comprehensive, comparative, selective) under three controlled adversarial pressures (visual context scale, perceptual difficulty, contextual bias). Through evaluation of 29 models, we reveal that even state-of-the-art systems like GPT-5 and Gemini-2.5-Pro exhibit distinct failure patterns across different reasoning patterns and tasks. Our evaluation reveals that hallucination stems not merely from perceptual failures but from integration-stage limitations when maintaining object representations across multiple images. MIOH provides a controlled framework for analyzing multi-image object hallucination and serves as a critical evaluation tool for developing more reliable multimodal AI systems.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、視覚的コンテキストにまたがる複雑な推論を必要とするマルチイメージシナリオに、ますます多くデプロイされている。
しかし、現在のMLLMは、対象の幻覚を生成できるが、現実的には矛盾しない記述によって、基本的に制限されている。
既存のベンチマークは、主にシングルイメージの設定のために設計され、高レベルのマルチイメージアセスメントのみを提供するが、視覚的複雑さと推論要求が幻覚を引き起こすことを体系的に診断することはできない。
このギャップに対処するために,3つの制御された逆圧(視覚的文脈尺度,知覚的難易度,文脈的バイアス)の下で,3つの基本課題(存在,数,属性,位置)にまたがるオブジェクト幻覚を体系的に評価する,きめ細かいマルチイメージオブジェクト幻覚ベンチマークMIOHを導入する。
29モデルの評価により、GPT-5やGemini-2.5-Proのような最先端のシステムでさえ、異なる推論パターンやタスクで異なる障害パターンを示すことが明らかとなった。
評価の結果,幻覚は知覚障害だけでなく,複数の画像にまたがるオブジェクト表現の維持において,統合段階の制約によってもたらされることが明らかとなった。
MIOHは、マルチイメージオブジェクト幻覚を分析するための制御されたフレームワークを提供し、より信頼性の高いマルチモーダルAIシステムを開発するための重要な評価ツールとして機能する。
関連論文リスト
- FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs [34.69526064799019]
MLLM(Multimodal Large Language Models)は幻覚に悩まされる。
F FREAKはMLLMの微細な幻覚評価のために設計された総合的なベンチマークである。
F FREAKはMLLMの詳細な視覚知覚における幻覚現象を革新的に評価する。
論文 参考訳(メタデータ) (2026-03-20T08:52:39Z) - M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering [10.491266031106774]
M3-ACE(M3-ACE)は、数学の推論において視覚的知覚を正すために設計された多言語コンテキストエンジニアリングフレームワークである。
提案手法は,MathVisionベンチマークで89.1の新たな結果を確立し,他の関連するデータセットに対して一貫した改善を実現する。
論文 参考訳(メタデータ) (2026-03-09T13:32:25Z) - MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models [73.20126092411776]
マルチイメージMLLMにおける幻覚に関する最初の体系的研究を行う。
複数の画像に対してオブジェクト関連幻覚を評価するためのベンチマークであるMIHBenchを提案する。
MIHBenchは、Multi-Image Object Existence Hallucination、Multi-Image Object Count Hallucination、Object Identity Consistency Hallucinationの3つのコアタスクから構成される。
論文 参考訳(メタデータ) (2025-08-01T15:49:29Z) - A Survey of Multimodal Hallucination Evaluation and Detection [52.03164192840023]
MLLM(Multi-modal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なパラダイムとして登場した。
これらのモデルはしばしば幻覚に悩まされ、もっともらしいように見えるコンテンツを生成するが、入力内容や確立された世界的知識と矛盾する。
本調査では,イメージ・トゥ・テキスト(I2T)およびテキスト・トゥ・イメージ(T2I)生成タスクを対象とした幻覚評価ベンチマークと検出方法の詳細なレビューを行う。
論文 参考訳(メタデータ) (2025-07-25T07:22:42Z) - MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM [58.2298313720146]
マルチモーダル幻覚は多源性であり、様々な原因から生じる。
既存のベンチマークでは、知覚誘発幻覚と推論誘発幻覚を適切に区別することができない。
論文 参考訳(メタデータ) (2025-05-30T05:54:36Z) - VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning [63.0285363282581]
MLLM(Multimodal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なツールとなっている。
本稿では,MLLMの知覚的理解と抽象的関係推論を評価するためのベンチマークVOILAを紹介する。
我々は,現在のMLLMが画像間関係の理解に苦慮し,高レベルの関係推論において限られた能力を示すことを明らかにした。
論文 参考訳(メタデータ) (2025-02-25T23:36:19Z) - Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models [57.58426038241812]
LVLM(Large Vision-Language Models)は、複雑なマルチモーダルタスクにおいて顕著な性能を示す。
これらのモデルは、画像から様々な視覚的実体を暗黙的に認識または推測する必要がある場合、まだ幻覚に悩まされている。
本稿では,視覚的質問応答(VQA)ベンチマークを提案する。
論文 参考訳(メタデータ) (2024-12-29T23:56:01Z) - Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning [151.4060202671114]
マルチモーダル大規模言語モデル(MLLM)は、視覚言語タスクを前進させる前例のない能力を示した。
本稿では,MLLMにおける幻覚に対処するためのボトムアップ推論フレームワークを提案する。
本フレームワークは、認識レベル情報と認知レベルコモンセンス知識を検証・統合することにより、視覚とテキストの両方の入力における潜在的な問題に体系的に対処する。
論文 参考訳(メタデータ) (2024-12-15T09:10:46Z) - Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models [13.48296910438554]
我々は2万以上の実世界のサンプルからなる関係幻覚を対象とする総合的なベンチマークであるReefknotを紹介した。
関係幻覚を体系的に定義し、知覚的視点と認知的視点を統合するとともに、Visual Genomeのシーングラフデータセットを用いて関係ベースのコーパスを構築する。
本稿では,Reefknotを含む3つのデータセットに対して,幻覚率を平均9.75%削減する信頼性に基づく新たな緩和戦略を提案する。
論文 参考訳(メタデータ) (2024-08-18T10:07:02Z) - Multi-Object Hallucination in Vision-Language Models [28.135215173793785]
大型視覚言語モデル(LVLM)は、しばしば物体幻覚に悩まされる。
幻覚行動は、データ固有の要因、サリエンスと周波数、本質的なモデル行動に影響される。
論文 参考訳(メタデータ) (2024-07-08T17:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。