論文の概要: HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
- arxiv url: http://arxiv.org/abs/2607.07507v1
- Date: Wed, 08 Jul 2026 15:02:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.431155
- Title: HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
- Title(参考訳): HIVE:視覚言語モデルにおける幻覚後の推論を理解する
- Abstract要約: 視覚言語モデルにおける幻覚は、一般的に意味的誤りとして扱われる。
それまでの研究は主に、世代ごとの幻覚の検出や抑制に重点を置いていた。
幻覚的意味論がモデルの推論コンテキストに入る段階である PHR (Post Hallucination Reasoning) について検討する。
- 参考スコア(独自算出の注目度): 70.67112531913669
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hallucinations in vision language models (VLMs) are commonly treated as semantic errors, yet they often arise from partial or ambiguous visual evidence. Prior work mainly focuses on detecting or suppressing hallucinations at generation time, leaving the subsequent reasoning stage largely unexplored. In this work, we study Post Hallucination Reasoning (PHR), the stage in which hallucinated semantics enter the model's inference context and influence downstream predictions. To systematically investigate PHR, we introduce HIVE, Hallucination Inference and Verification Engine, an evaluation infrastructure that enables controlled comparisons between faithful and hallucinated captions. Across nine tasks and nine models, we observe structured modality dependent patterns: hallucinated captions often improve accuracy on vision language tasks, while text only tasks exhibit limited or unstable effects. Further analyses show that hallucinated cues broaden semantic coverage and reshape reasoning dynamics while preserving stable inference. These findings highlight that hallucinated semantics may influence downstream reasoning once they enter the model's inference context. Understanding this post hallucination stage is important for improving the reliability and interpretability of multimodal reasoning systems. Code is publicly available at https://github.com/hefengcs/HIVE.
- Abstract(参考訳): 視覚言語モデル(VLM)における幻覚は、一般的に意味的誤りとして扱われるが、部分的または曖昧な視覚的証拠から生じることが多い。
先行研究は主に幻覚の検出や抑制に重点を置いており、その後の推論段階は未解明のままである。
本研究では,幻覚的意味論がモデルの推論コンテキストに入り,下流の予測に影響を与える段階である PHR (Post Hallucination Reasoning) について検討する。
PHRを体系的に研究するために,HIVE,Halucination Inference and Verification Engineを導入する。
9つのタスクと9つのモデルにまたがって、構造化されたモダリティ依存パターンを観察する:幻覚キャプションは視覚言語タスクの精度を向上するが、テキストのみのタスクは限定的または不安定な効果を示す。
さらに解析したところ、幻覚的手がかりは、安定な推論を維持しつつ、意味的カバレッジを拡大し、推論ダイナミクスを再形成することが明らかとなった。
これらの結果は、モデルが推論コンテキストに入ると、幻覚的意味論が下流の推論に影響を及ぼす可能性があることを示している。
この幻覚の段階を理解することは,マルチモーダル推論システムの信頼性と解釈可能性を向上させる上で重要である。
コードはhttps://github.com/hefengcs/HIVE.comで公開されている。
関連論文リスト
- When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs [54.411658510110215]
本研究では,異なる要因が幻覚を誘発する程度をよりよく理解するために,HauScopeを提案する。
HalluVL-DPOは、市販のLVLMをより視覚的な応答に向けて微調整するためのフレームワークである。
論文 参考訳(メタデータ) (2026-04-23T17:54:36Z) - Review of Hallucination Understanding in Large Language and Vision Models [65.29139004945712]
本稿では,多様なアプリケーションにまたがる画像とテキストの幻覚を特徴付けるフレームワークを提案する。
我々の調査によると、幻覚はデータ分布や遺伝バイアスの予測可能なパターンから生じることが多い。
この調査は、現実世界の生成AIシステムにおける幻覚に対するより堅牢で効果的なソリューションを開発する基盤を提供する。
論文 参考訳(メタデータ) (2025-09-26T09:23:08Z) - Two Causes, Not One: Rethinking Omission and Fabrication Hallucinations in MLLMs [31.601057368065877]
既存の手法は、省略と製造幻覚が共通の原因を共有するという欠点のある仮定に基づいており、しばしば省略を減らし、より多くの製造を誘発する。
本研究は,視覚的特徴を言語表現にマッピングする場合に,排他的幻覚が不十分な自信から生じることを示すことによって,この見解を覆すものである。
本研究では,物体の存在や不在を視覚的証拠がどのように推測するかを明らかにする概念的枠組みである視覚意味的注意力場を提案する。
論文 参考訳(メタデータ) (2025-08-30T05:47:41Z) - Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images [6.48620624181578]
SHE(Sequence Hallucination Eradication)は,幻覚を検知し緩和する軽量なフレームワークである。
また,行動幻覚の重症度を定量化する新しい指標(BEACH)を提案する。
論文 参考訳(メタデータ) (2025-06-08T15:08:52Z) - When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding [75.57997630182136]
シーンテキスト領域に着目した大規模マルチモーダルモデルにおけるトランスフォーマー層は,意味幻覚を生成する傾向が低い。
本研究では,ZoomText と Grounded Layer Correction の2つの主要コンポーネントからなる学習自由な意味幻覚緩和フレームワークを提案する。
本手法は,意味幻覚を効果的に緩和するだけでなく,シーンテキストのスポッティングや理解のための公開ベンチマークの性能も向上する。
論文 参考訳(メタデータ) (2025-06-05T19:53:19Z) - Why and How LLMs Hallucinate: Connecting the Dots with Subsequence Associations [82.42811602081692]
本稿では,幻覚を体系的に追跡・理解するサブシーケンス・アソシエーション・フレームワークを提案する。
主要な洞察は、支配的な幻覚協会が忠実なものを上回るときに生じる幻覚である。
ランダムな入力コンテキストにおける幻覚の確率を解析することにより因果列を同定するトレースアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-04-17T06:34:45Z) - HalCECE: A Framework for Explainable Hallucination Detection through Conceptual Counterfactuals in Image Captioning [5.130890556960832]
この研究は、広く使われている画像キャプターが示す幻覚現象の複雑さを掘り下げて、興味深いパターンを明らかにした。
採用された概念的反事実のバックボーンの決定論的かつ効率的な性質は、意味的に最小限の編集を提案することができる。
提案する幻覚検出フレームワークは,スタンドアローン数とは別に意味論的に意味のある編集を提供することにより,高い解釈が可能となる。
論文 参考訳(メタデータ) (2025-03-01T10:28:19Z) - Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence [69.86946427928511]
大型視覚言語モデル(LVLM)における幻覚を駆動する内部メカニズムについて検討する。
本稿では,視覚的コンテキストに対する注目ヘッド出力の感度を定量化する指標として,視覚認識型頭部偏差(VHD)を紹介する。
視覚認識型頭部強化(VHR)は,視覚認識型頭部機能を高めることで幻覚を緩和するための訓練不要なアプローチである。
論文 参考訳(メタデータ) (2024-12-18T15:29:30Z) - Who Brings the Frisbee: Probing Hidden Hallucination Factors in Large Vision-Language Model via Causality Analysis [14.033320167387194]
現実の応用における大きな課題は幻覚であり、LVLMは存在しない視覚要素を生成し、ユーザの信頼を損なう。
我々は、オブジェクト、コンテキスト、セマンティックフォアグラウンド・バックグラウンド構造といった隠れた要因が幻覚を引き起こすという仮説を立てた。
画像・テキスト・プロンプト・ネットワーク・サリエンシの因果関係を解析することにより,これらの要因をブロックするための介入を系統的に検討する。
論文 参考訳(メタデータ) (2024-12-04T01:23:57Z) - On Large Language Models' Hallucination with Regard to Known Facts [74.96789694959894]
大規模な言語モデルはファクトイドの質問に答えることに成功したが、幻覚を起こす傾向がある。
正しい解答知識を持つLLMの現象を推論力学の観点から検討する。
我々の研究は、LLMの幻覚が既知の事実について、そしてより重要なのは、幻覚を正確に予測する理由を理解することに光を当てた。
論文 参考訳(メタデータ) (2024-03-29T06:48:30Z) - In-Context Sharpness as Alerts: An Inner Representation Perspective for
Hallucination Mitigation [36.31646727970656]
大規模言語モデル(LLM)は、しばしば幻覚を起こし、事実の誤りを引き起こす。
正しい世代は、不正な世代に比べて、コンテキスト内のトークンの隠された状態において、よりシャープなコンテキストアクティベーションを持つ傾向がある。
本研究では,テキスト内隠れ状態のシャープネス'を定量化し,デコード処理に組み込むエントロピーに基づく計量法を提案する。
論文 参考訳(メタデータ) (2024-03-03T15:53:41Z) - Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models [57.42800112251644]
本研究では,画像中の特定の物体の数を誤って識別するモデルを参照しながら,特定の種類の幻覚数幻覚に焦点を当てた。
そこで,本研究では,数幻覚を減らすための一貫性向上を目的としたトレーニング手法を考案し,直接微調整法よりも8%の性能向上を図った。
論文 参考訳(メタデータ) (2024-03-03T02:31:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。