論文の概要: When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
- arxiv url: http://arxiv.org/abs/2604.21911v1
- Date: Thu, 23 Apr 2026 17:54:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.812156
- Title: When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
- Title(参考訳): プロンプトが視覚をオーバーライドする時--LVLMにおけるプロンプト誘発幻覚
- Authors: Pegah Khayatan, Jayneel Parekh, Arnaud Dapogny, Mustafa Shukor, Alasdair Newson, Matthieu Cord,
- Abstract要約: 本研究では,異なる要因が幻覚を誘発する程度をよりよく理解するために,HauScopeを提案する。
HalluVL-DPOは、市販のLVLMをより視覚的な応答に向けて微調整するためのフレームワークである。
- 参考スコア(独自算出の注目度): 54.411658510110215
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite impressive progress in capabilities of large vision-language models (LVLMs), these systems remain vulnerable to hallucinations, i.e., outputs that are not grounded in the visual input. Prior work has attributed hallucinations in LVLMs to factors such as limitations of the vision backbone or the dominance of the language component, yet the relative importance of these factors remains unclear. To resolve this ambiguity, We propose HalluScope, a benchmark to better understand the extent to which different factors induce hallucinations. Our analysis indicates that hallucinations largely stem from excessive reliance on textual priors and background knowledge, especially information introduced through textual instructions. To mitigate hallucinations induced by textual instruction priors, we propose HalluVL-DPO, a framework for fine-tuning off-the-shelf LVLMs towards more visually grounded responses. HalluVL-DPO leverages preference optimization using a curated training dataset that we construct, guiding the model to prefer grounded responses over hallucinated ones. We demonstrate that our optimized model effectively mitigates the targeted hallucination failure mode, while preserving or improving performance on other hallucination benchmarks and visual capability evaluations. To support reproducibility and further research, we will publicly release our evaluation benchmark, preference training dataset, and code at https://pegah-kh.github.io/projects/prompts-override-vision/ .
- Abstract(参考訳): 大規模な視覚言語モデル(LVLM)の能力は著しく進歩しているが、これらのシステムは幻覚、すなわち視覚入力に基づかない出力に弱いままである。
以前の研究は、LVLMの幻覚は視覚バックボーンの制限や言語成分の優位性などの要因に起因しているが、これらの要因の相対的重要性はいまだ不明である。
この曖昧さを解決するために、異なる要因が幻覚を引き起こす程度をよりよく理解するためのベンチマークであるHaluScopeを提案する。
分析の結果,幻覚はテキストの先行や背景知識,特にテキストの指示による情報の過度な依存に起因していることが示唆された。
そこで本研究では,より視覚的に接地された反応に対して,市販のLVLMを微調整するためのフレームワークであるHaluVL-DPOを提案する。
HalluVL-DPOは、私たちが構築した学習データセットを用いて好みの最適化を利用する。
最適化されたモデルは、他の幻覚ベンチマークや視覚能力評価の性能を保ちつつ、目的の幻覚障害モードを効果的に緩和することを示した。
再現性とさらなる研究をサポートするため、私たちは評価ベンチマーク、好みのトレーニングデータセット、コードをhttps://pegah-kh.github.io/projects/prompts-override-vision/で公開します。
関連論文リスト
- SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - OViP: Online Vision-Language Preference Learning for VLM Hallucination [44.14029765850719]
大型視覚言語モデル(LVLM)は幻覚に弱いままであり、しばしば視覚入力と一致しないコンテンツを生成する。
本稿では,モデル自身の幻覚に基づいて,コントラスト学習データを動的に構築するオンラインビジョン言語嗜好学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-21T19:26:09Z) - Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence [69.86946427928511]
大型視覚言語モデル(LVLM)における幻覚を駆動する内部メカニズムについて検討する。
本稿では,視覚的コンテキストに対する注目ヘッド出力の感度を定量化する指標として,視覚認識型頭部偏差(VHD)を紹介する。
視覚認識型頭部強化(VHR)は,視覚認識型頭部機能を高めることで幻覚を緩和するための訓練不要なアプローチである。
論文 参考訳(メタデータ) (2024-12-18T15:29:30Z) - V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization [21.248617886995103]
トレーニング時の視覚的コンテキスト学習を改善するために,視覚誘導直接選択最適化(V-DPO)を提案する。
分析の結果,V-DPOは画像コントラストの嗜好データからの学習に優れており,視覚的文脈のニュアンスを抽出し理解する能力に優れていたことが示唆された。
論文 参考訳(メタデータ) (2024-11-05T01:24:37Z) - A Survey of Hallucination in Large Visual Language Models [48.794850395309076]
幻覚の存在は、様々な分野におけるLVLMの可能性と実用性を制限している。
LVLMの構造と幻覚の発生の主な原因を紹介する。
LVLMの幻覚評価ベンチマークについて述べる。
論文 参考訳(メタデータ) (2024-10-20T10:58:58Z) - Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback [40.930238150365795]
我々は,LVLM(Large Vision Language Models)における幻覚の検出と緩和について,きめ細かいAIフィードバックを用いて提案する。
プロプライエタリモデルによる小型幻覚アノテーションデータセットを生成する。
そこで本研究では,幻覚緩和モデルの訓練のための選好データセットを自動構築する検出テーマ書き換えパイプラインを提案する。
論文 参考訳(メタデータ) (2024-04-22T14:46:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。