論文の概要: Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs
- arxiv url: http://arxiv.org/abs/2606.28401v1
- Date: Wed, 24 Jun 2026 11:06:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.548294
- Title: Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs
- Title(参考訳): VLMにおける幻覚の緩和のための視覚駆動型選好合成
- Authors: Yunhun Nam, Jongheon Jeong,
- Abstract要約: 政策整合性と視覚的基盤を有する嗜好データを構築するためのフレームワークであるViPSy(Vision-driven Preference Synthesis)を提案する。
我々のフレームワークは2つの段階から構成されており、第1段階では、VIPSyは、意味的に整列された画像の変種をまたいだオブジェクトレベルコンテンツから視覚的キューを導出する。
第2段階では、ViPSyはポリシーの独自のロールアウトをこのキューに設定し、ポリシーの応答分布に近づきながら、視覚的に接地されたコンテンツによって候補者をガイドすることができる。
- 参考スコア(独自算出の注目度): 14.381884325190105
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) have shown strong performance in visual understanding, yet they still suffer from hallucinations, generating content that is not grounded in the image. Preference alignment is a promising approach to improve visual faithfulness, but its success depends heavily on how preference pairs are constructed. Existing methods exhibit two key limitations; (a) intervention-based methods often introduce significant deviation from the policy distribution, and (b) sampling-based methods often underuse visual information during the construction. In this paper, we propose ViPSy (Vision-driven Preference Synthesis), a framework for constructing preference data that are both policy-aligned and visually grounded. Our framework consists of two stages; in the first stage, ViPSy derives a visual cue from recurring object-level content across semantically aligned image variants, so preference construction can rely on visual information rather than language priors. In the second stage, ViPSy conditions the policy's own rollouts on this cue, allowing candidates to be guided by visually grounded content while staying close to the policy's response distribution. The resulting candidates remain close to the policy's response distribution while better leveraging visual information from the image. Experiments show that the resulting VLM, preference-aligned with ViPSy-constructed preference pairs, achieves a new state-of-the-art in hallucination mitigation. Compared with the previous state-of-the-art method, it reduces hallucination rates on AMBER and Object HalBench by 35.7% and 24.5%, respectively. The resulting model further improves on general visual grounding benchmarks, e.g., MMStar, MMVP, and CV-Bench, while also yielding gains in semantic segmentation and ImageNet linear probing, underscoring the effectiveness of our framework in enhancing the model's visual capabilities.
- Abstract(参考訳): VLM(Vision-Language Models)は視覚的理解において高い性能を示してきたが、それでも幻覚に悩まされ、画像に基づかない内容を生成する。
選好アライメントは、視覚的忠実性を改善するための有望なアプローチであるが、その成功は、選好ペアの構築方法に大きく依存する。
既存の方法には2つの重要な制限がある。
(a)介入に基づく手法は、しばしば政策分布から著しく逸脱することがあり、
b) サンプリングに基づく手法は、建設中にしばしば視覚情報を過小評価する。
本稿では、政策整合性と視覚的基盤を有する嗜好データを構築するためのフレームワークであるViPSy(Vision-driven Preference Synthesis)を提案する。
我々のフレームワークは2つの段階から構成されており、第1段階では、VPSyは意味的に整合した画像の変種をまたいだオブジェクトレベルのコンテンツから視覚的キューを導出するので、好みの構成は言語よりも視覚的情報に頼ることができる。
第2段階では、ViPSyはポリシーの独自のロールアウトをこのキューに設定し、ポリシーの応答分布に近づきながら、視覚的に接地されたコンテンツによって候補者をガイドすることができる。
得られた候補は、画像からの視覚情報をより活用しながら、ポリシーの応答分布に近づいたままである。
実験により、VLMはViPSy構成された選好ペアに適合し、幻覚の緩和において新たな最先端を実現することが示された。
従来の最先端法と比較して、AMBERとObject HalBenchの幻覚率をそれぞれ35.7%、24.5%削減する。
結果として得られたモデルは、例えば、MMStar、MMVP、CV-Benchといった一般的なビジュアルグラウンドのベンチマークをさらに改善するとともに、セマンティックセグメンテーションやイメージネットの線形探索の利益をもたらし、モデルの視覚能力を高める上での我々のフレームワークの有効性を裏付ける。
関連論文リスト
- P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization [55.74731799669337]
幻覚は近年、LVLM(Large Vision-Language Models)において大きな研究の注目を集めている。
直接選好最適化(DPO)は、人間が提供した修正選好から直接学習することを目的としている。
既存の選好ペアは視覚に依存しないことが多く、その本質的に非政治的な性質は、モデル学習を導く上での有効性を制限している。
本稿では、モデルが独自の選好ペアから生成し学習する新しい訓練パラダイムである知覚処理直接選好最適化(P$2$-DPO)を提案する。
論文 参考訳(メタデータ) (2026-06-02T09:22:53Z) - Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models [58.9387276447485]
視覚推論 前者(VIF)は、純粋な視覚表現とモデルの出力空間の間の橋渡しを確立する軽量アーキテクチャモジュールである。
一般的な推論、OCR、テーブル理解、視覚中心の評価、幻覚を含む14のベンチマークタスクについて実験を行った。
論文 参考訳(メタデータ) (2026-05-18T10:04:22Z) - Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation [31.028607494171336]
VLM(Vision-Language Models)は、物体の幻覚によってしばしば弱められる。
トレーニング不要な推論フレームワークであるPND(Positive-and-Negative Decoding)を紹介する。
PNDは、視覚的忠実性を強制するために、デコードプロセスに直接介入する。
論文 参考訳(メタデータ) (2026-04-27T12:23:00Z) - OViP: Online Vision-Language Preference Learning for VLM Hallucination [44.14029765850719]
大型視覚言語モデル(LVLM)は幻覚に弱いままであり、しばしば視覚入力と一致しないコンテンツを生成する。
本稿では,モデル自身の幻覚に基づいて,コントラスト学習データを動的に構築するオンラインビジョン言語嗜好学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-21T19:26:09Z) - V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization [21.248617886995103]
トレーニング時の視覚的コンテキスト学習を改善するために,視覚誘導直接選択最適化(V-DPO)を提案する。
分析の結果,V-DPOは画像コントラストの嗜好データからの学習に優れており,視覚的文脈のニュアンスを抽出し理解する能力に優れていたことが示唆された。
論文 参考訳(メタデータ) (2024-11-05T01:24:37Z) - Dual-Image Enhanced CLIP for Zero-Shot Anomaly Detection [58.228940066769596]
本稿では,統合視覚言語スコアリングシステムを活用したデュアルイメージ強化CLIP手法を提案する。
提案手法は,画像のペアを処理し,それぞれを視覚的参照として利用することにより,視覚的コンテキストによる推論プロセスを強化する。
提案手法は視覚言語による関節異常検出の可能性を大幅に活用し,従来のSOTA法と同等の性能を示す。
論文 参考訳(メタデータ) (2024-05-08T03:13:20Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z) - Aligning Modalities in Vision Large Language Models via Preference
Fine-tuning [67.62925151837675]
本研究では,幻覚の問題をアライメント問題とみなし,好みのチューニングで対処する。
具体的には,AIモデルを用いたフィードバックデータを生成するPOVIDを提案する。
提案手法は,好ましくないデータを生成するための2段階のアプローチである。
広範ベンチマークを用いた実験では、幻覚を減らすだけでなく、標準ベンチマークでのモデル性能を向上させることができ、従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-02-18T00:56:16Z) - Progressive Visual Prompt Learning with Contrastive Feature Re-formation [15.385630262368661]
本稿では,異なるレイヤのプロンプト間の相互作用を強化するために,プログレッシブ・ビジュアル・プロンプト(ProVP)構造を提案する。
我々のProVPは、画像の埋め込みを深い層に効果的に伝播させ、インスタンス適応的なプロンプトメソッドと部分的に似た振る舞いをすることができる。
我々の知る限り、我々はV-Lモデルにおける視覚的プロンプトの、下流タスクにおける従来のプロンプトベースの手法よりも優れた性能を示す最初の人物である。
論文 参考訳(メタデータ) (2023-04-17T15:54:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。