論文の概要: SAVOR: Self-Aware Visual Grounding via Confidence-Calibrated Reinforcement Learning for Multimodal Hallucination Mitigation
- arxiv url: http://arxiv.org/abs/2609.16601v1
- Date: Tue, 15 Sep 2026 03:53:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.33328
- Title: SAVOR: Self-Aware Visual Grounding via Confidence-Calibrated Reinforcement Learning for Multimodal Hallucination Mitigation
- Title(参考訳): SAVOR:マルチモーダル幻覚軽減のための信頼度校正強化学習による自己認識型視覚接地
- Abstract要約: MLLM(Multimodal large language model)は、画像に基づかないオブジェクト、属性、関係について、流動的なクレームを生成する。
Savorは、トークンと回答の信頼性で出力スキーマを拡張するトレーニングフレームワークです。
本研究では,MME や MMBench の一般性を維持しながら幻覚を低減し,DPO よりも低い誤差とデコードベースラインを有することを示す。
- 参考スコア(独自算出の注目度): 4.100479369058624
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) have made strong progress on visual question answering and image captioning, yet they still produce fluent claims about objects, attributes, or relations that are not grounded in the image. Many remedies either modify decoding at test time, which adds latency, or fine tune with preferences such as DPO variants, which teach which answer is preferred but not when the model's own answer is unreliable. We argue that calibrated self assessment is the missing signal. We introduce Savor, a training framework that (i) augments the output schema with token and answer confidence, (ii) optimises the policy with a Group Relative Policy Optimisation (GRPO) objective that penalises calibration error and poor abstention decisions, and (iii) uses the learned confidence at inference time to revisit visual evidence only when the model is uncertain. Experiments on POPE, HallusionBench, AMBER and MMHal-Bench across two recent backbones (InternVL3-8B and Qwen3-VL-8B) show that Savor reduces hallucination while preserving general capability on MME and MMBench, with lower Expected Calibration Error than DPO and decoding baselines.
- Abstract(参考訳): MLLM(Multimodal large language model)は、視覚的質問応答や画像キャプションに大きく進歩しているが、画像に基づかないオブジェクト、属性、関係性に関する流動的な主張を生成する。
多くのリメディエーションは、テスト時にデコードを変更するか、遅延を追加するか、DPO変種のような好みに合わせて微調整する。
我々は、校正された自己評価が欠落する信号であると主張している。
私たちはSaveorというトレーニングフレームワークを紹介します。
(i)トークンによる出力スキーマの強化と回答の信頼性。
(二 校正エラー及び棄権判断の低さを罰するグループ相対的政策最適化(GRPO)目標による政策の最適化
三 モデルが不確実な場合に限って、学習した信頼度を用いて視覚的証拠を再考すること。
POPE, HallusionBench, AMBER, MMHal-Benchを最近の2つのバックボーン(InternVL3-8B, Qwen3-VL-8B)で実験したところ, Savor は MME と MMBench の一般性を維持しながら幻覚を低減し, DPO よりも低いキャリブレーション誤差とデコードベースラインが得られた。
関連論文リスト
- Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards [52.42920996842378]
視覚的理解と画像生成の両方をサポートするほとんどの統合された大型マルチモーダルモデル(LMM)は、訓練後の監督に頼っている。
本稿では,3つの内部的役割を持つ自己進化型トレーニングフレームワークを提案する。 視覚的質問を生成するプロポーラ, 回答と評価を行うソルバ, 画像を生成するジェネレータである。
画像生成のために,質問文の忠実度とサイクル一貫性キャプションを組み合わせたマルチスケール内部評価手法を設計する。
論文 参考訳(メタデータ) (2026-06-25T17:59:57Z) - Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA [0.16383644639245779]
マルチモーダル大言語モデル (MLLM) を医用視覚質問回答 (VQA) に適用すると, 実際の正確性に関わらず, 自信過剰なアウトプットが生じる傾向にある。
本研究では、MLLMを微調整し、複合損失関数を用いて校正を改善するためのトレーニングベースフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-25T13:33:58Z) - Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking [7.845652284569666]
本稿では,モデルに依存しない信頼度推定フレームワークBICR(Blind-Image Contrastive Ranking)を紹介する。
ライトウェイトプローブは、実像隠蔽状態に基づいてトレーニングされ、ブラックアウトビューに対する高い信頼度を罰するランキング損失によって正規化される。
5つの現代のLVLMと7つのベースラインで評価され、視覚的質問応答、オブジェクト検出、医用画像、財務文書理解に関するベンチマークが実施された。
論文 参考訳(メタデータ) (2026-05-11T17:35:10Z) - Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems [52.83669998269706]
テキストのみの設定で研究されてきたが、まだマルチモーダルに探索されていない。
現在のベンチマークでは、未解決性を無視するか、現実的な障害モードを見逃す粗末なメソッドに依存している。
MM-AQAは、2つの軸に沿った変換によって解答不能なインスタンスを解答可能なインスタンスから構築するベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T09:23:22Z) - Benchmarking Deflection and Hallucination in Large Vision-Language Models [25.176271096443482]
既存のベンチマークでは、視覚的証拠とテキスト的証拠の衝突を見落としている。
多様なマルチモーダル検索設定にまたがる2,775個のサンプルのベンチマークであるVLM-DeflectionBenchを紹介する。
私たちの結果は、モデルが知っていることだけでなく、そうでないときにどのように振る舞うかを評価する必要性を強調します。
論文 参考訳(メタデータ) (2026-04-13T20:22:22Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding [41.828387997311474]
LVLM(Large Vision-Language Models)は画像キャプションや視覚的質問応答といったマルチモーダルタスクにおいて,近年顕著な成果を上げている。
それらは、まだ存在しない、または誤認されたオブジェクトの記述を生成する、オブジェクト幻覚の傾向にある。
本稿では,複数のLVLMからの予測を集約することで幻覚を緩和する,学習不要でトークンレベルのアンサンブルフレームワークであるAdaptive Token Ensemble Decoding (ated)を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:11:24Z) - Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection [71.8243083897721]
視覚言語モデルは、しばしば詳細を幻覚させ、既存のオブジェクトを生成するか、出力信頼性を損なう不正確な属性を生成する。
本稿では、長文応答と短文応答の自己整合性を利用して、学習のための選好ペアを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:37:11Z) - Measuring Epistemic Humility in Multimodal Large Language Models [17.490955813494693]
HumbleBench は,MLLM が正解ではないが誤解を拒否する能力を評価するために設計された,新しい幻覚ベンチマークである。
我々は、微粒なシーングラフアノテーションを利用して、地中構造体と関係を抽出し、GPT-4-Turboに多重選択質問を生成する。
HumbleBenchは、現在の評価スイートにおける重要なギャップを埋め、安全クリティカルな設定におけるMLLMの信頼性をより現実的に測定する。
論文 参考訳(メタデータ) (2025-09-11T17:54:00Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - Multi-Modal Hallucination Control by Visual Information Grounding [121.6983694815504]
本稿では,VLM(Generative Vision-Language Models)が,入力画像に常に接するとは限らない,可聴性のあるテキスト応答を生成する傾向があることを示す。
即時増幅のための新しいサンプリング手法であるM3ID(Multi-Modal Mutual-Information Decoding)を導入する。
M3IDは、言語に対する参照画像の影響を増幅し、視覚的プロンプトと高い相互情報を持つトークンの生成を優先する。
論文 参考訳(メタデータ) (2024-03-20T22:05:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。