論文の概要: GEASS: Training-Free Caption Steering for Hallucination Mitigation in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.01733v1
- Date: Sun, 03 May 2026 06:09:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.911795
- Title: GEASS: Training-Free Caption Steering for Hallucination Mitigation in Vision-Language Models
- Title(参考訳): GEASS:視覚・言語モデルにおける幻覚緩和のためのトレーニングフリーキャプションステアリング
- Abstract要約: VLM(Vision-Language Models)は、接地推論において優れているが、対象の幻覚の傾向が強い。
近年の研究では、自己生成キャプションを一様正の資源として扱っているが、HalusionBench上でQwen2.5-VL-3Bの精度を10ポイント近く下げるよりも、埋め込むことで分解できることがわかった。
本稿では,モデルがどの程度のキャプションを消費するかをクエリ毎に決定する,トレーニング不要なモジュールであるGAASSを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Models (VLMs) excel at grounded reasoning but remain prone to object hallucination. Recent work treats self-generated captions as a uniformly positive resource, yet we find that naively embedding one can degrade rather than help--dropping Qwen2.5-VL-3B accuracy on HallusionBench by nearly 10 points. Two structural properties explain this. First, captions anchor not only the model's final answer but also its reasoning trajectory and lexical choices. Second, caption errors are asymmetric: omissions vastly outnumber fabrications, yet each fabrication carries a much larger per-instance impact. A caption's usefulness is therefore a per-query property, not a per-corpus one. We propose GEASS (Gated Evidence-Aware Selective Steering), a training-free module that decides on each query how much of the caption the model consumes: it gates the caption by the clean path's confidence, weights it by the entropy reduction it produces, and raises the evidence bar when the two pathways disagree. Experiments on POPE and HallusionBench across four VLMs show that GEASS consistently improves over vanilla inference and contrastive decoding, with only two extra forward passes per query.
- Abstract(参考訳): VLM(Vision-Language Models)は、接地推論において優れているが、対象の幻覚の傾向が強い。
近年の研究では、自己生成キャプションを一様に肯定的な資源として扱っているが、ハルーシオンベンチのQwen2.5-VL-3B精度を10ポイント近く下げるよりは、鼻に埋め込まれたキャプションを分解することができる。
2つの構造的特性がこれを説明する。
第一に、キャプションはモデルの最終回答だけでなく、推論の軌跡と語彙の選択も固定する。
第二に、キャプションエラーは非対称である: 省略は製造数を大幅に上回っているが、各製造はインスタンスごとの影響がはるかに大きい。
したがって、キャプションの有用性は、コーパスごとではなく、クエリごとのプロパティである。
GEASS(Gated Evidence-Aware Selective Steering)は,モデルがどれだけのキャプションを消費するかをクエリ毎に決定する学習自由モジュールで,クリーンパスの信頼度によってキャプションをゲートし,エントロピーの低減によってそれを重み付けし,二つの経路が一致しない場合にエビデンスバーを上昇させる。
4つのVLMにわたるPOPEとHalusionBenchの実験では、GAASSはバニラ推論とコントラストデコーディングよりも一貫して改善されており、クエリ毎に2回のフォワードパスのみである。
関連論文リスト
- SAVOR: Self-Aware Visual Grounding via Confidence-Calibrated Reinforcement Learning for Multimodal Hallucination Mitigation [4.100479369058624]
MLLM(Multimodal large language model)は、画像に基づかないオブジェクト、属性、関係について、流動的なクレームを生成する。
Savorは、トークンと回答の信頼性で出力スキーマを拡張するトレーニングフレームワークです。
本研究では,MME や MMBench の一般性を維持しながら幻覚を低減し,DPO よりも低い誤差とデコードベースラインを有することを示す。
論文 参考訳(メタデータ) (2026-09-15T03:53:32Z) - Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models [54.097381112138]
現在の自己進化型LMMは、イメージキャプションや視覚的質問応答といった視覚言語理解タスクに苦慮している。
モデルの視覚条件を直接正規化する,純粋に教師なしの自己進化型フレームワークであるVISEを提案する。
VISEは、専門的な役割、外部報酬モデル、アノテーションなしで単一のモデル内で動作します。
論文 参考訳(メタデータ) (2026-06-25T17:59:55Z) - Improving Reasoning in Vision-Language Models via Perception Verified Self-Training [3.443084677278651]
本稿では,視覚的根拠に基づく推論を強制する自己学習フレームワークを提案する。
まず,認識を推論から切り離すCoTテンプレートを用いて,視覚的理解の独立した検証を可能にする。
回答の正確さとともにキャプション検証を用いて、データを3つのサブセットに分割する: 簡単(正しいキャプションと結論)、中(正しいキャプションだが、間違った結論)、ハード(間違ったキャプション)。
論文 参考訳(メタデータ) (2026-06-20T17:33:07Z) - CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning [86.9494763617273]
本稿では,Captioning Reinforcement Learning++ (CapRL++)を紹介した。
本稿では,CapRL++が高密度キャプション品質を向上し,空間的・時間的理解などのタスクにおけるキャプションベースの事前訓練を強化していることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:09:20Z) - CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning [23.289413412387223]
CCCaption: 専用微調整コーパスを備えた双方向逆強化学習フレームワークについて紹介する。
完全性のために、私たちは多様なLVLMを使用して、画像を一連のビジュアルクエリに切り離し、これらのクエリにもっと答えるキャプションに報いる。
正当性については,サブキャプションクエリの正当性を検証することによって,幻覚を含む字幕を罰する。
論文 参考訳(メタデータ) (2026-02-25T07:34:26Z) - Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints [0.5414847001704249]
「Look, Recite, Then Answer」は、視覚言語モデルを強化するパラメータ効率のよいフレームワークである。
AgroBenchでは,Qwen2-VL-72Bでの雑草同定精度を23.52%向上し,検索オーバーヘッドを伴わずにGPT-4oを上回った。
論文 参考訳(メタデータ) (2025-11-30T13:04:43Z) - CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning [90.19455861166745]
本稿では,キャプションの品質を再定義するトレーニングフレームワークであるCaptioning Reinforcement Learning (CapRL)を紹介する。
主観的画像キャプションタスクにRLVRを適用した最初の研究として、CapRLは複数の設定を大幅に強化することを示した。
CapRLはQwen2.5-VL-72Bに匹敵する性能を達成し、ベースラインのマージンは平均8.4%を超えた。
論文 参考訳(メタデータ) (2025-09-26T17:59:55Z) - Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors [8.089908150148554]
マルチモーダル大規模言語モデル (MLLM) は様々な視覚言語タスクにおいて顕著な成功を収めている。
MLLMは幻覚に非常に敏感であり、視覚的証拠とは相容れない内容を生み出す。
本研究では,幻覚の緩和のための訓練不要で自己指導的な方法を提案する。
論文 参考訳(メタデータ) (2025-09-26T07:24:28Z) - ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing [128.8346376825612]
高品質画像キャプションの主な課題は、LVLMの固有のバイアスにある。
本稿では,キャプションを継続的に強化・校正し,推論予算を増大させる,スケーラブルなデバイアス付きキャプション戦略を提案する。
450KイメージにScaleCapをアノテートし、LVLMプレトレーニングに使用することで、11の広く使用されているベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-06-24T17:59:55Z) - AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models [91.78328878860003]
視覚言語モデル(LVLM)は幻覚の傾向が強い。
ベンチマークは多くの場合、障害パターンが一般化できない手作りのコーナーケースに依存します。
最初の自動ベンチマーク生成手法であるAutoHallusionを開発した。
論文 参考訳(メタデータ) (2024-06-16T11:44:43Z) - Woodpecker: Hallucination Correction for Multimodal Large Language Models [77.48131391764021]
Woodpeckerは生成されたテキストから幻覚を抽出して修正する。
キーコンセプト抽出、質問定式化、視覚的知識検証、視覚的クレーム生成、幻覚補正の5段階からなる。
我々はWoodpeckerを定量的かつ質的に評価し、この新しいパラダイムの潜在可能性を示す。
論文 参考訳(メタデータ) (2023-10-24T17:58:07Z) - HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models [69.52245481329899]
本稿では,画像コンテキスト推論評価のためのベンチマークであるHalusionBenchを紹介する。
このベンチマークは、1129の質問と組み合わせた346の画像で構成されており、すべて人間の専門家によって細心の注意を払って作成されている。
HallusionBenchの評価では、15種類のモデルをベンチマークし、最先端のGPT-4Vによって達成された31.42%の質問対精度を強調した。
論文 参考訳(メタデータ) (2023-10-23T04:49:09Z) - HallE-Control: Controlling Object Hallucination in Large Multimodal Models [80.03697683629035]
詳細な字幕作成のための GPT-4 支援評価手法である $textitCCEval$ を導入する。
LMMは既存のVQAベンチマークにおいて最小限のオブジェクト存在幻覚を示すが、提案手法はそのような幻覚への感受性を継続することを示す。
LLaVA$_7B$に比べて幻覚は44%減少し,対象範囲を維持できる。
論文 参考訳(メタデータ) (2023-10-03T04:01:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。