論文の概要: When Helpful Text Hurts: Option-Redirecting Bias in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.32489v1
- Date: Sat, 26 Sep 2026 11:33:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 08:35:00.431922
- Title: When Helpful Text Hurts: Option-Redirecting Bias in Vision-Language Models
- Title(参考訳): 視覚言語モデルにおけるテキストのヘルプ化:オプションリダイレクトバイアス
- Abstract要約: もっとも有害な補助テキストは必ずしも最も事実的に誤りであるとは限らないが、イメージを矛盾させ、特定の注意散らしを好みながら疑問に沿うものである。
本研究の結果は, 事実的正確性だけでなく, 判断レベルでの補助テキストの信頼性の理解が不可欠であることが示唆された。
- 参考スコア(独自算出の注目度): 2.9248916859490173
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In tri-modal visual question answering (VQA), auxiliary text is commonly used to complement visual and textual inputs, yet its reliability is often uncontrolled. While prior work studies modality conflicts in general, it remains unclear how different types of unreliable auxiliary text affect answer selection under fixed image-question-option contexts. In this work, we show that the most harmful auxiliary text is not necessarily the most factually incorrect, but the one that aligns with the question while contradicting the image and favoring a specific distractor, leading to systematic redirection of model predictions. To isolate this effect, we introduce the Textual Reliability Ladder, a controlled diagnostic protocol that decomposes auxiliary text along three axes: image consistency, question relevance, and option support. Across multiple datasets (ScienceQA, VCR, A-OKVQA, Causal-VidQA) and recent VLMs, we find that such distractor-supporting text induces the largest accuracy drops (up to 53.1%) and concentrates errors on specific incorrect options. To mitigate this failure mode, we propose a training-free inference-time intervention that explicitly counteracts this redirection effect via noise-stability steering and dynamic grounding, reducing redirected errors while largely preserving performance under faithful text. Our results highlight that auxiliary-text reliability must be understood at the decision level, rather than solely through factual correctness, and provide a practical pathway toward more robust tri-modal reasoning.
- Abstract(参考訳): 3モーダルな視覚的質問応答(VQA)では、補助的なテキストは視覚的およびテキスト的な入力を補完するために一般的に使用されるが、その信頼性は制御されていないことが多い。
先行研究は概してモダリティと矛盾するが、信頼できない補助テキストの種類が、固定された画像探索-選択コンテキスト下での回答選択にどのように影響するかは定かではない。
本研究は,最も有害な補助テキストが必ずしも最も事実的に誤っているわけではなく,画像に矛盾し,特定の注意散らしを好んで疑問に沿うものであることを示し,モデル予測の体系的リダイレクトに繋がった。
この効果を分離するために、画像整合性、質問関連性、オプションサポートの3つの軸に沿って補助テキストを分解する制御された診断プロトコルであるTextual Reliability Ladderを導入する。
複数のデータセット(ScienceQA、VCR、A-OKVQA、Causal-VidQA)と最近のVLMでは、そのような乱雑なサポートされたテキストは最大の精度低下(最大53.1%)を引き起こし、特定の誤ったオプションにエラーを集中させる。
この障害モードを緩和するために,ノイズ-安定ステアリングと動的グラウンドリングにより,このリダイレクト効果を明示的に抑制し,リダイレクトエラーを低減し,忠実なテキスト下での性能を保ちながら,トレーニング不要な推論時間介入を提案する。
以上の結果から, テキストの信頼性は, 事実的正確性だけでなく, 意思決定レベルでも理解されなければならないこと, より堅牢な三モーダル推論への実践的な道筋が示唆された。
関連論文リスト
- Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - Implicit Reasoning Steering via Concept Chaining [29.121206944212556]
自然言語のテキストを使って、明示的な指示やトリガー、直接回答の手がかりを使わずに、指定された回答に向けてモデルをバイアスする。
間接的な自然なテキストは、直接のパラフレーズよりも推論がかなり少ないまま、体系的にモデル予測を操ることができることを示す。
論文 参考訳(メタデータ) (2026-07-15T18:03:08Z) - PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution [51.96078493242164]
PRISMは単一ステップ拡散ベースのText-SRフレームワークである。
PRISMはミリ秒レベルの推論で最先端の性能を達成する。
論文 参考訳(メタデータ) (2026-05-13T05:31:06Z) - Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs [17.56537230934894]
Vision-Language Models (VLM)は、Visual-Question-Answering (VQA)ベンチマークで強力なマルチモーダル推論能力を示している。
これらのモデルが、誤解を招くテキストのプロンプトに対して脆弱であることを示し、しばしば矛盾するテキストを支持する明確な視覚的証拠をオーバーライドしている。
論文 参考訳(メタデータ) (2026-01-27T05:04:38Z) - What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews [31.373823254968315]
事実が正しいとしても、ソーシャルメディアのニュースプレビューは解釈のドリフトを引き起こす。
この秘密の害は明示的な誤報よりも検出が難しいが、未発見のままである。
我々は、プレビューベースとコンテキストベースの理解を分離し、シミュレートするマルチステージパイプラインを開発した。
論文 参考訳(メタデータ) (2026-01-09T06:29:19Z) - Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks [54.31998314008198]
大きな言語モデル(LLM)は、単一の正しい答えを必要とするタスクの推論において優れているが、マルチソリューションタスクでは不十分である。
我々はこの制限を、不完全解集合における不完全確実性を表現する傾向という、不確実な過信(textbfreasoning overconfidence)に起因している。
この仮説は, 思考経路の狭いセットに早急に収束すると, 過信が生じることを示唆するものである。
論文 参考訳(メタデータ) (2025-12-01T14:35:06Z) - Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval [48.85977777168096]
Gap-Aware Retrievalフレームワークは、テキスト$t_i$とビデオ$v_j$の間で、学習可能なペア固有のインクリメント$Delta_ij$を導入している。
セマンティックギャップに条件付けされた軽量なニューラルモジュールは、構造認識の修正のためにバッチ間で増分する。
4つのベンチマークの実験は、GAREが一貫してアライメント精度とロバスト性を改善することを示した。
論文 参考訳(メタデータ) (2025-05-18T17:18:06Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z) - Zero-shot Faithful Factual Error Correction [53.121642212060536]
事実の誤りを忠実に訂正することは、テキストの知識基盤の整合性を維持し、シーケンス・ツー・シーケンス・モデルにおける幻覚を防ぐために重要である。
提案するゼロショットフレームワークは,入力クレームに関する質問を定式化し,与えられたエビデンスにおける正しい回答を求め,そのエビデンスとの整合性に基づいて各補正の忠実さを評価する。
論文 参考訳(メタデータ) (2023-05-13T18:55:20Z) - Counterfactual Reasoning for Out-of-distribution Multimodal Sentiment
Analysis [56.84237932819403]
本稿では,OODの高次一般化に対するテキストモダリティの悪影響を推定・緩和することを目的とする。
そこで本研究では,マルチモーダル感情分析のためのモデルに依存しない反現実的フレームワークを考案した。
論文 参考訳(メタデータ) (2022-07-24T03:57:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。