論文の概要: Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.15565v1
- Date: Fri, 17 Jul 2026 02:16:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.736248
- Title: Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models
- Title(参考訳): Ask Twice, Look Twice: Prompt Echoingが視覚言語モデルにおける質問第一のパラドックスを解消
- Abstract要約: 視覚言語計算モデルにおける疑問第一パラドックスについて検討する。
イメージの前に置かれた質問は、真に知覚を操り、イメージパッチの表現を質問関連概念へと移動させる。
因果注意ノックアウトは、質問がイメージに従う場合にのみ、答えが質問を読み取ることを確認します。
画像の両側に質問を再現し、相手が回答時に読み出される間、相手が認識をコピーするようにする。
- 参考スコア(独自算出の注目度): 34.94717741758006
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Where should the question go in a vision-language model (VLM) prompt: before the image or after it? Intuition says before: knowing what is asked should tell the model where to look. Yet across visual question answering benchmarks, question-first prompting consistently underperforms the image-first ordering recommended for frontier VLMs, a phenomenon we term the question-first paradox. We trace the paradox to a conflict between two stages of VLM computation. Logit-lens and attention probes show the intuition is half right: a question placed before the image genuinely steers perception, moving image patch representations toward question-relevant concepts. The failure lies downstream. Stranded behind hundreds of image tokens, the question is barely attended by the answer token, which instead commits to image-driven (often wrong) answers; a causal attention knockout confirms that the answer reads the question only when the question follows the image. The diagnosis yields a training-free fix: question echoing, restating the question on both sides of the image so that one copy steers perception while the other is read out at answer time. The same division of labor appears in a fifty-year-old finding on human ``adjunct questions'', where repeating a question before and after a passage aids comprehension more than either position alone. Echoing the image as well brings further gains, restoring the whole-image view a causal decoder otherwise loses. The paradox holds across five open VLMs, costing up to 17.5 group-accuracy points. Echoed prompts close it and surpass the best single-pass ordering on NaturalBench, POPE, Winoground, and open-ended VQAv2, by up to 19 Winoground group-accuracy points, with no training, fine-tuning, or architecture change. The paradox reveals a trade-off between steering perception and preserving question access; echoing resolves it through prompt design alone.
- Abstract(参考訳): この疑問は、視覚言語モデル(VLM)のプロンプト(画像の前か後か)でどこへ進むべきか?
質問されたことを知ることは、モデルにどこに見えるかを伝えるべきです。
しかし、視覚的質問応答ベンチマークでは、クエスチョンファーストプロンプトは、フロンティアVLMに推奨されるイメージファーストオーダリングを一貫して過小評価しており、これはクエスチョンファーストパラドックスと呼ばれる現象である。
我々はこのパラドックスを、VLM計算の2段階間の衝突に辿り着いた。
ロジットレンズとアテンションプローブは、直感が半分正しいことを示している: イメージが真に知覚を操り、イメージパッチの表現を質問関連の概念へと移動させる前に、疑問を定めている。
その失敗は下流にある。
何百もの画像トークンの後ろに並べられたこの質問には、代わりにイメージ駆動の(しばしば間違った)回答をコミットする応答トークンがほとんど入っていない。
画像の両側に質問を再現し、相手が回答時に読み出される間、相手が認識をコピーするようにする。
同じ分業は、人間の「補助的質問」の発見から50年が経つと、通過前後の質問を繰り返して、どちらの立場よりも理解を助長する。
画像のエコーもさらに向上し、画像全体のビューを復元すると、因果デコーダが失われる。
パラドックスは5つのオープンなVLMにまたがっており、最大17.5個のグループ精度ポイントがかかる。
Echoedはそれを閉じて、NaturalBench、POPE、Winoground、そしてオープンエンドのVQAv2上の最高のシングルパスオーダーを19のWinogroundグループ精度ポイントまで上回り、トレーニング、微調整、アーキテクチャの変更はない。
パラドックスは、操舵知覚と質問アクセスの保存のトレードオフを明らかにし、エコーは迅速な設計だけでそれを解決する。
関連論文リスト
- VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning? [79.44137632338062]
マルチモーダルな大規模言語モデルが視覚的推論問題に正しく答える場合、その予測はタスククリティカルな視覚的証拠によって実際に支持されているか?
VisualFLIPは1,374枚の画像が基数,属性,空間,論理的タスクにまたがって同一の問合せペアとして配置されたベンチマークである。
ペアの両面を解く必要がある24個のMLLMと、少なくとも一方の面を解くモデルが両方の画像に対して同じ空でない答えを繰り返す頻度を測定するCR(Collapse Rate)を評価した。
論文 参考訳(メタデータ) (2026-06-05T22:06:07Z) - Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference [107.53380946417003]
本稿では,応答認識と領域参照を用いた視覚的質問生成のための新しい学習パラダイムを提案する。
我々は、追加の人間のアノテーションを導入することなく、視覚的ヒントを自己学習する簡単な手法を開発した。
論文 参考訳(メタデータ) (2024-07-06T15:07:32Z) - Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering [58.64831511644917]
本稿では, モデル決定を中間的人間法的な説明に分解する設計モデルを提案する。
我々は、我々の本質的に解釈可能なシステムは、推論に焦点をあてた質問において、同等のブラックボックスシステムよりも4.64%改善できることを示した。
論文 参考訳(メタデータ) (2023-05-24T08:33:15Z) - Enhancing Visual Dialog Questioner with Entity-based Strategy Learning
and Augmented Guesser [43.42833961578857]
本稿では,関連エンティティの指導の下で質問を生成し,人間の対話からエンティティベースの質問戦略を学習するReeQ(Relationed entity enhanced Questioner)を提案する。
また,特にVD設定に最適化されたAugG(Augmented Guesser)を提案する。
VisDial v1.0データセットによる実験結果から,本手法は画像認識タスクと問合せ多様性の両方において最先端の性能を実現する。
論文 参考訳(メタデータ) (2021-09-06T08:58:43Z) - Check It Again: Progressive Visual Question Answering via Visual
Entailment [12.065178204539693]
Visual Entailmentに基づいたSAR(Select-and-Rerank)プログレッシブフレームワークを提案する。
まず、質問や画像に関連する候補の答えを選択し、その候補の答えを視覚的細分化タスクで並べ替える。
実験の結果,VQA-CP v2の精度が7.55%向上した。
論文 参考訳(メタデータ) (2021-06-08T18:00:38Z) - Semantic Equivalent Adversarial Data Augmentation for Visual Question
Answering [65.54116210742511]
ディープニューラルネットワーク(DNN)の急速な発展により、VQA(Visual Question Answering)は大きな成功を収めた。
本稿では,画像と質問を直接操作する代わりに,画像と質問の両方に対して生成した逆例を拡張データとして使用する。
VQAv2の全体的な性能は向上するばかりでなく、敵攻撃に効果的に対応できることがわかりました。
論文 参考訳(メタデータ) (2020-07-19T05:01:01Z) - Neuro-Symbolic Visual Reasoning: Disentangling "Visual" from "Reasoning" [49.76230210108583]
本稿では,視覚的質問応答(VQA)の推論的側面をその知覚から分離し,評価する枠組みを提案する。
また,不完全な知覚においても,モデルが推論問題に答えられるような,新しいトップダウンキャリブレーション手法を提案する。
難易度の高いGQAデータセットでは、このフレームワークがよく知られたVQAモデル間の深い非絡み合いの比較に使用される。
論文 参考訳(メタデータ) (2020-06-20T08:48:29Z) - Rephrasing visual questions by specifying the entropy of the answer
distribution [0.0]
本稿では,質問のあいまいさを制御し,新しい課題を提案する。
視覚的質問のあいまいさは、VQAモデルによって予測される回答分布のエントロピーを用いて定義される。
我々は,質問のあいまいさを制御できるアプローチの利点を実証し,あいまいさを減らすことよりも増大が難しいという興味深い観察を行った。
論文 参考訳(メタデータ) (2020-04-10T09:32:37Z) - SQuINTing at VQA Models: Introspecting VQA Models with Sub-Questions [66.86887670416193]
現状のVQAモデルでは、知覚や推論の問題に答える上で同等の性能を持つが、一貫性の問題に悩まされていることを示す。
この欠点に対処するため、サブクエスト対応ネットワークチューニング(SQuINT)というアプローチを提案する。
我々は,SQuINTがモデル一貫性を5%向上し,VQAにおける推論問題の性能も改善し,注意マップも改善したことを示す。
論文 参考訳(メタデータ) (2020-01-20T01:02:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。