論文の概要: When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs
- arxiv url: http://arxiv.org/abs/2608.23978v1
- Date: Tue, 25 Aug 2026 02:12:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.74936
- Title: When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs
- Title(参考訳): LVLMにおけるインタラクティブなビジュアルグラウンドのベンチマーク
- Authors: Zhengxiang Wang, Owen Rambow,
- Abstract要約: 大規模視覚言語モデル(LVLM)における対話型視覚接地のための制御された評価フレームワークを提案する。
LVLMは、4つの視覚的コンテキストと4つのインタラクションプロトコルでタスクレベルの人間のベースラインをはるかに下回る性能を示した。
LVLMは校正も不十分で、しばしば実験精度を超える信頼性を報告している。
- 参考スコア(独自算出の注目度): 13.266692327291748
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual grounding is typically evaluated as a one-shot mapping from an informative referring expression to a visual target. This formulation misses a central property of real-world reference: target information is often incomplete, ambiguous, and established through interaction. We introduce a controlled evaluation framework for interactive visual grounding in large vision-language models (LVLMs), varying how much target information is provided upfront and how much must be acquired through dialogue. Across four human-grounded visual contexts and four interaction protocols, current LVLMs perform significantly below task-level human baselines. Interaction can help when follow-up questions refine or repair an initial target description. Performance is lowest when no initial description is provided and target information must be acquired through questions, indicating that proactive question-driven grounding remains difficult. LVLMs are also poorly calibrated, often reporting confidence that exceeds their empirical accuracy. Follow-up studies confirm these patterns across varied description sources (human versus AI), reasoning efforts, repeated interactions, description providers, and visual contexts. Overall, interactive visual grounding remains an important challenge, requiring visual matching, information seeking and synthesis.
- Abstract(参考訳): 視覚的接地は通常、情報的参照表現から視覚的ターゲットへのワンショットマッピングとして評価される。
この定式化は現実世界の参照の中心的な性質を欠いている: ターゲット情報は多くの場合不完全で曖昧であり、相互作用を通じて確立される。
大規模視覚言語モデル(LVLM)における対話型視覚接地のための制御された評価フレームワークを導入する。
4つの視覚的コンテキストと4つのインタラクションプロトコルにおいて、現在のLVLMはタスクレベルの人間のベースラインよりも大幅に低い性能を示す。
インタラクションは、フォローアップ質問が初期ターゲット記述を洗練または修復するのに役立つ。
初期記述が提供されず、目標情報を質問を通じて取得しなければならない場合、パフォーマンスは最低であり、積極的な質問駆動の根拠付けが困難であることを示す。
LVLMは校正も不十分で、しばしば実験精度を超える信頼性を報告している。
フォローアップ研究は、これらのパターンを、さまざまな記述ソース(人間対AI)、推論の取り組み、繰り返しのインタラクション、記述プロバイダ、視覚的コンテキストにまたがって確認する。
全体として、インタラクティブな視覚的接地は、視覚的マッチング、情報検索、および合成を必要とする重要な課題である。
関連論文リスト
- Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds [12.841957617988148]
本研究では,タスクの視覚的提示がモデル性能と障害モードを,基礎となる推論問題が変化しない場合にどのように形成するかを検討する。
空間構造をより使いやすくしながら、視覚的モダリティを保ちつつ、軽量な入力側足場を導入する。
視覚提示は,VLMベンチマークが基底認識,下流推論,あるいは両者の混合を計測するかどうかを決定する中心的な要因であることがわかった。
論文 参考訳(メタデータ) (2026-08-21T14:40:26Z) - Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding [13.93076527078901]
本稿では,VDU課題の解決に必要な情報が,大規模視覚言語モデルの異なる層にどのように表現されるかを検討する。
本研究は,内部表現と生成応答の間に明確なギャップがあることを明らかにする。
実験により、微調整中間層はギャップを狭めながら線形探索精度と応答精度の両方を改善することが示された。
論文 参考訳(メタデータ) (2026-04-06T04:25:52Z) - ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models [32.24716280370563]
ICTは、異なるレベルの視覚情報に焦点を移すための介入方向を計算する軽量でトレーニング不要な手法である。
少量のデータで強力なパフォーマンスを実現し、さまざまなデータセットやモデルにまたがってうまく一般化する。
論文 参考訳(メタデータ) (2024-11-22T12:22:21Z) - VAGUE: Visual Contexts Clarify Ambiguous Expressions [26.190504250419547]
VAGUEは、意図の視覚的コンテキストを統合するマルチモーダルAIシステムの能力を評価するベンチマークである。
我々の実験によると、既存のマルチモーダルAIモデルは話者の真の意図を推測するのに苦労している。
失敗事例の分析は、現在のモデルが視覚的なシーンにおける表面的相関と真の意図を区別できないことを示す。
論文 参考訳(メタデータ) (2024-11-21T14:01:42Z) - Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models [69.79709804046325]
視覚関係の幻覚を評価するための新しいベンチマークであるR-Benchを紹介する。
R-Benchは、関係の存在に焦点を当てたイメージレベルの質問と、局所的な視覚的理解を評価するインスタンスレベルの質問を特徴としている。
我々は,関係関連性,主観関連性,関係対象性という,幻覚につながる3つの関係共起関係を同定する。
論文 参考訳(メタデータ) (2024-06-24T08:42:42Z) - Understanding ME? Multimodal Evaluation for Fine-grained Visual
Commonsense [98.70218717851665]
モデルが、限られた評価データ資源のために、視覚的シーンと基礎となるコモンセンス知識を本当に理解しているかどうかは不明だ。
本稿では,視覚シーン,テキスト,関連知識に対するモデルの理解をテストするために,質問応答ペアを自動的に生成するマルチモーダル評価(ME)パイプラインを提案する。
次に、MEデータによるトレーニングが標準VCR評価におけるモデルの性能を高めることを示すために、さらに一歩踏み出します。
論文 参考訳(メタデータ) (2022-11-10T21:44:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。