論文の概要: Counting to Four is still a Chore for VLMs
- arxiv url: http://arxiv.org/abs/2604.10039v1
- Date: Sat, 11 Apr 2026 05:23:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.807079
- Title: Counting to Four is still a Chore for VLMs
- Title(参考訳): カウント・トゥ・フォー」は、まだVLMのコレだ
- Abstract要約: 視覚言語モデル(VLM)は、複雑なマルチモーダル推論タスクにおいて印象的な性能を達成した。
それらは依然として、オブジェクトカウントのような単純な接地スキルで失敗します。
本稿では, 挙動解析と力学解析の両方を通して, VLM計数行動の実証的研究を行った。
- 参考スコア(独自算出の注目度): 3.017198998175514
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision--language models (VLMs) have achieved impressive performance on complex multimodal reasoning tasks, yet they still fail on simple grounding skills such as object counting. Existing evaluations mostly assess only final outputs, offering limited insight into where these failures arise inside the model. In this work, we present an empirical study of VLM counting behavior through both behavioral and mechanistic analysis. We introduce COUNTINGTRICKS, a controlled evaluation suite of simple shape-based counting cases designed to expose vulnerabilities under different patchification layouts and adversarial prompting conditions. Using attention analysis and component-wise probing, we show that count-relevant visual evidence is strongest in the modality projection stage but degrades substantially in later language layers, where models become more susceptible to text priors. Motivated by this finding, we further evaluate Modality Attention Share (MAS), a lightweight intervention that encourages a minimum budget of visual attention during answer generation. Our results suggest that counting failures in VLMs stem not only from visual perception limits, but also from the underuse of visual evidence during language-stage reasoning. Code and dataset will be released at https://github.com/leduy99/-CVPRW26-Modality-Attention-Share.
- Abstract(参考訳): 視覚言語モデル(VLM)は、複雑なマルチモーダル推論タスクにおいて印象的な性能を達成しているが、オブジェクトカウントのような単純な基礎技術では失敗している。
既存の評価は主に最終的なアウトプットのみを評価し、モデル内でこれらの障害が発生する場所について限定的な洞察を提供する。
本研究では,VLM計数行動について,動作解析と力学解析の両方を通して実証的研究を行った。
我々は,異なるパッチのレイアウトと対向的なプロンプト条件下で脆弱性を明らかにするために設計された,単純な形状に基づくカウントケースの制御された評価スイートであるCOUNINGTRICKSを紹介した。
注意分析とコンポーネント・ワイド・プロービングを用いて、モーダリティ・プロジェクションの段階では、カウント関連視覚的エビデンスが最も強いが、後続の言語層では大幅に劣化し、テキストの先行性に敏感になることを示す。
本研究の目的は,回答生成時の視覚的注意の最小限の予算を促す軽量な介入である,モダリティ・アテンション・シェア(MAS)を評価することである。
以上の結果から,VLMにおける障害のカウントは,視覚的知覚限界だけでなく,言語段階の推論における視覚的証拠の不足にも起因していることが示唆された。
コードとデータセットはhttps://github.com/leduy99/-CVPRW26-Modality-Attention-Shareでリリースされる。
関連論文リスト
- Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds [12.841957617988148]
本研究では,タスクの視覚的提示がモデル性能と障害モードを,基礎となる推論問題が変化しない場合にどのように形成するかを検討する。
空間構造をより使いやすくしながら、視覚的モダリティを保ちつつ、軽量な入力側足場を導入する。
視覚提示は,VLMベンチマークが基底認識,下流推論,あるいは両者の混合を計測するかどうかを決定する中心的な要因であることがわかった。
論文 参考訳(メタデータ) (2026-08-21T14:40:26Z) - Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Unveiling the Visual Counting Bottleneck in Vision-Language Models [49.591496870141846]
この研究は視覚的数え上げを3つの認知段階(視覚的識別、大きさ認識、象徴的マッピング)に分解する。
合成Go基板と線形プローブを用いて、視覚的バックボーンは、外挿系にしっかりと、線形に分離可能な量表現を保っていることを示す。
我々は、崩壊をシンボルマッピングステージに向ける。そこでは、モデルがシンボルトークンに有効な視覚的大きさを投影することに失敗する。
論文 参考訳(メタデータ) (2026-05-28T16:20:29Z) - Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision? [10.315515647818009]
ベンチマーク精度はしばしば、視覚言語モデルにおける基底的な視覚的理解を反映していると仮定される。
我々は、このミスマッチをオープンソースの視覚言語モデルで体系的に研究する。
VLMは視覚入力を取り入れているが、その予測はきめ細かい視覚的証拠の喪失にはあまり敏感ではない。
論文 参考訳(メタデータ) (2026-05-21T17:35:04Z) - CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models [44.585250047959924]
VLM(Vision-Language Models)はマルチモーダル推論において優れているが、その答えが視覚的証拠に根ざされているか、あるいは学習言語や世界の先駆者によって駆動されているかは定かではない。
本稿では,VLMにおけるデファクトカウントの診断フレームワークであるCounterCountを紹介する。
これらの失敗は、欠落または曖昧な視覚的証拠によるものではなく、無関係な視覚的トークンへの注意を過小評価するモデルによるものであることを示す。
論文 参考訳(メタデータ) (2026-05-18T04:00:05Z) - Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models [154.39583176906893]
大規模言語モデル(ML)は高度な理解を持ち、シーンにおける幻覚の傾向が高い。
これは、時間的モニタリングの失敗、オブジェクトの動的アイデンティティ、状態、そして時間とともに関係を永続的に追跡する能力に起因している、と我々は主張する。
既存のベンチマークでは、局所的な視覚的手がかりや統計的先行によってしばしば解決される1つの最終回答クエリに頼って、この欠陥を曖昧にしている。
論文 参考訳(メタデータ) (2026-05-09T14:32:36Z) - Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification [55.357038267439684]
Visual Re-Examination (VRE)は、MLLMが視覚的な入力を追加することなく推論中に自律的に視覚的イントロスペクションを実行することができる自己進化型トレーニングフレームワークである。
VREは推論精度と知覚信頼性を継続的に改善し、特にロングチェーン環境では幻覚を著しく低減する。
論文 参考訳(メタデータ) (2026-03-27T12:22:13Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs [7.406217790017003]
自然主義的環境下での視覚的推論を文脈言語による制御なしで研究するためのベンチマークであるVisRes Benchを紹介した。
3段階の複雑さのモデル行動を分析し、知覚的および関係的な視覚的推論能力の明らかな限界を明らかにする。
我々は、VisResがマルチモーダル研究における抽象的な視覚的推論を促進するための統一的なフレームワークをどのように提供するかについて論じる。
論文 参考訳(メタデータ) (2025-12-24T14:18:38Z) - [De|Re]constructing VLMs' Reasoning in Counting [2.1856941852799134]
制御された実験条件下での計数作業における7つの最先端ビジョンランゲージモデル(VLM)の推論技術について検討した。
レイヤワイズ解析により、エラーは最終層表現の出力空間への誤ったマッピングによるものであることが明らかになった。
対象とするトレーニングでは,出力層のみの微調整により,最大21%の精度が向上した。
論文 参考訳(メタデータ) (2025-10-22T13:08:47Z) - Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting [16.47788191300739]
VLM(Vision-Language Models)は、今日のAIコミュニティの中心となっている。
本稿では,基本的な幾何学的形状しか持たない最小限の設定で設計したベンチマークVLMCountBenchを紹介する。
本研究では, 制御アブレーションにおける色, サイズ, 急激な改質など, 簡便な特性の影響について検討した。
論文 参考訳(メタデータ) (2025-10-06T00:11:24Z) - SpatialViz-Bench: An MLLM Benchmark for Spatial Visualization [44.427830927596204]
SpaceViz-Benchは4つのサブ能力にまたがる12のタスクを持つ空間視覚化のための総合的なベンチマークである。
33種類の最先端MLLMを評価した結果,多彩な性能の変動がみられ,反直感的な結果が得られた。
論文 参考訳(メタデータ) (2025-07-10T10:27:20Z) - Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios [69.00444996464662]
RIV-CoT(Retrieval-based Interleaved Visual Chain-of-Thought法)を提案する。
実験の結果, RIV-CoTの解答精度は3.1%向上し, バニラCoTの解答精度は4.6%向上した。
論文 参考訳(メタデータ) (2025-01-08T18:31:16Z) - VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models [57.43276586087863]
LVLM(Large Vision-Language Models)は幻覚に悩まされ、このモデルでは可聴音を発生させるが、実際には誤出力を発生させる。
既存のベンチマークはスコープに限られており、主にオブジェクト幻覚に焦点を当てている。
対象,属性,関係を多次元のベンチマークで表現し,連想バイアスに基づいて画像を選択する。
論文 参考訳(メタデータ) (2024-04-22T04:49:22Z) - NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision [64.83085920775316]
NPHardEval4Vは4つの古典的NPハード問題に基づくマルチモーダルベンチマークスイートである。
各タスクは、構造化された視覚レイアウトとテキストプロンプトを組み合わせることで、視覚言語的制約の下で推論を行うLVLMの能力を評価するように設計されている。
以上の結果から,これらのモデルは知覚に基づく入力に対して合理的に優れているが,グローバルな最適化,抽象化,制約満足度に苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2024-03-04T07:10:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。