論文の概要: Inside VLM Chart Reading: Tracing Value Reading from Vertical Bar Charts Across Space and Depth
- arxiv url: http://arxiv.org/abs/2609.13745v1
- Date: Sat, 12 Sep 2026 06:28:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.492475
- Title: Inside VLM Chart Reading: Tracing Value Reading from Vertical Bar Charts Across Space and Depth
- Title(参考訳): VLMチャートの読み込み - 空間と深さの垂直バーチャートから値を読み取る方法
- Abstract要約: 視覚言語モデル(VLM)は、チャートの質問に正確に答えることができるが、正確な値を取り戻すのに必要な証拠をどのように組み合わせるかは、出力精度が示さない。
Qwen2.5VL-7B-Instruct および InternVL3.5-8B における反現実的活性化パッチによる垂直バー値の読み出しについて検討した。
- 参考スコア(独自算出の注目度): 50.62320148925983
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision--language models (VLMs) can answer chart questions accurately, but output accuracy does not show how they combine the evidence needed to recover an exact value. We study vertical-bar value reading with controlled counterfactual activation patching in Qwen2.5VL-7B-Instruct and InternVL3.5-8B. The study connects three analyses: (1) The single-factor results show that the changed bar-top region restores much more answer preference than the unchanged bar body, despite containing fewer visual tokens. Legend- and series-related states also lose local recoverability earlier than bar-geometry and axis-scale states. (2) In the handoff analysis, restoration shifts from visual legend regions in early layers to prompt-series positions in middle layers. Resetting the prompt-series state selectively reduces legend-source rescue, supporting its role as a partial mediator. (3) In the factorial analysis, both models can use geometry and scale states from separate donors to favor the combined target. InternVL performs similarly when the states come from separate donors or one image, while Qwen shows lower restoration for separate donors which suggests higher context sensitivity. Together, these results provide preliminary causal evidence for localizing the internal computations that support exact bar-value reading.
- Abstract(参考訳): 視覚言語モデル(VLM)は、チャートの質問に正確に答えることができるが、正確な値を取り戻すのに必要な証拠をどのように組み合わせるかは、出力精度が示さない。
Qwen2.5VL-7B-Instruct および InternVL3.5-8B における反現実的活性化パッチによる垂直バー値の読み出しについて検討した。
1) 単要素分析の結果、変化したバートップ領域は、視覚的トークンが少ないにもかかわらず、変化したバー本体よりもはるかに多くの回答の好みを復元することが示された。
レジェンドおよびシリーズ関連状態は、バー幾何学や軸スケール状態よりも早く局所的な回復性を失う。
2) ハンドオフ解析では, 初期階層の視覚的伝説地域から中層におけるプロンプト・シリーズ位置へ復元が移行した。
プロンプトシリーズ状態のリセットは、レジェンドソースの救助を選択的に削減し、部分的な仲介者としての役割をサポートする。
(3) 因子分析では、どちらのモデルも、異なるドナーからの幾何学的およびスケール状態を用いて、組み合わせた目標を好むことができる。
InternVLも同様に、状態が別々のドナーまたは1つのイメージから来ている場合、Qwenは、より高いコンテキスト感度を示す別々のドナーに対する低い復元を示す。
これらの結果は、正確なバー値読み取りをサポートする内部計算を局所化するための予備的な因果的証拠を提供する。
関連論文リスト
- Concentrate After Imagination: Text-Conditioned Evidence Grounding for Partially Relevant Video Retrieval [27.64333612353748]
関連のあるビデオ検索は、クエリーが短い瞬間だけを記述すると、未トリミングされたビデオを検索する。
本稿では,PRVRのためのスコアレベルのエビデンス検証演算子TRACEを提案する。
ActivityNet Captions、Charades-STA、TVRでは、TRACEは3つのベンチマークで最高のSumRを達成する。
論文 参考訳(メタデータ) (2026-09-08T16:37:35Z) - Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation [18.20369971970953]
On-Policy Self-Distillation (OPSD)は、高密度のトークンレベルの監視を得るために、特権的なリプレイビューの下で生成されたトークンを再スコアする。
結果として得られるサポートは、リプレイビューに含まれる特権情報と、リプレイスキャフォールドによって誘導されるスコアシフトの両方を反映することができる。
本研究では, この問題点を解決するために, OCSD (Observatory-Calibrated Self-Distillation) を提案する。
論文 参考訳(メタデータ) (2026-08-05T12:52:14Z) - Steering Vision-Language Models with Joint Sparse Autoencoders [2.367986397868328]
連成スパースオートエンコーダ(JSAE)を導入し、シーケンスプールされた視覚と言語アクティベーションを、共用、解釈可能な画像/カプセルレベルの特徴に分解する。
JSAEを視覚言語モデル(VLM)に適用すると、制御可能なクロスモーダルステアリングの方向として使うのが難しい表現が得られる。
論文 参考訳(メタデータ) (2026-06-24T10:11:04Z) - SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding [56.079013202051094]
ボックスレベルのアノテーションを信号として転送する新しい手法であるSegVGを提案する。
このアプローチでは,ボックスレベルのレグレッションとピクセルレベルのセグメンテーションの両方の信号としてアノテーションを反復的に利用することができる。
論文 参考訳(メタデータ) (2024-07-03T15:30:45Z) - Breaking the Frame: Visual Place Recognition by Overlap Prediction [53.17564423756082]
本稿では,重なり合う予測に基づく新しい視覚的位置認識手法 VOP を提案する。
VOPは、Vision Transformerのバックボーンを使用してパッチレベルの埋め込みを取得することで、コビジュアブルなイメージセクションを進める。
提案手法では,データベース画像の重複点の評価に投票機構を用いる。
論文 参考訳(メタデータ) (2024-06-23T20:00:20Z) - Noisy-Correspondence Learning for Text-to-Image Person Re-identification [50.07634676709067]
本稿では,雑音対応においても頑健な視覚関係を学習するための新しいロバスト二重埋め込み法(RDE)を提案する。
提案手法は,3つのデータセット上での合成ノイズ対応と非合成ノイズ対応を両立させる。
論文 参考訳(メタデータ) (2023-08-19T05:34:13Z) - A Unified BEV Model for Joint Learning of 3D Local Features and Overlap
Estimation [12.499361832561634]
本稿では,3次元局所特徴の同時学習と重なり推定のための統合鳥眼ビュー(BEV)モデルを提案する。
提案手法は,特に重複の少ないシーンにおいて,重複予測における既存手法よりも優れていた。
論文 参考訳(メタデータ) (2023-02-28T12:01:16Z) - One-Shot Object Localization in Medical Images based on Relative
Position Regression [17.251097303541002]
ボリューム医療画像における臓器局在とランドマーク局在のためのワンショットフレームワークを提示する。
私たちの主な考え方は、異なる人体の組織や臓器が、同様の相対的な位置と文脈を持っていることです。
ヘッド・アンド・ネック(HaN)CTボリュームからの多臓器局在化実験により,本手法は実時間で競合性能を得た。
論文 参考訳(メタデータ) (2020-12-13T11:54:19Z) - Graph-PCNN: Two Stage Human Pose Estimation with Graph Pose Refinement [54.29252286561449]
グラフPCNNと呼ばれる2段階のグラフベースおよびモデルに依存しないフレームワークを提案する。
第1段階では、粗局化結果を得るために熱マップ回帰ネットワークを適用し、ガイドポイントと呼ばれる一連の提案キーポイントをサンプリングする。
第2段階では、各案内点について、ローカライゼーションにより異なる視覚特徴を抽出する。
ガイドされた点間の関係は、より正確なローカライゼーション結果を得るためにグラフポーズ精製モジュールによって探索される。
論文 参考訳(メタデータ) (2020-07-21T04:59:15Z) - High-Order Information Matters: Learning Relation and Topology for
Occluded Person Re-Identification [84.43394420267794]
本稿では,高次関係とトポロジ情報を識別的特徴とロバストなアライメントのために学習し,新しい枠組みを提案する。
我々のフレームワークはOccluded-Dukeデータセットで最先端の6.5%mAPスコアを大幅に上回っている。
論文 参考訳(メタデータ) (2020-03-18T12:18:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。