論文の概要: Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2608.04452v1
- Date: Wed, 05 Aug 2026 05:03:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.726578
- Title: Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning
- Title(参考訳): Q-CueGraph:マルチモーダル推論のためのクエリ定義ビジュアルエビデンスグラフ
- Authors: Pengcheng Pan, Xinfang Zhang,
- Abstract要約: Q-CueGraphは質問と画像表現を凍結リーダのための予算付き座標レベルの観測にマップする。
テキストリッチなイメージは再利用可能なOCR/グラフを使用し、自然言語検索は同じ選択、合成、予算設定インターフェースの背後にあるクエリ条件付きビジュアルノードをインスタンス化する。
凍結されたQwen2.5-VL-7Bリーダーでは、Q-CueGraphはV*Benchで0.833の精度に達し、画像領域予算の19%からフルイメージの推測では0.696に達し、画像領域の約半分からInfographicVQAでフルイメージのANLSの92%に達する。
- 参考スコア(独自算出の注目度): 1.237556184089774
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-resolution pixels and crop or zoom tools give multimodal large language models the ability to inspect an image, but they do not provide a reliable task-conditioned policy for deciding where to inspect. Q-CueGraph makes this decision explicit. It maps a question and an image representation to budgeted, coordinate-level observations for a frozen reader. Text-rich images use a reusable OCR/layout graph; natural-image search instantiates query-conditioned visual nodes behind the same selection, composition, and budgeting interface. Optional utility refinement learns which candidate crops the frozen reader can use from training-answer correctness, without region-box supervision. With a frozen Qwen2.5-VL-7B reader, Q-CueGraph reaches 0.833 accuracy on V*Bench versus 0.696 for full-image inference from a 19% image-area budget, and reaches 92% of full-image ANLS on InfographicVQA from about half the image area. Across six benchmarks, explicit observation is most valuable when evidence is localizable, the question discriminates its location, and resolution limits full-image reading.
- Abstract(参考訳): 高解像度のピクセルやクロップ、ズームツールは、マルチモーダルな大言語モデルに画像の検査能力を与えるが、検査場所を決定するための信頼性の高いタスク条件付きポリシーは提供していない。
Q-CueGraphはこの決定を明示する。
質問と画像表現を、冷凍リーダーのための予算付き座標レベルの観測にマップする。
テキストリッチな画像は再利用可能なOCR/レイアウトグラフを使用し、自然言語検索はクエリ条件付き視覚ノードを同じ選択、合成、予算設定インターフェースでインスタンス化する。
任意のユーティリティリファインメントは、フリーズリーダーがどの候補作物を、リージョンボックスの監督なしに、トレーニングと回答の正しさから利用できるかを学習する。
凍結されたQwen2.5-VL-7Bリーダーでは、Q-CueGraphはV*Benchで0.833の精度に達し、画像領域予算の19%からフルイメージの推測では0.696に達し、画像領域の約半分からInfographicVQAでフルイメージのANLSの92%に達する。
6つのベンチマークで、エビデンスがローカライズ可能で、問題はその位置を識別し、解像度はフルイメージの読み取りを制限する。
関連論文リスト
- When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning [73.56343820592399]
本稿では,視覚的タスクセマンティックス(VTS, Visualized Task Semantics)について紹介する。
6つのMLLMと4つのベンチマークで、24のモデルとタスクのペアの精度は平均17.8ポイント低下した。
本稿では,質問領域を型付きセマンティクスと整合させ,そのクリーンな表現をマスクビューから復元するプロンプト領域グラウンドを提案する。
論文 参考訳(メタデータ) (2026-08-05T11:46:15Z) - ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics [0.0]
Infographic Visual Question Answering (InfographicVQA) は、データリッチでレイアウトの多いビジュアルを読み書きするモデルの能力を評価する。
ベトナムのInfographicVQAの最初のベンチマークであるViInfographicVQAを紹介する。
このベンチマークは、6747以上の現実世界のインフォグラフィックと、20409の人間による検証された質問応答ペアで構成されている。
論文 参考訳(メタデータ) (2025-12-13T18:37:47Z) - T-Graph: Enhancing Sparse-view Camera Pose Estimation by Pairwise Translation Graph [3.3301244688278078]
T-Graphは軽量でプラグアンドプレイのモジュールで、スパースビュー設定でのカメラポーズ推定を強化する。
入力としてペア画像の特徴を取り込み、MLP(Multilayer Perceptron)を通してそれらをマップする。
その後、完全に接続された翻訳グラフを構築し、ノードはカメラとエッジを表現し、翻訳関係を符号化する。
論文 参考訳(メタデータ) (2025-05-02T11:50:48Z) - Picking the Cream of the Crop: Visual-Centric Data Selection with Collaborative Agents [62.616106562146776]
textbfVisual-Centric textbfSelection approach by textbfAgents Collaboration (ViSA)を提案する。
提案手法は,(1)視覚エージェントの協調による画像情報定量化手法により,リッチな視覚情報を持つ画像を選択する方法,(2)高品質な画像に関連する高品質な画像を選択する視覚中心の指示品質評価手法からなる。
論文 参考訳(メタデータ) (2025-02-27T09:37:30Z) - Breaking the Frame: Visual Place Recognition by Overlap Prediction [53.17564423756082]
本稿では,重なり合う予測に基づく新しい視覚的位置認識手法 VOP を提案する。
VOPは、Vision Transformerのバックボーンを使用してパッチレベルの埋め込みを取得することで、コビジュアブルなイメージセクションを進める。
提案手法では,データベース画像の重複点の評価に投票機構を用いる。
論文 参考訳(メタデータ) (2024-06-23T20:00:20Z) - SelfGraphVQA: A Self-Supervised Graph Neural Network for Scene-based
Question Answering [0.0]
シーングラフはマルチモーダル画像解析の有用なツールとして登場した。
理想化されたアノテートシーングラフを利用する現在の手法は、画像から抽出された予測シーングラフを使用する場合、一般化に苦慮している。
本稿では,事前学習したシーングラフ生成器を用いて,入力画像からシーングラフを抽出する。
論文 参考訳(メタデータ) (2023-10-03T07:14:53Z) - Advancing Visual Grounding with Scene Knowledge: Benchmark and Method [74.72663425217522]
ビジュアルグラウンドディング(VG)は、視覚と言語の間にきめ細かいアライメントを確立することを目的としている。
既存のVGデータセットの多くは、単純な記述テキストを使って構築されている。
我々は、アンダーラインScene underline-guided underlineVisual underlineGroundingの新たなベンチマークを提案する。
論文 参考訳(メタデータ) (2023-07-21T13:06:02Z) - VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks
for Visual Question Answering [79.22069768972207]
本稿では,VQA-GNNモデルを提案する。VQA-GNNは,非構造化知識と構造化知識の双方向融合を行い,統一知識表現を得る。
具体的には,シーングラフとコンセプトグラフを,QAコンテキストを表すスーパーノードを介して相互接続する。
課題2つのVQAタスクにおいて,本手法はVCRが3.2%,GQAが4.6%,強いベースラインVQAが3.2%向上し,概念レベルの推論を行う上での強みが示唆された。
論文 参考訳(メタデータ) (2022-05-23T17:55:34Z) - Understanding the Role of Scene Graphs in Visual Question Answering [26.02889386248289]
我々はGQAデータセット上で実験を行い、計数、構成性、高度な推論能力を必要とする質問の挑戦的なセットを示す。
我々は,シーングラフに使用する画像+質問アーキテクチャを採用し,未認識画像の様々なシーングラフ生成手法を評価し,人間の注釈と自動生成シーングラフを活用するためのトレーニングカリキュラムを提案する。
視覚質問応答におけるシーングラフの利用に関する多面的研究を行い,本研究を第一種とした。
論文 参考訳(メタデータ) (2021-01-14T07:27:37Z) - REXUP: I REason, I EXtract, I UPdate with Structured Compositional
Reasoning for Visual Question Answering [4.02726934790798]
視覚構造を意識したテキスト情報を用いた深部推論VQAモデルを提案する。
REXUPネットワークは、画像オブジェクト指向とシーングラフ指向の2つのブランチで構成され、超対角融合合成注意ネットワークと協調して動作する。
私たちの最高のモデルは、検証セットに92.7%、テストデブセットに73.1%を提供する、貴重な最先端技術よりも大幅に優れています。
論文 参考訳(メタデータ) (2020-07-27T00:54:50Z) - Comprehensive Image Captioning via Scene Graph Decomposition [51.660090468384375]
本稿では,画像シーングラフの表現を再検討することにより,画像キャプションの課題に対処する。
我々の手法の核となるのは、シーングラフをサブグラフの集合に分解することである。
我々は,重要な部分グラフを選択し,選択した各サブグラフを1つのターゲット文にデコードするディープモデルを設計する。
論文 参考訳(メタデータ) (2020-07-23T00:59:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。