論文の概要: DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering
- arxiv url: http://arxiv.org/abs/2607.23921v1
- Date: Mon, 27 Jul 2026 01:26:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.268861
- Title: DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering
- Title(参考訳): DDVT:ビジュアル質問応答における解答接地のための動的デュアルレベル視覚変換器フュージョンネットワーク
- Abstract要約: 視覚的質問応答の基盤となる解答のための動的デュアルレベル・ビジョントランスフォーマー・フュージョン・ネットワーク(DDVT)を導入する。
本稿では、ROIアラインとテキストコンテンツによる補完的な画像コンテキストを組み合わせた質問誘導動的地域レベルモジュール(QGDR)を提案する。
また、画素レベルの特徴と領域レベルの特徴を融合させるクロスモーダルなマルチスケールアグリゲーションモジュール(CMA)を提案する。
- 参考スコア(独自算出の注目度): 12.19277105352502
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Answer grounding in visual question answering aims to locate the region from a given natural language question associated with the visual content of an image, which has garnered significant attention due to its practical applications. In this paper, we introduce the Dynamic Dual-level Vision Transformer Fusion Network (DDVT) for answer grounding in visual question answering. Specifically, we propose a question-guided dynamic regional-level module (QGDR) that combines complementary image context through ROI Align and text content, enabling precise localization of text-related visual content. Moreover, we present a cross-modal multi-scale aggregation module (CMA) that enhances feature fusion between pixel-level and region-level features, facilitating the effective localization of visual content associated with grounded answers. Furthermore, we fuse the located visual content with text features to locate the region and provide answers to questions posed about the image. Experimental results demonstrate that our DDVT outperforms state-of-the-art methods on several widely-used benchmarks.
- Abstract(参考訳): 視覚的質問応答における回答は,画像の視覚的内容に関連する自然言語的質問から領域を特定することを目的としている。
本稿では,動的デュアルレベル視覚変換器フュージョンネットワーク(DDVT)を導入する。
具体的には、ROIアラインとテキストコンテンツを通して補完的な画像コンテキストを組み合わせた質問誘導動的地域レベルモジュール(QGDR)を提案し、テキスト関連ビジュアルコンテンツの正確なローカライズを可能にする。
さらに,画素レベルの特徴と領域レベルの特徴を融合させるクロスモーダル・マルチスケール・アグリゲーション・モジュール (CMA) を提案する。
さらに、位置した視覚コンテンツをテキスト特徴と融合させて、領域を特定し、画像に関する質問に対する回答を提供する。
実験の結果, DDVTは, 広く使用されているベンチマークにおいて, 最先端の手法よりも優れていた。
関連論文リスト
- TeSG: Textual Semantic Guidance for Infrared and Visible Image Fusion [55.34830989105704]
Infrared and visible image fusion (IVF) は、画像モダリティの相補的な情報を組み合わせることを目的としている。
テキスト意味論は,マスクの意味レベルとテキスト意味レベルという2つのレベルで導入する。
画像合成プロセスのガイドとなる赤外線・可視画像融合のためのテクスチュアル・セマンティック・ガイダンスを提案する。
論文 参考訳(メタデータ) (2025-06-20T03:53:07Z) - FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity [68.15983300711355]
Fine CapTIONは、任意のマスクを参照入力として認識し、異なるレベルの合成画像キャプションのための高解像度画像を処理する新しいVLMである。
本研究では,多粒領域合成画像キャプションのための新しいデータセットであるコンポジションCAPを紹介し,コンポジション属性対応地域画像キャプションの課題を紹介した。
論文 参考訳(メタデータ) (2024-11-23T02:20:32Z) - TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding [91.30065932213758]
大規模マルチモーダルモデル(LMM)は、その顕著な推論能力を活用することを目的とした研究の急増を引き起こした。
テキストリッチな画像理解のための新しいChain-of-ThoughtフレームワークであるTextCoTを提案する。
私たちのメソッドは追加のトレーニングが不要で、即時プラグアンドプレイ機能を提供します。
論文 参考訳(メタデータ) (2024-04-15T13:54:35Z) - GeoVLN: Learning Geometry-Enhanced Visual Representation with Slot
Attention for Vision-and-Language Navigation [52.65506307440127]
我々は,ロバストなビジュアル・アンド・ランゲージナビゲーションのためのスロットアテンションに基づく幾何学的視覚表現を学習するGeoVLNを提案する。
我々はV&L BERTを用いて言語情報と視覚情報の両方を組み込んだクロスモーダル表現を学習する。
論文 参考訳(メタデータ) (2023-05-26T17:15:22Z) - VITR: Augmenting Vision Transformers with Relation-Focused Learning for
Cross-Modal Information Retrieval [0.3211619859724084]
本稿では、視覚変換器(ViT)を画像領域の関係を抽出し、推論することによって拡張する新しいネットワークであるVITRを紹介する。
ViTRは、画像と記述間の類似点を予測するために、理由付けされた結果とグローバル知識を組み合わせた融合モジュールを組み込んでいる。
論文 参考訳(メタデータ) (2023-02-13T13:34:29Z) - Image-Specific Information Suppression and Implicit Local Alignment for
Text-based Person Search [61.24539128142504]
テキストベースの人物検索(TBPS)は,問合せテキストが与えられた画像ギャラリーから同一の身元で歩行者画像を検索することを目的とした課題である。
既存の手法の多くは、モダリティ間の微粒な対応をモデル化するために、明示的に生成された局所的な部分に依存している。
TBPSのためのマルチレベルアライメントネットワーク(MANet)を提案する。
論文 参考訳(メタデータ) (2022-08-30T16:14:18Z) - BOSS: Bottom-up Cross-modal Semantic Composition with Hybrid
Counterfactual Training for Robust Content-based Image Retrieval [61.803481264081036]
CIR(Content-Based Image Retrieval)は,サンプル画像と補完テキストの合成を同時に解釈することで,対象画像の検索を目的とする。
本稿では,新しいアンダーラインtextbfBottom-up crunderlinetextbfOss-modal underlinetextbfSemantic compounderlinetextbfSition (textbfBOSS) とHybrid Counterfactual Training frameworkを用いてこの問題に取り組む。
論文 参考訳(メタデータ) (2022-07-09T07:14:44Z) - Multimodal Incremental Transformer with Visual Grounding for Visual
Dialogue Generation [25.57530524167637]
視覚的対話は、視覚環境を理解することに基づいて、一連の一貫性のある質問に答える必要がある。
ビジュアルグラウンドティングは、テキストエンティティによってガイドされたイメージ内の関連オブジェクトを明示的に特定することを目的としている。
マルチモーダルインクリメンタルトランスフォーマーは、対話の順序に応じてステップごとに、多ターン対話履歴と視覚シーンのステップとをエンコードし、コンテキスト的かつ視覚的に一貫性のある応答を生成する。
論文 参考訳(メタデータ) (2021-09-17T11:39:29Z) - Exploring Explicit and Implicit Visual Relationships for Image
Captioning [11.82805641934772]
本稿では,画像キャプションのための領域レベルの表現を豊かにするために,明示的かつ暗黙的な視覚関係を探索する。
具体的には、オブジェクトペア上にセマンティックグラフを構築し、ゲートグラフ畳み込みネットワーク(Gated GCN)を利用して、近隣住民の情報を選択的に集約する。
暗黙的に、我々は変圧器から領域ベースの双方向エンコーダ表現を介して検出されたオブジェクト間のグローバルな相互作用を描画する。
論文 参考訳(メタデータ) (2021-05-06T01:47:51Z) - MAGNet: Multi-Region Attention-Assisted Grounding of Natural Language
Queries at Phrase Level [6.47137925955334]
画像レベルの視覚・テキスト融合に空間的注意ネットワークを活用することを提案する。
In-network Region Proposal Network (RPN) でリージョン提案を洗練し、フレーズクエリに対して単一または複数リージョンを検出する。
このような参照式データセットであるReferItでは、マルチリージョンアテンション支援基盤ネットワーク(MAGNet)が最先端技術よりも12%以上の改善を実現しています。
論文 参考訳(メタデータ) (2020-06-06T04:14:15Z) - Visual Question Answering Using Semantic Information from Image
Descriptions [2.6519061087638014]
本稿では,視覚的質問応答(VQA)タスクにおいて,画像の領域から抽出した画像の特徴や自然言語質問,意味的知識を利用して質問に対するオープンな回答を生成する,深層ニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2020-04-23T04:35:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。