論文の概要: UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering
- arxiv url: http://arxiv.org/abs/2608.01147v2
- Date: Wed, 05 Aug 2026 14:42:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.074843
- Title: UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering
- Title(参考訳): UniHEAR:知識に基づく視覚的質問応答のための統一的不均一ソース注意検索
- Authors: Ganzhong Luo, Yang Ren, Hanyong Wang, Shuyu Zheng, Menglong Yang,
- Abstract要約: 知識に基づくビジュアル質問回答 (KB-VQA) では、外部ソースからエンティティ知識を取得して、視覚的に根拠づけられた質問に答える必要がある。
既存の検索強化システムは2つの限界に悩まされている。
We propose UniHEAR, a unified framework for heterogeneous-source entity search and re rank。
- 参考スコア(独自算出の注目度): 4.2809639728730415
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge-Based Visual Question Answering (KB-VQA) requires retrieving entity knowledge from external sources to answer visually grounded questions. Existing retrieval-augmented systems suffer from two critical limitations. First, relying on a single retrieval modality creates a Single-Source Retrieval Bottleneck, missing ground-truth entities that are only accessible through complementary sources. Second, dual-tower pointwise rerankers suffer from Retrieval-Source-Blind Reranking, as they overlook retrieval origins and candidate-level retrieval priors, leading to redundant modality reliance. To address these challenges, we propose UniHEAR, a unified lightweight framework for heterogeneous-source entity retrieval and reranking. UniHEAR constructs a Coarse Retrieval Descriptor for each candidate entity, and introduces Retrieval-Guided Attentive Modality Gating to condition modality attention weights on this descriptor, complemented by Entropy-Weighted Source Fusion of coarse retrieval priors. A hybrid training strategy combining contrastive learning with an auxiliary modality-preserving loss unifies entity-level and section-level retrieval within a single model. Extensive experiments on E-VQA and InfoSeek demonstrate that UniHEAR achieves state-of-the-art retrieval and VQA performance, improving Recall@1 by 6.7 and 1.2 points over the strongest baselines while maintaining a lightweight reranking architecture. Code and model are available at https://github.com/iven-luo/UniHEAR.
- Abstract(参考訳): 知識に基づくビジュアル質問回答 (KB-VQA) では、外部ソースからエンティティ知識を取得して、視覚的に根拠づけられた質問に答える必要がある。
既存の検索強化システムは2つの限界に悩まされている。
第一に、単一の検索モダリティに頼ることで、補完的なソースを通してのみアクセス可能な、基礎的な実体の欠如である単一ソース検索ボトルネックが生成される。
第二に、二重解答点再帰者は、検索の原点と候補レベルの検索先を見落とし、冗長なモダリティ依存に繋がるため、レトリーバル・ソース・ブラインド・リグレードに苦しむ。
これらの課題に対処するために、異種ソースエンティティ検索と再ランク付けのための統一軽量フレームワークUniHEARを提案する。
UniHEARは、各候補エンティティに対して粗い検索記述子を構築し、粗い検索先行のエントロピー重みソース融合を補完して、この記述子に条件のモダリティ注意重みを付与する検索ガイド付注意モダリティゲーティングを導入する。
比較学習と補助的モダリティ保存損失を組み合わせたハイブリッド学習戦略は,一つのモデル内でのエンティティレベルとセクションレベルの検索を統一する。
E-VQAとInfoSeekに関する大規模な実験は、UniHEARが最先端の検索とVQAのパフォーマンスを実現し、軽量なリグレードアーキテクチャを維持しながら、最強のベースラインであるRecall@1を6.7と1.2ポイント改善したことを示している。
コードとモデルはhttps://github.com/iven-luo/UniHEAR.comで公開されている。
関連論文リスト
- Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs [45.88028371034407]
大規模言語モデルは、前もって微調整を行わずに、科学的文書からドメイン固有のキーオンに答えるときに幻覚を起こす傾向がある。
本稿では,これらの課題を解決するための高度なマルチモーダル検索型生成システムを提案する。
Qwen2-VL-2B-InstructはBERTScoreのクラウドベースモデルに匹敵する結果を得た。
論文 参考訳(メタデータ) (2026-07-06T08:32:09Z) - CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search [51.911048955965136]
CoSearchは多段階推論エージェントと生成ドキュメントランキングモデルを共同でトレーニングするフレームワークである。
この結果から, 推論エージェントと検索システムの協調訓練は, 実現可能であり, 性能も高いことが示唆された。
論文 参考訳(メタデータ) (2026-04-19T17:48:17Z) - Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training [80.20022221643414]
Cycle-Consistent Searchは、検索エージェントを訓練するための金色のスーパービジョンのないフレームワークである。
CCSは教師付きベースラインに匹敵する性能を示す。
これらの結果から,CCSは金の監督が不可能な環境で検索エージェントを訓練するためのスケーラブルな訓練パラダイムを提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-04-14T17:00:18Z) - ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning [48.01143057928348]
本稿では、強化学習を活用して外部リライト管理に依存しないフレームワークであるConvSearch-R1を提案する。
新たな2段階のアプローチは,検索誘導型自己蒸留によるコールドスタート問題に対処するために,セルフ駆動型ポリシーウォームアップと,従来型の検索指標における疎度問題に対処する特別に設計されたランクインセンティブ報酬形成機構を備えた検索誘導型強化学習を組み合わせたものである。
論文 参考訳(メタデータ) (2025-05-21T17:27:42Z) - Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines [17.803396998387665]
Retrieval-augmented Generation (RAG)は、知識集約型視覚質問応答(VQA)タスクに対処するために登場した。
本稿では,知識に基づくVQAタスクに対する従来のRAGモデルの代替としてReAuSEを提案する。
我々のモデルは生成型検索器と正確な回答生成器の両方として機能する。
論文 参考訳(メタデータ) (2025-02-23T16:39:39Z) - Zero-Shot Retrieval with Search Agents and Hybrid Environments [8.017306481455778]
現在の言語モデルは、伝統的な用語ベースの検索と組み合わせて、シンボリックなクエリ再構成ポリシーを学習することができるが、より優れたニューラル検索には及ばない。
本稿では,2つのエンコーダを経由した1回目検索の後に,個別のクエリ精算操作を受け入れるハイブリッド環境に,従来の学習環境を拡張した。
BEIRタスクの実験では、動作クローンによって訓練されたサーチエージェントが、二重エンコーダレシーバーとクロスエンコーダリランカの組み合わせに基づいて、基礎となるサーチシステムより優れていることが示された。
論文 参考訳(メタデータ) (2022-09-30T13:50:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。