論文の概要: Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering
- arxiv url: http://arxiv.org/abs/2607.25422v1
- Date: Tue, 28 Jul 2026 08:20:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.757233
- Title: Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering
- Title(参考訳): 有能な知識経路:効率的な知識集約型マルチモーダル質問応答のためのスパース・クロスモーダルルーティング
- Authors: Noor Islam S. Mohammad, Uluğ Bayazıt,
- Abstract要約: SKIPは,問題,画像,難易度を共同で設定したスパース経路を経路する統一推論アーキテクチャである。
我々は,現実的な質問画像の相互情報的仮定の下で,最適な視覚的空間性率が$O (1/sqrtN)$としてスケールすることを示す情報-ブートネック境界を導出する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge-intensive multimodal question answering (KI-MMQA) sits at the intersection of three expensive primitives: long visual token sequences, dense retrieval over large external corpora, and full cross-modal fusion. Existing systems pay all three costs uniformly per query, even though only a small fraction of visual content and retrieved knowledge is actually relevant to any given question. We introduce SKIP (Salient Knowledge-Injected Pathways), a unified inference architecture that routes computation along sparse pathways jointly conditioned on the question, the image, and a difficulty estimate. SKIP combines question-guided visual token pruning, region-conditional sparse retrieval, bipartite sparse cross-attention, and speculative knowledge verification with an adaptive budget controller that allocates compute proportional to predicted question difficulty. We derive an information-bottleneck bound showing that the optimal visual sparsity rate scales as $O(1/\sqrt{N})$ under realistic question-image mutual-information assumptions, with retained accuracy guarantees. Across five KI-MMQA benchmarks (OK-VQA, A-OKVQA, InfoSeek, Encyclopedic-VQA, and ViQuAE), SKIP matches or exceeds the accuracy of strong dense baselines while using $3.4$--$6.8\times$ fewer FLOPs and $2.7\times$ less end-to-end latency. Code available at: https://pmlrbd.github.io/skip/
- Abstract(参考訳): 知識集約型マルチモーダル質問応答 (KI-MMQA) は、3つの高価なプリミティブの交差点に位置する。
既存のシステムはクエリ毎に3つのコストを均一に支払うが、視覚的コンテンツと検索された知識は、実際には任意の質問に関係している。
SKIP (Salient Knowledge-Injected Pathways) は,問題,画像,難易度などに基づいて,スパース経路に沿って計算をルーティングする統合推論アーキテクチャである。
SKIPは、質問誘導型ビジュアルトークンプルーニング、領域条件スパース検索、二部間スパース相互注意、投機的知識検証と、予測された質問難度に比例した計算を割り当てる適応型予算制御器を組み合わせる。
我々は,現実的な質問画像の相互情報仮定の下で,最適視空間比が$O(1/\sqrt{N})$にスケールし,精度の保証が保たれていることを示す情報-ブートネック境界を導出する。
5つのKI-MMQAベンチマーク(OK-VQA, A-OKVQA, InfoSeek, Encyclopedic-VQA, ViQuAE)で、SKIPは3.4$-6.8\times$2.7\times$2.7\times$3.4$--6.8\timesを使用すると、強い高密度ベースラインの精度にマッチする。
コード https://pmlrbd.github.io/skip/
関連論文リスト
- Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG [7.082282444371973]
質問に対するモダリティの関連性は、そのモダリティが正しく答えるために実際に必要であるかどうかの弱い予測因子であることを示す。
テキストとテーブルから安価に回答し、検証を行い、そこでのみVLMエビデンスを支払って、textbfpost-hoc選択モーダリティエスカレーションを提案する。
論文 参考訳(メタデータ) (2026-07-03T15:28:16Z) - Neural Scalable Symbolic Search Framework for Complex Logical Queries with Multiple Free Variables [55.952069550106906]
複雑クエリアンサーリング(CQA)は、不完全知識グラフ(KG)上の基本的な知識表現と推論タスクである
ここで$mathcalEk$はKGのエンティティセットを表す。
既存のベンチマークとメソッドは、個々の変数よりも限界ランクに依存している。
我々は、$mathcalEk$を列挙することなく、共同ランキングを近似するフレームワークであるNeural Scalable Symbolic Search (NS3)を提案する。
論文 参考訳(メタデータ) (2026-05-25T16:04:57Z) - GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs [3.9266376632068485]
GridProbeは、効率的なトレーニング不要な後処理推論パラダイムである。
解答空間における証拠は、凍結したVLM自身の推論を用いて得られる。
疑似関連フレームを適応的に選択し、精度の損失が少なくて、準四分法的な注意コストをもたらす。
論文 参考訳(メタデータ) (2026-05-11T15:57:46Z) - Do Quantum Transformers Help? A Systematic VQC Architecture Comparison on Tabular Benchmarks [2.005299372367689]
変分量子回路(VQCs)は、短期デバイス上での量子機械学習における主要なアプローチである。
マルチ層完全連結(FC-VQC)、残留(ResNet-VQC)、ハイブリッド量子古典変換器(QT)、完全量子変換器(FQT)の4つのVQC族を比較した。
FC-VQCは、40-50%少ないパラメータを使用しながら、注目ベースのVQCのR2$の90-96%を達成している。
これらの知見は、短期量子ハードウェアにVQCをデプロイするための実用的なアーキテクチャガイダンスを提供する。
論文 参考訳(メタデータ) (2026-04-27T01:13:14Z) - CoV: Chain-of-View Prompting for Spatial Reasoning [64.77921266428824]
CoV(Chain-of-View)は、視覚言語モデルをアクティブな視点推論子に変換する。
我々はOpenEQA上でのCoVの評価を行い、Qwen3-VL-Flashで最大13.62%向上したLLM-Matchで平均+11.56%改善した。
論文 参考訳(メタデータ) (2026-01-08T17:59:42Z) - Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation [55.47971671635531]
大言語モデル(LLM)は、一般質問回答(QA)において顕著な性能を示した。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識で強化することで、この制限に対処する。
既存のシステムは、主に構造化されていないドキュメントに依存しているが、主にリレーショナルデータベースを見下ろしている。
論文 参考訳(メタデータ) (2025-09-30T22:19:44Z) - CLAUSE: Agentic Neuro-Symbolic Knowledge Graph Reasoning via Dynamic Learnable Context Engineering [47.77119771502664]
CLAUSEは,文脈構築を知識グラフ上の逐次決定プロセスとして扱うエージェント型3エージェントニューロシンボリックフレームワークである。
CLAUSEは提案したLagrangian-Constrained Multi-Agent Proximal Policy Optimization (LC-MAPPO)アルゴリズムを用いて、サブグラフアーキテクト、パスナビゲータ、コンテキストキュレーターの3つのエージェントを調整する。
HotpotQA、MetaQA、FactKG全体では、CLAUSEはより高いEM@1を得られると同時に、トークン予算が等しく低い場合のサブグラフの成長とエンドツーエンドのレイテンシを低減する。
論文 参考訳(メタデータ) (2025-09-25T11:43:08Z) - QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension [86.0749609778104]
既存の大規模ビデオ言語モデルを拡張した,アンテホックなトレーニングフリーモジュールQuoTAを提案する。
QuoTAは、クエリ関連性に基づいて、フレームレベルの重要度スコアを戦略的に割り当てる。
クエリをChain-of-Thoughts推論で切り離し、より正確なLVLMベースのフレーム重要度スコアリングを容易にする。
論文 参考訳(メタデータ) (2025-03-11T17:59:57Z) - Select, Substitute, Search: A New Benchmark for Knowledge-Augmented
Visual Question Answering [35.855792706139525]
テキストコーパス、知識グラフ、画像にまたがるマルチモーダルIRは、近年の関心事である。
驚くほど多くのクエリは、クロスモーダル情報を統合する能力を評価しません。
我々は新しいデータセットを構築し、OKVQA,viz., S3における重要な構造イディオムに挑戦する。
論文 参考訳(メタデータ) (2021-03-09T17:19:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。