論文の概要: DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding
- arxiv url: http://arxiv.org/abs/2607.24554v1
- Date: Mon, 27 Jul 2026 15:28:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.477359
- Title: DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding
- Title(参考訳): DeCoRAG: 複雑な文書理解のための認知的デカップリングとセマンティック・アウェア・クロップ
- Abstract要約: DeCoRAGはマルチモーダルグラフRAGパイプラインで、知識処理を結合した視覚的意味論的推論から「認知的疎結合」へ移行する。
DeCoRAGは最強のベースラインに対して最大12.5ポイントのセマンティックパスレートを改善する。
RAP-Cropは、エンドツーエンドの精度を犠牲にすることなく、オフライングラフ構築プロンプトを40.8%削減する。
- 参考スコア(独自算出の注目度): 9.340832029984703
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advancing multimodal retrieval-augmented generation (RAG) for complex document understanding presents a formidable dual dilemma of accuracy and efficiency, particularly in graph RAG. Processing structurally sparse yet visually dense layouts, such as extracting a tiny data marker from a financial chart, often incurs computationally prohibitive token overhead while still triggering catastrophic hallucination. However, multimodal Graph RAG pipelines rely on graph-construction stages that assume Vision-Language Models (VLMs) can resolve sparse semantics within high-density layouts. We challenge this assumption, revealing that forcing VLMs to localize visual evidence, interpret semantics, and extract relations triggers a "Visual Attention Sink," a mechanism driving catastrophic semantic loss, while full-page processing incurs massive computational overhead. Controlled interventions verify that this failure is boundary-driven rather than content-specific and that semantic anchoring mitigates it. To fundamentally correct this flawed paradigm, we introduce DeCoRAG, a multimodal Graph RAG pipeline that shifts knowledge processing from coupled visual-semantic reasoning to "Cognitive Decoupling." Rather than passively processing raw pixels, its graph-construction stage establishes a macroscopic Semantic Anchor to neutralize the attention sink. This anchor subsequently drives our Region-Aware Pruning and Cropping (RAP-Crop) mechanism, shifting the reasoning space from dense, noisy backgrounds to purified, intent-driven semantic clusters. The resulting graph supports hybrid retrieval and answer generation. Across complex document benchmarks, DeCoRAG improves the semantic pass rate by up to 12.5 percentage points over the strongest baseline and generalizes to DocVQA. RAP-Crop reduces offline graph-construction prompt tokens by 40.8% without sacrificing end-to-end accuracy.
- Abstract(参考訳): 複雑な文書理解のためのマルチモーダル検索拡張生成(RAG)の強化は、特にグラフRAGにおいて、正確性と効率性の強い2重ジレンマを示す。
財務チャートから小さなデータマーカーを抽出するなど、構造的にスパースで視覚的に密なレイアウトを処理することは、しばしば、破滅的な幻覚を引き起こしながら、計算的に禁止されるトークンオーバーヘッドを引き起こす。
しかし、マルチモーダルグラフRAGパイプラインは、高密度レイアウト内のスパースセマンティクスを解決できると仮定したグラフ構築段階に依存している。
本稿では,VLMに視覚的証拠のローカライズ,意味論の解釈,関係の抽出を強制させることで,破滅的な意味喪失を引き起こすメカニズムである「視覚注意シンク」が引き起こされ,全ページ処理は膨大な計算オーバーヘッドを発生させる,という仮定に挑戦する。
制御された介入は、この障害がコンテンツ固有のものではなく境界駆動であり、セマンティックアンカーがそれを緩和することを検証する。
この欠陥を根本的に修正するために,知識処理を結合した視覚的意味論的推論から「認知的疎結合」に移行するマルチモーダルグラフRAGパイプラインであるDeCoRAGを導入する。
生のピクセルを受動的に処理するのではなく、グラフ構築段階は、注目シンクを中和するマクロなセマンティックアンカーを確立する。
このアンカーはその後、Rerea-Aware Pruning and Cropping (RAP-Crop) メカニズムを駆動し、推論空間を密度の高いノイズの多いバックグラウンドから、浄化された意図駆動のセマンティッククラスタに移行する。
結果として得られるグラフは、ハイブリッド検索と回答生成をサポートする。
複雑な文書ベンチマーク全体で、DeCoRAGは最強のベースライン上で最大12.5ポイントのセマンティックパス率を改善し、DocVQAに一般化する。
RAP-Cropは、エンドツーエンドの精度を犠牲にすることなく、オフライングラフ構築プロンプトを40.8%削減する。
関連論文リスト
- LoRC: Detecting AI-Generated Images via Low-Rank Collapse in Semantic Residuals [50.157719466558696]
現代の発電機は, セマンティック・残留部分空間において, 支配的なセマンティックな方向を保ちながら, 低ランクの崩壊を示すことを示す。
崩壊した残余幾何を捉えるために意味的優位性を分離するフレームワークである textbfLoRC を提案する。
本手法は,複数のベンチマークで平均7.0%の精度向上を実現し,39個の未知のジェネレータ上で97.0%の精度を実現する。
論文 参考訳(メタデータ) (2026-08-21T08:58:47Z) - RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT [0.014257559724536567]
視覚変換器(ViT)は高い性能を実現するが、二次的な自己注意の複雑さにより高い計算コストを被る。
本稿では,トークン表現の層的特性に還元戦略を適用した深度対応型トークン還元フレームワークを提案する。
我々のフレームワークは、階層的特徴進化と縮小戦略を整合させることにより、視覚モデルを最適化するためのトレーニング不要のテンプレートを提供する。
論文 参考訳(メタデータ) (2026-06-06T13:13:02Z) - Robust Multimodal Recommendation via Graph Retrieval-Enhanced Modality Completion [71.20734649881258]
実世界のマルチモーダルデータセットは、センサーの故障、アノテーションの不足、プライバシーの制約によって、しばしばモダリティの不完全性に悩まされる。
効果的な解決策の1つはモダリティ補完であり、下流タスクのためのモダリティ完全グラフを提供するために欠落した特徴を再構成する。
本稿では,これらの制限を克服するグラフ検索拡張モード補完フレームワークであるGRE-MCを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:50:52Z) - Query-Aware Flow Diffusion for Graph-Based RAG with Retrieval Guarantees [10.806910118253976]
グラフベースのRetrieval-Augmented Generation (RAG)システムは複雑な関係を捉えるために相互接続された知識構造を利用する。
本稿では,各クエリの全体的意味論にグラフトラバーサルを動的に適用する学習自由フレームワークであるQuery-Aware Flow Diffusion RAG (QAFD-RAG)を提案する。
QAFD-RAGは、弱い信号対雑音条件下で、高い確率で関連部分グラフを復元する。
論文 参考訳(メタデータ) (2026-04-21T08:53:34Z) - Beyond Explicit Edges: Robust Reasoning over Noisy and Sparse Knowledge Graphs [39.73839943827917]
INSESは明示的なエッジを超えて推論するために設計された動的フレームワークである。
LLM誘導航法はノイズやステアリングを誘発し、埋め込みベースの類似性拡張と組み合わせている。
複数のベンチマークでSOTA RAGとGraphRAGのベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-14T16:16:47Z) - HELP: HyperNode Expansion and Logical Path-Guided Evidence Localization for Accurate and Efficient GraphRAG [53.30561659838455]
大きな言語モデル(LLM)は、しばしば固有の知識境界と幻覚に苦しむ。
Retrieval-Augmented Generation (RAG) は、マルチホップ推論に不可欠な構造的相互依存性をしばしば見落としている。
ヘルプは、複数の単純でマルチホップなQAベンチマークで競合性能を達成し、グラフベースのRAGベースラインよりも28.8$times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-02-24T14:05:29Z) - ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization [62.03035862528452]
ForgeryVCRは、視覚中心推論(Visual-Centric Reasoning)を通じて、知覚できないトレースを明示的な視覚中間体に物質化するフレームワークである。
ForgeryVCRは、検出タスクとローカライゼーションタスクの両方において、最先端(SOTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-15T11:14:47Z) - Youtu-GraphRAG: Vertically Unified Agents for Graph Retrieval-Augmented Complex Reasoning [32.78218766121055]
グラフ検索拡張生成(GraphRAG)は,複雑な推論において,大規模言語モデルを効果的に拡張した。
本稿では,フレームワーク全体を複雑な統合として結合する,垂直に統一されたエージェントパラダイムYoutu-GraphRAGを提案する。
論文 参考訳(メタデータ) (2025-08-27T13:13:20Z) - Align-GRAG: Reasoning-Guided Dual Alignment for Graph Retrieval-Augmented Generation [79.75818239774952]
大きな言語モデル(LLM)は目覚ましい能力を示しているが、幻覚や時代遅れの情報といった問題に苦戦している。
Retrieval-augmented Generation (RAG) は、情報検索システム(IR)を用いて、外部知識のLLM出力を基底にすることで、これらの問題に対処する。
本稿では、検索後句における新しい推論誘導二重アライメントフレームワークであるAlign-GRAGを提案する。
論文 参考訳(メタデータ) (2025-05-22T05:15:27Z) - Divide by Question, Conquer by Agent: SPLIT-RAG with Question-Driven Graph Partitioning [62.640169289390535]
SPLIT-RAGは、質問駆動セマンティックグラフ分割と協調サブグラフ検索による制限に対処するマルチエージェントRAGフレームワークである。
革新的なフレームワークは、まずリンク情報のセマンティック分割を作成し、次にタイプ特化知識ベースを使用してマルチエージェントRAGを実現する。
属性対応グラフセグメンテーションは、知識グラフを意味的に一貫性のあるサブグラフに分割し、サブグラフが異なるクエリタイプと整合することを保証する。
階層的なマージモジュールは、論理的検証を通じて、部分グラフ由来の解答間の矛盾を解消する。
論文 参考訳(メタデータ) (2025-05-20T06:44:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。