論文の概要: Learning Multiresolution Relevance for Hierarchical Generative Retrieval
- arxiv url: http://arxiv.org/abs/2609.39312v1
- Date: Wed, 30 Sep 2026 08:51:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.457648
- Title: Learning Multiresolution Relevance for Hierarchical Generative Retrieval
- Title(参考訳): 階層的生成検索のための多分解能関係の学習
- Abstract要約: 意味的識別子(SID)による生成的検索は、文書階層上で連続的な決定を行う。
RARSはクエリエンコーダをトレーニングし、関連するドキュメントで共有される粗い構造と、より細かい分岐割り当ての両方をキャプチャする。
RARSは、共通の検索ルールの下で、グループ化されたソフトターゲット、デコーダソフトターゲット、サンプルツリーの監視も上回っている。
- 参考スコア(独自算出の注目度): 26.594708944920868
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative retrieval with semantic identifiers (SIDs) makes successive decisions over a document hierarchy. Relevant documents for the same query may share coarse prefixes and diverge at finer depths, with branching patterns varying across queries. These paths reveal how relevance is distributed across successive refinements, yet standard full-SID supervision treats them as separate training targets. To make this allocation explicit, we formulate multiresolution relevance as consistent conditional distributions induced by a single document-level relevance measure across the SID hierarchy. We introduce \textbf{RARS}, \textbf{R}esolution-\textbf{A}ligned \textbf{R}elevance \textbf{S}upervision, which uses the resulting refinement-level distributions to supervise a shared query representation. RARS aggregates document relevance over prefixes and trains a prefix-conditioned predictor to allocate relevance among sibling branches. All relevance-bearing children participate in local competition, and each local loss is weighted by the relevance mass reaching its parent. This objective trains the query encoder to capture both the coarse structure shared by relevant documents and their finer branch allocations. The predictor is discarded after training, preserving standard autoregressive retrieval at inference. Experiments on three multilingual ESCI locales show consistent improvements over matched full-SID training under autoregressive decoding. RARS also outperforms grouped soft-target, decoder soft-target, and sampled-tree supervision under a common retrieval rule. The gains persist across alternative identifier structures and relevance definitions. Code is available at: https://github.com/Nevaeh7/RARS
- Abstract(参考訳): 意味的識別子(SID)による生成的検索は、文書階層上で連続的な決定を行う。
同じクエリに関連するドキュメントは、粗いプレフィックスを共有し、より詳細な深さで分岐し、クエリ毎に分岐パターンが変化する。
これらのパスは、連続した改善にどのように関連性が分散されているかを明らかにするが、標準的なフルSID監視は、それらを個別のトレーニングターゲットとして扱う。
このアロケーションを明示するために、SID階層全体にわたる単一の文書レベル関連尺度によって誘導される一貫した条件分布として多分解能関連を定式化する。
本稿では、共有クエリ表現を監督するために、結果の洗練レベル分布を使用する、textbf{RARS}, \textbf{R}esolution-\textbf{A}ligned \textbf{R}elevance \textbf{S}upervisionを紹介する。
RARSは、プレフィックスに対するドキュメントの関連性を集約し、プレフィックス条件付き予測器を訓練して、兄弟ブランチ間の関連を割り当てる。
関連性を持つすべての子供が地元の競争に参加し、それぞれのローカルな損失は、親に達する関連質量によって重み付けされる。
この目的は、クエリエンコーダをトレーニングし、関連するドキュメントで共有される粗い構造と、より細かい分岐割り当ての両方をキャプチャする。
予測器はトレーニング後に破棄され、推論時に標準的な自己回帰検索を保持する。
3つの多言語ESCIローカライズ実験は、自己回帰復号化下での一致したフルSIDトレーニングよりも一貫した改善を示した。
RARSは、共通の検索ルールの下で、グループ化されたソフトターゲット、デコーダソフトターゲット、サンプルツリーの監視も上回っている。
ゲインは、代替識別子構造と関連定義にまたがって持続する。
コードは、https://github.com/Nevaeh7/RARSで入手できる。
関連論文リスト
- STITCH-RAG: Spatio-Temporal Influence Tracing over Topic Hypergraphs for Multi-Hop Retrieval-Augmented Generation [2.749903988734273]
マルチホップ検索拡張生成では、ドキュメントに分散したエビデンスを接続するためにレトリバーが必要である。
3つの結合したコンポーネントを持つハイパーグラフベースのフレームワークSTITCH-RAGを提案する。
論文 参考訳(メタデータ) (2026-09-28T02:05:31Z) - ORDER: Task-Conditioned Routing for Retrieval-Augmented Generation [3.6028767235872965]
本稿では,クエリにインデックス付けと検索を併用する問合せ条件付きRAGフレームワークを提案する。
我々は,大規模かつ異種な歴史的アーカイブの枠組みを評価し,クエリのインデックス付けと検索の条件付けが,根本的ベースラインと最先端RAGシステムの両方を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-09-15T11:23:16Z) - Imputation Meets Clustering: Exploiting Latent Subgroup Structure for Missing Data Recovery [52.29866804948133]
本稿では、クラスタリングと命令を相互に強化する共最適化プロセスとして再構築するフレームワークであるCAGI(Cluster-Aware Generative Imputation)を提案する。
14のベンチマークデータセットと15の代表的なベースラインの実験は、CAGIの優位性を実証している。
論文 参考訳(メタデータ) (2026-07-08T02:50:02Z) - Hierarchical Evidence-Driven Reasoning for Long Document Understanding [95.51688464037096]
閉領域文書理解のための階層的・エビデンス駆動型マルチモーダルRAGフレームワークであるHIEVI-RAGを紹介する。
我々のフレームワークは、既存のオープンソースベースラインを著しく上回り、最強の報告ベースラインを平均8.05%の精度で上回ります。
論文 参考訳(メタデータ) (2026-07-06T03:08:28Z) - SproutRAG: Attention-Guided Tree Search with Progressive Embeddings for Long-Document RAG [23.48941508046885]
本稿では,注意誘導型階層型RAGフレームワークであるSproutRAGを紹介する。
文レベルのチャンクを徐々に大きく、意味的に一貫性のある単位に整理する。
どのアテンションヘッドとレイヤがセマンティックドキュメント構造を最もよく捉えているかを学ぶ。
論文 参考訳(メタデータ) (2026-06-16T18:28:00Z) - HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering [19.052998569565627]
HiKEYは階層木に基づくマルチモーダル検索フレームワークであり、文書階層を1級検索信号に高める。
ODQAベンチマークの実験では、HiKEYはページベースとチャンクベースのベースラインを大きく上回っている。
論文 参考訳(メタデータ) (2026-05-28T08:42:21Z) - GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation [22.803751188961865]
検索は類似性マッチングを超えて移動し、代わりに潜在コンポーネントを操作するべきだと我々は主張する。
我々は、無傷ユニットの階層を構築し、検索可能な高レベルノード組織を維持するxMemoryを提案する。
論文 参考訳(メタデータ) (2026-02-02T12:04:58Z) - Generative Retrieval Meets Multi-Graded Relevance [104.75244721442756]
GRADed Generative Retrieval (GR$2$)というフレームワークを紹介します。
GR$2$は2つの重要なコンポーネントに焦点を当てている。
マルチグレードとバイナリの関連性を持つデータセットの実験は,GR$2$の有効性を示した。
論文 参考訳(メタデータ) (2024-09-27T02:55:53Z) - UnifieR: A Unified Retriever for Large-Scale Retrieval [84.61239936314597]
大規模な検索は、クエリを与えられた巨大なコレクションから関連ドキュメントをリコールすることである。
事前学習型言語モデル(PLM)に基づく最近の検索手法は,高密度ベクターあるいはレキシコンに基づくパラダイムに大別することができる。
本論文では,高密度ベクトルとレキシコンに基づく検索を2つの表現能力を持つ1つのモデルで統合する学習フレームワークUnifieRを提案する。
論文 参考訳(メタデータ) (2022-05-23T11:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。