論文の概要: H+ Embedding: Harmonizing Global and Token-Level Retrieval with Context-Dependent Phrases
- arxiv url: http://arxiv.org/abs/2608.00065v2
- Date: Thu, 06 Aug 2026 07:56:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 20:00:13.679617
- Title: H+ Embedding: Harmonizing Global and Token-Level Retrieval with Context-Dependent Phrases
- Title(参考訳): H+埋め込み: 文脈依存句によるグローバルとトークンレベル検索の調和
- Abstract要約: H+ Embeddingは可変長の句分割を予測し、未発見トークンをシングルトンとして保存し、重み付きMaxSimインタラクションによる重要誘導単位選択を適用する。
16の科学的、医学的、バイリンガル的タスクにまたがって、そのフレーズ検索部は、グローバル検索部を6.91マクロのnDCG@10で上回っている。
また、Tokenとほぼ一致し、ドキュメントベクターを13.7%削減し、適度なベクター予算の下でコンテンツ非依存のグルーピングルールを上回っている。
- 参考スコア(独自算出の注目度): 20.2337258233724
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Terminology-intensive retrieval, especially in medical settings, depends on preserving multi-word entities, abbreviations, numerical constraints, and compositional concepts. However, existing representations lie at two extremes: single-vector retrievers often over-compress local relevance signals, while token-level late interaction retains every tokenizer subword at substantial indexing, storage, and scoring cost. This mismatch raises a natural question: can context-dependent phrases provide a useful retrieval unit between global vectors and tokens? We introduce H+ Embedding, a unified multi-granularity retriever that predicts variable-length phrase partitions, preserves uncovered tokens as singletons, and applies importance-guided unit selection with weighted MaxSim interaction. Across 16 scientific, medical, and bilingual tasks, its phrase retrieval branch exceeds the global retrieval branch by 6.91 macro nDCG@10. It also nearly matches Token while using 13.7% fewer document vectors and outperforms content-independent grouping rules under moderate vector budgets. Context-dependent phrase interaction therefore provides an intermediate quality-cost point between global compression and token-level interaction for practical retrieval systems.
- Abstract(参考訳): 用語中心の検索は、特に医学的環境では、複数単語の実体、略語、数値的制約、構成的概念の保存に依存している。
しかし、既存の表現は2つの極端にある: シングルベクターレトリバーは、しばしば局所的な関連性シグナルを過剰に圧縮するが、トークンレベルの遅延相互作用は、重要なインデックス付け、ストレージ、スコアリングコストで全てのトークン化サブワードを保持する。
このミスマッチは自然な疑問を提起する: 文脈に依存したフレーズは、グローバルベクトルとトークンの間の有用な検索単位を提供することができるか?
H+ Embeddingは可変長の句分割を予測し、未発見トークンをシングルトンとして保存し、重み付きMaxSimインタラクションによる重要誘導単位選択を適用する。
16の科学的、医学的、バイリンガル的タスクにまたがって、そのフレーズ検索部は、グローバル検索部を6.91マクロのnDCG@10で上回っている。
また、Tokenとほぼ一致し、ドキュメントベクターを13.7%削減し、適度なベクター予算の下でコンテンツ非依存のグルーピングルールを上回っている。
したがって、文脈に依存したフレーズの相互作用は、実用的な検索システムにおけるグローバル圧縮とトークンレベルの相互作用の間の中間的な品質・コストのポイントを提供する。
関連論文リスト
- Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation [10.813064862132379]
STAMPは、強い参照と推論のセグメンテーションと、保存されたマルチモーダル能力と効率的な推論を組み合わせる。
明示的なIDとオプションボックスを持つターゲットリストを生成し、これらのIDを共有のマルチクラスマスク空間にバインドし、1つの非自己回帰パスですべてのターゲットを共同で予測する。
単一の統一されたチェックポイントは、STAMPの参照と推論能力を維持しながら、オープン語彙セマンティクス、インスタンス認識、リモートセンシングされた小さなターゲットセグメンテーションに拡張する。
論文 参考訳(メタデータ) (2026-08-03T18:42:11Z) - Sparse Attention for Dense Open-Vocabulary Prediction in CLIP [54.45759517856271]
最終視覚的自己注意層における行方向のソフトマックスの推測時間置換について検討した。
entmaxは低得点を正確に0にマッピングするデータ依存しきい値を適用するため、暗黙のデノイザとして機能する。
オープン語彙タスクセンスセマンティックセマンティックセグメンテーション (Pascal VOC, Pascal Context, ADE20K) ときめ細かい検索 (FG-OVD) について検討する。
論文 参考訳(メタデータ) (2026-07-08T08:30:48Z) - Improving Long-Context Retrieval with Multi-Prefix Embedding [64.08968715893504]
Multi-Prefix Embeddingは、ドキュメントをEOSトークンで区切られたチャンクに分割し、完全なシーケンスを単一の因果フォワードパスにエンコードし、各プレフィックス境界に1つの埋め込みを抽出する。
MPEはクロスチャンクコンテキストを保持し、チャンクレベルのMaxSimマッチングを可能にし、ドキュメントレベルの関連ラベルのみをトレーニングする。
論文 参考訳(メタデータ) (2026-06-22T17:31:02Z) - TIDE: Every Layer Knows the Token Beneath the Context [21.609102126208608]
本稿では,標準トランスフォーマーを EmbeddingMemory で拡張する TIDE を提案する。
我々は、TIDEの利点を理論的かつ実証的に確立し、シングルトークンID注入に関連する問題に対処する。
論文 参考訳(メタデータ) (2026-05-07T13:16:18Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - Multi-Vector Index Compression in Any Modality [73.7330345057813]
後期の相互作用は、テキスト、画像、ビジュアルドキュメント、ビデオにおける情報検索の主要なパラダイムとして現れてきた。
インデックス圧縮には,シーケンスリサイズ,メモリトークン,階層プール,新しいアテンション誘導クラスタリング(AGC)の4つのアプローチを導入する。
AGCは、ドキュメントの最もセマンティックな領域をクラスタセントロイドとして識別し、トークンの集合を重み付けするために注意誘導機構を使用する。
論文 参考訳(メタデータ) (2026-02-24T18:57:33Z) - Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation [22.803751188961865]
検索は類似性マッチングを超えて移動し、代わりに潜在コンポーネントを操作するべきだと我々は主張する。
我々は、無傷ユニットの階層を構築し、検索可能な高レベルノード組織を維持するxMemoryを提案する。
論文 参考訳(メタデータ) (2026-02-02T12:04:58Z) - A General and Flexible Multi-concept Parsing Framework for Multilingual Semantic Matching [60.51839859852572]
我々は,テキストを多言語セマンティックマッチングのためのマルチコンセプトに分解し,NERモデルに依存するモデルからモデルを解放することを提案する。
英語データセットのQQPとMRPC、中国語データセットのMedical-SMについて包括的な実験を行った。
論文 参考訳(メタデータ) (2024-03-05T13:55:16Z) - mCL-NER: Cross-Lingual Named Entity Recognition via Multi-view
Contrastive Learning [54.523172171533645]
CrossNERは多言語コーパスの不足により不均一な性能から生じる課題に直面している。
言語横断的名前付きエンティティ認識(mCL-NER)のためのマルチビューコントラスト学習を提案する。
40言語にまたがるXTREMEベンチマーク実験では、従来のデータ駆動型およびモデルベースアプローチよりもmCL-NERの方が優れていることを示した。
論文 参考訳(メタデータ) (2023-08-17T16:02:29Z) - Multi-Vector Retrieval as Sparse Alignment [21.892007741798853]
本稿では,クエリと文書トークンの相互アライメントを疎結合に学習する,新しいマルチベクタ検索モデルを提案する。
エントロピー規則化線形計画法により、疎度を達成するために他の手法よりも優れるスパースなユニタリサリエンスを学習する。
我々のモデルは、しばしば解釈可能なアライメントを生成し、より大きな言語モデルからその性能を著しく向上させる。
論文 参考訳(メタデータ) (2022-11-02T16:49:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。