論文の概要: SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication
- arxiv url: http://arxiv.org/abs/2607.01601v1
- Date: Thu, 02 Jul 2026 02:00:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.637588
- Title: SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication
- Title(参考訳): SemHash-LLM: ドキュメント重複処理のための多言語セマンティックハッシュフレームワーク
- Abstract要約: SemHash LLMは、セマンティックプロジェクションハッシュ、注意重み付きMinHash、対照的な境界学習、選択的なLLMベースの適応を統一するフレームワークである。
実験によると、SemHash LLMは、ニューラルネットワークによる検証コストが1%未満で、強力な重複検出品質を実現する。
- 参考スコア(独自算出の注目度): 19.22271811995236
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large scale document deduplication must preserve semantic equivalence while remaining efficient over massive corpora. We present SemHash LLM, a multi granularity framework that unifies semantic projection hashing, attention weighted MinHash, contrastive boundary learning, and selective LLM based adjudication. The method combines character, token, and document level signals through gated fusion, then applies a cascaded filtering pipeline for efficient candidate reduction. Semantic projection hashing learns compact binary codes in distilled LLM embedding space, while attention weighted Min- Hash suppresses boilerplate and emphasizes informative content. Adaptive decision boundaries and uncertainty estimation further improve robustness across template pollution, short text perturbation, containment, and viral fragments. Experiments show that SemHash LLM achieves strong duplicate detection quality with less than one percent neural verification cost.
- Abstract(参考訳): 大規模文書重複は意味的等価性を保ちながら、大量コーパス上で効率を保たなければならない。
本稿では,セマンティック・プロジェクション・ハッシュ,注目重み付きMinHash,コントラスト境界学習,選択的LLMに基づく適応を統一する多粒度フレームワークSemHash LLMを提案する。
この方法は、ゲート融合により文字、トークン、文書レベルの信号を合成し、効率の良い候補低減のためにカスケードフィルタリングパイプラインを適用する。
セマンティック射影ハッシュは蒸留LDM埋め込み空間においてコンパクトなバイナリ符号を学習し、注意重み付きMin-Hashはボイラープレートを抑制し、情報的内容を強調する。
適応的な決定境界と不確実性推定により、テンプレート汚染、短いテキスト摂動、封じ込め、およびウイルス断片間の堅牢性がさらに向上する。
実験によると、SemHash LLMは、ニューラルネットワークによる検証コストが1%未満で、強力な重複検出品質を実現する。
関連論文リスト
- Bit-mask Robust Contrastive Knowledge Distillation for Unsupervised
Semantic Hashing [71.47723696190184]
セマンティックハッシュのための革新的なBit-mask Robust Contrastive Knowledge Distillation (BRCD)法を提案する。
BRCDはセマンティックハッシュモデルの蒸留のために特別に考案されている。
論文 参考訳(メタデータ) (2024-03-10T03:33:59Z) - One Loss for Quantization: Deep Hashing with Discrete Wasserstein
Distributional Matching [19.831174790835732]
画像ハッシュ(英: image hashing)は、画像の大規模なコレクションにおいて、クエリに類似したアイテムを見つけるために、原理的に最も近い近隣アプローチである。
最適な検索性能を得るためには、低量子化誤差でバランスの取れたハッシュコードを生成することが重要である。
本稿では、量子化制約を学習するための代替手法について考察し、量子化エラーの少ないバランスの取れた符号の学習タスクを、学習された連続コードの分布と事前定義された離散的均一な分布とを一致させるものとして再定式化する。
論文 参考訳(メタデータ) (2022-05-31T12:11:17Z) - Rank-Consistency Deep Hashing for Scalable Multi-Label Image Search [90.30623718137244]
スケーラブルなマルチラベル画像検索のための新しいディープハッシュ法を提案する。
2つの空間の類似性順序を整列するために、新しい階数整合性目的を適用した。
強力な損失関数は、意味的類似性とハミング距離が一致しないサンプルをペナルティ化するように設計されている。
論文 参考訳(メタデータ) (2021-02-02T13:46:58Z) - Self-supervised asymmetric deep hashing with margin-scalable constraint
for image retrieval [3.611160663701664]
画像検索のためのマージンスケール可能な制約(SADH)アプローチを備えた,新しい自己監視型非対称深ハッシュ法を提案する。
sadhは自己教師付きネットワークを実装し、セマンティック特徴マップに意味情報を保存し、与えられたデータセットのセマンティクスを意味コードマップに格納する。
特徴学習部では、ハミング空間におけるペア関係の高精度な構築とより識別的なハッシュコード表現の両方に、新たなマージンスケータブル制約を用いる。
論文 参考訳(メタデータ) (2020-12-07T16:09:37Z) - CIMON: Towards High-quality Hash Codes [63.37321228830102]
我々はtextbfComprehensive stextbfImilarity textbfMining と ctextbfOnsistency leartextbfNing (CIMON) という新しい手法を提案する。
まず、グローバルな洗練と類似度統計分布を用いて、信頼性とスムーズなガイダンスを得る。第二に、意味的整合性学習とコントラスト的整合性学習の両方を導入して、乱不変と差別的ハッシュコードの両方を導出する。
論文 参考訳(メタデータ) (2020-10-15T14:47:14Z) - Deep Hashing with Hash-Consistent Large Margin Proxy Embeddings [65.36757931982469]
画像ハッシュコードは、分類または検索のために訓練された畳み込みニューラルネットワーク(CNN)の埋め込みをバイナライズすることによって生成される。
この曖昧さを解消するために、固定されたプロキシ(CNN分類層の重み)の使用が提案されている。
得られたHCLMプロキシはハッシュ単位の飽和を促進することが示され、小さな二項化誤差が保証される。
論文 参考訳(メタデータ) (2020-07-27T23:47:43Z) - Reinforcing Short-Length Hashing [61.75883795807109]
既存の手法は、非常に短いハッシュコードを用いた検索性能が劣っている。
本研究では, 短寿命ハッシュ(RSLH)を改良する新しい手法を提案する。
本稿では,ハッシュ表現とセマンティックラベルの相互再構成を行い,セマンティック情報を保存する。
3つの大規模画像ベンチマークの実験は、様々な短いハッシュシナリオ下でのRSLHの優れた性能を示す。
論文 参考訳(メタデータ) (2020-04-24T02:23:52Z) - Targeted Attack for Deep Hashing based Retrieval [57.582221494035856]
本研究では, ディープ・ハッシュ・ターゲット・アタック (DHTA) と呼ばれる新たな手法を提案し, 対象とする攻撃を探索する。
まず、対象の攻撃を点対セットの最適化として定式化し、敵のサンプルのハッシュコードと対象のラベルを持つ対象の集合の平均距離を最小化する。
性能と知覚性のバランスをとるために,摂動に対する$ellinfty$制限の下で,逆例のハッシュコードとアンカーコードとのハミング距離を最小化することを提案する。
論文 参考訳(メタデータ) (2020-04-15T08:36:58Z) - Deep Robust Multilevel Semantic Cross-Modal Hashing [25.895586911858857]
ハッシュベースのクロスモーダル検索は、最近大きな進歩を遂げた。
しかし、異なるモダリティからのデータを共同のハミング空間に簡単に埋め込むことは、必然的に偽のコードを生成する。
より正確なクロスモーダル検索のための新しいロバスト多レベルセマンティックハッシュ(RMSH)を提案する。
論文 参考訳(メタデータ) (2020-02-07T10:08:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。