論文の概要: H3D: Benchmarking Unsupervised Text Hashing for Fine-Grained Document Deduplication
- arxiv url: http://arxiv.org/abs/2607.08382v1
- Date: Thu, 09 Jul 2026 12:01:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.516832
- Title: H3D: Benchmarking Unsupervised Text Hashing for Fine-Grained Document Deduplication
- Title(参考訳): H3D: きめ細かいドキュメント重複のための教師なしテキストハッシュのベンチマーク
- Abstract要約: ドキュメントハッシュは、効率的な類似性検索とドキュメント重複のためのコンパクトな表現を提供する。
H3Dは、きめ細かい科学文書のための教師なしテキストハッシュベンチマークである。
- 参考スコア(独自算出の注目度): 19.69952041175283
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Document hashing provides compact representations for efficient similarity search and document deduplication, but existing studies rarely compare hashing pipelines under a unified protocol for fine-grained scientific documents. H3D is an unsupervised text hashing benchmark for fine-grained document deduplication. It evaluates representative unsupervised non-learning hashing approaches (MinHash, SimHash, Winnowing, FuzzyHash, FlyHash) together with semantic-sensitive methods built from frozen BGE embeddings and two quantization strategies (BGE-BIHash and BGE-LSHash). The non-learning methods generate hash fingerprints through manually designed mathematical rules without training or labeled similarity pairs, which distinguishes them from neural semantic hashing models. We benchmark all methods on CSFCube and RELISH, two datasets that provide complementary evaluation settings: facet-level analysis for scientific-document similarity and larger-scale split-level evaluation for biomedical similarity search. H3D jointly reports ranking quality (MAP, NDCG@20), efficiency, and robustness under controlled text compression. The results show a consistent trade-off: lexical and structural fingerprints are competitive for near-duplicate matching, while semantic-sensitive representations better preserve similarity under content rewriting, at higher computational cost. We further analyze when different similarity measures become rank-equivalent for specific hash representations, improving the interpretability and reproducibility of method comparisons.
- Abstract(参考訳): 文書ハッシュは、効率的な類似性探索と文書復号のためのコンパクトな表現を提供するが、既存の研究では、微細な科学文書のための統一されたプロトコルの下でハッシュパイプラインを比較することは滅多にない。
H3Dは、きめ細かいドキュメント複製のための教師なしテキストハッシュベンチマークである。
凍結したBGE埋め込みと2つの量子化戦略(BGE-BIHashとBGE-LSHash)で構築されたセマンティック・センシティブな手法とともに、非教師なしのハッシュ手法(MinHash、SimHash、Winnowing、FuzzyHash、FlyHash)を評価している。
非学習方法は、トレーニングやラベル付き類似性ペアなしで、手動で設計された数学的ルールを通じてハッシュフィンガーを生成する。
CSFCubeとRELISHのすべての手法をベンチマークし、相補的な評価設定を提供する2つのデータセット、すなわち、科学的文書類似性のためのファセットレベル分析と、生物医学類似性探索のための大規模分割レベル評価をベンチマークした。
H3Dは、制御されたテキスト圧縮の下で、ランキング品質(MAP、NDCG@20)、効率、堅牢性を共同で報告する。
語彙的および構造的指紋は、ほぼ重複するマッチングに競争力があり、セマンティック・センシティブな表現は、より高い計算コストでコンテンツ書き換え時の類似性を保っている。
さらに、異なる類似度尺度が特定のハッシュ表現に等価になるタイミングを分析し、メソッド比較の解釈可能性と再現性を向上させる。
関連論文リスト
- A Survey on Deep Text Hashing: Efficient Semantic Text Retrieval with Binary Representation [69.50397417361351]
テキストハッシュはオリジナルのテキストをコンパクトなバイナリハッシュコードに投影する。
ディープテキストハッシュは、従来のデータに依存しないハッシュ技術よりも大きなアドバンテージを示している。
本調査では, コアコンポーネントに基づいて分類することで, 現在の深層テキストハッシュ法について検討する。
論文 参考訳(メタデータ) (2025-10-31T06:51:37Z) - Deep Hashing with Semantic Hash Centers for Image Retrieval [15.771584515999283]
本稿では,従来のハッシュセンタの概念に基づくセマンティックハッシュセンタの概念を紹介する。
データ依存的類似性計算を用いてクラス間の意味的類似性を識別する分類ネットワークを開発する。
次に, セマンティック・ハッシュ・センターを生成するアルゴリズムを導入し, セマンティック・ハッシュ・コードに過度に類似しないよう, セマンティック・ハッシュ・センター間の最小距離を保ちながら意味的関連性を維持する。
論文 参考訳(メタデータ) (2025-07-11T08:22:27Z) - Learning to Hash Naturally Sorts [84.90210592082829]
そこで我々はNaturely-Sorted Hashing (NSH)を導入し,最終結果のソートによる深層ハッシュモデルのトレーニングを行った。
NSHはサンプルのハッシュコードのハミング距離をソートし、それに従って自己教師付きトレーニングのための潜伏した表現を収集する。
Sorted Noise-Contrastive Estimation (SortedNCE) の新たな損失について述べる。
論文 参考訳(メタデータ) (2022-01-31T16:19:02Z) - Unsupervised Multi-Index Semantic Hashing [23.169142004594434]
マルチインデックスハッシュに最適化することで,効率的かつ高効率なハッシュコードを学習する教師なしハッシュモデルを提案する。
文書類似度検索のタスクにおいて、MISHと最先端のセマンティックハッシュベースラインを実験的に比較する。
マルチインデックスハッシュは、線形スキャンと比較してベースラインの効率も向上しますが、MISHよりも33%遅くなっています。
論文 参考訳(メタデータ) (2021-03-26T13:33:48Z) - CIMON: Towards High-quality Hash Codes [63.37321228830102]
我々はtextbfComprehensive stextbfImilarity textbfMining と ctextbfOnsistency leartextbfNing (CIMON) という新しい手法を提案する。
まず、グローバルな洗練と類似度統計分布を用いて、信頼性とスムーズなガイダンスを得る。第二に、意味的整合性学習とコントラスト的整合性学習の両方を導入して、乱不変と差別的ハッシュコードの両方を導出する。
論文 参考訳(メタデータ) (2020-10-15T14:47:14Z) - Deep Hashing with Hash-Consistent Large Margin Proxy Embeddings [65.36757931982469]
画像ハッシュコードは、分類または検索のために訓練された畳み込みニューラルネットワーク(CNN)の埋め込みをバイナライズすることによって生成される。
この曖昧さを解消するために、固定されたプロキシ(CNN分類層の重み)の使用が提案されている。
得られたHCLMプロキシはハッシュ単位の飽和を促進することが示され、小さな二項化誤差が保証される。
論文 参考訳(メタデータ) (2020-07-27T23:47:43Z) - Unsupervised Semantic Hashing with Pairwise Reconstruction [22.641786533525245]
本稿では、離散変分オートエンコーダに基づくハッシュモデルであるPairwise Reconstruction(PairRec)を提案する。
PairRecと従来の手法と最先端の手法を実験的に比較し,文書類似性検索のタスクにおいて大幅な性能向上を実現した。
論文 参考訳(メタデータ) (2020-07-01T10:54:27Z) - Pairwise Supervised Hashing with Bernoulli Variational Auto-Encoder and
Self-Control Gradient Estimator [62.26981903551382]
バイナリ潜在変数を持つ変分自動エンコーダ(VAE)は、文書検索の精度の観点から最先端のパフォーマンスを提供する。
本稿では、クラス内類似度とクラス間類似度に報いるために、個別潜伏型VAEを用いたペアワイズ損失関数を提案する。
この新しいセマンティックハッシュフレームワークは、最先端技術よりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2020-05-21T06:11:33Z) - Reinforcing Short-Length Hashing [61.75883795807109]
既存の手法は、非常に短いハッシュコードを用いた検索性能が劣っている。
本研究では, 短寿命ハッシュ(RSLH)を改良する新しい手法を提案する。
本稿では,ハッシュ表現とセマンティックラベルの相互再構成を行い,セマンティック情報を保存する。
3つの大規模画像ベンチマークの実験は、様々な短いハッシュシナリオ下でのRSLHの優れた性能を示す。
論文 参考訳(メタデータ) (2020-04-24T02:23:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。