論文の概要: FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora
- arxiv url: http://arxiv.org/abs/2607.10020v2
- Date: Wed, 15 Jul 2026 18:51:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.199911
- Title: FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora
- Title(参考訳): FindMyText: 大規模ウェブクローリングコーパスにおけるテキスト内容のロバストでスケーラブルな検出
- Authors: Lars Henry Berge Olsen, Pierre Lison, Martin Jullum, Mark Anderson,
- Abstract要約: FindMyTextは、テキストコーパス内で、あるテキストが部分的に、または完全に現れるかどうかを効率的に評価するように設計されたPythonパッケージである。
このツールは、文書指紋の以前の技術をベースにしているが、一致する指紋のシーケンスを明示的にキャプチャする新しいメカニズムでそれを拡張している。
テキストの類似性よりも、与えられたテキストの近似に近いコピーをより確実に検出することができる。
- 参考スコア(独自算出の注目度): 3.678882282826422
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present FindMyText, an open-source Python package designed to efficiently assess whether a given text appears, in part or in full, within a text corpus. The tool builds on prior techniques for document fingerprinting, but extends them with a novel mechanism to explicitly capture sequences of matching fingerprints. By identifying such chains, the tool can more reliably detect near-verbatim copies of a given text rather than mere textual similarities. This makes FindMyText particularly suited for verifying the presence of copyrighted material in a corpus. Leveraging a distributed, disk-based indexing framework, the system scales to large web-crawled datasets. Using a new benchmark for evaluating text containment methods, we show that FindMyText outperforms alternative approaches across three datasets (ArXiv papers, Wikipedia, and generic web content).
- Abstract(参考訳): FindMyTextはオープンソースのPythonパッケージで、テキストコーパス内で、あるテキストが部分的に、あるいは完全に現れるかどうかを効率よく評価するように設計されている。
このツールは、文書指紋の以前の技術をベースにしているが、一致する指紋のシーケンスを明示的にキャプチャする新しいメカニズムでそれを拡張している。
このようなチェーンを識別することで、ツールがテキストの類似性よりも、与えられたテキストのほぼ頂点に近いコピーをより確実に検出することができる。
これにより、FindMyTextは、コーパス内の著作権物質の存在を検証するのに特に適している。
分散ディスクベースのインデックスフレームワークを活用すると、システムは大規模なWebクローリングデータセットにスケールする。
テキストの格納方法を評価するための新しいベンチマークを用いて、FindMyTextは3つのデータセット(ArXiv論文、ウィキペディア、ジェネリックウェブコンテンツ)の代替手法よりも優れていることを示す。
関連論文リスト
- Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents [7.358946120326249]
本稿では,テキスト抽出ツールである'Eclairについて紹介する。
画像が与えられたら、"Eclairは、バウンディングボックスとその対応するセマンティッククラスとともに、読み順でフォーマットされたテキストを抽出できる。
このベンチマークで'Eclair'は最先端の精度を達成し、主要なメトリクスで他のメソッドよりも優れています。
論文 参考訳(メタデータ) (2025-02-06T17:07:22Z) - ClusterChat: Multi-Feature Search for Corpus Exploration [3.4123736336071864]
ClusterChatは、クラスタベースのドキュメント組織を統合するコーパス探索用のオープンソースのシステムである。
我々は,400万の抽象PubMedデータセットを2つのケーススタディで検証した。
論文 参考訳(メタデータ) (2024-12-19T05:11:16Z) - RETSim: Resilient and Efficient Text Similarity [1.6228944467258688]
RETSimは、テキスト検索、クラスタリング、データセット重複タスクのための堅牢なメトリック埋め込みを生成するためにトレーニングされた、軽量で多言語的なディープラーニングモデルである。
我々は、RETSimがMinHashやニューラルテキストの埋め込みよりもはるかに堅牢で正確であることを実証した。
また,W4NT3Dベンチマークを用いて,多言語・ほぼ重複したテキスト検索機能の評価を行った。
論文 参考訳(メタデータ) (2023-11-28T22:54:33Z) - Copy Is All You Need [66.00852205068327]
既存のテキストコレクションからテキストセグメントを段階的にコピーするテキスト生成を定式化する。
提案手法は, 自動評価と人的評価の両方により, より優れた生成品質を実現する。
当社のアプローチでは,より大規模なテキストコレクションにスケールアップすることで,さらなるパフォーマンス向上を実現しています。
論文 参考訳(メタデータ) (2023-07-13T05:03:26Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - Towards End-to-End Unified Scene Text Detection and Layout Analysis [60.68100769639923]
本稿では,シーンテキストの検出とレイアウト解析を統合化するタスクについて紹介する。
この新たな研究課題を実現するために、最初の階層的なシーンテキストデータセットが導入された。
また,シーンテキストを同時に検出し,テキストクラスタを統一的に形成する手法を提案する。
論文 参考訳(メタデータ) (2022-03-28T23:35:45Z) - SwinTextSpotter: Scene Text Spotting via Better Synergy between Text
Detection and Text Recognition [73.61592015908353]
本稿では,SwinTextSpotter と呼ばれるシーンテキストスポッティングフレームワークを提案する。
動的頭部を検出器とするトランスを用いて、2つのタスクを新しい認識変換機構で統一する。
この設計は、追加の修正モジュールも文字レベルのアノテーションも必要としない簡潔なフレームワークをもたらす。
論文 参考訳(メタデータ) (2022-03-19T01:14:42Z) - Documenting the English Colossal Clean Crawled Corpus [28.008953329187648]
この作業は、Common Crawlの単一のスナップショットにフィルターのセットを適用することによって作成されたデータセットであるColossal Clean Crawled Corpus(C4; Raffel et al., 2020)の最初のドキュメントを提供します。
まず、テキストがどこから来ていつ書き込まれたかの分布を含む、データのハイレベルな要約から始めます。
次に、最も頻繁なテキストソースを含む、このデータの突出した部分に関するより詳細な分析を行う。
論文 参考訳(メタデータ) (2021-04-18T07:42:52Z) - Scene Text Retrieval via Joint Text Detection and Similarity Learning [68.24531728554892]
シーンテキスト検索は、与えられたクエリテキストと同じまたは類似している画像ギャラリーからすべてのテキストインスタンスをローカライズし、検索することを目的としています。
自然画像からクエリテキストと各テキストインスタンスのクロスモーダルな類似性を直接学習することでこの問題に対処します。
このように、検出されたテキストインスタンスを学習された類似度でランク付けすることで、シーンテキスト検索を簡単に実行できます。
論文 参考訳(メタデータ) (2021-04-04T07:18:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。