論文の概要: Short Text Classification Approach to Identify Child Sexual Exploitation
Material
- arxiv url: http://arxiv.org/abs/2011.01113v2
- Date: Fri, 13 Nov 2020 09:39:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2022-10-01 23:55:24.488778
- Title: Short Text Classification Approach to Identify Child Sexual Exploitation
Material
- Title(参考訳): 児童の性行為を識別するための短いテキスト分類手法
- Abstract要約: 本稿では,児童性行為資料(CSEM)ファイルを識別するために,短いテキスト分類に基づく2つのアプローチを提案する。
提案されたソリューションは、すべてのファイルのビジュアルコンテンツに取り組むことなくCSEMを識別するための法執行機関をサポートするための法医学ツールやサービスに統合することができる。
- 参考スコア(独自算出の注目度): 4.415977307120616
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Producing or sharing Child Sexual Exploitation Material (CSEM) is a serious
crime fought vigorously by Law Enforcement Agencies (LEAs). When an LEA seizes
a computer from a potential producer or consumer of CSEM, they need to analyze
the suspect's hard disk's files looking for pieces of evidence. However, a
manual inspection of the file content looking for CSEM is a time-consuming
task. In most cases, it is unfeasible in the amount of time available for the
Spanish police using a search warrant. Instead of analyzing its content,
another approach that can be used to speed up the process is to identify CSEM
by analyzing the file names and their absolute paths. The main challenge for
this task lies behind dealing with short text distorted deliberately by the
owners of this material using obfuscated words and user-defined naming
patterns. This paper presents and compares two approaches based on short text
classification to identify CSEM files. The first one employs two independent
supervised classifiers, one for the file name and the other for the path, and
their outputs are later on fused into a single score. Conversely, the second
approach uses only the file name classifier to iterate over the file's absolute
path. Both approaches operate at the character n-grams level, while binary and
orthographic features enrich the file name representation, and a binary
Logistic Regression model is used for classification. The presented file
classifier achieved an average class recall of 0.98. This solution could be
integrated into forensic tools and services to support Law Enforcement Agencies
to identify CSEM without tackling every file's visual content, which is
computationally much more highly demanding.
- Abstract(参考訳): 児童セクシャル・エクスプロイテーション・マテリアル(英: Child Sexual Exploitation Materials、CSEM)は、法律執行機関(LEA)が積極的に行う犯罪である。
LEAがCSEMの潜在的な生産者や消費者からコンピュータを奪取する際には、容疑者のハードディスクのファイルを分析して証拠を探す必要がある。
しかし,CSEMを検索するファイル内容の手動検査は時間を要する作業である。
ほとんどの場合、捜索令状を使ってスペイン警察が利用できる時間内では不可能である。
コンテンツを解析する代わりに、プロセスのスピードアップに使える別のアプローチは、ファイル名とその絶対パスを分析してCSEMを特定することである。
このタスクの主な課題は、難解な単語とユーザー定義の命名パターンを使用して、この資料の所有者が故意に歪んだ短いテキストを扱うことである。
本稿では,CSEMファイルを識別するための短いテキスト分類に基づく2つのアプローチを提示し,比較する。
1つは2つの独立した教師付き分類器、もう1つはファイル名、もう1つはパスで、出力は後に1つのスコアに融合される。
逆に、第2のアプローチはファイル名分類器のみを使用してファイルの絶対パスを反復する。
どちらのアプローチも文字 n-grams レベルで動作し、バイナリと正書法の特徴はファイル名表現を強化し、バイナリロジスティック回帰モデルは分類に使用される。
提示されたファイル分類器は平均0.98のクラスリコールを達成した。
このソリューションは、すべてのファイルの視覚的コンテンツに取り組むことなくCSEMを識別するための法執行機関をサポートする法医学ツールやサービスに統合することができる。
関連論文リスト
- EviMap: Evidence-Grounded Hierarchical Topic Maps for Exploring Unlabeled Corpora [0.0]
EviMapは、このようなコーパスの監査可能なテーマ概要を提供するインタラクティブシステムである。
ドキュメント内のエビデンスフレーズを抽出し、アスペクト、グループ、きめ細かいトピックの3レベルマップにまとめます。
ユーザーはトップレベルのコーパスマップから始め、トピックを掘り下げ、オリジナルのドキュメントのハイライトされたエビデンスを検査し、2つのトピックを組み合わせて両方を議論するドキュメントを見つけることができる。
論文 参考訳(メタデータ) (2026-09-06T15:14:09Z) - Two-Step Occupation Coding [45.88028371034407]
本稿では,職種と職種を区別する新しい2段階のアプローチを提案する。
最初のステップでは、ドメイン固有の名前付きエンティティ認識(NER)モデルが、連続したテキスト内の職種を識別する。
第2のステップでは、抽出されたジョブのタイトルを分類にマッピングし、分類器がこのマッピングのみに集中できるようにする。
この方法はドイツの文書のために開発されたが、他の言語に転送可能である。
論文 参考訳(メタデータ) (2026-07-22T12:55:34Z) - Context-as-AI-Service: Surfacing Cross-File Dependency Chains for LLM-Generated Developer Documentation [1.5749416770494706]
我々は、LCMエージェントがドキュメントのレビューや生成時に証拠を見つけるためにクエリする検索層であるContext-as-AI-Service(CAIS)を提示する。
CAISはソースコード、API参照、アップストリームドキュメンテーションをインデックスし、エージェントはキーワードとセマンティック検索を組み合わせたツールコールを通じてインデックスをクエリできる。
CAISは2つのタスクで壁時計時間を22%減らして34%減らし、入力トーケンの使用を減らした。
論文 参考訳(メタデータ) (2026-06-03T03:26:56Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - ReLeVAnT: Relevance Lexical Vectors for Accurate Legal Text Classification [5.530730417910086]
ReLeVAnTは法的文書バイナリ分類のためのフレームワークである。
n-gram処理、コントラストスコアマッチング、および差別的分類の原動力として浅いニューラルネットワークを使用する。
99.3%の精度と98.7%のF1スコアがLexGLUEデータセットにある。
論文 参考訳(メタデータ) (2026-04-24T07:13:24Z) - Safeguarding LLMs Against Misuse and AI-Driven Malware Using Steganographic Canaries [16.391742476325323]
AIを利用したマルウェアは、クラウドでホストされた生成AIサービスや大規模言語モデルを活用する傾向にある。
両方の脅威はAIサービスの取り込みバウンダリに収束するが、既存の防御はエンドポイントとネットワーク周辺に重点を置いている。
本稿では, 統計カナリアファイルに基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-30T16:40:55Z) - FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents [53.03492387564392]
我々はFS-Researcherを紹介した。FS-Researcherはファイルシステムベースのフレームワークで、永続的なワークスペースを通じてコンテキストウィンドウを超えて深い研究をスケールする。
Context Builderエージェントはインターネットを閲覧し、構造化されたノートを書き、ソースを階層的な知識ベースにアーカイブする。
その後、レポートライターエージェントが最終レポートセクションをセクションごとに構成し、知識ベースを事実のソースとして扱う。
論文 参考訳(メタデータ) (2026-02-02T03:00:19Z) - C2T-ID: Converting Semantic Codebooks to Textual Document Identifiers for Generative Search [73.61009656398384]
本稿では,階層クラスタリングによる意味的数値決定法を構築するC2T-IDを提案する。
C2T-IDは、アトミック、セマンティック・コードブック、純粋テキスト・ドシッド・ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-22T04:05:38Z) - Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models [53.17363502535395]
信頼できる言語モデルは、正しい答えと検証可能な答えの両方を提供するべきです。
現在のシステムは、外部レトリバーを推論時にクエリすることで、引用を挿入する。
本稿では,合成QAペアを継続的に事前訓練するActive Indexingを提案する。
論文 参考訳(メタデータ) (2025-06-21T04:48:05Z) - Attribution analysis of legal language as used by LLM [0.0]
公開可能な2つの法的データセット、より単純な二項分類タスク、および保持者の司法判断を特定するためのより精巧な複数の選択タスクを使用します。
すべてのモデルがケースホールドタスクからテスト例を正しく分類しているのに対して、他の例は1つ、モデル、属性のみによってのみ識別できる。
論文 参考訳(メタデータ) (2025-01-28T22:48:29Z) - Document Type Classification using File Names [7.130525292849283]
迅速な文書分類は、デジタル法医学や大規模メディア分類といった、時間に敏感ないくつかの応用において重要である。
重厚なディープラーニングモデルに依存する従来のアプローチは、膨大な入力データセットよりも高い推論時間のために不足している。
本稿では、TF-IDF特徴抽出に基づくトークン化手法と組み合わせ、軽量教師付き学習モデルを用いた手法を提案する。
論文 参考訳(メタデータ) (2024-10-02T01:42:19Z) - African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification [53.89380284760555]
textttFOCI (textbfFine-fine textbfObject textbfClasstextbfIfication) は、きめ細かいオブジェクト分類のための難しい多重選択ベンチマークである。
textttFOCIxspaceは、ImageNet-21kから4つのドメイン固有のサブセットで5つの一般的な分類データセットを補完する。
論文 参考訳(メタデータ) (2024-06-20T16:59:39Z) - Adapting Dual-encoder Vision-language Models for Paraphrased Retrieval [55.90407811819347]
モデルが類似した結果を返すことを目的とした,パラフレーズ付きテキスト画像検索の課題について考察する。
我々は、大きなテキストコーパスで事前訓練された言語モデルから始まる二重エンコーダモデルを訓練する。
CLIPやOpenCLIPのような公開デュアルエンコーダモデルと比較して、最高の適応戦略で訓練されたモデルは、パラフレーズクエリのランク付けの類似性を大幅に向上させる。
論文 参考訳(メタデータ) (2024-05-06T06:30:17Z) - Zero-shot Audio Topic Reranking using Large Language Models [42.774019015099704]
実例によるマルチモーダルビデオ検索 (MVSE) では, ビデオクリップを情報検索の問合せ語として利用する。
本研究の目的は,この高速アーカイブ検索による性能損失を,再ランク付け手法を検証することによって補償することである。
パブリックなビデオアーカイブであるBBC Rewind corpusでトピックベースの検索のパフォーマンスを評価する。
論文 参考訳(メタデータ) (2023-09-14T11:13:36Z) - DAPR: A Benchmark on Document-Aware Passage Retrieval [57.45793782107218]
我々は,このタスクemphDocument-Aware Passage Retrieval (DAPR)を提案する。
State-of-The-Art(SoTA)パスレトリバーのエラーを分析しながら、大きなエラー(53.5%)は文書コンテキストの欠如に起因する。
提案するベンチマークにより,検索システムの開発・比較を今後行うことができる。
論文 参考訳(メタデータ) (2023-05-23T10:39:57Z) - ThreatCrawl: A BERT-based Focused Crawler for the Cybersecurity Domain [0.0]
ThreatCrawlと呼ばれる新しい集中クローラが提案されている。
BiBERTベースのモデルを使用して文書を分類し、クローリングパスを動的に適応する。
収穫率は最大52%で、私たちの知る限りでは、現在の最先端技術よりも優れています。
論文 参考訳(メタデータ) (2023-04-24T09:53:33Z) - Adversarial Networks and Machine Learning for File Classification [0.0]
検査中のファイルの種類を正しく特定することは、法医学的な調査の重要な部分である。
本稿では、逆学習された機械学習ニューラルネットワークを用いてファイルの真の型を決定することを提案する。
半教師付き生成敵ネットワーク(SGAN)は,11種類のファイルの分類において97.6%の精度を達成した。
論文 参考訳(メタデータ) (2023-01-27T19:40:03Z) - Same or Different? Diff-Vectors for Authorship Analysis [78.83284164605473]
古典的な著作物分析において、特徴ベクトルは文書を表し、特徴の値は文書中の特徴の相対周波数(関数の増大)を表し、クラスラベルは文書の著者を表す。
筆者らの実験は共著者検証,著者検証,クローズドセットの著者帰属に取り組んでおり,DVは自然に第1の問題を解くのに向いているが,第2と第3の問題を解くための2つの新しい方法も提供している。
論文 参考訳(メタデータ) (2023-01-24T08:48:12Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z) - Reinforcing Semantic-Symmetry for Document Summarization [15.113768658584979]
文書要約は、長い文書を詳細な情報と正確な意味記述を備えた短いバージョンに凝縮する。
本稿では,文書要約のための新しいtextbfreinforcing stextbfemantic-textbfsymmetric Learning textbfmodelを提案する。
CNN/Daily MailとBigPatentの2つの大胆なベンチマークデータセットに対して、一連の実験が行われた。
論文 参考訳(メタデータ) (2021-12-14T17:41:37Z) - Content-Based Textual File Type Detection at Scale [0.0]
プログラミング言語の検出は、大規模なソースコードの分析において一般的なニーズです。
我々は,テキストファイルの内容のみに基づいて,ソフトウェアコードベースでよく見られるファイルの種類を正確に検出する問題を考える。
論文 参考訳(メタデータ) (2021-01-21T09:08:42Z) - R$^2$-Net: Relation of Relation Learning Network for Sentence Semantic
Matching [58.72111690643359]
文意味マッチングのための関係学習ネットワーク(R2-Net)を提案する。
最初にBERTを使用して、グローバルな視点から入力文をエンコードします。
次に、cnnベースのエンコーダは、ローカルな視点からキーワードやフレーズ情報をキャプチャするように設計されている。
関係情報抽出にラベルを十分に活用するために,関係分類タスクの自己教師付き関係性を導入する。
論文 参考訳(メタデータ) (2020-12-16T13:11:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。