論文の概要: PhiShark2026: A Multi-Layer Active-Web Raw-Evidence Dataset for Phishing Website Research
- arxiv url: http://arxiv.org/abs/2608.23199v1
- Date: Mon, 24 Aug 2026 12:50:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.068751
- Title: PhiShark2026: A Multi-Layer Active-Web Raw-Evidence Dataset for Phishing Website Research
- Title(参考訳): PhiShark2026: フィッシングWebサイト研究のための多層アクティブWebRaw-Evidenceデータセット
- Authors: Furkan Çolhak, Ferhat Demirkıran, Hasan Dağ, Alexander Iliev,
- Abstract要約: フィッシングWebサイトは短命で急速に変化するが、多くのフィッシングデータセットは、URLや事前計算機能に対する観察を減らす。
この制限を67,502個のスキャンからなる多層能動Webデータセットを用いて解決し,操作フィードからの33,387個のフィッシング観測と34,115個の良性基準観測を行った。
コーパスはHTMLコンテンツやスクリーンショット、URLとリダイレクトの動作、HTTPとセキュリティヘッダ、コンプライアンスファイル、TLS証明書、DNSとドメイン登録、オープンポート、位置情報とアクセシビリティの測定、ネットワークインフラストラクチャの詳細な証拠を保存している。
- 参考スコア(独自算出の注目度): 39.146761527401424
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Phishing websites are short-lived and rapidly changing, yet many phishing datasets reduce observations to URLs or precomputed features, constraining researchers to predefined representations and discarding the underlying evidence needed to derive alternative features, apply new extraction methods, examine cross-layer relationships, and reanalyze observations as phishing techniques evolve. This study addresses this limitation with a multi-layer active-web dataset comprising 67,502 scans, including 33,387 phishing observations from operational feeds and 34,115 screened benign reference observations. The corpus preserves raw evidence across HTML content and screenshots, URL and redirect behavior, HTTP and security headers, compliance files, TLS certificates, DNS and domain registration, open ports, geolocation and accessibility measurements, and network infrastructure, while explicitly recording unavailable evidence rather than treating it as negative observations. To avoid misleading infrastructure attribution on shared platforms, the study applies a hosting-aware evidence model that masks provider-owned infrastructure signals for free-hosted tenant pages while retaining meaningful page- and transport-level evidence. Characterization reveals systematic differences between phishing and benign websites across web-resource usage, domain maturity, mail and policy configuration, security headers, and infrastructure context. By preserving raw artifacts together with acquisition metadata and explicit evidence availability, the corpus provides an inspectable and reproducible foundation for future phishing measurement and dataset research.
- Abstract(参考訳): フィッシングのウェブサイトは短命であり、急速に変化するが、多くのフィッシングのデータセットは、URLや事前計算された特徴への観察を減らし、研究者を事前定義された表現に制限し、代替の特徴を導き出すために必要な証拠を捨て、新しい抽出方法を適用し、層間関係を調べ、フィッシングのテクニックが進化するにつれて観察を再分析する。
この制限を67,502個のスキャンからなる多層能動Webデータセットを用いて解決し,操作フィードからの33,387個のフィッシング観測と34,115個の良性基準観測を行った。
コーパスは、HTMLコンテンツやスクリーンショット、URLとリダイレクト行動、HTTPとセキュリティヘッダ、コンプライアンスファイル、TLS証明書、DNSとドメイン登録、オープンポート、位置情報とアクセシビリティの測定、ネットワークインフラストラクチャなどにわたる生のエビデンスを、否定的な観察として扱うのではなく、明示的に記録する。
共有プラットフォーム上でのインフラストラクチャの帰属を誤解させるのを避けるため、この研究では、プロバイダが所有するテナントページに対して、意味のあるページレベルのエビデンスを保持しながら、プロバイダが所有するインフラストラクチャ信号を隠蔽する、ホスティング対応エビデンスモデルを適用した。
キャラクタリゼーションは、Webリソースの使用、ドメインの成熟度、メールとポリシーの設定、セキュリティヘッダ、インフラストラクチャコンテキストにまたがる、フィッシングと良質なWebサイト間の体系的な違いを明らかにします。
生のアーティファクトを取得メタデータと明確なエビデンス・アベイラビリティと共に保存することにより、コーパスは将来のフィッシング計測とデータセット研究のための検査可能で再現可能な基盤を提供する。
関連論文リスト
- A Tree-Structured Approach for Phishing Template and Attacker Attribution Analysis [0.9199488958939334]
フィッシングは今でも、永続的で進化しているサイバーセキュリティの脅威だ。
本研究では,HTML構造がフィッシングテンプレートの再利用を識別するための堅牢な指紋として機能するかどうかを検討する。
論文 参考訳(メタデータ) (2026-08-17T06:23:16Z) - Receipt Replay OOD: A Small Benchmark for Screen Replay Detection Under Domain Shift [51.56484100374058]
本稿では,画面リプレイ検出のためのベンチマークであるReceipt Replay OODを紹介する。
クロスドメイン条件下での文書再生検出モデルの評価を行い、ドメインシフトが一般化性能に与える影響を実証する。
論文 参考訳(メタデータ) (2026-05-26T11:15:33Z) - IE as Cache: Information Extraction Enhanced Agentic Reasoning [82.00741114456727]
情報抽出は、構造化されていないテキストから構造化された決定関連情報を抽出することを目的としている。
我々は,IEを認知キャッシュとして再利用し,エージェント推論を強化するフレームワークであるtextitIE-as-Cacheを提案する。
論文 参考訳(メタデータ) (2026-04-16T12:18:27Z) - TLS Certificate and Domain Feature Analysis of Phishing Domains in the Danish .dk Namespace [0.0]
フィッシング攻撃は依然としてサイバーセキュリティの脅威だ。
本研究では、証明書メタデータとドメイン特性が、デンマークの.dk内の良性ドメインとフィッシングドメインを区別するのに役立つかどうかを検討する。
論文 参考訳(メタデータ) (2026-03-23T07:30:05Z) - Characterizing Phishing Pages by JavaScript Capabilities [77.64740286751834]
本論文は,フィッシングページのグループを自動的に識別し,研究者やアナリストを支援することを目的としている。
キット検出の精度は,4,562個のフィッシングURLに展開した548個のキット群に対して97%であった。
UIの対話性と基本的なフィンガープリントは、クラスタの90%と80%に存在する普遍的なテクニックであることが分かりました。
論文 参考訳(メタデータ) (2025-09-16T15:39:23Z) - Bridging the Gap in Phishing Detection: A Comprehensive Phishing Dataset Collector [0.030786914102688596]
本稿では,CSSやJavaScript,ファビコン,Webページイメージ,スクリーンショットなど,URLに関連するさまざまなリソースを収集するリソース収集ツールを紹介する。
我々は,4,056個の正当性および5,666個のフィッシングURLと関連するリソースからなるツールを用いて生成されたサンプルデータセットを共有する。
論文 参考訳(メタデータ) (2025-09-11T16:30:12Z) - Can Features for Phishing URL Detection Be Trusted Across Diverse Datasets? A Case Study with Explainable AI [0.0]
フィッシング(Phishing)は、ユーザーを操り、偽装戦術によって機密性の高い個人情報を暴露するサイバー脅威として広く利用されている。
フィッシングURL(またはウェブサイト)を積極的に検出することは、広く受け入れられた防衛アプローチとして確立されている。
公開されている2つのフィッシングURLデータセットを分析し、それぞれのデータセットにはURL文字列とWebサイトコンテンツに関連する独自の、重複した機能セットがあります。
論文 参考訳(メタデータ) (2024-11-14T21:07:52Z) - Black-box Dataset Ownership Verification via Backdoor Watermarking [67.69308278379957]
我々は、リリースデータセットの保護を、(目立たしい)サードパーティモデルのトレーニングに採用されているかどうかの検証として定式化する。
バックドアの透かしを通じて外部パターンを埋め込んでオーナシップの検証を行い,保護することを提案する。
具体的には、有毒なバックドア攻撃(例えばBadNets)をデータセットのウォーターマーキングに利用し、データセット検証のための仮説テストガイダンスメソッドを設計する。
論文 参考訳(メタデータ) (2022-08-04T05:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。