論文の概要: Detecting Bot Detection: Prevalence, Techniques, and Implications for Web Measurement Research
- arxiv url: http://arxiv.org/abs/2606.14525v1
- Date: Fri, 12 Jun 2026 14:59:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.947317
- Title: Detecting Bot Detection: Prevalence, Techniques, and Implications for Web Measurement Research
- Title(参考訳): ボット検出:Web計測研究における有病率・技術・意義
- Authors: Ralf Gundelach, Michael Mühlhauser, Dominik Herrmann,
- Abstract要約: 本研究では、4つのブラウザ構成で1万のWebサイトを計測し、検出精度の定量化と手法の適用について検討する。
ボット検出手法の分類法を開発し,実際の出現頻度を測定した。
これらの結果から,ボット検出は,Web測定コミュニティが計測や報告を行わないような,組織的かつプロバイダに関連のあるサンプル損失を発生させることが示唆された。
- 参考スコア(独自算出の注目度): 0.5352699766206808
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Browser automation frameworks are essential tools for security and privacy research on the web, yet bot detection scripts increasingly probe their artifacts, threatening measurement validity as automated browsers may be blocked or served different content. Prior work measures detection deployment, while we measure blocking-induced sample loss. Through a literature survey of top-tier security, privacy, and web measurement venues, we find that 83% of papers omit any discussion of bot detection blocking. To address this gap, we conduct a measurement study of 10,000 websites across four browser configurations (40K page visits in total) to quantify detection prevalence and employed techniques. Using custom instrumentation to detect when sites probe for automation, we develop a taxonomy of bot detection techniques and measure how often they appear in practice. Chromium headless encounters a 15% soft block rate compared to 7% for other configurations. Across all conditions, 82% of blocks are attributable to bot detection (59% vendor-confirmed, 23% inferred from condition-dependent blocking), predominantly by providers with integrated bot detection such as Cloudflare (37% block rate) and Akamai (26%). A header spoofing experiment establishes that 75% of Chromium-headless-only blocks are caused by header-level signals alone, yet JavaScript-based environment probing is more extensive than current blocking rates suggest. These findings demonstrate that bot detection creates systematic, provider-correlated sample loss that the web measurement community neither measures nor reports. The downstream effect on specific measurement outcomes remains future work.
- Abstract(参考訳): ブラウザ自動化フレームワークは、Web上のセキュリティとプライバシの研究に不可欠なツールである。しかしながら、ボット検出スクリプトは、それらのアーティファクトをますます調査し、自動化されたブラウザがブロックされるか、異なるコンテンツを提供する可能性があるため、測定の妥当性を脅かしている。
以前の作業は、ブロッキングによって引き起こされるサンプル損失を計測しながら、デプロイメントを検出する。
トップレベルのセキュリティ、プライバシ、Web測定の場所に関する文献調査の結果、論文の83%がボット検出ブロックに関する議論を省略していることがわかった。
このギャップに対処するため、4つのブラウザ構成(合計40万ページ訪問)にまたがる1万のWebサイトを計測し、検出頻度の定量化と手法の適用について検討する。
カスタムインスツルメンテーションを用いて、サイトが自動化を調査するタイミングを検知し、ボット検出技術の分類を開発し、実際にどれだけ頻度で現れるかを測定する。
Chromiumのヘッドレスは15%のソフトブロックレートに遭遇し、他の構成では7%である。
すべての条件において、ブロックの82%は、ボット検出(ベンダーが確認した59%、条件に依存したブロッキングから推測される23%)に起因する。
ヘッダスプーフィング実験では、Chromium-ヘッドレスのみのブロックの75%はヘッダレベルの信号だけで発生しているが、JavaScriptベースの環境探索は現在のブロッキングレートよりも広範囲である。
これらの結果から,ボット検出は,Web測定コミュニティが計測や報告を行わないような,組織的かつプロバイダに関連のあるサンプル損失を発生させることが示唆された。
特定の測定結果に対する下流の影響は、将来の作業のままである。
関連論文リスト
- Shy Guys: A Light-Weight Approach to Detecting Robots on Websites [1.5036109852211983]
本稿では,クライアント側のインタラクションを伴わない標準的なWebサーバログ上でのみ動作する,軽量でパッシブなボット検出手法を提案する。
世界中にホストされているウェブサイトから収集された54,945個のユニークなユーザエージェント文字列を含む460万件以上のリクエストに対して,本手法の評価を行った。
提案手法は, 偽陽性率3%を維持しながら, ボットトラフィックの67.7%を検知し, 美術品の状態を20%以下に向上させる。
論文 参考訳(メタデータ) (2026-03-30T15:07:00Z) - Characterizing Phishing Pages by JavaScript Capabilities [77.64740286751834]
本論文は,フィッシングページのグループを自動的に識別し,研究者やアナリストを支援することを目的としている。
キット検出の精度は,4,562個のフィッシングURLに展開した548個のキット群に対して97%であった。
UIの対話性と基本的なフィンガープリントは、クラスタの90%と80%に存在する普遍的なテクニックであることが分かりました。
論文 参考訳(メタデータ) (2025-09-16T15:39:23Z) - BOTracle: A framework for Discriminating Bots and Humans [5.3248028128815434]
ボットはインターネットトラフィックの重要な部分を占め、複数のドメインにまたがる様々な問題の原因となっている。
我々は,3つの異なる検出手法を解析することにより,高トラフィックシナリオにおけるボット検出の課題を分析する。
精度、リコール、AUCなどのパフォーマンス指標は98%以上に達し、Botchaを上回っています。
論文 参考訳(メタデータ) (2024-12-03T08:38:30Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - My Brother Helps Me: Node Injection Based Adversarial Attack on Social Bot Detection [69.99192868521564]
Twitterのようなソーシャルプラットフォームは、数多くの不正なユーザーから包囲されている。
ソーシャルネットワークの構造のため、ほとんどの手法は攻撃を受けやすいグラフニューラルネットワーク(GNN)に基づいている。
本稿では,ボット検出モデルを欺いたノードインジェクションに基づく逆攻撃手法を提案する。
論文 参考訳(メタデータ) (2023-10-11T03:09:48Z) - An Unforgeable Publicly Verifiable Watermark for Large Language Models [84.2805275589553]
現在の透かし検出アルゴリズムは、透かし生成プロセスで使用される秘密鍵を必要としており、公開検出中にセキュリティ違反や偽造の影響を受ける。
両段階で同じキーを使用するのではなく、2つの異なるニューラルネットワークを用いて透かしの生成と検出を行う。
論文 参考訳(メタデータ) (2023-07-30T13:43:27Z) - An Adversarial Attack Analysis on Malicious Advertisement URL Detection
Framework [22.259444589459513]
悪意のある広告URLは、サイバー攻撃の源泉であるため、セキュリティ上のリスクをもたらす。
既存の悪意のあるURL検出技術は制限されており、見えない機能やテストデータの一般化を扱うことができる。
本研究では,新しい語彙・ウェブスクラップ機能群を抽出し,機械学習技術を用いて不正広告URL検出システムを構築する。
論文 参考訳(メタデータ) (2022-04-27T20:06:22Z) - Phishing URL Detection Through Top-level Domain Analysis: A Descriptive
Approach [3.494620587853103]
本研究では,Splunkプラットフォーム内で使用可能な不正なURLを検出する機械学習モデルを開発することを目的とする。
文学における同様のアプローチから着想を得た私たちは、悪意のあるデータセットと良心的なデータセットを使用して、SVMとランダムフォレストアルゴリズムを訓練しました。
我々はアルゴリズムの性能を精度とリコールで評価し,ランダムフォレストの場合,最大85%の精度と87%のリコールを達成した。
論文 参考訳(メタデータ) (2020-05-13T21:41:29Z) - Learning to Evaluate Perception Models Using Planner-Centric Metrics [104.33349410009161]
本稿では,自動運転のタスクに特化して,3次元物体検出の原理的基準を提案する。
私たちのメトリクスは、他のメトリクスが設計によって課す多くの間違いを罰します。
人間の評価では,基準基準値と基準値が一致しないシーンを生成し,基準値の79%が人間の側にあることがわかった。
論文 参考訳(メタデータ) (2020-04-19T02:14:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。