論文の概要: You Get What You Sample: Evaluating Sampling Strategies for Web Security Measurements
- arxiv url: http://arxiv.org/abs/2609.11218v2
- Date: Wed, 16 Sep 2026 12:45:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.376425
- Title: You Get What You Sample: Evaluating Sampling Strategies for Web Security Measurements
- Title(参考訳): サンプル:Webセキュリティ測定のためのサンプリング戦略の評価
- Abstract要約: この研究は、サンプリング手法が測定と結論にどのように影響するかに関する最初の包括的な研究である。
Top$N$サンプリングは合理的な戦略かもしれないが、Top$N$はWeb全体の分布を反映していないことを忘れてはならない。
本稿では,対象問題の頻度が不明な場合でも有効である適応型確率ベースサンプリング戦略を提案する。
- 参考スコア(独自算出の注目度): 15.393354110563237
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Web measurement studies rely on domain datasets such as Tranco to quantify the prevalence and impact of security issues at scale, but exhaustively analyzing these datasets is often infeasible because of the cost of advanced analysis techniques, requiring the use of sampling. Despite its widespread use, sampling remains largely guided by convention---most commonly \emph{Top $N$} domain selection---rather than evidence, and its influence on the validity and generalizability of security findings has received little systematic evaluation. Consequently, it remains unclear whether common sampling strategies introduce systematic bias, distort observed vulnerability rates, or limit comparability across studies. In this work, we undertake, to the best of our knowledge, the first comprehensive investigation into how sampling methodologies affect the measurements and the conclusions. Through a comprehensive literature review and large-scale measurements of 500k Tranco and 24.8M Common Crawl hosts, we perform a comparative evaluation of datasets and sampling strategies. We show that, while Top $N$ sampling may be a rational strategy, the researchers have to bear in mind that Top $N$ does not reflect the overall distribution of the web. Instead, probability-based strategies yield stable, unbiased estimates for prevalence and many impact objectives. Hybrid sampling provides no advantages over pure probability sampling, as its deterministic prefix consistently contributes negatively to accuracy. Building on these results, we provide data-backed guidance for future studies, proposing to use an adaptive probability-based sampling strategy that remains effective even when the prevalence of the target issue is unknown.
- Abstract(参考訳): ウェブ計測の研究は、Trancoのようなドメインデータセットに頼って、大規模なセキュリティ問題の発生頻度と影響を定量化しているが、これらのデータセットを徹底的に分析することは、サンプリングを必要とする高度な分析手法のコストのために、しばしば実現不可能である。
広く使われているにもかかわらず、サンプリングは大半が慣例によって導かれており、最も一般的な例である「emph{Top $N$}」ドメインの選択は証拠ではなく、その安全性の妥当性と一般化性への影響はほとんど体系的な評価を受けていない。
その結果、一般的なサンプリング手法が、系統的バイアス、観察された脆弱性率の歪曲、研究間の互換性の制限をもたらすかは明らかでない。
本研究は,本研究の知見を最大限に活用するために,サンプリング手法が測定と結論にどのように影響するかを包括的に調査した最初の事例である。
総合的な文献レビューと、500kトランコと24.8MのCommon Crawlホストの大規模測定を通じて、データセットとサンプリング戦略の比較評価を行う。
Top$N$サンプリングは合理的な戦略かもしれないが、Top$N$はWeb全体の分布を反映していないことを忘れてはならない。
その代わり、確率に基づく戦略は、有病率と多くの影響目標に対して安定で偏見のない見積もりをもたらす。
ハイブリッドサンプリングは、決定論的プレフィックスが常に精度に負の貢献をするので、純粋な確率サンプリングよりも利点がない。
これらの結果に基づいて, 対象問題の発生頻度が不明な場合でも有効である適応型確率ベースサンプリング戦略を用いることを提案, 今後の研究に向けてデータ支援によるガイダンスを提供する。
関連論文リスト
- Robust Sampling for Active Statistical Inference [11.929391566298841]
アクティブ統計的推論はAI支援データ収集を用いた新しい推論手法である。
アクティブな統計的推測のためのロバストなサンプリング戦略を提案する。
本稿では,本手法の有効性を実データに示す。
論文 参考訳(メタデータ) (2025-11-12T05:18:36Z) - On the Reliability of Sampling Strategies in Offline Recommender Evaluation [3.4956406636452626]
オフライン評価は、オンラインテストが非現実的または危険である場合、推奨システムのベンチマークにおいて中心的な役割を果たす。
露出バイアスは、ユーザが表示されているアイテムのみと対話する、露出バイアスと、全カタログではなくログされたアイテムのサブセットで評価を行う際に導入されるサンプリングバイアスである。
論文 参考訳(メタデータ) (2025-08-07T13:50:05Z) - Optimal Sampling for Generalized Linear Model under Measurement Constraint with Surrogate Variables [3.5903555216741405]
場合によっては、代理変数はデータセット全体を通してアクセスでき、真の応答変数の近似として機能する。
本稿では,サロゲート変数から得られる情報を効果的に活用する最適なサンプリング戦略を提案する。
論文 参考訳(メタデータ) (2025-01-01T22:41:52Z) - Stratified Prediction-Powered Inference for Hybrid Language Model Evaluation [62.2436697657307]
予測駆動推論(英: Prediction-powered Inference, PPI)は、人間ラベル付き限られたデータに基づいて統計的推定を改善する手法である。
我々はStratPPI(Stratified Prediction-Powered Inference)という手法を提案する。
単純なデータ階層化戦略を用いることで,基礎的なPPI推定精度を大幅に向上できることを示す。
論文 参考訳(メタデータ) (2024-06-06T17:37:39Z) - Uncertainty for Active Learning on Graphs [70.44714133412592]
不確実性サンプリングは、機械学習モデルのデータ効率を改善することを目的とした、アクティブな学習戦略である。
予測の不確実性を超えた不確実性サンプリングをベンチマークし、他のアクティブラーニング戦略に対する大きなパフォーマンスギャップを強調します。
提案手法は,データ生成プロセスの観点から基幹的ベイズ不確実性推定法を開発し,不確実性サンプリングを最適クエリへ導く上での有効性を実証する。
論文 参考訳(メタデータ) (2024-05-02T16:50:47Z) - On the Universal Adversarial Perturbations for Efficient Data-free
Adversarial Detection [55.73320979733527]
本稿では,UAPに対して正常サンプルと逆サンプルの異なる応答を誘導する,データに依存しない逆検出フレームワークを提案する。
実験結果から,本手法は様々なテキスト分類タスクにおいて,競合検出性能を実現することが示された。
論文 参考訳(メタデータ) (2023-06-27T02:54:07Z) - Uncertainty-Aware Instance Reweighting for Off-Policy Learning [63.31923483172859]
本研究では,不確実性を考慮した逆確率スコア推定器 (UIPS) を提案する。
実世界の3つのレコメンデーションデータセットを用いた実験結果から,提案したUIPS推定器の有効サンプル効率が示された。
論文 参考訳(メタデータ) (2023-03-11T11:42:26Z) - ZigZag: Universal Sampling-free Uncertainty Estimation Through Two-Step Inference [54.17205151960878]
汎用的でデプロイが容易なサンプリング不要のアプローチを導入します。
我々は,最先端手法と同等の信頼性のある不確実性推定を,計算コストを著しく低減した形で生成する。
論文 参考訳(メタデータ) (2022-11-21T13:23:09Z) - MEET: A Monte Carlo Exploration-Exploitation Trade-off for Buffer
Sampling [2.501153467354696]
経験リプレイバッファのための最先端サンプリング戦略は強化学習エージェントの性能を向上させる。
Q値推定に不確実性は含まない。
本稿では,探索・探索トレードオフを利用した新しいサンプリング戦略を提案する。
論文 参考訳(メタデータ) (2022-10-24T18:55:41Z) - Rethinking Collaborative Metric Learning: Toward an Efficient
Alternative without Negative Sampling [156.7248383178991]
コラボレーティブ・メトリック・ラーニング(CML)パラダイムはレコメンデーション・システム(RS)分野に広く関心を集めている。
負のサンプリングが一般化誤差のバイアス付き推定に繋がることがわかった。
そこで我々は,SFCML (textitSampling-Free Collaborative Metric Learning) という名前のCMLに対して,負のサンプリングを伴わない効率的な手法を提案する。
論文 参考訳(メタデータ) (2022-06-23T08:50:22Z) - Holistic Approach to Measure Sample-level Adversarial Vulnerability and
its Utility in Building Trustworthy Systems [17.707594255626216]
敵対的攻撃は、知覚不能な雑音を伴うイメージを摂動させ、誤ったモデル予測をもたらす。
本稿では,異なる視点を組み合わせることで,サンプルの敵対的脆弱性を定量化するための総合的アプローチを提案する。
サンプルレベルで確実に敵の脆弱性を推定することにより、信頼できるシステムを開発できることを実証する。
論文 参考訳(メタデータ) (2022-05-05T12:36:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。