論文の概要: Practice Makes (Im)Perfect: A Look Back at Benchmarking Practices for Microarchitectural Side-Channel Attacks
- arxiv url: http://arxiv.org/abs/2609.03893v2
- Date: Wed, 09 Sep 2026 14:03:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.914907
- Title: Practice Makes (Im)Perfect: A Look Back at Benchmarking Practices for Microarchitectural Side-Channel Attacks
- Title(参考訳): Practice Makes (Im)Perfect: マイクロアーキテクチャサイドチャネル攻撃のベンチマークプラクティスを振り返る
- Abstract要約: マイクロアーキテクチャーサイドチャネルの研究は近年異例のペースで成長している。
現在のベンチマークは、新しいプリミティブの特定の特性を評価するのに最も関係がないかもしれない。
不十分な評価慣行は、比較の関連性を損なうとともに、疑問を投げかけた。
2014年から2024年にかけて、トップランクのセキュリティとアーキテクチャのカンファレンスで公表された83のアタック・ペーパーを調査した。
- 参考スコア(独自算出の注目度): 2.1990852305468533
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Microarchitectural side-channel research has grown at an exceptional pace in recent years, increasing the need for rigorous and meaningful benchmarking. Early attack papers typically relied on indirect proxies, such as covert-channel bandwidth or key-recovery on naive AES and RSA implementations, setting de facto standards that many subsequent works continued to replicate, sometimes by directly comparing against raw numbers from prior work. While these practices offer convenient points of comparison, current benchmarks may not be the most relevant to assess specific properties of new primitives. Even more problematic, microarchitectural attacks are notoriously sensitive to experimental conditions: minimal changes in the target system can significantly alter outcomes and performance. As a result, inadequate evaluation practices undermine reproducibility and cast doubt on the relevance of comparisons, even in top-tier venues where such issues should be identified. This paper tackles the core problem of proper benchmarking for microarchitectural side-channel attacks and examines its broader impact on research quality in the field. We survey 83 attack papers published in top-ranked security and architecture conferences from 2014 to 2024. From this corpus, we identify and define 19 recurrent benchmarking flaws that affect evaluation completeness, relevance, soundness, and reproducibility. These flaws include unfair or absent comparisons, missing code or materials, and the failure to evaluate the key attack properties. On average, each paper exhibits 5.5 such flaws, highlighting how widespread the issue is, even in highly selective venues. Based on our findings, we identify and suggest key properties that are relevant to properly evaluate new attacks. We also highlight trends over time and different practices between security and architecture conferences.
- Abstract(参考訳): マイクロアーキテクチャーサイドチャネルの研究は近年異例のペースで成長し、厳密で有意義なベンチマークの必要性が高まっている。
初期の攻撃文書は、通常、秘密チャンネルの帯域幅や秘密のAESとRSAの実装のキー復元のような間接プロキシに依存しており、多くの後続の作業が複製され続け、時には以前の作業の生数と直接比較することで、事実上の基準を設定した。
これらのプラクティスは、便利な比較ポイントを提供するが、現在のベンチマークは、新しいプリミティブの特定の特性を評価するのに最も重要でないかもしれない。
さらに問題なのは、マイクロアーキテクチャー攻撃は実験的な条件に敏感であることだ。
その結果, 再現性を損なう評価手法が不十分であり, 比較の妥当性に疑問を呈している。
本稿では、マイクロアーキテクチャーサイドチャネル攻撃に対する適切なベンチマークのコア問題に取り組み、その分野における研究品質への影響について検討する。
2014年から2024年にかけて、トップランクのセキュリティとアーキテクチャのカンファレンスで公表された83のアタック・ペーパーを調査した。
このコーパスから、評価完全性、妥当性、健全性、再現性に影響を及ぼす19の繰り返しベンチマーク欠陥を特定し、定義する。
これらの欠陥には、不公平または欠落した比較、コードや資料の欠落、主要な攻撃特性の評価の失敗が含まれている。
平均して、各論文は5.5の欠陥を示し、高い選択性のある場所でも、問題がどの程度広範囲にあるかを強調している。
本研究は,新たな攻撃を適切に評価するための鍵となる特性を同定し,提案するものである。
また、セキュリティとアーキテクチャのカンファレンス間の時間的トレンドと異なるプラクティスも強調しています。
関連論文リスト
- FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks [31.87029149284585]
本稿では,LLMの安全性ベンチマークにおける影響(5つの指標に基づく)とコード品質の多次元評価について述べる。
ベンチマーク論文は,非ベンチマーク論文に対する学術的影響(引用数や密度など)に有意な優位性を示すものではない。
著者の優位性は紙の影響と相関するが、著者の優位性も紙の影響もコード品質と有意な相関を示す。
論文 参考訳(メタデータ) (2026-03-03T09:10:45Z) - SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions [54.34001921326444]
話者検証(SV)モデルは、セキュリティ、パーソナライゼーション、アクセス制御システムにますます統合されている。
既存のベンチマークでは、これらの条件のサブセットのみを評価しており、他は完全に欠落している。
SVeritasは、録音時間、自発性、コンテンツ、ノイズ、マイクロホン距離、残響、チャンネルミスマッチ、オーディオ帯域幅、コーデック、話者年齢、スプーフィングおよび敵攻撃に対する感受性などのストレス下でのSVシステムの評価を行う総合的な話者検証タスクベンチマークスイートである。
論文 参考訳(メタデータ) (2025-09-21T14:11:16Z) - The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination [18.05548914181797]
ベンチマークデータ汚染(BDC)-トレーニングセットにベンチマークテストサンプルを含めることで、LLM(Large Language Model)評価における懸念が高まった。
これを解決するために、研究者は既存のベンチマークを更新するための様々な緩和戦略を提案している。
従来の評価手法、例えば精度低下や精度のマッチングは、集計精度のみに焦点を合わせ、しばしば不完全あるいは誤解を招く結論に至る。
論文 参考訳(メタデータ) (2025-03-20T17:55:04Z) - LLM-Safety Evaluations Lack Robustness [58.334290876531036]
我々は、大規模言語モデルに対する現在の安全アライメント研究は、多くのノイズ源によって妨げられていると論じる。
本研究では,将来の攻撃・防衛用紙の評価において,ノイズやバイアスを低減させる一連のガイドラインを提案する。
論文 参考訳(メタデータ) (2025-03-04T12:55:07Z) - Reinforcement Learning for Dynamic Resource Allocation in Optical Networks: Hype or Hope? [39.78423267310698]
光ネットワークにおける動的資源配分への強化学習の適用は、近年の激しい研究活動の焦点となっている。
本稿では、この分野の進歩を概観し、ベンチマークの実践とソリューションにおける大きなギャップを明らかにする。
論文 参考訳(メタデータ) (2025-02-18T12:09:42Z) - BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices [28.70453947993952]
我々は、AIベンチマークのライフサイクル全体で46のベストプラクティスを検討し、それに対して24のAIベンチマークを評価するアセスメントフレームワークを開発した。
私たちは、大きな品質差があり、よく使われるベンチマークが重大な問題に悩まされていることに気付きました。
論文 参考訳(メタデータ) (2024-11-20T02:38:24Z) - MIBench: A Comprehensive Framework for Benchmarking Model Inversion Attack and Defense [42.56467639172508]
Model Inversion (MI)攻撃は、ターゲットモデルの出力情報を活用して、プライバシに敏感なトレーニングデータを再構築することを目的としている。
我々は、モデル反転攻撃と防御の体系的評価のためのMIBenchという最初の実用的なベンチマークを構築した。
論文 参考訳(メタデータ) (2024-10-07T16:13:49Z) - Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models [81.27391252152199]
大規模言語モデル(LLM)は、さまざまな自然言語ベンチマークで素晴らしいパフォーマンスを実現している。
本稿では、データセットの自動更新と、その有効性に関する体系的な分析を提案する。
1) 類似したサンプルを生成するための戦略を模倣すること,2) 既存のサンプルをさらに拡張する戦略を拡張すること,である。
論文 参考訳(メタデータ) (2024-02-19T07:15:59Z) - Towards Evaluating Transfer-based Attacks Systematically, Practically,
and Fairly [79.07074710460012]
ディープニューラルネットワーク(DNN)の敵対的脆弱性に大きな注目を集めている。
ブラックボックスDNNモデルを騙すための転送ベース手法が増えている。
30以上のメソッドを実装した転送ベースアタックベンチマーク(TA-Bench)を確立する。
論文 参考訳(メタデータ) (2023-11-02T15:35:58Z) - Deconstructing Self-Supervised Monocular Reconstruction: The Design
Decisions that Matter [63.5550818034739]
本稿では,自己教師付き単分子深度推定への最先端の貢献を評価するための枠組みを提案する。
事前トレーニング、バックボーン、アーキテクチャ設計の選択、損失関数が含まれる。
我々は16の最先端コントリビューションを再実装し、検証し、再評価し、新しいデータセットを導入します。
論文 参考訳(メタデータ) (2022-08-02T14:38:53Z) - Open-Set Recognition: A Good Closed-Set Classifier is All You Need [146.6814176602689]
分類器が「ゼロ・オブ・ア・ア・ア・ベ」決定を行う能力は、閉集合クラスにおける精度と高い相関関係があることが示される。
この相関を利用して、閉セット精度を向上させることにより、クロスエントロピーOSR'ベースライン'の性能を向上させる。
また、セマンティックノベルティを検出するタスクをより尊重する新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2021-10-12T17:58:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。