論文の概要: A More Accurate Algorithm Comparison through A/B Testing using Offline Evaluation Methods
- arxiv url: http://arxiv.org/abs/2607.01958v1
- Date: Thu, 02 Jul 2026 09:50:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.777951
- Title: A More Accurate Algorithm Comparison through A/B Testing using Offline Evaluation Methods
- Title(参考訳): オフライン評価手法を用いたA/Bテストによる高精度アルゴリズムの比較
- Abstract要約: A/Bテストは、オンラインサービスでより良いアルゴリズムを選択するための金の標準です。
オフライン評価は、高い実験コストと、ユーザエクスペリエンスを劣化させるリスクのために注目を集めている。
本稿では,A/Bテストにおけるアルゴリズム選択を改善するために,意図的に正の相関を導出する推定器を提案する。
- 参考スコア(独自算出の注目度): 16.718993861590857
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A/B testing is the gold standard for selecting the better algorithm in online services. While offline evaluation has attracted attention as a safer alternative due to the high experimental costs and the potential risk of degrading user experience and revenue in A/B testing, it is widely recognized that the estimation accuracy of offline evaluation is substantially lower. As a result, final selection decisions are typically made through A/B testing. Contrary to this conventional view, we reveal a counterintuitive phenomenon in which A/B testing can produce a higher algorithm selection error rate than offline evaluation. This occurs because the sample mean estimator used in A/B testing does not induce positive correlation, which is crucial for reducing critical selection errors, namely underestimating the truly superior algorithm and overestimating the truly inferior one. In contrast, offline evaluation methods unintentionally generate this beneficial correlation by relying on shared offline data when estimating and comparing the performance of multiple algorithms. Building on this insight, we propose an estimator that intentionally induces positive correlation to improve algorithm selection in A/B testing. The key idea is to introduce a hypothetical middle algorithm and to estimate the performance difference between algorithms A, M, and B in a stepwise manner using shared data at each step. This approach enables the application of offline evaluation techniques in each step, thereby inducing positive correlation and reducing critical selection errors. Furthermore, we derive the optimal middle algorithm regarding the resulting variance and analyze its advantages over existing methods through bias-variance analysis. Experiments on real-world data demonstrate that our estimator achieves the same selection error rate as existing approaches while using only one half of the A/B testing data.
- Abstract(参考訳): A/Bテストは、オンラインサービスでより良いアルゴリズムを選択するための金の標準です。
オフライン評価は、実験コストが高く、A/Bテストでユーザエクスペリエンスや収益が低下する可能性があり、より安全な代替手段として注目されているが、オフライン評価の精度はかなり低いことが広く認識されている。
その結果、最終選択決定は通常、A/Bテストによって行われる。
従来の見方とは対照的に、A/Bテストがオフライン評価よりも高いアルゴリズム選択誤差率を生成できる反直観的な現象を明らかにする。
これは、A/Bテストで使用されるサンプル平均推定器が正の相関を起こさないためであり、これは決定的な選択誤差を減らし、真に優れたアルゴリズムを過小評価し、真に劣ったアルゴリズムを過小評価するために重要である。
対照的に、オフライン評価手法は、複数のアルゴリズムの性能を推定し比較する際に、共有オフラインデータに依存することによって、この有益な相関関係を意図せずに生成する。
この知見に基づいて、A/Bテストにおけるアルゴリズム選択を改善するために、意図的に正の相関を導出する推定器を提案する。
鍵となる考え方は、仮説的な中間アルゴリズムを導入し、各ステップで共有データを用いてアルゴリズムA、M、Bのパフォーマンス差を段階的に推定することである。
このアプローチは各ステップにオフライン評価手法を適用し、正の相関を誘導し、臨界選択誤差を低減させる。
さらに、得られた分散に関する最適な中間アルゴリズムを導出し、バイアス分散分析により既存の手法に対する利点を解析する。
実世界のデータを用いた実験では,A/Bテストデータの半分しか使用せず,既存手法と同じ選択誤差率が得られることが示された。
関連論文リスト
- Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains [67.71020482405343]
評価ギャップの形で追加情報を活用するアルゴリズムを設計する方法について検討する。
精度の高いレーティングギャップ情報が存在する場合,DPOよりも高速な統計的レートを実現するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-31T08:38:21Z) - Robustness and accuracy of mean opinion scores with hard and soft outlier detection [2.9214619971854723]
映像品質と映像品質の主観評価では、観察者は選択された刺激を評価・比較する。
信頼できない評価を受けた可能性のある不信者を特定し、対処することが推奨される。
論文 参考訳(メタデータ) (2025-09-08T11:09:14Z) - Practical Improvements of A/B Testing with Off-Policy Estimation [51.25970890274447]
従来の手法よりも分散度を低くする非バイアスのオフ・ポリティクス推定器のファミリーを導入する。
提案手法の有効性と実用性を理論的に検証した。
論文 参考訳(メタデータ) (2025-06-12T13:11:01Z) - Exploring the Performance of Continuous-Time Dynamic Link Prediction Algorithms [14.82820088479196]
ダイナミックリンク予測(DLP)は、進化するネットワークにおける将来のリンクの予測に対処する。
本研究では,このような総合的な評価を行うためのツールをコントリビュートする。
評価時に使用可能な陰性サンプリング手法の網羅的な分類法について述べる。
論文 参考訳(メタデータ) (2024-05-27T14:03:28Z) - Online Estimation via Offline Estimation: An Information-Theoretic Framework [75.80823630681323]
オフライン推定アルゴリズムをオンライン推定アルゴリズムに変換することは可能か?
我々はOracle-Efficient Online Estimation (OEOE)という新しいフレームワークを導入し,学習者はストリーム上で動作しているブラックボックスアルゴリズムによって生成されたオフライン推定器のシーケンスを通じて,データストリームと間接的にのみ対話することができる。
論文 参考訳(メタデータ) (2024-04-15T20:19:18Z) - Learning to Estimate Without Bias [57.82628598276623]
ガウスの定理は、重み付き最小二乗推定器は線形モデルにおける線形最小分散アンバイアスド推定(MVUE)であると述べている。
本稿では、バイアス制約のあるディープラーニングを用いて、この結果を非線形設定に拡張する第一歩を踏み出す。
BCEの第二の動機は、同じ未知の複数の推定値が平均化されてパフォーマンスが向上するアプリケーションにおいてである。
論文 参考訳(メタデータ) (2021-10-24T10:23:51Z) - Scalable Personalised Item Ranking through Parametric Density Estimation [53.44830012414444]
暗黙のフィードバックから学ぶことは、一流問題の難しい性質のために困難です。
ほとんどの従来の方法は、一級問題に対処するためにペアワイズランキングアプローチとネガティブサンプラーを使用します。
本論文では,ポイントワイズと同等の収束速度を実現する学習対ランクアプローチを提案する。
論文 参考訳(メタデータ) (2021-05-11T03:38:16Z) - Towards Feature-Based Performance Regression Using Trajectory Data [0.9281671380673306]
ブラックボックス最適化は非常に活発な研究領域であり、毎年多くの新しいアルゴリズムが開発されている。
アルゴリズムの多様性はメタプロブレム(メタプロブレム):どのアルゴリズムが与えられた問題を選択するか?
過去の研究では、探索ランドスケープ分析に基づくインスタンスごとのアルゴリズム選択が、このメタプロブレムに取り組むための効率的な手段であることが示されている。
論文 参考訳(メタデータ) (2021-02-10T10:19:13Z) - Taking the Counterfactual Online: Efficient and Unbiased Online
Evaluation for Ranking [74.46448041224247]
データロギングのポリシーを最適化する新しいロギング・ポリシ最適化アルゴリズム(LogOpt)を導入する。
LogOptは、ログポリシーに無関係な反ファクト的なアプローチをオンラインアプローチに変換し、アルゴリズムが表示すべきランキングを決定する。
オンライン評価手法として、LogOptは既存のインターリービング方法とは異なり、位置と項目選択バイアスに偏りがないことが証明されている。
論文 参考訳(メタデータ) (2020-07-24T18:05:58Z) - Debiased Off-Policy Evaluation for Recommendation Systems [8.63711086812655]
A/Bテストは信頼できるが、時間と費用がかかり、失敗のリスクが伴う。
提案手法は,履歴データに対するアルゴリズムの性能を推定する手法である。
提案手法は,最先端手法よりも平均2乗誤差が小さい。
論文 参考訳(メタデータ) (2020-02-20T02:30:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。