論文の概要: Best-Arm Identification with Generative Proxy
- arxiv url: http://arxiv.org/abs/2607.06879v1
- Date: Wed, 08 Jul 2026 00:41:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.242152
- Title: Best-Arm Identification with Generative Proxy
- Title(参考訳): 生成プロキシを用いたBest-Arm識別
- Authors: Tianyi Ma, Hanzhang Qin, Ruihao Zhu, Jierui Zuo,
- Abstract要約: 固定信頼度ベストアーム識別法について検討し,各報酬の引き分けを,安価だが相関の取れたプロキシスコアと組み合わせて検討した。
本稿では,最小二乗法に適合する残差の上限値を維持する位相除去アルゴリズム PROBE を提案する。
我々は PROBE が$-PAC であり、一定の乗算係数と一定の加法キャリブレーションコストまで、既知の相関オラクルサンプルの複雑さが得られることを証明した。
- 参考スコア(独自算出の注目度): 10.674965991983974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Best-arm identification is a canonical model for data-driven decision-making, but in many applications each reward observation is costly. Motivated by the growing availability of cheap predictions from machine learning and large language models, we study fixed-confidence best-arm identification in which each costly reward pull is paired with a cheap but correlated proxy score. The marginal mean of the proxy can be estimated offline and is treated as known, whereas its correlation $ρ$ with the reward, which governs how much the proxy helps, is unknown and must be learned online in pair with real rewards. We show that a control-variate adjustment turns this model into a heteroscedastic identification problem whose oracle sample complexity improves by residual variance $1-ρ^2$. The central difficulty is that the correlation must be learned from the same costly samples that identification consumes online, and that a plug-in estimate of the residual variance is anti-conservative and can compromise correctness. We propose PROBE (PRoxy OLS for Best-arm Exploration), a phase-elimination algorithm that directly maintains an upper certificate on the residual variance with an ordinary least squares fit, whose exact chi-square law keeps the certificate valid regardless of the unknown correlation. We prove that PROBE is $δ$-PAC and attains the known-correlation oracle sample complexity up to a constant multiplicative factor and a constant additive calibration cost. The guarantee extends to the $(ε,δ)$-PAC setting under minimal changes to the algorithm. Numerical experiments on synthetic instances and on an auto-loan pricing replay with large language model and tabular proxies confirm that the sample savings of PROBE scale with the strength of the reward-proxy correlation, exactly as the theory predicts.
- Abstract(参考訳): ベストアーム識別は、データ駆動意思決定のための標準的なモデルであるが、多くのアプリケーションでは、各報酬の観測にはコストがかかる。
機械学習と大規模言語モデルによる安価な予測の可用性の向上を動機として、各コスト報酬の引き分けが安価だが相関するプロキシスコアと組み合わせられる固定信頼度ベストアーム識別について検討する。
プロキシの限界平均はオフラインで推定され、既知のものとして扱われるが、その相関は$ρ$で、プロキシがどれだけ役に立つかは、不明であり、実際の報酬と組み合わせてオンラインで学ぶ必要がある。
制御変数の調整により、このモデルが、オラクルサンプルの複雑さが1-ρ^2$の残留分散によって改善される異種確率的識別問題に変換されることを示す。
中心的な困難は、識別がオンラインで消費されるのと同じコストのかかるサンプルから相関を学ばなければならず、残差のプラグイン推定が反保守的であり、正当性を損なう可能性があることである。
ProBE (PRoxy OLS for Best-arm Exploration) は,最小二乗法則に適合する残差の上位証明書を直接保持する位相除去アルゴリズムである。
PROBEが$δ$-PACであることが証明され、一定の乗算係数と一定の加法キャリブレーションコストまで、既知の相関オラクルサンプルの複雑さが得られる。
この保証は、アルゴリズムの最小限の変更の下で$(ε,δ)$-PAC設定にまで拡張される。
合成事例と大規模言語モデルと表式プロキシを用いた自動ローン価格リプレイによる数値実験により, PROBEのサンプル貯蓄は,理論が予測するとおり,報酬-プロキシ相関の強さでスケールできることが確認された。
関連論文リスト
- Anytime PAC-Bayes for Constrained Density-Ratio Networks under Covariate Shift [0.0]
PAC-Bayesはベルヌーイ-KL境界を生じる固定時間状態の重み付けリスクに基づいてインスタンス化される。
実データデプロイメントによる解析的基盤真理に対するパッチテストは、フレームワークを検証します。
単一の固定時間カバレッジ障害が記録され、スプリット単位のカバレッジがラベルシフトの大きさと一致している。
論文 参考訳(メタデータ) (2026-05-17T01:07:17Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Reinforcement Learning from Multi-Source Imperfect Preferences: Best-of-Both-Regimes Regret [71.69884486156359]
我々は, 累積的不完全化予算を用いて, エンフルティソースの不完全性選好からエピソードRLを考察した。
我々は,最良な登録行動を示す,後悔$tildeO(sqrtK/M+)$の統一アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:34:53Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - Best Arm Identification with LLM Judges and Limited Human [18.85883540190321]
固定信頼ベストアーム識別(BAI)について検討する。
本研究では,各アームの平均値と逆正当性重み付け残差を結合した平均値の推定器を開発する。
推定器と信頼性シーケンスに基づいて,アームを適応的に選択し,監査するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-29T09:50:34Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Measuring Model Fairness under Noisy Covariates: A Theoretical
Perspective [26.704446184314506]
本研究では,雑音情報に基づく機械学習モデルの公平性の測定問題について検討する。
本稿では, 精度の高い公平性評価が可能な弱い条件を特徴付けることを目的とした理論的解析を行う。
論文 参考訳(メタデータ) (2021-05-20T18:36:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。