論文の概要: Elicitation and Decision Geometry in Single-Index Bandits
- arxiv url: http://arxiv.org/abs/2609.35622v1
- Date: Mon, 28 Sep 2026 16:58:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 20:16:47.27393
- Title: Elicitation and Decision Geometry in Single-Index Bandits
- Title(参考訳): 単軸バンドの励起と決定幾何学
- Abstract要約: 両腕のコンテキスト帯について,腕特異的な単一指標と未知のモノトーンリンクを用いて検討した。
本研究では, 逐次ステインコントラストを用いて, 最適境界を直接学習する, 強欲な手続きである自然境界学習(NBL)を紹介する。
- 参考スコア(独自算出の注目度): 6.8609885668865935
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study two-arm contextual bandits with arm-specific single indices and a shared unknown monotone link. Monotonicity makes the optimal action depend only on the contrast between the index directions, hence arm-specific reward functions need not be estimated. We introduce Natural Boundary Learning (NBL), a greedy procedure that uses a sequential Stein contrast to learn the optimal boundary directly, without estimating the reward functions or the common link. We characterize the local Riemannian dynamics of NBL through a decision stability coefficient balancing arm separation, link geometry, and the context distribution. We show that this stability is connected to the elicitation geometry of the underlying convex potential. Under local decision stability, NBL contracts toward the optimal boundary and achieves $O(\log n)$ expected regret. Numerical experiments illustrate the predicted stability regimes and compare NBL with a parametric greedy benchmark under link misspecification.
- Abstract(参考訳): 両腕のコンテキスト帯について,腕特異的な単一指標と未知のモノトーンリンクを用いて検討した。
単調性は、最適作用を指数方向のコントラストにのみ依存させるので、腕固有の報酬関数を推定する必要はない。
本研究では,報酬関数や共通リンクを推定することなく,逐次ステインコントラストを用いて最適境界を直接学習する,自然な境界学習(NBL)を提案する。
我々は, NBL の局所リーマン力学を, アーム分離, リンク幾何学, コンテキスト分布のバランスをとる決定安定性係数によって特徴づける。
この安定性は、下層の凸ポテンシャルのエリケーション幾何と結びついていることが示される。
局所的な決定安定性の下では、NBLは最適境界に向けて収縮し、$O(\log n)$期待された後悔を達成する。
数値実験は、予測された安定性状態を示し、NBLとパラメトリックグリーディベンチマークをリンクミススペクテーションで比較する。
関連論文リスト
- Low-Rank Single-Index Bandits with Unknown Links: From Matrices to Tensors [3.0594138391611967]
低ランク行列とテンソルバンディットは構造的相互作用を利用するが、典型的には既知の報酬リンクを仮定する。
最近の単一インデックス法は、行列やテンソルランクを直接利用せずに未知のリンクを許容する。
このギャップを、未知の共有リプシッツリンクと低ランク指数パラメータを用いて、行列とテンソルのバンドイットを研究することで解決する。
論文 参考訳(メタデータ) (2026-09-26T23:50:38Z) - Selective Ensemble Based on Preference-Directed Multi-Objective Bandits [90.75513823660775]
我々は、部分的に指定された線形選好の下で逐次決定問題を定式化する。
次に、嗜好指向の高信頼度境界(PrefUCB)アルゴリズムを提案する。
大規模な事前学習型モデル選択アンサンブルタスクと,機関委任下でのオンラインアセットアロケーションの実験により,本手法が検証された。
論文 参考訳(メタデータ) (2026-06-20T07:52:46Z) - Learning Nonlinear Factor Models with Unknown Monotone Links from Incomplete and Noisy Data [5.256805330951789]
我々は,未知のリンク関数によって観測応答が低ランク因子に依存する非線形因子モデルをブロックする。
リンク関数は単調な空間回復にあり、識別可能性を維持しながら柔軟性のあるあいまいさを可能にすると仮定される。
論文 参考訳(メタデータ) (2026-05-25T18:57:03Z) - Autoregressive Learning in Joint KL: Sharp Oracle Bounds and Lower Bounds [8.164687789644365]
本研究では, 自己回帰モデルにおける長周期学習の基本的かつタイムリーな問題と, モデル不特定の下での次トーケン予測について検討する。
我々のゴールは、シーケンス水平線(H)が、この共同分布、シーケンスレベル状態における近似と推定誤差の両方にどのように影響するかを特徴づけることである。
論文 参考訳(メタデータ) (2026-05-12T16:01:29Z) - Zeroth-Order Optimization at the Edge of Stability [59.54782674222443]
ゼロ階数(ZO)系の(平均二乗の)線形安定性を捉える明示的なステップサイズ条件を提供する。
以上の結果から,ZO法に特有の暗黙的な正則化効果が示され,大きなステップサイズが主にヘッセントレースを正則化することがわかった。
論文 参考訳(メタデータ) (2026-04-16T06:23:18Z) - A Perturbation Approach to Unconstrained Linear Bandits [48.45987210959519]
我々は、制約のない帯域線形最適化(uBLO)の文脈で、Abernethy et al. (2008) の標準摂動に基づくアプローチを再考する。
制約のない環境では、バンド線形最適化(BLO)を標準オンライン線形最適化(OLO)問題に効果的に還元することを示す。
論文 参考訳(メタデータ) (2026-03-30T09:17:46Z) - Kernel Single-Index Bandits: Estimation, Inference, and Learning [3.1109381260263853]
我々は、各アームの報酬が単一インデックスモデルに従う、有限個の動作を伴う文脈的包帯について研究する。
本稿では,Steinをベースとした指標パラメータ推定と逆プロペンシティ重み付きリッジ回帰を組み合わせた,カーネル化された$varepsilon$-greedyアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-19T14:15:16Z) - Perfect Clustering for Sparse Directed Stochastic Block Models [1.3464152928754485]
スパース指向SBMにおけるコミュニティ検出のための非スペクトル2段階手法を提案する。
提案手法はまず,非対称設定に適した近傍平滑化スキームを用いて有向確率行列を推定する。
提案手法は,有向スペクトル法とスコア法が劣化した状況下で確実に動作可能であることを示す。
論文 参考訳(メタデータ) (2026-01-23T03:53:20Z) - Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback [50.89125374999765]
NLHFにおける最適乗算重み更新(mathtOMWU$)に対する最初の収束保証を提供する。
本分析では, 稀に発生する行動の確率が指数関数的に小さい値から指数関数的に増大する新たな限界収束挙動を同定する。
論文 参考訳(メタデータ) (2025-12-31T12:08:29Z) - On Lower Bounds for Standard and Robust Gaussian Process Bandit
Optimization [55.937424268654645]
有界ノルムを持つ関数のブラックボックス最適化問題に対するアルゴリズム非依存な下界を考える。
本稿では, 単純さ, 汎用性, エラー確率への依存性の向上など, 後悔の下位境界を導出するための新しい証明手法を提案する。
論文 参考訳(メタデータ) (2020-08-20T03:48:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。