論文の概要: Stochastic Linear Bandits with Partially Observed Actions
- arxiv url: http://arxiv.org/abs/2607.08971v1
- Date: Thu, 09 Jul 2026 22:23:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.750506
- Title: Stochastic Linear Bandits with Partially Observed Actions
- Title(参考訳): 部分的に観察された動作を伴う確率線形帯域
- Abstract要約: 学習エージェントが各動作に対する座標のランダムな部分集合しか見ない線形帯域問題の部分的に観察された変種について検討する。
作用ベクトルが本質的な次元が低い場合,この障壁は克服可能であることを示す。
我々の理論は、TOFU-POVが本質的な作用部分空間次元でスケールする後悔の$sqrtT$を楽しんでいることを示している。
- 参考スコア(独自算出の注目度): 11.633556389435244
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The stochastic linear bandit, where actions are represented as vectors and rewards are linear, is a central paradigm for sequential decision making. We study a partially observed variant of this problem in which the learning agent only sees a random subset of coordinates for each action. Such partial observability arises naturally in settings like recommendation and healthcare, where full action descriptions can be expensive or even impossible to obtain. In general, this makes sublinear regret information-theoretically impossible. However, we show that this barrier can be overcome when the action vectors have low intrinsic dimension. We propose an algorithm, TOFU-POV, that estimates the latent action subspace using the masked actions, imputes current actions using an epoch-wise frozen representation, and runs OFUL in the resulting low-dimensional coordinates. Our theory shows that TOFU-POV enjoys a $\sqrt{T}$ regret that scales with the intrinsic action subspace dimension as opposed to the ambient dimension and quantifies the interaction between these quantities and the missingness, decision set size, and subspace conditioning. We also devise a rank-adaptive algorithm that does not require the knowledge of the intrinsic dimension. We complement these guarantees with a lower bound based on a novel product construction that separates usual reward-learning uncertainty from a missingness-dependent cost intrinsic to partial observation. Synthetic and real data experiments support our theory and show that TOFU-POV can substantially improve upon natural baselines in this challenging problem.
- Abstract(参考訳): アクションをベクトルとして表現し、報酬を線形とする確率線形帯域は、シーケンシャルな意思決定における中心的なパラダイムである。
本研究では,学習エージェントが各行動に対するランダムな座標のサブセットのみを見るという,この問題の部分的に観察された変種について検討する。
このような部分的な可観測性は、レコメンデーションやヘルスケアのような設定で自然に発生します。
一般に、これはサブリニアな後悔の情報-理論上は不可能である。
しかし,作用ベクトルが本質的な次元が低い場合,この障壁は克服可能であることを示す。
マスクされた動作を用いて潜在動作部分空間を推定し,エポックワイドな表現を用いて現在の動作をインプットし,結果として生じる低次元座標でOFULを実行するアルゴリズムTOFU-POVを提案する。
我々の理論は、TOFU-POVが、周囲次元とは対照的に本質的な作用部分空間次元とスケールし、これらの量と不足量、決定セットサイズ、および部分空間条件の間の相互作用を定量化する、$\sqrt{T}$の後悔を楽しんでいることを示している。
また、本質的な次元の知識を必要としないランク適応アルゴリズムを考案する。
これらの保証は、通常の報酬学習の不確実性と、欠如に依存したコストの本質的な部分的な観察とを分離する新しい製品構築に基づいて、低い境界で補完する。
合成および実データ実験は,本理論を支持し,TOFU-POVが本課題における自然ベースラインを大幅に改善できることを示す。
関連論文リスト
- Partial Feedback Online Learning [88.27143767009376]
我々は、偏見フィードバックオンライン学習と呼ばれる新しい学習プロトコルについて研究する。
各インスタンスは許容できるラベルのセットを許可するが、学習者は1ラウンドごとに許容できるラベルを1つだけ観察する。
論文 参考訳(メタデータ) (2026-01-29T09:39:11Z) - VAE with Hyperspherical Coordinates: Improving Anomaly Detection from Hypervolume-Compressed Latent Space [56.362776482614976]
変分オートエンコーダ(VAE)は、これらのベクトルをデータに復号する前に、データを低次元の潜在ベクトルに符号化する。
本稿では,超球面座標を用いてVAEの潜伏変数を定式化し,超球面上の所定の方向に向かって潜伏ベクトルを圧縮する手法を提案する。
これにより、VAEの完全な教師なしおよびOOD異常検出能力が向上し、検討したデータセット上で最高のパフォーマンスを達成できることが示される。
論文 参考訳(メタデータ) (2026-01-25T03:10:24Z) - Linear Bandits with Partially Observable Features [35.08645010112184]
本稿では,部分的に観測可能な特徴を考慮に入れた線形帯域問題について検討する。
本稿では,新たな理論的枠組みとサブ線形後悔保証付きアルゴリズムを提案する。
我々のアルゴリズムでは、観測されていない特徴空間に関する事前の知識は必要とせず、より多くの機能が隠されるにつれて拡張される可能性がある。
論文 参考訳(メタデータ) (2025-02-10T04:15:38Z) - Dynamical Linear Bandits [45.3190496371625]
多くの実世界のシーケンシャルな意思決定問題において、アクションはすぐにフィードバックを反映せず、その効果を長い時間枠で広げる。
これまでの研究は、遅延や集約されたフィードバックの可能性について、Multi-Armed Banditフレームワークを調査してきた。
本稿では,隠れ状態に特徴付けられる線形帯域の拡張である動的線形帯域(DLB)について紹介する。
論文 参考訳(メタデータ) (2022-11-16T15:51:44Z) - Exploration in Linear Bandits with Rich Action Sets and its Implications
for Inference [23.364534479492715]
期待行列の最小固有値は、アルゴリズムの累積後悔が$sqrtn)$であるときに、$Omega(sqrtn)として増加することを示す。
本研究は, 線形帯域におけるEmphmodel selectionとEmphclusteringの2つの実践シナリオに適用する。
論文 参考訳(メタデータ) (2022-07-23T20:25:07Z) - Origins of Low-dimensional Adversarial Perturbations [17.17170592140042]
分類における低次元対向摂動現象について検討した。
目標は、分類器を騙して、指定されたクラスからの入力のゼロではない割合でその決定を反転させることである。
任意の部分空間のばかばかし率の低いバウンドを計算する。
論文 参考訳(メタデータ) (2022-03-25T17:02:49Z) - Anti-Concentrated Confidence Bonuses for Scalable Exploration [57.91943847134011]
固有の報酬は、探検と探検のトレードオフを扱う上で中心的な役割を果たす。
楕円ボーナスを効率的に近似するためのエンファンティ集中型信頼境界を導入する。
我々は,Atariベンチマーク上での現代固有の報酬と競合する,深層強化学習のための実用的な変種を開発する。
論文 参考訳(メタデータ) (2021-10-21T15:25:15Z) - Orthogonal Jacobian Regularization for Unsupervised Disentanglement in
Image Generation [64.92152574895111]
直交ジャコビアン正規化法(OroJaR)を提案する。
提案手法は, 絡み合った, 制御可能な画像生成に有効であり, 最先端の手法に対して好適に機能する。
論文 参考訳(メタデータ) (2021-08-17T15:01:46Z) - Where and What? Examining Interpretable Disentangled Representations [96.32813624341833]
解釈可能なバリエーションの獲得は、長い間、絡み合い学習の目標の1つだった。
独立性の仮定と異なり、解釈性は教師なしの設定での絡み合いを促進するために使われることは滅多にない。
本論文では, 解釈対象と解釈対象の2つの質問について検討し, 離散表現の解釈可能性を検討する。
論文 参考訳(メタデータ) (2021-04-07T11:22:02Z) - Nearly Dimension-Independent Sparse Linear Bandit over Small Action
Spaces via Best Subset Selection [71.9765117768556]
本研究では,高次元線形モデルの下での文脈的帯域問題について考察する。
この設定は、パーソナライズされたレコメンデーション、オンライン広告、パーソナライズされた医療など、不可欠な応用を見出す。
本稿では,最適部分集合選択法を用いて2重成長エポックを推定する手法を提案する。
論文 参考訳(メタデータ) (2020-09-04T04:10:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。