論文の概要: AFA-BANDIT: Provably Near-Optimal Online Multi-Feature Classification Under Budget Constraints
- arxiv url: http://arxiv.org/abs/2610.07615v1
- Date: Tue, 06 Oct 2026 02:02:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.753157
- Title: AFA-BANDIT: Provably Near-Optimal Online Multi-Feature Classification Under Budget Constraints
- Title(参考訳): AFA-BANDIT: 予算制約下でのオンライン多機能分類
- Abstract要約: オンラインAFAを,獲得と予測を結びつけるKnapsacks (BwK) 問題として定式化する。
emphLP-Chainは,機能数に応じて線形に成長するサイズを持つ機能サブセットのコスト認識チェーンを探索する変種である。
合成データに基づいて、emphLP-Chainは、深いRLベースのオンラインAFAベースラインに匹敵する予測性能を達成し、より多くの機能に好適にスケールする。
- 参考スコア(独自算出の注目度): 6.351870389232079
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Active Feature Acquisition (AFA) is a classification problem in which an agent decides which costly features to acquire before predicting each sample's label. Unlike batch AFA, which trains a fixed policy and classifier offline on fully observed data, online AFA updates its predictor from revealed labels as samples arrive. Existing online methods either use deep reinforcement learning (RL) without performance guarantees or maximize cost-adjusted reward rather than enforce a global budget. We formulate online AFA as a combinatorial Bandits with Knapsacks (BwK) problem that couples acquisition and prediction. Unlike prior bandit-based AFA and classical BwK, our setting has combinatorial complexity, evolving rewards, a global budget, and structured side information. We obtain an improved regret upper bound over standard BwK bounds in this framework, leveraging a cardinality-aware confidence bound and the subset update structure. To avoid an exponentially large action space, we propose \emph{LP-Chain}, a variant that searches a cost-aware chain of feature subsets with a size that grows linearly with the number of features. While the regret upper bound is specific to the combinatorial framework, \emph{LP-Chain} empirically achieves comparable predictive performance. On synthetic data, \emph{LP-Chain} outperforms HEDGE-based BwK and deep RL-based online AFA baselines and scales favorably to more features.
- Abstract(参考訳): アクティブ・フィーチャー獲得(英: Active Feature Acquisition、AFA)とは、エージェントが各サンプルのラベルを予測する前にどのコストがかかるかを決定する分類問題である。
完全に観測されたデータに対して、固定ポリシーと分類器をオフラインでトレーニングするバッチAFAとは異なり、オンラインAFAは、サンプルが到着すると、明らかにラベルから予測器を更新する。
既存のオンライン手法では、パフォーマンス保証のない深層強化学習(RL)を使用するか、世界的な予算を強制するのではなく、コスト調整された報酬を最大化する。
我々は、オンラインAFAを、獲得と予測を結合するKnapsacks (BwK)問題との組合せ帯域として定式化する。
従来のバンディットベースのAFAや古典的なBwKとは異なり、私たちの設定は組合せの複雑さ、報酬の進化、グローバルな予算、構造化されたサイド情報を持っている。
このフレームワークの標準BwKバウンダリに対する改善された後悔の上限を求め、濃度認識された信頼境界とサブセット更新構造を利用する。
指数関数的に大きな作用空間を避けるために,特徴量と線形に増大する大きさを持つ特徴部分集合のコスト認識鎖を探索する変種である \emph{LP-Chain} を提案する。
後悔の上限は組合せフレームワークに固有のものであるが、\emph{LP-Chain} は経験的に同等な予測性能を達成している。
合成データでは、emph{LP-Chain}はHEDGEベースのBwKと深層RLベースのオンラインAFAベースラインを上回り、より多くの機能に好適にスケールする。
関連論文リスト
- On the Complexity of Preference-Based Bandits [8.91479401538491]
そこでは、学習者が連続してアームを選択し、Bradley-Terryモデルによって制御される二分選好フィードバックを観察する。
従来の結果とは対照的に,選好フィードバックによる学習は直接的な報酬観察から学ぶのと同じくらい統計的に効率的であることを示す,一階の後悔境界を確立する。
論文 参考訳(メタデータ) (2026-09-30T09:12:09Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning [1.4474373238664187]
セルフプレイの微調整により、人間のアノテーションを追加することなく、教師付き微調整を超えて大きな言語モデルを改善することができる。
IRIS(Interpolative Rényi Iterative Self-play)は,連続的に調整可能な目的を持った,レニイをベースとしたセルフプレイファインチューニングフレームワークである。
Zephyr-7BとQwen2.5-3Bを10のベンチマークで比較したところ、IRISはベースラインを改善し、平均スコアは44.57%に達した。
論文 参考訳(メタデータ) (2026-04-22T11:52:21Z) - AFABench: A Generic Framework for Benchmarking Active Feature Acquisition [6.922744987645169]
AFABenchはActive Feature Acquisitionの最初のベンチマークフレームワークです。
静的,欲求,強化学習に基づくアプローチを含む,すべての主要カテゴリの代表的アルゴリズムを実装し,評価する。
我々の結果は、異なるAFA戦略間の重要なトレードオフを浮き彫りにし、将来の研究に実用的な洞察を提供する。
論文 参考訳(メタデータ) (2025-08-20T14:29:16Z) - Fusing Rewards and Preferences in Reinforcement Learning [24.93050534953955]
本稿では、個別の報酬とペアの好みを融合させる強化学習アルゴリズムであるDual-Feedback Actor(DFA)を提案する。
DFAはポリシーのログ確率を直接使用して好みの確率をモデル化し、別の報酬モデリングのステップを避ける。
シミュレーションの結果,生成した嗜好に基づいて訓練したDFAは,ソフトアクター・クリティカル(SAC)ポリシーを超えていることがわかった。
論文 参考訳(メタデータ) (2025-08-15T09:56:03Z) - ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization [48.50761200321113]
大型言語モデル(LLM)における嗜好学習手法ConfPOを紹介する。
補助モデルや計算を必要とせずに、トレーニングポリシの信頼性のみに基づいて、優先クリティカルトークンを特定し、最適化する。
AlpacaEval 2 や Arena-Hard などのアライメントベンチマークの実験結果は、ConfPO が一様DAA を一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-06-10T11:54:22Z) - Continuous K-Max Bandits [54.21533414838677]
我々は、連続的な結果分布と弱い値-インデックスフィードバックを持つ、$K$-Maxのマルチアームバンディット問題について検討する。
この設定は、レコメンデーションシステム、分散コンピューティング、サーバスケジューリングなどにおいて重要なアプリケーションをキャプチャします。
我々の重要な貢献は、適応的な離散化とバイアス補正された信頼境界を組み合わせた計算効率の良いアルゴリズムDCK-UCBである。
論文 参考訳(メタデータ) (2025-02-19T06:37:37Z) - Offline Learning for Combinatorial Multi-armed Bandits [56.96242764723241]
Off-CMABはCMABの最初のオフライン学習フレームワークである。
Off-CMABは悲観的な報酬推定と解法を組み合わせる。
合成および実世界のデータセットの実験は、CLCBの優れた性能を強調している。
論文 参考訳(メタデータ) (2025-01-31T16:56:18Z) - Autoregressive Bandits [58.46584210388307]
本稿では,オンライン学習環境であるAutoregressive Banditsを提案する。
報酬プロセスの軽微な仮定の下では、最適ポリシーを便利に計算できることが示される。
次に、新しい楽観的後悔最小化アルゴリズム、すなわちAutoRegressive Upper Confidence Bound (AR-UCB)を考案し、$widetildemathcalO left( frac(k+1)3/2sqrtnT (1-G)のサブ線形後悔を被る。
論文 参考訳(メタデータ) (2022-12-12T21:37:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。