論文の概要: BRiG-AFA: Bellman Risk-to-Go Learning for Non-Myopic Active Feature Acquisition
- arxiv url: http://arxiv.org/abs/2608.02305v1
- Date: Mon, 03 Aug 2026 14:30:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.602283
- Title: BRiG-AFA: Bellman Risk-to-Go Learning for Non-Myopic Active Feature Acquisition
- Title(参考訳): BRiG-AFA:Bellman Risk-to-Go Learning for Non-Myopic Active Feature Acquisition
- Abstract要約: アクティブな機能取得は、予算の下で各テストインスタンスの次を計測する観測されていない機能を要求する。
本稿では,残予算毎に個別の候補条件付きリスク・ツー・ゴー関数を学習する,デプロイ可能な教師付き代替手段であるメソッドを導入する。
- 参考スコア(独自算出の注目度): 8.363536351727978
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Active feature acquisition (AFA) asks which unobserved feature to measure next for each test instance under a budget. Greedy rules are easy to train but can overlook context features whose value is realized only through later acquisitions, while reinforcement-learning and generative approaches introduce difficult optimization or conditional-density estimation. We introduce \method, a deployable, supervised alternative that learns a separate candidate-conditioned risk-to-go function for every remaining budget. Starting from the one-step terminal classification risk, the functions are fitted backward with Bellman targets; inference greedily minimizes the learned terminal risk using only observed values, the mask, candidate identity, and remaining budget. A controlled non-myopic benchmark shows the expected mechanism: at budgets two and three, \method improves accuracy over its one-step ablation by $4.84\pm2.17$ and $4.39\pm1.10$ percentage points (mean $\pm$ standard error over five seeds). On Fashion-MNIST with 20 candidate pixels, it improves accuracy at every nontrivial reported budget on average, including $10.20\pm0.74$ points at four acquisitions; its mean paired gain across budgets $\{2,4,8,12,16\}$ is $3.50\pm0.37$ points. A three-seed MiniBooNE study is mixed at small budgets but positive at 8 and 16 acquisitions, identifying a current boundary rather than supporting a universal claim. These results establish a reproducible mechanism-level case for direct Bellman risk regression and delimit the experiments still needed for state-of-the-art comparison.
- Abstract(参考訳): アクティブ機能取得(AFA)は、予算の下で各テストインスタンスの次を計測する観測されていない機能を要求する。
グレディルールは訓練が容易であるが、後続の取得によってのみ価値が実現されるコンテキストの特徴を見落とし、強化学習と生成アプローチは難しい最適化や条件密度推定を導入している。
残りの予算ごとに個別の候補条件付きリスク・ツー・ゴー関数を学習する,デプロイ可能な,管理可能な代替手段である \method を導入する。
1段階の端末分類リスクから始まり、関数をベルマン目標に後方に配置する。
2と3の予算で、\methodは1ステップのアブレーションの精度を4.84\pm2.17$と4.39\pm1.10$パーセンテージポイント(平均5シードの標準誤差)で改善する。
20ピクセルのFashion-MNISTでは、4回の買収で10.20\pm0.74$ポイントを含む、平均的な非自明な予算で精度を向上し、予算で平均2対当たり$2,4,8,12,16\}$は3.50\pm0.37$ポイントである。
3段階のMiniBooNE研究は、小さな予算で混在するが、8と16の買収で肯定的であり、普遍的な主張を支持するのではなく、現在の境界を特定できる。
これらの結果は、直接ベルマンリスク回帰のための再現可能なメカニズムレベルのケースを確立し、最先端の比較に必要な実験を除外する。
関連論文リスト
- AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval [1.1647715835517187]
AgentWorldは、パーソナリティ駆動のユーザ人口とステートフルなツール使用環境を組み合わせたシミュレーションフレームワークである。
10のOCEANペルソナにわたる会話分析エージェント(240の評価者判断)、5つのタスクにわたるカスタマーサポートエージェント($times$4のペルソナ変種)、既存のトラジェクタの不安定さを示す5つのタスクの逆ストレステストである。
論文 参考訳(メタデータ) (2026-08-25T05:15:33Z) - Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions [51.50375419691955]
分布的に堅牢なマルコフ決定プロセスは、モデルの不確実性の下でのシーケンシャルな意思決定のための原則化されたフレームワークを提供する。
我々は,平均回帰基準の下で,$varepsilon$-Optimal robust policyを学習するのに必要なサンプル数と十分なサンプル数について検討した。
論文 参考訳(メタデータ) (2026-08-06T19:49:48Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - Bayesian Best-Arm Identification with Abstention: A Polynomial-to-Exponential Phase Transition [51.253617466579335]
本研究では,学習者が端末の推薦を控えることができるベイジアン固定予算のベストアーム識別問題について検討する。
本研究は,非検出誤りの確率を解析し,吸収を伴わない準最適腕を推奨するリスクについて考察する。
論文 参考訳(メタデータ) (2026-06-28T05:07:27Z) - A Complexity Measure for Active Learning in Multi-group Mean Estimation [8.550300650352732]
マルチグループ平均バンドレート$d$-armed banditsにおけるemphmax-riskによるアクティブラーニングの目的について検討した。
学習者は、最悪の不確実性指数を最小限に抑えるために、$d$グループ全体で$T$サンプルの予算を適応的に割り当てる。
滑らかなクラスに対しては、$mathrmVLC$ は分散-フィッシャー情報の再パラメータ化であり、共通族に対する閉形式値を持つ。
論文 参考訳(メタデータ) (2026-06-12T17:54:26Z) - A Spectral Phase Diagram for Binary Few-Shot Classification: Intrinsic Dimensionality, Geometric Saturation, and Representational Diagnosis [0.0]
飽和指数 $S(K) = operatornameerank(widehat_W(K)) / K$ は、プールされたクラス内サンプルの有効ランクとショットカウントとの比を測る。
インデックスはサポート機能だけで$O(d3)$ timeで計算可能で、テストラベルやトレーニングされた分類子を必要としない。
論文 参考訳(メタデータ) (2026-06-12T16:46:24Z) - The Sample Complexity of Multiclass and Sparse Contextual Bandits [106.74652380822778]
我々は,包括的フィードバックに基づいて,与えられたクラスからほぼ最適なポリシーを特定することを目的とする。
ゼロ・ワンの報酬を伴うバンド型マルチクラス分類に動機付けられ、emph$s$-sparse設定に焦点をあてる。
我々は、$s$-sparseの報酬で、誘導モデルクラスは、$s$でスケールするシャープなDEC境界を認め、直接最適なレートを得ることを示す。
論文 参考訳(メタデータ) (2026-05-28T09:12:20Z) - MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents [0.0]
検索強化エージェントに対するメモリ中毒攻撃を,統合評価フレームワークを用いたStackelbergゲームとして定式化する。
ASR-R: 0.25〜1.00$) による攻撃成功度を4倍に向上させる。
私たちの主な貢献は、勾配結合に接地したキャリブレーションに基づく防御であるMEMSADである。
論文 参考訳(メタデータ) (2026-05-05T08:15:41Z) - Polynomial Resource Classification of Quantum Circuit Familes via Classical Shadows [4.519665961894666]
我々は、I, Clifford, Clifford$+T$の3つの量子回路群を分類する。
Z$のみの測定は、すべてのキュービット数にわたって、マルチベーシや古典的な影よりも優れている。
4つの戦略はすべて、二次ショット予算の下で、およそ12キュービット以上の近距離精度(0.33ドル)に崩壊する。
論文 参考訳(メタデータ) (2026-04-28T14:34:25Z) - Low-Rank Bandits via Tight Two-to-Infinity Singular Subspace Recovery [45.601316850669406]
本稿では,政策評価,最良政策識別,後悔の最小化のための効率的なアルゴリズムを提案する。
政策評価と最良の政策識別のために,我々のアルゴリズムは最小限に最適であることを示す。
提案アルゴリズムは、まずスペクトル法を利用して、低ランク報酬行列の左特異部分空間と右特異部分空間を推定する。
論文 参考訳(メタデータ) (2024-02-24T06:36:08Z) - Contextual Combinatorial Bandits with Probabilistically Triggered Arms [55.9237004478033]
確率的に誘発される腕(C$2$MAB-T)を様々な滑らかさ条件下で検討した。
トリガー変調 (TPM) 条件の下では、C$2$-UC-Tアルゴリズムを考案し、後悔すべき$tildeO(dsqrtT)$を導出する。
論文 参考訳(メタデータ) (2023-03-30T02:51:00Z) - Sharp Statistical Guarantees for Adversarially Robust Gaussian
Classification [54.22421582955454]
逆向きに頑健な分類の過剰リスクに対する最適ミニマックス保証の最初の結果を提供する。
結果はAdvSNR(Adversarial Signal-to-Noise Ratio)の項で述べられており、これは標準的な線形分類と逆数設定との類似の考え方を一般化している。
論文 参考訳(メタデータ) (2020-06-29T21:06:52Z) - Risk-Sensitive Reinforcement Learning: Near-Optimal Risk-Sample Tradeoff
in Regret [115.85354306623368]
本研究では,未知の遷移カーネルを持つマルコフ決定過程におけるリスク感応性強化学習について検討する。
確率的に効率的なモデルレスアルゴリズムとして、リスク感性価値反復(RSVI)とリスク感性Q-ラーニング(RSQ)を提案する。
RSVIが $tildeObig(lambda(|beta| H2) cdot sqrtH3 S2AT big) に達したことを証明しています。
論文 参考訳(メタデータ) (2020-06-22T19:28:26Z) - Learning Near Optimal Policies with Low Inherent Bellman Error [115.16037976819331]
エピソード強化学習における近似線形作用値関数を用いた探索問題について検討する。
我々は,検討した設定に対して最適な統計率を達成するアルゴリズムを用いて,Emphbatch仮定のみを用いて探索を行うことが可能であることを示す。
論文 参考訳(メタデータ) (2020-02-29T02:02:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。