論文の概要: Restless bandits with imperfect binary feedback: PCL-indexability analysis and computation
- arxiv url: http://arxiv.org/abs/2606.11192v1
- Date: Fri, 27 Mar 2026 17:34:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.818113
- Title: Restless bandits with imperfect binary feedback: PCL-indexability analysis and computation
- Title(参考訳): 不完全な二分フィードバックを持つレスレスバンド:PCL-インデクサビリティ解析と計算
- Abstract要約: 本研究は,2成分の潜伏状態と不完全な2成分フィードバックを併用したレストレスバンドについて検討した。
関連する信念状態モデルに対して,指数性を確立し,Whittle指数を評価するための部分的保存法則(PCL)に基づく解析・計算フレームワークを開発する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study restless bandits with binary latent states and imperfect binary feedback, motivated by opportunistic spectrum access with sensing errors. For the associated belief-state model, we develop a partial conservation laws (PCL)-based analytical and computational framework for establishing indexability and evaluating the Whittle index, building on a verification theorem for real-state discounted restless bandits. The framework analyzes the stochastic dynamics via an associated deterministic skeleton, renewal decompositions, and combinatorics on words. It yields tractable expressions for discounted reward and resource metrics in several threshold regimes, enabling full verification of the PCL-indexability conditions there. For the remaining regime, where a complete analytic verification is not achieved in this paper, we derive efficient numerical schemes for computing the relevant marginal metrics and the marginal productivity (MP) index, which equals the Whittle index when those conditions hold. Extensive computational experiments provide strong evidence that these conditions also hold in that regime across broad parameter ranges and without the stringent parameter restrictions imposed in prior work. The experiments further show that theMP index policy typically outperforms standard benchmark policies, often by a substantial margin.
- Abstract(参考訳): 本研究は,2成分の潜伏状態と不完全な2成分フィードバックを併用したレストレスバンドについて検討した。
関連する信念-状態モデルに対し、実状態割引レスベルトの検証定理に基づいて、指数性を確立し、ウィトル指数を評価するための部分保存法則(PCL)に基づく分析・計算フレームワークを開発する。
このフレームワークは、関連する決定論的骨格、更新分解、および単語のコンビネータによって確率力学を解析する。
いくつかのしきい値において、割引報酬とリソースメトリクスの抽出可能な式を生成し、PCL-インデクサビリティ条件の完全な検証を可能にする。
本論文では,完全解析検証を行なわない残りの状態に対しては,関連する辺縁指標と辺縁生産性指数(MP)を計算するための効率的な数値スキームを導出する。
大規模な計算実験は、これらの条件が、幅広いパラメータ範囲にわたって、また以前の作業で課された厳密なパラメータ制限がなければ、その状態に保たれるという強い証拠を提供する。
実験の結果、MP指数の政策が標準ベンチマークの政策を上回ることが示され、しばしば実質的なマージンで示される。
関連論文リスト
- Smooth Multi-Policy Causal Effect Estimation in Longitudinal Settings [13.1234934131475]
本稿では,共有表現による共同推定が可能な反復条件予測(ICE)Q-関数の再パラメータ化を提案する。
共有ポリシエンコーダを中心としたアーキテクチャであるPEQ-Net(Policy-Encoded Q Network)において,このアプローチを実装した。
半合成データセットの実験では、PEQ-Netは既存のICEベースの手法よりも一貫して優れており、ルート平均二乗誤差の大幅な削減を実現している。
論文 参考訳(メタデータ) (2026-05-14T02:33:58Z) - Quantifiable Uncertainty: A Stochastic Consensus Multi-Agent RAG Framework for Robust Malware Detection [1.2183405753834562]
本稿では,マルウェア解析をセマンティックコード検索と確率的検証に分離するフレームワークMAGMAを提案する。
MAGMAは98.4%の検知率を示し,既存の解よりもかなり高い値を示した。
論文 参考訳(メタデータ) (2026-05-08T18:46:24Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Kernel Single-Index Bandits: Estimation, Inference, and Learning [3.1109381260263853]
我々は、各アームの報酬が単一インデックスモデルに従う、有限個の動作を伴う文脈的包帯について研究する。
本稿では,Steinをベースとした指標パラメータ推定と逆プロペンシティ重み付きリッジ回帰を組み合わせた,カーネル化された$varepsilon$-greedyアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-19T14:15:16Z) - BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning [49.25750348525603]
BandPOは、信頼領域を動的で確率対応のクリッピング間隔に投影する統一理論演算子であるBandに取って代わる。
BandPOはカノニカルクリッピングやClip-Higherより一貫して優れ,エントロピー崩壊の軽減が図られている。
論文 参考訳(メタデータ) (2026-03-05T08:03:05Z) - Pushing the Boundaries of Natural Reasoning: Interleaved Bonus from Formal-Logic Verification [49.506412445511934]
大きな言語モデル(LLM)は目覚ましい能力を示すが、その次は論理的不整合と報奨ハックを生み出す。
本稿では,自然言語生成プロセスと形式的記号的検証を動的にインターリーブする形式論理検証誘導フレームワークを提案する。
我々はこのフレームワークを,形式論理検証誘導制御による微調整とポリシー最適化の相乗効果を生かした,新しい2段階のトレーニングパイプラインを通じて運用する。
論文 参考訳(メタデータ) (2026-01-30T07:01:25Z) - Efficient Thought Space Exploration through Strategic Intervention [54.35208611253168]
本稿では,この知見を2つの相乗的コンポーネントを通して操作するHint-Practice Reasoning(HPR)フレームワークを提案する。
フレームワークの中核となる革新は、動的に介入点を識別する分散不整合低減(DIR)である。
算術的および常識的推論ベンチマークによる実験は、HPRの最先端の効率-精度トレードオフを実証している。
論文 参考訳(メタデータ) (2025-11-13T07:26:01Z) - Imputation-Powered Inference [2.676349883103404]
Imputation-powered Inference (IPI) は、ブラックボックス計算の柔軟性と、完全に観測されたデータを用いたバイアス補正を組み合わせたモデルリーンフレームワークである。
IPIは、二重頑健な推定値とナイーブな計算値の両方が名目的カバレッジを達成できない設定において、統計的妥当性を維持しながら、完全ケース分析と比較して、サブポピュレーション効率を大幅に改善する可能性がある。
論文 参考訳(メタデータ) (2025-09-17T07:48:54Z) - Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes [55.2480439325792]
強化学習(Reinforcement Learning, RL)は、数学のような検証可能な決定論的領域において、言語モデルの精度を向上させるために著しく有効であることが証明されている。
本稿では,現在のRL法が,科学的実験のような検証可能な領域における言語モデルの最適化にも有効かどうかを検討する。
論文 参考訳(メタデータ) (2025-08-15T20:50:53Z) - The Curse of CoT: On the Limitations of Chain-of-Thought in In-Context Learning [56.574829311863446]
CoT(Chain-of-Thought)プロンプトは,大規模言語モデル(LLM)における推論能力の向上によって広く認識されている。
我々は、CoTとその推論変異が、様々なモデルスケールやベンチマークの複雑さに対して、直接応答を一貫して過小評価していることを実証する。
パターンベースICLにおけるCoTの性能を駆動する明示的単純推論の基本的なハイブリッド機構を明らかにする。
論文 参考訳(メタデータ) (2025-04-07T13:51:06Z) - Accuracy of Discretely Sampled Stochastic Policies in Continuous-time Reinforcement Learning [3.973277434105709]
我々は、個別の時点におけるポリシーからアクションをサンプリングするポリシー実行フレームワークを厳格に分析し、それらを断片的に一定の制御として実装する。
サンプリングメッシュのサイズがゼロになる傾向にあるため、制御された状態過程は、ポリシーに従って係数で動的に弱く収束する。
これらの結果に基づいて、離散時間観測に基づいて、様々な政策勾配推定器のバイアスとばらつきを分析した。
論文 参考訳(メタデータ) (2025-03-13T02:35:23Z) - A Backdoor-based Explainable AI Benchmark for High Fidelity Evaluation of Attributions [60.06461883533697]
まず、属性手法の信頼性ベンチマークが満たすであろう信頼度基準のセットを同定する。
次に、望ましい忠実度基準に準拠したBackdoorベースのeXplainable AIベンチマーク(BackX)を紹介します。
我々の分析はまた、属性を利用して神経トロイの木馬を守るための洞察を提供する。
論文 参考訳(メタデータ) (2024-05-02T13:48:37Z) - Nonparametric Score Estimators [49.42469547970041]
未知分布によって生成されたサンプルの集合からスコアを推定することは確率モデルの推論と学習における基本的なタスクである。
正規化非パラメトリック回帰の枠組みの下で、これらの推定器の統一的なビューを提供する。
カールフリーカーネルと高速収束による計算効果を享受する反復正規化に基づくスコア推定器を提案する。
論文 参考訳(メタデータ) (2020-05-20T15:01:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。