論文の概要: Revealing After Overwriting: An Exponential POMDP OPE Lower Bound under History-Dependent Logging
- arxiv url: http://arxiv.org/abs/2610.05063v1
- Date: Sun, 04 Oct 2026 09:05:51 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:21:12.092501
- Title: Revealing After Overwriting: An Exponential POMDP OPE Lower Bound under History-Dependent Logging
- Title(参考訳): オーバーライト後のリベリング: 指数POMDP OPEローバウンドの履歴依存ロギングによる検討
- Abstract要約: マルチステップの露呈は、メモリレスロギングの下で、オフポリシー評価をトラクタブルにする。
我々は4つのアクションを持つ2つの正確に実現可能なPOMDPを構築し、少なくとも4つのレイヤ、既知のロガー、メモリレスターゲットを構築した。
- 参考スコア(独自算出の注目度): 12.447016167869078
- License:
- Abstract: Multi-step revealing can make off-policy evaluation tractable under memoryless logging. With history-dependent logging, state decodability and target-relevant evidence can separate. For every horizon $H\ge3$, we construct two exactly realizable POMDPs with four actions, at most four states per layer, a known logger, and a memoryless target. Action overlap, history coverage, and observation-only revealing remain bounded independently of $H$, yet the target values differ by $1/2$ and the KL divergence between the logged laws is $Θ(4^{-(H-1)})$, forcing exponential sample complexity. Logger memory makes states distinguishable, while reset erases the model-distinguishing evidence preserved by the target. A separate construction retains this barrier with common, known observation-only revealing operators. Under action and history coverage, we give a finite-class OPE guarantee using common observable value representations that remain valid at every history. The sample bound depends polynomially on their second-moment cost. In the common-operator construction, the same value direction has constant marginal decoding cost but exponential history-conditioned cost. Finally, on a fixed four-action continuum, we derive matching passive and budgeted readout rates. With one known channel and unit read cost, early reads are optimal. With unknown sensor bias, early reads alone remain exponentially costly. Combining them with post-reset calibration gives sample complexity independent of $H$ when both read types receive fixed positive expected budgets per trajectory.
- Abstract(参考訳): マルチステップの露呈は、メモリレスロギングの下で、オフポリシー評価をトラクタブルにする。
履歴に依存したロギングでは、状態の隠蔽性とターゲット関連エビデンスを分離することができる。
すべての水平線に対して、私たちは4つのアクションを持つ正確に実現可能な2つのPOMDPを構築します。
アクションオーバーラップ、ヒストリーカバレッジ、観察のみの明示は$H$とは独立に有界であるが、ターゲット値は1/2$と、ログされた法則間のKLのばらつきは$(4^{-(H-1)})$と異なり、指数的なサンプルの複雑さを強制する。
ローガーメモリは状態を区別しやすくし、リセットはターゲットが保存したモデル識別証拠を消去する。
別個の構成では、この障壁はよく知られた観測のみの露光作用素によって維持される。
動作と履歴のカバレッジでは、すべての履歴で有効である共通の観測可能な値表現を用いて、有限クラス OPE を保証する。
サンプル境界は、その第2モーメントコストに多項式的に依存する。
共通演算子構成では、同じ値方向が一定の限界復号コストを持つが、指数的履歴条件のコストを持つ。
最後に、固定された4アクション連続体において、受動的および予算化された読み出し率に一致することを導出する。
1つの既知のチャンネルとユニット読み取りコストにより、早期読み出しは最適である。
センサバイアスが不明な場合、早期読み出しだけで指数関数的にコストがかかる。
リセット後のキャリブレーションと組み合わせることで、両方の読み取り型がトラジェクトリ毎に一定の肯定的な予算を受ける場合、サンプルの複雑さは$H$とは無関係になる。
関連論文リスト
- Exponential Hardness of Off-Policy Evaluation under History-Dependent Logging [0.10152838128195468]
ログされたデータセットは、すべての隠れた状態を頻繁に訪問でき、それでもターゲットポリシーの価値について指数関数的に非形式的であることを示す。
有向二車線グリッドワールドは構成を実現し、軌道シミュレーションはその有限サンプル予測と一致する。
論文 参考訳(メタデータ) (2026-09-16T17:56:12Z) - Calibrating Interpretability Instruments Before Trusting Their Verdicts [1.0829694003408499]
Causal氏は、大きな言語モデル(LLM)の内部は測定にかかっていると主張している。
これらの測定は、エラーではなく可算数を返す特定の診断可能な方法で失敗する。
このノートは、拒絶と道徳的表現に関する因果的解釈可能性プログラムの6つの失敗を文書化している。
論文 参考訳(メタデータ) (2026-09-13T19:37:02Z) - A Single Fixed Shallow Circuit for Classical Shadows of Arbitrary n-Qubit States [2.5735476569508995]
我々は、再利用可能なシャドウスナップショットのラベルとして外部サンプル設定を置き換える、単一の固定された浅い量子アナライザを構築した。
アナライザは新しく用意された$n$-qubitfiducial register$A$と並列のBellreadout$A$と未知のシステム$S$を組み合わせて、1コピーあたり2n$-bitレコードを生成する。
論文 参考訳(メタデータ) (2026-09-07T04:36:39Z) - Constrained Online Learning with Noisy Constraint Values [55.29259818039367]
一般的な実現可能性の下では、我々のLEDGERアルゴリズムは、期待される損失$O(sqrt T)と期待される予算違反$O(sqrtTlog(eT))を達成します。
スレーター条件、フィードバックチャネル間の独立性、絶対的制約値境界は不要である。
論文 参考訳(メタデータ) (2026-09-07T01:38:41Z) - Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Method [0.0]
投機的実行は、予測上流入力で下流操作を起動することでアイドル時間を再利用することができる。
ここでは、各投機は実際の費用(単価単価)を負担し、その成功確率は見積もりが困難で、時間の経過とともにドリフトする。
本稿では,(D1)上流が完成する前に下流での運用を開始する,(D2)各投機を個別の入出力レートで価格設定する,(D3)単一演算子ダイヤルをレイテンシ対コストで公開する,(D4)障害重み付きコスト項と優先調整しきい値による期待値ルールによる決定,()
論文 参考訳(メタデータ) (2026-06-05T21:13:47Z) - Score-Repellent Monte Carlo: Toward Efficient Non-Markovian Sampler with Constant Memory in General State Spaces [48.37754141688874]
本稿では,スコアと状態表現の次元である$Rd$のスコア評価の実行平均で履歴を要約するフレームワークを提案する。
この歴史は指数的なスコア傾きによって代理対象に変換され、歴史に基づく反発の大きさを制御する際の反発の強さを表す$$がインデックス付けされる。
連続目標モデルと離散エネルギーベースモデルの実験では、メモリ使用率を$O(d)$に抑えつつ、推定値の分散とモードカバレッジを改善した。
論文 参考訳(メタデータ) (2026-04-24T18:39:50Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - The Curse of Passive Data Collection in Batch Reinforcement Learning [82.6026077420886]
高い利害関係のアプリケーションでは、アクティブな実験は危険すぎると考えられ、データはしばしば受動的に収集される。
バンディットやパッシブ、アクティブなデータ収集などの単純な場合も同様に効果的であるが、制御された状態のシステムからデータを集める場合、パッシブサンプリングの価格ははるかに高い。
論文 参考訳(メタデータ) (2021-06-18T07:54:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。