論文の概要: OSCC: Certified Observation-Safe Coupling Optimization for Gradient-Noise Control in Imperfect-Information Learning
- arxiv url: http://arxiv.org/abs/2609.33543v1
- Date: Sun, 27 Sep 2026 13:10:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 15:54:37.870165
- Title: OSCC: Certified Observation-Safe Coupling Optimization for Gradient-Noise Control in Imperfect-Information Learning
- Title(参考訳): OSCC:不完全情報学習におけるグラディエントノイズ制御のための認証観測安全結合最適化
- Abstract要約: 無効な結合は、隠された状態を隠蔽し、内因性ポリシーのランダム性を同期させ、または、偽の履歴が分岐した後の誤ったチャンスイベントを発生させる。
本稿では,限界保存,情報状態安全性,ブランチローカルなポリシーランダム性,セマンティックイベントアライメント,トレース・ビオークル・リプレイなどを通じて,許容可能なクラスを定義するフレームワークであるオブザーバセーフ・カウンタファクト・カップリング(O SCC)を紹介する。
我々は, 限界保存結合に対して, ポリシ・ヤコビアン重み付き対角外帰還共分散が雑音変化を決定することを示す勾配対応結合基準を導出する。
- 参考スコア(独自算出の注目度): 23.835119696596095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coupled rollouts can reduce the noise of counterfactual action comparisons, but two issues prevent standard common-random-number constructions from serving as a general learning primitive in imperfect-information environments. First, an invalid coupling may expose hidden state, synchronize endogenous policy randomness, or misalign chance events after counterfactual histories diverge. Second, in multi-action policy optimization, lower return-contrast variance is not by itself the relevant objective: the optimizer depends on the return covariance matrix after projection through the local policy-gradient geometry. We introduce observation-safe counterfactual coupling (OSCC), a framework that defines an admissible class through marginal preservation, information-state safety, branch-local policy randomness, semantic event alignment, and trace-before-oracle replay. We derive a gradient-aware coupling criterion showing that, for marginal-preserving couplings, policy-gradient noise changes are determined by policy-Jacobian-weighted off-diagonal return covariance. This motivates OSCC-Select, a calibration-only selector that chooses among independent, root-only, continuation-only, and fully coupled rollouts using separate safety and gain certificates. Its gain target combines projected gradient noise with measured physical sampling cost and falls back to independent sampling whenever a simultaneous lower confidence bound does not certify improvement. On 100,000 fixed-root Leduc comparisons, the fully coupled CP-GRPO instantiation reduces return-contrast variance from 41.1158 to 18.1441, a 55.87% reduction, while preserving the declared branch marginals. With three actions, OSCC-Select chooses continuation coupling and attains gradient-noise trace 0.0783 versus 0.0917 for return-variance selection. Increasing calibration from 64 to 2,048 groups raises certification from 0.327 to 0.995.
- Abstract(参考訳): 結合ロールアウトは、対実的な行動比較のノイズを低減することができるが、2つの問題により、不完全な情報環境における一般的な学習プリミティブとして、標準の共通乱数構造が機能することを妨げている。
第一に、無効なカップリングは隠れた状態を暴露し、内因性ポリシーのランダム性を同期させたり、反ファクトリアルな歴史が分岐した後の誤ったチャンスイベントを発生させたりすることができる。
第二に、マルチアクションポリシー最適化において、低いリターンコントラスト分散はそれ自体が関連する目的ではない。
本稿では, 限界保存, 情報状態安全性, ブランチローカルなポリシーランダム性, セマンティックイベントアライメント, トレース・バイ・オーラル・リプレイを通じて, 許容クラスを定義するフレームワークである, 観測安全対実カップリング(OSCC)を紹介する。
我々は, 限界保存結合に対して, ポリシ・ヤコビアン重み付き外対角リターン共分散により, ポリシー・グラディエントノイズ変化が決定されることを示す勾配対応結合基準を導出する。
これはOSCC-Selectというキャリブレーションのみのセレクタで、独立、ルートのみ、継続のみ、および完全に結合されたロールアウトの中から、個別の安全と証明書を取得する。
そのゲインターゲットは、投影された勾配ノイズと測定された物理的サンプリングコストを組み合わせ、同時に低い信頼度境界が改善を証明しない場合、独立サンプリングにフォールバックする。
10万の固定根Leducの比較では、完全に結合したCP-GRPOのインスタンス化により、リターンコントラストのばらつきは41.1158から18.1441に減少し、55.87%減少する。
3つの作用により、OSCC-Selectは継続結合を選択し、戻り分散選択のために勾配ノイズトレース0.0783と0.0917を得る。
64グループから2,048グループへのキャリブレーションの増加により、0.327グループから0.995グループへの認証が引き上げられる。
関連論文リスト
- A Free Knob: Decoupling Calibration and Predictive Skill in Threshold-Based Evaluation [1.6099403809839037]
固定された稀な操作点において、最大臨界成功指数(CSI)は、振幅校正と空間的識別を一致させる。
我々はモノトン校正を対称監査として再利用し、ホールドアウトデータに適合したポストホック変換を各システムに個別に適用した。
この効果は、試験期間前の窓に変換が取り付けられる際に持続し、キャリブレーションにより、より良い校正基準線によって隠された利点が明らかになる。
論文 参考訳(メタデータ) (2026-09-27T11:08:55Z) - DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents [55.84813053778976]
ロングホライゾン言語モデルエージェントは、現在の決定と関係が変化する推論の痕跡、ツール交換、観察を蓄積する。
直接セットリスクスコアは、削除セットの選択としてエージェント履歴圧縮リスクを定式化する。
メカニカル・アナリシスとアブリケーションは、決定に制約のある関係、保持されたコンテキスト情報、ペア・インタラクション、および棄権がそれぞれ信頼できるプルーニングに寄与していることを示している。
論文 参考訳(メタデータ) (2026-09-23T03:06:01Z) - Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay [0.6768558752130311]
単一エージェント環境において,実行されたリプレイからポリシー条件の真偽を検査する。
段階的な信用シグナルは、限界整合シャッフル制御以上の信頼度の高いインクリメンタル忠実度を示すものではない。
信頼のみのルータは、チャンスレベルにおいて重要なステップを回復するが、1ターンあたりの審査コストを13.1%削減する。
論文 参考訳(メタデータ) (2026-08-20T08:04:00Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - TwistedMerge: Certified Higher-Order Diagnostics and Abstention for Model Merging [0.48086260459837454]
我々は、チェックポイントが局所対象、アライメントマップが遷移、サイクル積が残留する有限降下問題としてマージを定式化する。
提案手法は, 定数エッジのNo-go結果, フリーズ・コンプレックスの3方向およびプレファミリーの誤差制御定理, 比較・複雑感度の精査試験である。
訓練された低ランク適応型監査では, 平均化係数は選択したGLr代表に依存するが, 大域的因子同期と高密度デルタSVDは安定である。
論文 参考訳(メタデータ) (2026-07-23T03:24:50Z) - Entropy in Conversational AI: Structured Unpredictability as Inferrable Interiority [0.0]
選択層は、容量制限されたストリームから低次元のスタイル・アンド・アテンション状態を更新し、固定ベースモデルで複数の応答を生成し、新規性及び状態親和性を選択する。
合成実装はパイプラインを検証し、ポイントレベルでの4つの前向きな急速凍結分岐特徴と一致する。
論文 参考訳(メタデータ) (2026-07-20T23:03:28Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes [44.974100402600165]
意思決定プロセス(MDP)に対する最良パラメトリックかつ最悪の摂動の評価について検討する。
我々は、元のMDPからの遷移観測を用いて、それらが同一または異なるポリシーの下で生成されるかのどちらかを判断する。
我々の推定器はウォルドの信頼区間を用いた統計的推測も行う。
論文 参考訳(メタデータ) (2024-03-29T18:11:49Z) - Improper Learning with Gradient-based Policy Optimization [62.50997487685586]
未知のマルコフ決定過程に対して学習者がmベースコントローラを与えられる不適切な強化学習設定を考える。
制御器の不適切な混合のクラス上で動作する勾配に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2021-02-16T14:53:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。