論文の概要: Prospect-Theory Behavior from Bellman Optimality in MDPs with Catastrophic States
- arxiv url: http://arxiv.org/abs/2606.00970v1
- Date: Sun, 31 May 2026 03:01:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.008548
- Title: Prospect-Theory Behavior from Bellman Optimality in MDPs with Catastrophic States
- Title(参考訳): 破砕状態のMDPにおけるベルマン最適性からの展望-理論的挙動
- Authors: Yujiao Chen,
- Abstract要約: 報酬は線形だが、エージェントは効用依存や曲率を持たず、大災害のペイオフは$r = 1.25$、または$r = 2$で13.9%である。
単価より1ドル高いところは、中央値がある。
1ドル以上は 中央値です
1ドル以上は 中央値です
1ドル以上は 中央値です
上のユニティは 境界のコントリビューションを超越しています
全ての細胞への貢献です
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study risk-neutral control in Markov decision processes with an absorbing catastrophic state. Even though rewards are linear and the agent has no utility curvature, probability weighting, or framing dependence, standard Bellman optimality produces three prospect-theory-like signatures: an S-shaped value-function profile (convex near catastrophe, concave in the far field), an endogenous loss-sensitivity coefficient $λ^*(S) > 1$, and a reflection-effect policy reversal. Across 495 configurations, the optimal policy plays safe near catastrophe in positive-drift (growth) regimes despite the risky action's higher immediate expected value, and plays risky near catastrophe in negative-drift (decline) regimes despite the safe action's lower immediate expected loss. We derive a closed-form expression for the asymptotic loss-aversion plateau $\barλ$ that depends only on win probability $p$, payoff asymmetry $r = |Δ_\ell/Δ_w|$, and discount factor $β$, and matches numerical solutions to $R^2 = 0.999$. The mechanism does not require asymmetric payoffs. Across a sweep of $(p,β)$ at three asymmetry levels, the asymmetry share of $\barλ$ above unity has median 4.6% at $r = 1.25$ and rises to 13.9% at $r = 2$, with the boundary contribution exceeding the asymmetry contribution in every cell tested. The phenomena persist under tabular Q-learning (a model-free agent reproduces $V^*$ at correlation 0.98 in growth and 1.00 in decline) and under stochastic transitions with Gaussian, heavy-tailed Student-$t_3$, and asymmetric skew-normal noise up to 50% of the step size, where the asymptotic plateau tracks the closed-form prediction within 0.41% for safe-channel noise and within 9.6% for risky-channel or both-channel noise. These results identify absorbing failure states as a sufficient structural mechanism for prospect-theory-like behavior under optimal control.
- Abstract(参考訳): マルコフ決定過程におけるリスクニュートラル制御について検討した。
報酬は線形であり、有効曲率、確率重み付け、フレーミング依存を持たないが、標準的なベルマンの最適性は、S字型の値関数プロファイル(カタストロフィ付近の凸、遠方界の凹凸)、内因性損失感度係数$λ^*(S) > 1$、反射効果ポリシー逆転の3つの予測理論的なシグネチャを生成する。
495以上の構成では、リスク行動の即時期待値が高いにもかかわらず、最適政策は正のドリフト(成長)政権ではカタストロフィ付近で安全であり、安全行動の即時期待損失が低いにもかかわらず、負のドリフト(崩壊)体制ではカタストロフィ付近で危険である。
漸近的損失反転高原に対する閉形式式を導出する:$p$, Payoff asymmetric $r = |Δ_\ell/Δ_w|$, discount factor $β$ のみに依存し、数値解を$R^2 = 0.999$ とする。
このメカニズムは非対称な支払いを必要としない。
3つの非対称性レベルにおける$(p,β)$の全体にわたって、上記の$\barλ$の非対称性のシェアは、$r = 1.25$で中央値4.6%、$r = 2$で13.9%まで上昇し、テストされた全てのセルにおける非対称性の寄与を超える境界寄与となる。
この現象は、グラフ状のQ-ラーニング(成長0.98、減少1.00でV^*$を再現するモデルフリーエージェント)や、ガウス、重尾の学生-t_3$、および非対称スキューノーマルノイズ(英語版)の確率遷移の下で持続し、漸近プラトーは、安全なチャネルノイズのために0.41%、リスクチャネルノイズまたは両チャネルノイズに対して9.6%の範囲で閉形式予測を追跡する。
これらの結果は,吸収破壊状態を最適制御下での予測理論的挙動の十分な構造機構として同定した。
関連論文リスト
- How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis [53.063298916923976]
r*(x) = *(langle *, xrangle)$ と $x sim N(0, I_d)$ でガウスの単一インデックスモデルでフィードバックを研究する。
まず、報酬重み付きサンプルから隠れた方向を*$で学習し、次に重み付きリッジ回帰により読み出し層に適合する2段階のニューラル報酬モデルを分析する。
論文 参考訳(メタデータ) (2026-05-23T22:00:38Z) - Benchmarking the Utility of Privacy-Preserving Cox Regression Under Data-Driven Clipping Bounds: A Multi-Dataset Simulation Study [0.0]
微分プライバシー(DP)は、個人のプライバシーを保証する数学的枠組みである。
本研究では,データ駆動クリッピング境界を持つDP機構がCox比例ハザードモデルに与える影響を系統的に評価した。
論文 参考訳(メタデータ) (2026-04-23T09:53:15Z) - Artificial Intelligence and Systemic Risk: A Unified Model of Performative Prediction, Algorithmic Herding, and Cognitive Dependency in Financial Markets [0.7016842616745783]
我々は,金融市場におけるAI導入が3つの相互強化チャネルを通じてシステム的リスクを生み出す統一モデルを構築した。
このモデルは、バーゼルIII反環状バッファと比較して経済的に有意な18〜54%のテールロス増幅を示唆している。
論文 参考訳(メタデータ) (2026-03-23T06:47:55Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - A Theoretical and Empirical Taxonomy of Imbalance in Binary Classification [0.0]
我々は、不均衡が差別境界をいかに変化させるかを示し、通常、マイルド、エクストリーム、カタストロフィの4つの状態を予測する劣化勾配を生じさせる。
パラメトリックモデルと非パラメトリックモデル全体で、経験的劣化は理論的な予測に密接に従う。
これらの結果は、三重項 $(,,)$ がモデルに依存しない幾何的基底を持つ不均衡による劣化の説明を提供することを示している。
論文 参考訳(メタデータ) (2026-01-07T18:02:11Z) - Understanding Robust Machine Learning for Nonparametric Regression with Heavy-Tailed Noise [10.844819221753042]
我々は、Tikhonov-regularized risk minimizationのクローズアップ例として、Huberレグレッションを使用している。
i)弱モーメント仮定下での標準濃度ツールの分解と,(ii)非有界仮説空間によってもたらされる解析的困難に対処する。
我々の研究は、原則化されたルールを提供し、ハマーを超えて他の堅牢な損失に拡張し、頑健な学習を分析するための基本的なレンズとして、過剰なリスクではなく予測エラーを強調します。
論文 参考訳(メタデータ) (2025-10-10T21:57:18Z) - Nonlinear Stochastic Gradient Descent and Heavy-tailed Noise: A Unified Framework and High-probability Guarantees [56.80920351680438]
本研究では,重音の存在下でのオンライン学習における高確率収束について検討する。
ノイズモーメントを仮定することなく、幅広い種類の非線形性を保証する。
論文 参考訳(メタデータ) (2024-10-17T18:25:28Z) - Autoregressive Bandits [58.46584210388307]
本稿では,オンライン学習環境であるAutoregressive Banditsを提案する。
報酬プロセスの軽微な仮定の下では、最適ポリシーを便利に計算できることが示される。
次に、新しい楽観的後悔最小化アルゴリズム、すなわちAutoRegressive Upper Confidence Bound (AR-UCB)を考案し、$widetildemathcalO left( frac(k+1)3/2sqrtnT (1-G)のサブ線形後悔を被る。
論文 参考訳(メタデータ) (2022-12-12T21:37:36Z) - Uncertainty Quantification of the 4th kind; optimal posterior
accuracy-uncertainty tradeoff with the minimum enclosing ball [1.6009195333398072]
不確実性定量化(UQ)への第4のアプローチを紹介する。
これは、サンプルの$x$を観察して、相対的可能性を通して可能性領域を定義し、その領域でミンマックスゲームを行い、最適推定器とそれらのリスクを定義した後で要約できる。
提案手法は,データ同化に伴うロバストネス-精度トレードオフをナビゲートすることでベイズ推定の脆さに対処する。
論文 参考訳(メタデータ) (2021-08-24T04:02:45Z) - Risk-Sensitive Reinforcement Learning: Near-Optimal Risk-Sample Tradeoff
in Regret [115.85354306623368]
本研究では,未知の遷移カーネルを持つマルコフ決定過程におけるリスク感応性強化学習について検討する。
確率的に効率的なモデルレスアルゴリズムとして、リスク感性価値反復(RSVI)とリスク感性Q-ラーニング(RSQ)を提案する。
RSVIが $tildeObig(lambda(|beta| H2) cdot sqrtH3 S2AT big) に達したことを証明しています。
論文 参考訳(メタデータ) (2020-06-22T19:28:26Z) - Provably Efficient Safe Exploration via Primal-Dual Policy Optimization [105.7510838453122]
制約付きマルコフ決定過程(CMDP)を用いた安全強化学習(SRL)問題について検討する。
本稿では,関数近似設定において,安全な探索を行うCMDPの効率の良いオンラインポリシー最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-03-01T17:47:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。