論文の概要: Distinguish or Homogenize: Last-Chance Policy Identification and Risk-Budgeted Recovery under Irreversible Resource Depletion
- arxiv url: http://arxiv.org/abs/2609.36741v1
- Date: Tue, 29 Sep 2026 05:12:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.2052
- Title: Distinguish or Homogenize: Last-Chance Policy Identification and Risk-Budgeted Recovery under Irreversible Resource Depletion
- Title(参考訳): 差別化・均質化:非可逆的資源枯渇下における最終方針の特定とリスク予算回復
- Abstract要約: 不可逆的なリソース枯渇の下では、エージェントは潜在故障モデルと区別するためにリソースを消費することができる。
この差別化あるいは均質化の原則は、既存の識別、計画、診断のためのフレームワークが明示していないパスを識別する。
- 参考スコア(独自算出の注目度): 6.851814663295321
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Under irreversible resource depletion, an agent can spend resources to distinguish among latent fault models, or to change the system state so that the remaining models admit a common acceptable continuation--at which point further diagnosis becomes unnecessary. This distinguish-or-homogenize principle identifies a path that existing frameworks for identification, planning, and diagnosis do not make explicit: prior formulations treat the mapping from fault models to acceptable policies as a given, whereas LCPI makes it a function of the agent's own actions. We formalize this principle through Last-Chance Policy Identification (LCPI), where correctness is evaluated at the state the agent reaches rather than at the initial state. The Last Identifiable Margin (LIM) marks the feasibility boundary between distinguishing and homogenizing. For deterministic diagnostic graphs we provide the Exact-LIM recursion; for noisy finite-horizon recovery we propose Risk-Budgeted Compatibility Planning (RBCP), which searches a compatibility-aware frontier under a hard worst-case failure constraint. Across incident recovery on abstract microservice topologies and latent-damage navigation in MiniGrid, RBCP improves risk-feasible recovery while satisfying the failure budget. A sham control--cost-matched actions that preserve model incompatibility--eliminates the gain entirely, confirming that the benefit comes from changing which policies are acceptable for which models, not from extra search or additional budget.
- Abstract(参考訳): 不可逆的なリソース枯渇の下では、エージェントは潜在故障モデルと区別するためにリソースを消費したり、システムの状態を変更したり、残りのモデルに共通の許容継続が認められるようにすることができる。
この差別化あるいは均質化の原則は、既存の識別、計画、診断のためのフレームワークが明確でないパスを識別する:事前の定式化は、障害モデルから許容可能なポリシーへのマッピングを、LCPIはエージェント自身の行動の関数として扱う。
我々はこの原理をLCPI(Last-Chance Policy Identification)によって定式化し、エージェントが初期状態ではなく到達した状態において正当性を評価する。
LIM(Last Identibility Margin)は、識別と均質化の境界である。
決定論的診断グラフに対しては,Exact-LIM再帰(exact-LIM recursion)を提供し,ノイズの多い有限水平リカバリ(noisy finite-horizon recovery)に対して,厳しい最悪の障害制約の下で,互換性を意識したフロンティアを探索するリスク予算適合性計画(RBCP)を提案する。
抽象マイクロサービストポロジのインシデントリカバリとMiniGridの潜時障害ナビゲーションでは、RBCPは障害予算を満たすとともに、リスク実現可能なリカバリを改善している。
シャムコントロール(Sham Control)-モデル不適合性を保存するコストがかかるアクション-は完全に利益を排除し、余分な検索や追加予算からではなく、どのモデルに許容されるポリシーを変更することで利益が生まれることを確認します。
関連論文リスト
- Complex Problem Solving in Large Language Models: A Statistical Control Survey and Diagnostic Framework [52.886947585847594]
大規模言語モデル(LLM)による複雑な問題解決は、しばしばより強い推論やより長い生成の問題としてフレーム化される。
しかし、早期のエラー増幅、迅速な脆さ、誤ったコミットメントを修正する失敗を説明するのは難しい。
本調査はCPSを潜在解状態上の逐次推定・決定問題と解釈する。
論文 参考訳(メタデータ) (2026-09-17T18:28:45Z) - LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition [55.572260012037084]
本稿では, LC-ERD (Logic-Consistent Endogenous Reward Decomposition) を紹介する。
モデルの潜在論理エキスパートズ(Latent Logic Expertise)からのコンセンサスを集約することで、変分論理ポテンシャルを導出する。
LC-ERDは、論理の一貫性と正確性の間のトレードオフを明らかにする、堅牢な自己進化パスを提供する。
論文 参考訳(メタデータ) (2026-05-19T07:27:50Z) - Causal Algorithmic Recourse: Foundations and Methods [57.73269033551628]
AIシステムの主な特徴は、個人が否定的な決定を覆す方法のレコメンデーションを提供する能力である。
既存のアプローチでは、recourseの結果を固定単位の反事実として扱う。
我々は、事前および事後結果のプロセスとして、会話をモデル化する因果的枠組みを開発する。
論文 参考訳(メタデータ) (2026-05-12T00:55:19Z) - Right-to-Act: A Pre-Execution Non-Compensatory Decision Protocol for AI Systems [0.0]
我々は,AI生成した決定が実現可能であるかどうかを評価する決定論的で非補償的な事前実行決定層であるRight-to-Actプロトコルを導入する。
高信頼信号が故障した条件をオーバーライドできる補償システムとは異なり、提案手法は厳密な構造制約を強制する。
論文 参考訳(メタデータ) (2026-04-27T08:09:12Z) - Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning [31.629261193485053]
大規模推論モデル(LRM)は、複雑な現実世界のタスクを解くための強力なパラダイムとして登場した。
既存の結果のみのRLVRパイプラインのほとんどは、バイナリの正当性信号にのみ依存しており、モデルの本質的な不確かさをほとんど無視している。
本稿では,メタ認知型エントロピーキャリブレーションフレームワークEGPOを提案する。
論文 参考訳(メタデータ) (2026-02-26T08:40:06Z) - Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification [14.911955979675772]
我々は,グローバルな形状マッチングからサポートカバレッジへパラダイムをシフトさせるアンコレッドポリシー最適化(APO)を提案する。
APOは精度と多様性のトレードオフを破り、Pass@1を大幅に改善します。
論文 参考訳(メタデータ) (2026-02-05T14:41:57Z) - Epistemic Closure and the Irreversibility of Misalignment: Modeling Systemic Barriers to Alignment Innovation [0.0]
人工知能の安全な開発を保証する努力は、しばしばコンセンサスに基づくアライメントアプローチに依存する。
本稿では, 認知, 制度, 社会的, インフラ的フィルタを併用してアライメント提案を不可能にする, てんかん閉鎖機能モデルを提案する。
本稿では,AIシステムによる拒絶・非エンゲージメントパターンのメタ分析を含む,理論的および経験的情報源の両方が支持する重み付きクロージャモデルを提案する。
論文 参考訳(メタデータ) (2025-04-02T18:35:15Z) - Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization [59.758009422067]
モデルベース強化学習における累積報酬に対する不確実性を定量化する問題を考察する。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式(UBE)を提案する。
本稿では,リスク・サーキングとリスク・アバース・ポリシー最適化のいずれにも適用可能な汎用ポリシー最適化アルゴリズムQ-Uncertainty Soft Actor-Critic (QU-SAC)を導入する。
論文 参考訳(メタデータ) (2023-12-07T15:55:58Z) - PAGER: A Framework for Failure Analysis of Deep Regression Models [27.80057763697904]
PAGER (Principled Analysis of Generalization Errors in Regressors) は,深部回帰器の故障を系統的に検出し,特徴付けるフレームワークである。
深層モデルにおけるアンカードトレーニングの原理に基づいて、PAGERは、エピステマ性不確実性と相補的多様体の非整合スコアを統一し、サンプルを異なるリスクレジームに正確に整理する。
論文 参考訳(メタデータ) (2023-09-20T00:37:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。