論文の概要: PolyStepOR: Learning to Decide Without Optimal Decisions
- arxiv url: http://arxiv.org/abs/2609.32465v1
- Date: Sat, 26 Sep 2026 10:55:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 08:51:37.219732
- Title: PolyStepOR: Learning to Decide Without Optimal Decisions
- Title(参考訳): PolyStepor: 最適な決定をせずに決定することを学ぶ
- Abstract要約: 本稿では,事前計算したオプティマを使わずに,予測者を直接決定コストから訓練するPolySteporを提案する。
PolyStepOR のパーターは予測パラメータを計算し、結果の判断を評価し、最適なトランスポートを使用して低コストな方向を選択できる。
- 参考スコア(独自算出の注目度): 1.376408511310322
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decision-focused learning (DFL) trains predictors for downstream decision quality, but often relies on optimal reference decisions that are expensive to obtain. We present PolyStepOR, which trains directly from realized decision costs without pre-computed optima and extends to in-constraint predictions through repair or infeasibility penalties. To handle piecewise-constant losses, PolyStepOR perturbs predictor parameters, evaluates the resulting decisions, and uses optimal transport to favor lower-cost directions, requiring no derivatives. Without task-specific tuning, PolyStepOR performs strongly on classical optimization benchmarks and competitively on predicted-constraint and real-world problems. Theoretically, we characterize decision-preserving perturbations and boundary detection, bound sensitivity to cost errors, and establish stationarity guarantees for a smoothed objective. PolyStepOR thus replaces optimal reference decisions and derivatives with forward evaluations.
- Abstract(参考訳): 意思決定中心学習(DFL)は、下流の意思決定品質の予測器を訓練するが、しばしば得るのに高価な最適な基準決定に依存する。
提案するPolySteporは, 事前計算をせずに直接, 決定コストからトレーニングし, 補修や実現不可能なペナルティを通じて, 制約内予測にまで拡張する。
PolyStepORのパーターは、一括で一括して損失を処理するため、予測パラメータを計算し、結果の決定を評価し、より低コストな方向を優先するために最適なトランスポートを使用する。
タスク固有のチューニングがなければ、PolySteporは古典的な最適化ベンチマークに強く依存し、予測制約や実世界の問題に競合する。
理論的には、決定保存の摂動と境界検出、コストエラーに対する感度の制限、スムーズな目的に対する定常性保証の確立を特徴付ける。
このため、PolyStepORは最適な参照決定とデリバティブを前方評価に置き換える。
関連論文リスト
- Learning Polyhedral Conformal Sets for Robust Optimization [10.504036065018216]
本稿では,頑健な最適化目標に適した不確実性集合を学習する,意思決定対応型コンフォメーションフレームワークを提案する。
提案手法は,データ駆動型超平面による多面体集合のフレキシブルなファミリーをパラメータ化し,誘導されたロバスト損失を直接最小化することでそれらの幾何学を学習する。
オラクル決定に対する準最適ギャップの有限サンプルカバレッジ保証とバウンダリを提供する。
論文 参考訳(メタデータ) (2026-05-08T21:39:41Z) - When Robustness Meets Conservativeness: Conformalized Uncertainty Calibration for Balanced Decision Making [8.234618636958462]
本稿では,誤発見と後悔の保証を無分布で有限サンプルで提供する新しいフレームワークを提案する。
提案手法は,不規則なフロンティアを追従する有効な推定器を構築する。
これらの結果は、ロバスト性選択を導くための、最初の原則付きデータ駆動手法を提供する。
論文 参考訳(メタデータ) (2025-10-09T03:38:17Z) - Estimating Covariance for Global Minimum Variance Portfolio: A Decision-Focused Learning Approach [27.791742749950203]
決定中心学習(DFL)は、予測誤差ではなく、決定品質を直接最適化する手法である。
DFLに基づく手法は、常に優れた意思決定性能を提供することを示す。
論文 参考訳(メタデータ) (2025-08-14T16:00:52Z) - Online Decision-Focused Learning [74.3205104323777]
意思決定中心学習(DFL)は、意思決定タスクで予測出力が使用されるモデルのトレーニングパラダイムとして、ますます人気が高まっている。
本稿では,目的関数を規則化し,その相違を解消し,非最適関数を克服する方法を検討する。
また、クナップサック実験におけるアルゴリズムの有効性を示し、2つの標準ベンチマークを上回りました。
論文 参考訳(メタデータ) (2025-05-19T10:40:30Z) - End-to-End Learning for Fair Multiobjective Optimization Under
Uncertainty [55.04219793298687]
機械学習における予測-Then-Forecast(PtO)パラダイムは、下流の意思決定品質を最大化することを目的としている。
本稿では,PtO法を拡張して,OWA(Nondifferentiable Ordered Weighted Averaging)の目的を最適化する。
この結果から,不確実性の下でのOWA関数の最適化とパラメトリック予測を効果的に統合できることが示唆された。
論文 参考訳(メタデータ) (2024-02-12T16:33:35Z) - Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization [59.758009422067]
モデルベース強化学習における累積報酬に対する不確実性を定量化する問題を考察する。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式(UBE)を提案する。
本稿では,リスク・サーキングとリスク・アバース・ポリシー最適化のいずれにも適用可能な汎用ポリシー最適化アルゴリズムQ-Uncertainty Soft Actor-Critic (QU-SAC)を導入する。
論文 参考訳(メタデータ) (2023-12-07T15:55:58Z) - A Note on Task-Aware Loss via Reweighing Prediction Loss by
Decision-Regret [11.57423546614283]
我々は予測最適化の意思決定対応版を提案する。
コストの(非重みのない)パイロット推定器が犯した決定の後悔による予測誤差を再検討する。
このアプローチは"予測を最適化する"フレームワークよりも改善する可能性があることを示す。
論文 参考訳(メタデータ) (2022-11-09T18:59:35Z) - Learning MDPs from Features: Predict-Then-Optimize for Sequential
Decision Problems by Reinforcement Learning [52.74071439183113]
我々は、強化学習を通して解決された逐次決定問題(MDP)の文脈における予測列最適化フレームワークについて検討した。
2つの重要な計算課題は、意思決定中心の学習をMDPに適用することである。
論文 参考訳(メタデータ) (2021-06-06T23:53:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。