論文の概要: Not All Errors Matter: Decision-Relevant Prediction Error Predicts Planning Quality
- arxiv url: http://arxiv.org/abs/2609.32322v2
- Date: Wed, 30 Sep 2026 00:42:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:25.708229
- Title: Not All Errors Matter: Decision-Relevant Prediction Error Predicts Planning Quality
- Title(参考訳): すべてのエラーが問題ではない: 決定関連予測エラーは計画品質を予測する
- Abstract要約: 世界モデルは一般的に、より正確な予測がより良い決定につながると仮定して、予測エラーによって訓練され、評価される。
また, 異なる状態次元でエラーが発生した場合, 同様の総誤差を持つモデルでは, 計画性能が著しく異なることを示す。
- 参考スコア(独自算出の注目度): 1.0921670230038134
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models are typically trained and evaluated by prediction error, assuming that more accurate predictions lead to better decisions. We show that this assumption can fail because models with similar total error can differ substantially in planning performance when their errors occur on different state dimensions. We introduce Decision-Relevant Prediction Error (DRPE), which measures prediction error on the state dimensions that affect decisions. We also develop an iso-error evaluation protocol that varies error allocation while keeping total error fixed. In a factored gridworld with known state relevance and a standardized planner, we evaluate 55 controlled and learned models across different error levels and allocations. Total prediction error is weakly related to planning success (Spearman $ρ=-0.25$), whereas DRPE is strongly predictive ($ρ=-0.84$; $-0.98$ within the controlled family). Models with only a 1\% difference in total error can differ by 60 percentage points in planning success (97\% vs 37\%). The relevant error also depends on the task, with model rankings reversing across tasks at the same total error. Deeper imagination further amplifies decision-relevant errors, while learned models exhibit systematic bias on rare but decision-critical events. We formalize sufficient conditions under which DRPE correctly ranks models and total prediction error cannot.
- Abstract(参考訳): 世界モデルは一般的に、より正確な予測がより良い決定につながると仮定して、予測エラーによって訓練され、評価される。
この仮定は、同じ総誤差を持つモデルが、異なる状態次元でエラーが発生した場合の計画性能に大きく異なる可能性があるため、失敗する可能性があることを示す。
決定に影響を及ぼす状態次元の予測誤差を計測するDRPE(Decision-Relevant Prediction Error)を導入する。
また,エラーの総修正を保ちながらエラー割り当てを変更できる等エラー評価プロトコルを開発した。
既知の状態関連性と標準化されたプランナーを持つ因子グリッドワールドにおいて、異なるエラーレベルとアロケーションの55の制御および学習モデルを評価する。
総予測誤差は計画の成功と弱い関係にある(Spearman $ρ=-0.25$)が、DRPEは強い予測である(ρ=-0.84$; $-0.98$)。
総誤差の差が 1 % しかないモデルは、計画成功の60 パーセント(97 % 対 37 %)の違いがある。
関連するエラーはタスクにも依存し、モデルランキングはタスク全体で同じエラーで反転する。
より深い想像力は、決定関連エラーをさらに増幅し、学習されたモデルは、稀だが決定クリティカルな事象に体系的なバイアスを示す。
DRPEがモデルと総予測誤差を正しくランク付けできない十分条件を定式化する。
関連論文リスト
- Conformal Agent Error Attribution [12.400746451700945]
本稿では,共形予測(CP)に基づく誤り帰属の枠組みを提案する。
エージェントトラジェクトリなどのシーケンシャルデータ用に設計されたフィルタベースCPの新しいアルゴリズムを提案する。
我々の全体的なアプローチはモデルに依存しないものであり、MASエラーの帰属に対する原則的不確実性層を提供する。
論文 参考訳(メタデータ) (2026-05-07T18:00:07Z) - Rethinking Early Stopping: Refine, Then Calibrate [49.966899634962374]
キャリブレーション・リファインメント分解の新規な変分定式化について述べる。
我々は,校正誤差と精錬誤差が訓練中に同時に最小化されないという理論的,実証的な証拠を提供する。
論文 参考訳(メタデータ) (2025-01-31T15:03:54Z) - Establishing Task Scaling Laws via Compute-Efficient Model Ladders [136.76316239300363]
我々は,事前訓練された言語モデル(LM)のタスク性能を予測するために,タスクスケーリング法則とモデルはしごを開発する。
2つの予測ステップのパラメータ化関数に適合するデータポイントを収集し、2つの対象モデルの予測を行う。
ランク付けされた4つの多重選択タスクにおいて、絶対誤差の2ポイント以内で、両方のターゲットモデルの精度を予測することができる。
論文 参考訳(メタデータ) (2024-12-05T18:21:49Z) - Parameter uncertainties for imperfect surrogate models in the low-noise regime [0.3069335774032178]
我々は、不特定、ほぼ決定論的シュロゲートモデルの一般化誤差を解析する。
遅れた一般化誤差を避けるために、後続分布が全ての訓練点をカバーする必要があることを示す。
これは、原子論的機械学習における1000次元データセットに適用する前に、モデル問題で実証される。
論文 参考訳(メタデータ) (2024-02-02T11:41:21Z) - Automated Classification of Model Errors on ImageNet [7.455546102930913]
モデル選択がエラー分布にどのように影響するかを研究するための自動エラー分類フレームワークを提案する。
我々は、900以上のモデルのエラー分布を網羅的に評価するために、我々のフレームワークを使用します。
特に、重大エラーの一部は、モデルの性能を過小評価しているにもかかわらず、重要なパフォーマンス指標であることを示すトップ1の精度で大幅に低下する。
論文 参考訳(メタデータ) (2023-11-13T20:41:39Z) - Towards Fine-Grained Information: Identifying the Type and Location of
Translation Errors [80.22825549235556]
既存のアプローチでは、エラーの位置と型を同期的に考慮することはできない。
我々はtextbf の追加と textbfomission エラーを予測するために FG-TED モデルを構築した。
実験により,本モデルではエラータイプと位置の同時同定が可能であり,最先端の結果が得られた。
論文 参考訳(メタデータ) (2023-02-17T16:20:33Z) - Model error and its estimation, with particular application to loss
reserving [0.0]
本稿では,特に保険損失の保存に関して,予測誤差について考察する。
パラメータとモデル誤差の見積もりは絡み合っており、それらの解離は少なくとも困難であり、おそらく意味のあるものではない。
論文 参考訳(メタデータ) (2022-09-30T03:53:34Z) - Uncertainty estimation of pedestrian future trajectory using Bayesian
approximation [137.00426219455116]
動的トラフィックシナリオでは、決定論的予測に基づく計画は信頼できない。
著者らは、決定論的アプローチが捉えられない近似を用いて予測中の不確実性を定量化する。
将来の状態の不確実性に対する降雨重量と長期予測の影響について検討した。
論文 参考訳(メタデータ) (2022-05-04T04:23:38Z) - Model Mis-specification and Algorithmic Bias [0.0]
機械学習アルゴリズムは、批判的な決定を伝えるためにますます使われています。
偏見に対する懸念が高まっており、アルゴリズムは異なる人口集団の個人に対して不均一な結果をもたらす可能性がある。
本研究では,グループ間の平均予測誤差の差として偏差を測定する。
論文 参考訳(メタデータ) (2021-05-31T17:45:12Z) - AutoCP: Automated Pipelines for Accurate Prediction Intervals [84.16181066107984]
本稿では、自動予測のための自動機械学習(Automatic Machine Learning for Conformal Prediction, AutoCP)というAutoMLフレームワークを提案する。
最高の予測モデルを選択しようとする慣れ親しんだAutoMLフレームワークとは異なり、AutoCPは、ユーザが指定したターゲットカバレッジ率を達成する予測間隔を構築する。
さまざまなデータセットでAutoCPをテストしたところ、ベンチマークアルゴリズムを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2020-06-24T23:13:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。