論文の概要: When Low Prediction Error Misleads Planning: Diagnosing Representation, Dynamics, and Decision Failures in Latent World Models
- arxiv url: http://arxiv.org/abs/2610.05550v1
- Date: Sun, 04 Oct 2026 21:23:48 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:57:50.206123
- Title: When Low Prediction Error Misleads Planning: Diagnosing Representation, Dynamics, and Decision Failures in Latent World Models
- Title(参考訳): 低予測誤差が計画を誤る場合:潜在世界モデルにおける表現・ダイナミクス・決定失敗の診断
- Abstract要約: 潜在世界モデルの予測誤差を支配しているコンポーネントは、修復がアクション選択を最も改善するコンポーネントである必要はない。
動作シーケンスを同一の物理スタートから比較し、エンドポイントエラーを候補プールセンターとアクション相対応答に分離する。
これら6つの細胞において、行動関連応答のみを補正するオラクルは、中心のみを補正するものよりも、より優れた物理ランク相関と上位30のエリート品質をもたらす。
- 参考スコア(独自算出の注目度): 4.378939691762539
- License:
- Abstract: The component that dominates a latent world model's prediction error need not be the one whose repair most improves action selection. We show this by comparing action sequences from identical physical starts and separating endpoint error into a candidate-pool center and action-relative responses. Across four model families and four tasks, a confirmation pool of 256 new starts per task and 300 shared candidates per start shows that center error dominates MSE in 14/16 model-task cells. Yet in six of these cells, an oracle that corrects only the action-relative responses yields better physical rank correlation and top-30 elite quality than one that corrects only the center, while leaving more latent MSE (family-wise corrected intervals). The preference differs across the evaluated settings: a separate LeWorldModel (LeWM) study that executes oracle-selected actions favors center repair on PushT and on Reacher with a render-matched goal. Matched-candidate tests localize ordering loss: for LeWM, encoding realized endpoints raises physical Spearman from 0.464 to 0.975 on that Reacher setting and from 0.193 to 0.631 on PushT (64 starts per task), while Cube's encoded-goal cost remains uninformative. A 72-run objective study improves selected response diagnostics, while incremental closed-loop planning gains remain unconfirmed. These results separate error magnitude from the decision effects of oracle correction and motivate evaluating representation, prediction, and planning as separate stages.
- Abstract(参考訳): 潜在世界モデルの予測誤差を支配しているコンポーネントは、修復がアクション選択を最も改善するコンポーネントである必要はない。
動作シーケンスを同一の物理スタートから比較し、エンドポイントエラーを候補プールセンターとアクション相対応答に分離する。
4つのモデルファミリーと4つのタスクにまたがって、タスク毎に256の新しいスタートと300の共有候補の確認プールは、センターエラーが14/16モデルタスクセルでMSEを支配していることを示している。
しかし、これらの6つの細胞では、行動関連応答のみを補正するオラクルは、中央のみを補正するのに対して、身体的ランク相関と上位30のエリート品質を向上させ、より潜伏したMSE(家族的に補正された間隔)を残している。
分離されたLeWorldModel(LeWM)調査では、PushTとReacherのレンダリングマッチした目標に対する中心的な修正が好まれている。
一致候補テストは順序付け損失をローカライズする: LeWMでは、エンコードされたエンドポイントは、Reacherの設定では0.464から0.975に、PushTでは0.193から0.631に、Cubeのエンコードされたゴールコストは相変わらず非形式的である。
72ランの客観的研究は、選択された応答診断を改善する一方、漸進的な閉ループ計画ゲインは未確認のままである。
これらの結果は、オラクルの修正による決定効果から誤りの大きさを分離し、表現、予測、計画を別々の段階として評価する動機付けとなる。
関連論文リスト
- Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training [45.727227890697556]
我々は,9,961のソースタスクから50,228のエラー診断ペアからなるエージェントエラーデータセット(AED)を紹介した。
5段階のAgenic Error-to-Trainingパイプラインは自然の故障を収集し、診断と修正案を生成し、記録された証拠と照合する。
アクタートレーニングのレシピの比較において、アクションオンリーの修復トレーニングは成功オンリーのトレーニングよりもWebShop-liteの方が6.67ポイント高い。
論文 参考訳(メタデータ) (2026-09-30T16:40:22Z) - AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control [31.53438833300694]
対実的MPCのための行動識別型共同埋め込み世界モデルであるAD-WMを紹介する。
一致したLeWMベースラインに対して,AD-WMはハードスタート成功率を3.7%から52.0%に改善することを示した。
また,実際の予測誤差と銀行全体の行動ランクが閉ループ成功順序に従わないことを示す。
論文 参考訳(メタデータ) (2026-09-24T17:59:41Z) - Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference [13.137699166830322]
大規模言語モデルからのグレディ復号は、一般に決定論的として扱われる。
同一のモデル,プロンプト,デコードアルゴリズムは同一のハードウェア上で,BF16とFP16の異なる出力を生成する。
実験により,22層に蓄積したボディーエラーは,浮動小数点数と浮動小数点数とを区別しないことがわかった。
論文 参考訳(メタデータ) (2026-09-22T15:54:16Z) - VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control [57.5995346750474]
VA-Benchを導入し、完全なオブザーバ・レアソン・アクト・リビジョンループを評価する。
汎用MLLMは、RGBのみのデモンストレーションから手続き的コンテキストを学習する。
モデルには特権オブジェクトのポーズ、オラクルの軌跡、学習されたアクションヘッドは含まれない。
論文 参考訳(メタデータ) (2026-09-17T01:24:51Z) - INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models [10.370234132981677]
INTACT(Intent-To-ACTion)は、アクションラベル付き、報酬なしの軌道をインテント・トゥ・アクションインターフェースに変換するエンドツーエンドのJEPAである。
各トランジションは物理的インテント$z_t+1-z_t$を提供し、将来のゴールはデプロイメントインテント$operatornamesg(z_g)-z_t$を提供する。
公式の4つのLeWMタスクでは、ゼロサーチモデルは85.78%、100.00%、97.67%、97.89に達した。
論文 参考訳(メタデータ) (2026-07-28T17:59:40Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution [0.0]
予測市場は、不確実な出来事を予測するために集合的なインテリジェンスを集約する。
既存のオラクルシステムは、高速だが不安定な自動化と、正確だがコストのかかる人間の仲裁とをトレードオフする。
マルチエージェントLLMアーキテクチャが単一モデルベースラインよりもオラクル分解能を向上できるかどうかを評価する。
論文 参考訳(メタデータ) (2026-05-29T03:44:19Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models [74.40683913645731]
Zero-shot Multi-label Recognition (MLR) with Vision-Language Models (VLMs) は、トレーニングデータ、モデルチューニング、アーキテクチャの変更なしに重要な課題に直面している。
我々の研究は、VLMをブラックボックスとして扱い、トレーニングデータや地上の真実を使わずにスコアを活用する新しいソリューションを提案する。
これらのプロンプトスコアの分析により、VLMバイアスとAND'/OR信号の曖昧さが明らかになり、特に、最高スコアは2番目に高いスコアに比べて驚くほど低い。
論文 参考訳(メタデータ) (2025-02-24T07:15:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。