論文の概要: VIScore: Diagnosing Planning-Relevant Quality in Latent World Models
- arxiv url: http://arxiv.org/abs/2608.11174v2
- Date: Wed, 12 Aug 2026 16:51:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.68867
- Title: VIScore: Diagnosing Planning-Relevant Quality in Latent World Models
- Title(参考訳): VIScore: 潜在世界モデルにおける計画関連品質の診断
- Abstract要約: 潜在空間を等方性ガウス分布に規制することは、世界モデル計画のための安定で情報に最適化された景観を提供する。
SIGReg と VISReg の2つの正規化損失関数を同じ分布対象の異なる性質で比較して検討する。
SIGRegと比較すると、VISRegは中心、スケール、形状の正規化の重みを制御できる柔軟性が高く、バッチサイズが大きいほど分布近似が微妙になる。
符号化された予測器の到達性とキャパシティを定量化する指標であるVeracity-Influence-Sobriety score (VIScore)を提案する。
- 参考スコア(独自算出の注目度): 21.894781659564817
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Regulating the latent space to an isotropic Gaussian distribution provides a stable and information-maximized landscape for world model planning. However, the latent space property and successful planning remain disconnected. We first study this by comparing SIGReg and VISReg, two regularization loss functions with the same distribution target but different properties. Compared with SIGReg, VISReg has more flexibility in controlling the weights of center, scale, and shape regularization, and a larger batch size brings a finer distribution approximation. We find that the former, despite being beneficial in self-supervised learning (SSL), does not help the planning, whereas the latter improves the planning success on out-of-domain (OOD) datasets. This motivates a deep understanding of the factors that correlate with the success rate. Unlike the previous metrics focusing on the encoded latent only, we propose the Veracity-Influence-Sobriety score (VIScore), a metric that quantifies the reachability and capacity of a predictor given the encoded feature, and the hallucination of the searching-based planner. Compared with straightness, physical-state probing, and empowerment, we show that, with the measurement covering encoder, predictor, and planner, VIScore explains the success rate better than the others, as reflected by a strong Spearman correlation. Specifically, VIScore consistently achieves a Spearman correlation over 0.75 on both seen and unseen models and datasets on the cross-task success rate pool. Moreover, VIScore is the only metric that has a calibration error below the constant fit across all testing scenarios, showcasing the importance of these three aspects in planning success. We hope this metric can help future studies on world model design and diagnosis.
- Abstract(参考訳): 潜在空間を等方性ガウス分布に規制することは、世界モデル計画のための安定で情報に最適化された景観を提供する。
しかし、宇宙の潜在資産と計画の成功はいまだに未接続のままである。
まず、SIGReg と VISReg の2つの正規化損失関数を、同じ分布ターゲットを持つが異なる性質で比較する。
SIGRegと比較すると、VISRegは中心、スケール、形状の正規化の重みを制御できる柔軟性があり、より大きなバッチサイズはより詳細な分布近似をもたらす。
前者が自己教師付き学習(SSL)に長けているにも関わらず、後者がドメイン外データセット(OOD)の計画成功を改善するのに対して、後者は計画に役立ちません。
これは成功率と相関する要因を深く理解する動機となります。
符号化されたラテントのみに焦点を当てた以前の指標とは異なり、符号化された特徴が与えられた予測器の到達性とキャパシティを定量化し、探索に基づくプランナーの幻覚化を行う指標であるVeracity-Influence-Sobriety score (VIScore)を提案する。
直接性, 物理的状態探索, エンパワーメントと比較すると, エンコーダ, 予測器, プランナーの計測値とともに, VIScoreはスピアマン相関の強い結果から, 成功率を他よりもよく説明できることを示した。
具体的には、VIScoreは、クロスタスク成功率プール上の見つからないモデルとデータセットの両方において、0.75以上のスピアマン相関を一貫して達成している。
さらに、VIScoreは、すべてのテストシナリオに一定以下のキャリブレーションエラーを持つ唯一のメトリクスであり、計画の成功におけるこれらの3つの側面の重要性を示している。
この指標が将来の世界モデル設計および診断研究に役立つことを願っている。
関連論文リスト
- J-LAW: Joint Localization and Actionable World Modeling via Coupled Latent Factor Graphs [5.78717443304847]
行動条件付き世界モデルは計画のためのコンパクトな潜在力学を学習するが、グローバルなメートル法一貫性は無視する。
J-LAW は、パラメータのポーズ、潜時世界状態、潜時ランドマークの埋め込みを協調的に最適化する結合因子グラフである。
MAP目標の確率的因子として,観察,行動条件予測,メートル法,ポーズ-潜時結合,潜時ループ閉鎖,潜時ランドマーク観察を行った。
論文 参考訳(メタデータ) (2026-06-27T03:39:44Z) - Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most [11.4807141145402]
逆スケーリングでは、より有能なモデルでは、超線形成長を伴う問題を予測し、状態変化の尾リスクを予測し、分布予測が悪化する。
このパターンはForecastBench-Simで、線形制御にマッチした合成SIRの流行を予測し、COVID-19、麻疹、住宅市場、ハイパーインフレの実際のデータセットに複製する。
この逆スケーリングは、LLM予測ベンチマークに共通する単一閾値のメトリクスには現れず、同一出力における能力-正確性関係のサインを逆転させる。
論文 参考訳(メタデータ) (2026-05-21T16:14:33Z) - Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models [5.3565231231826695]
自己教師型学習(SSL)のビジョンとNLPは、時系列への急速な採用を動機付けている。
さまざまな時間的タスクにまたがってSSLが付加する価値である“事前トレーニング配当”を評価するためのフレームワークを確立します。
我々の分析では、事前学習配当は高度に非対称であり、異常検出と分類では最大375%の利得が得られるが、予測には限界がある。
論文 参考訳(メタデータ) (2026-05-19T07:13:20Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models [73.72877445629383]
Interpretability-Guided Data Selection (IGDS) は、まず周波数リコールと干渉フィルタリングによって因果タスクの特徴を識別するフレームワークである。
我々は,数学的推論,要約,翻訳タスクに関するIGDSをGemma-2,LLaMA-3.1,Qwen3モデルで検証する。
論文 参考訳(メタデータ) (2026-04-28T03:16:24Z) - Are We Winning the Wrong Game? Revisiting Evaluation Practices for Long-Term Time Series Forecasting [0.0]
長期時系列予測(LTSF)は、データマイニングと機械学習における中心的な課題として広く認識されている。
我々は、この計量中心の体制は単に不完全であるだけでなく、予測のより広い目的と構造的に不一致であると主張する。
本稿では, 統計的忠実度, 構造的コヒーレンス, 決定レベルの関連性を統合した多次元評価視点を提案する。
論文 参考訳(メタデータ) (2026-03-09T09:37:46Z) - WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning [82.12501258760814]
大規模言語モデル(LLM)ベースのエージェントは、Web情報検索において強力な能力を示している。
Plan anchorは、長期にわたるWeb推論タスクにおいて、最初の推論ステップが下流の動作に不均等に影響を与えている場所です。
計画と実行を分離する2段階のRLフレームワークであるAnchor-GRPOを提案する。
論文 参考訳(メタデータ) (2026-01-06T16:36:40Z) - Continual Action Quality Assessment via Adaptive Manifold-Aligned Graph Regularization [53.82400605816587]
アクション品質アセスメント(AQA)は、ビデオにおける人間の行動を定量化し、スポーツスコアリング、リハビリテーション、スキル評価の応用を支援する。
大きな課題は、現実世界のシナリオにおける品質分布の非定常的な性質にある。
本稿では,進化する分布を扱うための連続学習機能を備えた連続AQA(Continuous AQA)を紹介する。
論文 参考訳(メタデータ) (2025-10-08T10:09:47Z) - Improving Large Language Model Planning with Action Sequence Similarity [50.52049888490524]
本研究では,インコンテキスト学習(ICL)によるモデル計画能力の向上について検討する。
GRASE-DC は2段階のパイプラインで,まず高効率のAS例を再サンプリングし,選択した例をキュレートする。
実験の結果,GRASE-DCは様々な計画タスクにおいて大幅な性能向上を実現していることがわかった。
論文 参考訳(メタデータ) (2025-05-02T05:16:17Z) - Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models [79.2162092822111]
我々は,一連のナビゲーションタスクにおいて,強化学習(RL)と制御に基づく手法を体系的に評価する。
我々は、JEPA(Joint Embedding Predictive Architecture)を使用して、潜在ダイナミクスモデルを使用し、それを計画に使用します。
その結果,モデルベースプランニングではレイアウトが不明瞭になるのに対して,モデルフリーのRLは高品質なデータから恩恵を受けることがわかった。
論文 参考訳(メタデータ) (2025-02-20T18:39:41Z) - From Gradient Flow on Population Loss to Learning with Stochastic
Gradient Descent [50.4531316289086]
SGD(Gradient Descent)は、大規模非ルートモデルの学習方法である。
集団損失のGFが収束すると仮定して、総合的な条件 SGD が収束する。
我々は、凸損失のような古典的な設定だけでなく、Retrieval Matrix sq-rootのようなより複雑な問題に対してもGD/SGDを統一的に解析する。
論文 参考訳(メタデータ) (2022-10-13T03:55:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。