論文の概要: How Should World Models Be Evaluated? A Decision-Making-Centric Position
- arxiv url: http://arxiv.org/abs/2606.15032v1
- Date: Sat, 13 Jun 2026 00:21:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:32.659225
- Title: How Should World Models Be Evaluated? A Decision-Making-Centric Position
- Title(参考訳): 世界モデルはどのように評価されるべきか? 意思決定中心の位置
- Authors: Yang Yu, Shiyuan Zhang, Yifei Sheng, Haoxiang Ren, Haoxin Lin,
- Abstract要約: 世界モデルは、現代のAIにおいて、急速に中心的な抽象化の1つになっています。
近年の研究では、映像リアリズム、知覚的類似性、指示従順、身体的妥当性、政策ランク付け、実行可能性、計画成功、下流政策改善を計測している。
本稿は、中心的な問題は利用に依存していると論じる。
- 参考スコア(独自算出の注目度): 5.773605711982218
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models have rapidly become one of the central abstractions in modern AI. Yet the term now refers to several different objects: action-conditioned environment models, latent imagination models, future-video predictors, interactive neural simulators, latent predictive representations, and synthetic-data engines. Evaluation has broadened with the term. Recent papers measure video realism, perceptual similarity, instruction following, physical plausibility, policy ranking, executability, planning success, and downstream policy improvement. The result is not only metric diversity but also a recurring problem of claim/evidence mismatch: papers frequently make a stronger claim about what their model is useful for than their evaluation can actually establish. This paper surveys the recent literature and argues that the central question is use-dependent. When a model is presented as a world model for embodied decision-making, a more decisive issue is not whether it generates visually compelling videos, but whether it supports reliable counterfactual reasoning, policy evaluation, planning, and policy optimization under intervention, policy-induced distribution shift, and long-horizon rollout. We organize the literature using an L0--L7 ladder that ranges from visual plausibility to policy optimization utility. In our interpretation, L0--L3 are most naturally read as diagnostics of generated artifacts, L4 is often the first genuinely interventional test, and L5--L7 provide the most direct evidence of decision usefulness. Based on this diagnosis, we propose a decision-making-centric evaluation framework and a benchmark protocol that foreground counterfactual action fidelity, closed-loop rollout validity, reward/value prediction, policy-ranking agreement, optimization lift, model exploitability, and uncertainty calibration.
- Abstract(参考訳): 世界モデルは、現代のAIにおいて、急速に中心的な抽象化の1つになっています。
アクション条件付き環境モデル、潜時想像モデル、未来映像予測モデル、対話型ニューラルシミュレータ、潜時予測表現、合成データエンジンである。
評価は用語によって拡大した。
近年の研究では、映像リアリズム、知覚的類似性、指示従順、身体的妥当性、政策ランク付け、実行可能性、計画成功、下流政策改善を計測している。
その結果は、計量的多様性だけでなく、主張/証拠のミスマッチの繰り返しの問題でもある。
本稿では,近年の文献を概観し,その中心的課題は利用依存であると主張している。
モデルが具体的意思決定のための世界モデルとして提示される場合、より決定的な問題は、視覚的に魅力的なビデオを生成するかどうかではなく、信頼性の高い対実的推論、政策評価、計画、介入による政策最適化、政策による流通シフト、長期展開をサポートするかどうかである。
我々は、視覚的可視性からポリシー最適化ユーティリティまで幅広いL0-L7ラグを用いて文献を整理する。この解釈では、L0-L3は生成したアーティファクトの診断として最も自然に読まれており、L4は最初の真の介入テストであり、L5-L7は決定の有用性の最も直接的な証拠である。
本報告では, 意思決定中心評価フレームワークとベンチマークプロトコルを提案する。このフレームワークは, 対実的行動忠実性, 閉ループロールアウト妥当性, 報酬/価値予測, ポリシーレベルの合意, 最適化リフト, モデルエクスプロイラビリティ, 不確実性校正を基礎とする。
関連論文リスト
- Can Revealed Preferences Clarify LLM Alignment and Steering? [23.175180848107093]
LLMの観測した選択が最適化するインプリート嗜好を推定するための経験的パイプラインを提案する。
提案手法は,モデルが一貫したゴール指向の振る舞いをするかどうかの厳密な評価を可能にすることを示す。
論文 参考訳(メタデータ) (2026-05-08T23:26:35Z) - Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond [209.35045331678043]
2つの軸に沿って組織された「レベルx法」の分類を導入します。
第一に、3つの能力レベルを定義している: 1段階の局所遷移演算子を学ぶL1 Predictor、それらをドメインの法則を尊重する多段階のアクション条件付きロールアウトに構成するL2 Simulator、新しいエビデンスに対して予測が失敗すると自己のモデルを自動で修正するL3 Evolver。
我々は400以上の作品を合成し、モデルに基づく強化学習、ビデオ生成、WebおよびGUIエージェント、マルチエージェント社会シミュレーション、AIによる科学的発見にまたがる100以上の代表システムを要約する。
論文 参考訳(メタデータ) (2026-04-24T17:48:47Z) - MANTA: Multi-turn Assessment for Nonhuman Thinking & Alignment [0.1452394725421793]
MANTAは、Inspect AIプラットフォーム上に構築された動的マルチターン評価フレームワークである。
Clude-sonnet-4-20250514およびopenai/gpt-4oの評価を行った。
また, LLM-as-judge 評価において, 体系的フォーマットバイアスを示す制御された4要素法であるSTYLEJUDGEを提案する。
論文 参考訳(メタデータ) (2026-04-18T19:51:32Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking [50.72154186522052]
大規模言語モデル(LLM)は情報処理をリアクティブに行う能力に優れるが、仮説的未来を体系的に探索する能力に欠ける。
提案するWiA-LLMは,LLMにプロアクティブな思考能力を持たせる新しいパラダイムである。
複雑なマルチプレイヤーゲーム環境であるHonor of KingsにおけるWiA-LLMを検証する。
論文 参考訳(メタデータ) (2025-09-05T04:05:27Z) - Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning [33.27410930782468]
脳科学的な知見によって導かれる新たな研究の方向性を紹介する。
本稿では,3つの大規模言語モデル (LLM) と,RL(Reinforcement Learning) を用いた最先端の大規模視覚言語モデル (LVLM) を代表的なポリシー勾配アルゴリズムを用いて微調整する。
その結果、RLファインチューニングは、理想的な設定下でのベースライン推論を改善するが、3つの非理想シナリオ全てで性能は著しく低下することがわかった。
論文 参考訳(メタデータ) (2025-08-06T19:51:29Z) - Wait, that's not an option: LLMs Robustness with Incorrect Multiple-Choice Options [2.1184929769291294]
本研究は,LLMの命令追従能力と批判的推論とのバランスを評価するための新しいフレームワークを提案する。
トレーニング後のアライメントモデルでは,無効なオプションの選択がデフォルトとなることが多いが,ベースモデルでは,モデルサイズに合わせてスケールするリファリング機能が改善されている。
さらに、同様の指示追従バイアスを示す並列人間の研究を行い、これらのバイアスがアライメントに使用される人間のフィードバックデータセットを通してどのように伝播するかを示唆した。
論文 参考訳(メタデータ) (2024-08-27T19:27:43Z) - Dual policy as self-model for planning [71.73710074424511]
エージェントの自己モデルとして決定をシミュレートするために使用されるモデルについて述べる。
現在の強化学習アプローチと神経科学にインスパイアされた我々は、蒸留政策ネットワークを自己モデルとして利用することの利点と限界を探求する。
論文 参考訳(メタデータ) (2023-06-07T13:58:45Z) - Mismatched No More: Joint Model-Policy Optimization for Model-Based RL [172.37829823752364]
本稿では,モデルとポリシーを共同でトレーニングする単一目的について提案する。
我々の目標は、期待されるリターンのグローバルな低い境界であり、この境界は特定の仮定の下で厳密になる。
結果のアルゴリズム(MnM)は概念的にはGANと似ている。
論文 参考訳(メタデータ) (2021-10-06T13:43:27Z) - Counterfactual Learning of Stochastic Policies with Continuous Actions [42.903292639112536]
コンテクストとアクションを融合したカーネルを組み込んだモデリング戦略を導入する。
対実学習の最適化の側面が重要であることを実証的に示す。
実世界のログシステムにおけるオフラインポリシーの評価プロトコルを提案する。
論文 参考訳(メタデータ) (2020-04-22T07:42:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。