論文の概要: The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom
- arxiv url: http://arxiv.org/abs/2608.10145v1
- Date: Mon, 10 Aug 2026 19:00:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.790327
- Title: The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom
- Title(参考訳): 結果を決定する評価プロトコル: TwoRoom上でのLeWorldModelの独立した再現
- Abstract要約: LeModelは、予測損失と1つの反崩壊正規化器を備えた潜在世界モデルを訓練する。
約25ドル(約2万5000円)のレンタルコンピュータ上で、独立した再実装によってこれを再現し、1台のラップトップCPU上で全ての評価を行う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LeWorldModel trains a latent world model with a prediction loss and a single anti-collapse regulariser, and reports approximately 87% of goals reached on TwoRoom, its simplest diagnostic environment. We reproduce that result by independent reimplementation on roughly $25 of rented compute, with all evaluation on one laptop CPU. We reach 94.0% at the repository's evaluation goal offset, against 84.0% for the authors' own released checkpoint measured under our protocol on identical episodes, and we reproduce the reported representation result directly (position probe Pearson r = 0.9988 against a reported 0.996). Reaching that point required four conventions that determine the outcome and appear in no released configuration file: dense action gathering across a frameskip block, a programmatically-set action-encoder width, ImageNet pixel normalisation, and action z-scoring. A reproducer following the released configurations alone obtains a model whose predictor cannot converge. The evaluation protocol is itself contested by the released material. The paper's appendix and the repository's configuration specify different goal offsets and step budgets; on the authors' own weights these yield 14.0% and 84.0%, and only the configuration's values reproduce the reported figure. On fifty identical episodes, changing nothing but how the goal is constructed moves that checkpoint from 84.0% to 8.0%. Two findings generalise. One-step prediction accuracy does not predict long-horizon planning success: across three checkpoints spanning a sevenfold range in prediction error, including the authors' own, it orders short-horizon success monotonically and fails to order long-horizon success at all. And a batch normalisation layer inflated our reported validation loss by up to a factor of 300, concealing a training loss that was flat throughout.
- Abstract(参考訳): LeWorldModelは、予測損失と単一の反崩壊レギュラーを備えた潜在世界モデルを訓練し、最も単純な診断環境であるTwoRoomで達成された目標の約87%を報告している。
約25ドル(約2万5000円)のレンタルコンピュータ上で、独立した再実装によって、その結果を再現し、1台のラップトップCPU上で全ての評価を行う。
評価目標のオフセットで94.0%に達し、同一エピソードのプロトコルで測定された著者自身の公開チェックポイントの84.0%に対して、報告された表現結果を直接再現する(報告された0.996に対してピアソンr=0.9988)。
フレームスキップブロックに集まった密集したアクション、プログラムでセットされたアクションエンコーダ幅、ImageNetピクセルの正規化、アクションz-scoringである。
解放された構成に従う再生器は、予測器が収束できないモデルを得る。
評価プロトコル自体は、解放された材料によって競合される。
論文の付録とリポジトリの設定は、異なる目標オフセットとステップ予算を規定しており、著者自身の重み付けでは、これらの利得は14.0%と84.0%であり、構成値のみが報告された図を再現している。
50回の同じエピソードでは、ゴールの作り方以外は何も変化せず、チェックポイントは84.0%から8.0%に移動している。
2つの発見が一般化される。
1ステップの予測精度は長期計画の成功を予測しない: 著者自身を含む予測誤差の7倍の範囲にまたがる3つのチェックポイントにおいて、短水平計画の成功を単調に命令し、長期計画の成功を命令できない。
そして、バッチの正規化レイヤは、報告された検証損失を最大300倍に膨らませ、トレーニング損失を隠蔽しました。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - Modeling What Changes: Sparse, Residual World Models for Object-Centric Manipulation [0.0]
スパース/残留モデルは高密度多層パーセプトロンの2.5倍から4.6倍の精度で次状態のポーズを予測する。
自動回帰ロールアウトでは誤差がはるかに少なくなり、密度の高いモデルがドリフトする間、動きのないフロアを抱きしめる。
世界全体を予測するのではなく、どのような変化をモデル化するかは、オブジェクト中心の物理的なAIに対して単純で効果的なバイアスとなります。
論文 参考訳(メタデータ) (2026-09-02T03:20:09Z) - Does Fault Localization Beat a Fresh Attempt? A Placebo-Controlled Study of Test-Guided Code Repair [0.0]
フォールトローカライゼーションは、失敗したテストが意味するステートメントにコードモデルの修復に集中することができるが、ターゲットの編集が成功するのは、それが小さいためだけである。
我々はこれらの説明を3つの腕で分け、同じ失敗候補に当てはめます。
3つのフリーズ26-32Bモデル、3つのベンチマーク、488の候補が失敗し、3つの結果が続いた。
論文 参考訳(メタデータ) (2026-09-01T07:48:51Z) - A Calibration Audit of Confidence in Feed-Forward 3D Reconstruction [45.496856835431885]
3D再構成モデルは、下流システムが信頼性信号として読み取る画素当たりの信頼を出力する。
4つの特性に対する信頼度、エラーのランク付けの正確さ、そのレベルが平均的に正しいかどうか、信頼範囲を越えて保持されているかどうか、そしてその間隔が真実をカバーしているかどうか。
信頼度は誤差をよくランク付けするが、予測された不確実性は、トレーニングの正確さではない条件下で読み取られると低すぎる。
論文 参考訳(メタデータ) (2026-08-30T10:21:34Z) - When Graph-JEPA Learns the Wrong Thing: Diagnosing and Repairing Category-Conditional Collapse [3.0255780640228984]
共同埋め込み予測アーキテクチャは線形探索と有効ランクによってほぼ普遍的に選択される。
本報告では,表現中に使用可能なインスタンス情報がゼロである場合に,両者が正常に読まれる事例を報告する。
Graph-JEPAは、サブグラフの残りの側面から1つのマスクされたアスペクトを予測し、線形プローブ精度0.871と有効ランク18-47を達成する。
再現性監査とターゲットゲートを備えたハーネスをリリースする。
論文 参考訳(メタデータ) (2026-08-20T19:22:49Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - One Ruler: A Same-Hands Re-Evaluation of Bivariate Causal Direction on Tuebingen, with a Parameter-Free Compression Baseline [0.0]
我々は、同じ102ペア上で、すべてのメソッドが私たちによって実行される、Tuebingenの因果効果ペアを再評価する。
クリーンな参照ポイントとして、意図的に最小限のベースラインを導入します。
共通の統治者の下では、その地位は文学と大きく異なる。
論文 参考訳(メタデータ) (2026-06-22T15:43:19Z) - Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents [11.233308795768465]
VIGILは、端末のコミットメントを独立して測定できる評価フレームワークである。
VIGILのデフォルトプロトコルでは、エージェントはエゴセントリックなRGBのみを観察し、アクション・サクセス・シグナルを受信せず、各エピソードは、隠された世界状態に対して決定論的にチェックされたセマンティック・レポートで終了しなければならない。
これにより、ワールドステートコンプリート(W)とベンチマーク成功(B)の2つのスコアが得られます。
論文 参考訳(メタデータ) (2026-05-09T07:24:07Z) - When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models [2.064923532131528]
デプロイされた言語モデルは、正しいものとフォーマットに準拠した出力を生成する必要がある。
本稿では,GSM8KとMATHという2つの数学的ベンチマークを用いて,この構造化出力信頼性ギャップについて検討する。
対象モデルへのブラックボックスAPIアクセスのみを必要とする反復的なシステムプロンプトであるAloLabを開発した。
論文 参考訳(メタデータ) (2026-05-04T09:07:44Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making [38.75183725659772]
大規模言語モデル(LLM)は、複雑な推論を必要とするタスクにますます使われている。
モデル動作の理解と信頼性向上には,内部プロセスの測定が不可欠である,と我々は主張する。
計画,修正,資源制約のある意思決定という3つの中核的な側面に沿ってLCMを評価する枠組みを導入する。
論文 参考訳(メタデータ) (2025-06-13T17:59:10Z) - Confidence Adaptive Anytime Pixel-Level Recognition [86.75784498879354]
任意の時間推論は、いつでも停止される可能性のある予測の進行を行うモデルを必要とする。
我々は,任意のピクセルレベルの認識に対して,最初の統一とエンドツーエンドのモデルアプローチを提案する。
論文 参考訳(メタデータ) (2021-04-01T20:01:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。