論文の概要: Reading the Room: Implicit Confusion Encoding in Recurrent World Model States
- arxiv url: http://arxiv.org/abs/2608.21582v1
- Date: Fri, 21 Aug 2026 19:32:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.29601
- Title: Reading the Room: Implicit Confusion Encoding in Recurrent World Model States
- Title(参考訳): 部屋を読む: 連続した世界モデル状態における暗黙のコンフュージョンエンコーディング
- Abstract要約: 我々は、予測エラーのトラックの混乱を軽減するために、繰り返し発生する隠れ状態$h_t$を示す。
これは、新しい入力をフラグするアンサンブルの不一致と、現在悪い予測をフラグするリコンストラクションエラーとを機能的に区別している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models built on the RSSM architecture, such as DreamerV3, keep a recurrent hidden state $h_t$ trained only to reduce prediction error. We show this state also tracks its own confusion, hiding in plain sight: nearly orthogonal to $h_t$'s directions of greatest variance, invisible to any variance-based method. It is functionally distinct from ensemble disagreement, which flags new inputs, and reconstruction error, which flags bad predictions right now. On a test holding prediction error fixed while confusion varies, a linear probe on $h_t$ finds the signal (AUROC 0.72, 5 runs), while an ensemble baseline scores below chance. A discounted count of recent high-error steps explains 80% of the probe's output ($R^2=0.80$). We confirm the signal is causally used, not merely present, by editing $h_t$ directly and watching behaviour change, including a check using real values from other trajectories instead of synthetic edits. Its geometry and closed form generalize across three control tasks; the decisive dissociation test itself holds cleanly on only one, and its practical use, deciding when to check reality instead of trusting imagination, generalizes to only two of the three tasks.
- Abstract(参考訳): DreamerV3のようなRSSMアーキテクチャ上に構築されたワールドモデルは、予測エラーを減らすためだけに、リカレントなシークレットステート$h_t$をトレーニングし続ける。
ほぼ直交する$h_t$の最大分散方向は、どんな分散ベースのメソッドにも見えない。
これは、新しい入力をフラグするアンサンブルの不一致と、現在悪い予測をフラグするリコンストラクションエラーとを機能的に区別している。
混乱が生じながら固定されたテスト保持予測誤差では、$h_t$の線形プローブが信号(AUROC 0.72, 5 run)を見つけ、アンサンブルベースラインは確率以下となる。
最近の高リスクステップの割引数では、プローブの出力の80%(R^2=0.80$)が説明されている。
我々は、この信号が単に存在するだけでなく、$h_t$を直接編集して行動変化を観察することで因果的に使用されていることを確認した。
その幾何学と閉じた形式は3つの制御タスクにまたがって一般化され、決定的解離テスト自体が1つだけをきれいに保持し、その実践的利用によって、想像力を信頼するのではなく現実をいつチェックすべきかを判断し、3つのタスクのうち2つに一般化する。
関連論文リスト
- Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [66.44527094471619]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - Located but Not Releasable: Silent Gate Inversion and Bounded Linear Release [0.0]
完全なパイプライン -- 検出、ローカライズ、リリース -- を、25.7Mトランス上で完全に事前登録されたストレステストに送信します。
中層層の観測エビデンスチャネルでの干渉は、他の抑圧された世界における標的の挙動を復元する。
配当外のキャリブレーションをゼロにするために調整された検出器は、6.9-7.3%の配当前の世代と、実際にそれを必要とする2,400世代のうちゼロにトリガーをトリガーする。
論文 参考訳(メタデータ) (2026-08-12T09:04:54Z) - Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors [51.56484100374058]
自動回帰モデルは、長時間のロールアウトでエラーを蓄積しますが、デプロイ時には、それを測定するための基本的な真実はありません。
我々は、方向フラグを介して動的システムを前方または後方にステップする単一の条件付き潜在拡散モデルを訓練する。
この双方向性は測定不要なテスト時間誤差信号を提供することを示す。
論文 参考訳(メタデータ) (2026-08-01T13:49:46Z) - Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate [0.0]
混合精度量子化は、モデルのどの部分がより高い精度を維持するかを決定する必要がある。
本研究は, 層単位での定量化による損失を, 層ごとの感性や, 対方向の感性から再現可能であることを示す。
本稿では, 測定値の差分プロファイルである$f(S)=cbigl (1-prod_iin S (1-a_i)bigr)$を, その$L$適合ブレークレートから数パーセント以内まで再現する。
論文 参考訳(メタデータ) (2026-07-14T02:08:33Z) - Interaction Scaling: Grounding the Third Axis of Test-Time Compute [0.33451037881913753]
一つの変数がこの第3の軸を接地として支配し、ループの両側に保持しなければならないと論じる。
固定トークン予算でのハードコーディングタスクでは、推論のみとベストオブNの両方をサンプリングする。
提案手法は, ラン・ツー・ラン分散を伴わず, 100%パスレートに到達した。
論文 参考訳(メタデータ) (2026-07-13T14:22:06Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Epistemic Observability in Language Models [0.0]
製造時に高い信頼性を報告できるモデルがあることがわかりました。
正式な仮定では、これは能力ギャップではなく観察的なギャップである。
我々は,計算副産物を輸出することで不合理性から逃れるテンソルインタフェースを構築した。
論文 参考訳(メタデータ) (2026-03-20T21:59:34Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Probing for Arithmetic Errors in Language Models [86.8227317662622]
言語モデルの内部アクティベーションは、算術誤差を検出するために使用できる。
単純なプローブはモデルが予測した出力と正解の両方を隠蔽状態から正確に復号できることを示す。
モデル精度を90%以上の精度で予測する軽量エラー検出器を訓練する。
論文 参考訳(メタデータ) (2025-07-16T16:27:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。