論文の概要: Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix
- arxiv url: http://arxiv.org/abs/2607.06925v1
- Date: Wed, 08 Jul 2026 02:38:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.265431
- Title: Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix
- Title(参考訳): コンパクト世界モデルにおける接地空間関係--指導漏れとゴールフリー・ダイナミクス・フィックス-
- Abstract要約: 目標条件付き予測器は、精度0.90$の精度で到達するが、これは知覚ではなく、インテンストラクションの書き起こしである。
ゴールを破って(0.90!to!0.27$, three seed)チャンスを逃し、予測アンカーに9.5%の時間を与える。
診断は、修正を規定する: ゴールを(プランナーのコストに属する)ダイナミクスから遠ざけ、エンフレッドパスを監督する。
- 参考スコア(独自算出の注目度): 46.122203287541005
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Compact world models that condition on a language goal promise to ground relations such as ``put the red block left of the blue block'' using a sparse set of explicit \emph{reference anchors}. We ask when such references actually ground a relation, and identify a trap: a goal-conditioned predictor reaches a striking $0.90$ relation-readout accuracy, yet this is \emph{instruction transcription}, not perception. Withholding the goal collapses it to chance ($0.90\!\to\!0.27$, three seeds) and a counterfactual instruction makes the predicted anchors follow the \emph{false} instruction $94.5\%$ of the time (true scene $2.3\%$; $N{=}256$). Tested across three settings and a within-task ablation, our central claim characterizes the confound: \textbf{instruction leakage occurs when the scored quantity is transcribable from the instruction (when the instruction names the answer) and is essentially independent of how predictive the non-instruction inputs are.} Our tabletop and the external BabyAI benchmark leak, whereas a Language-Table forward-dynamics world model whose instruction names \emph{referents} does not, until the instruction is augmented to name the direction; and degrading the action never increases leakage, the opposite of what predictor-competition predicts. The diagnosis prescribes the fix: keep the goal out of the dynamics (it belongs to the planner's cost) and supervise the \emph{read} path, recovering genuine, instruction-independent grounding ($0.88$, identical with and without the goal). The detection protocol and remedy apply to any goal-conditioned world model whose instruction names the scored quantity.
- Abstract(参考訳): コンパクトな世界モデルは、言語目標の条件が、明示的な 'emph{reference anchors} のスパースセットを使用して '`put the red block left of the blue block''' のような接地関係を約束する。
目標条件付き予測器は、印象的な$0.90$の関係読出精度に達するが、これは認識ではなく、‘emph{instruction transcription}’である。
ゴールを守らないと、チャンス(0.90\!
やれ!
0.27$, three seed) と反実的な命令により、予測アンカーは時間の 94.5\%$ の \emph{false} 命令に従う(真のシーンは 2.3\%$; $N{=}256$)。
中央クレームは、3つの設定とタスク内アブレーションでテストされ、以下の特徴を特徴付けます。 \textbf{instruction leakageは、(指示が答えを名乗るときに)命令からスコアが変換可能で、非インストラクション入力の予測性に本質的に依存しているときに発生する。
テーブルトップと外部のBabyAIベンチマークはリークするが、命令名 \emph{referents} を持つLanguage-Table forward-dynamics world model は、指示が指示を名付けるように拡張されるまでは実行されない。
ゴールをダイナミックス(プランナーのコストに属する)から外し、 \emph{read}パスを監督し、真の命令非依存のグラウンドを回復する(0.88$、ゴールと同一かつ無関係)。
検出プロトコルと治療法は、得点した量を命名した任意の目標条件の世界モデルに適用される。
関連論文リスト
- Behavior--Realization Separation for Constrained Physical Human--Robot Interaction [0.0]
本稿では, メモリレスアフィン挙動を実現するリテーディングホライズン二次プログラムを実装した。
MuJoCoのトルク制御 7-DOF Franka FR3 では、実行時が解決するごとにタスク空間のダイナミクスを凍結し、水平方向にトルクの実現性を強制する。
論文 参考訳(メタデータ) (2026-09-01T03:46:05Z) - Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors [51.56484100374058]
自動回帰モデルは、長時間のロールアウトでエラーを蓄積しますが、デプロイ時には、それを測定するための基本的な真実はありません。
我々は、方向フラグを介して動的システムを前方または後方にステップする単一の条件付き潜在拡散モデルを訓練する。
この双方向性は測定不要なテスト時間誤差信号を提供することを示す。
論文 参考訳(メタデータ) (2026-08-01T13:49:46Z) - Spaghetti Architect: A Contamination-Resistant, By-Construction-Labelled, Multi-Language Code Dataset Generator [4.010371060637209]
Spaghetti Architectはクリーンで言語に依存しない中間表現を、意図的に冗長で完全にフラットなプログラムにマップする。
各プログラムは、参照するオラクルに対してコンパイル、実行、チェックされるので、各インスタンスは、構成によって正しい。
4モデルオープンラグのレポートベースライン: 正確な一致はスケールとともに上昇し、本質的なノブは最強モデルの算術的集約精度をゼロに崩壊させる。
論文 参考訳(メタデータ) (2026-07-21T02:23:22Z) - Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments [53.85970147743299]
専門家によるデモンストレーションは、ロボット模倣学習における金の標準であると広く考えられている。
しかし、挿入、積み重ね、アライメントなどのきめ細かい操作のために、私たちは直感的な失敗モードを発見しました。
視覚言語モデルとアクションエキスパートをブリッジする,コンパクトな動的特徴であるSTAIRを導入する。
論文 参考訳(メタデータ) (2026-06-14T04:15:29Z) - A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints [6.057587531186626]
目的指向エージェントが生成し、破壊し、交換する価値は、情報と同じカテゴリの法的構造量であることを示す。
価格がフレームに依存していない間、価値はフレーム相対的であり、そのリソースをプールし、その知覚を融合する艦隊が天井を継承する。
論文 参考訳(メタデータ) (2026-06-10T16:11:04Z) - Priors Persist Through Suppression: A Stroop Paradigm for Lexical Override [2.892857112058156]
用語、技術的仕様、システムは、不慣れな方法で慣れ親しんだ単語を使用するように言語モデルに日常的に要求する。
これが機能すると、語彙の先行は置き換えられるのではなく、オーバーライドを通じて持続する。
我々はこれをStroopスタイルのパラダイムでテストする: クエリワードの辞書("hospital")にマッチした中立制御を持つリマッピングルール。
論文 参考訳(メタデータ) (2026-05-25T05:53:31Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Subtle Injection for Ground-truth Inference of LLM Training Data [0.2538209532048867]
SIGILは、認識不能なEmphcanary Sequenceを保護されたテキストとコードに埋め込むフレームワークである。
SIGILは、語彙規則、語彙句、構文、意味、コードパターンの5つのカナリア戦略を定義している。
論文 参考訳(メタデータ) (2026-05-18T14:48:44Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Language models recognize dropout and Gaussian noise applied to their activations [74.06294367754748]
我々は, (a) アンフマスクのアクティベーションをシミュレートし, あるいは (b) アンフガウス雑音を付加する。
Llama、Olmo、Qwenファミリーのモデルをテストする。
論文 参考訳(メタデータ) (2026-04-19T14:30:13Z) - Towards Variable-Length Textual Adversarial Attacks [68.27995111870712]
データの離散性のため、自然言語処理タスクに対してテキストによる敵意攻撃を行うことは非自明である。
本稿では,可変長テキスト対比攻撃(VL-Attack)を提案する。
本手法は、iwslt14ドイツ語英訳で3,18$ bleuスコアを達成でき、ベースラインモデルより1.47$改善できる。
論文 参考訳(メタデータ) (2021-04-16T14:37:27Z) - Toward Adversarial Robustness via Semi-supervised Robust Training [93.36310070269643]
アドリラルな例は、ディープニューラルネットワーク(DNN)に対する深刻な脅威であることが示されている。
R_stand$ と $R_rob$ の2つの異なるリスクを共同で最小化することで、新しい防御手法であるロバストトレーニング(RT)を提案する。
論文 参考訳(メタデータ) (2020-03-16T02:14:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。