論文の概要: Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History
- arxiv url: http://arxiv.org/abs/2607.03372v1
- Date: Fri, 03 Jul 2026 14:27:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.600555
- Title: Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History
- Title(参考訳): 現時点では覚えていない - 凍結したVLAがいかにして視覚履歴をエンコードし、デプロイし、安定させるか
- Authors: Chih-Ting Liao, Xin Cao,
- Abstract要約: 凍結視覚言語行動モデル(VLA)は、決定ステップ毎に最近の観察を受信する。
我々は,この時間軸を層分解線形プローブ法と因果相互干渉法を用いて検討した。
- 参考スコア(独自算出の注目度): 3.168307501254055
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A frozen vision-language-action model (VLA) receives recent observations at every decision step, yet prior work has focused on adding memory rather than asking how existing history is represented and used. We study this temporal axis using layer-resolved linear probing and causal interchange interventions across three VLAs from two architecture families. We find a three-part dissociation. First, past-frame content remains linearly decodable throughout the network. Second, information unique to history beyond the current frame is nearly absent, indicating that stored history is largely a redundant copy of the present. Third, history is causally deployed only when the current frame is heavily degraded, while the action readout progressively loses dependence on history through the network. Although all models encode history similarly, their deployment strategies differ: under the same occlusion, one architecture increasingly relies on history as a fallback, whereas the other relies on it less. We further introduce a training-free temporal deployment audit that distinguishes these regimes. In the fallback regime, re-injecting history neither repairs occlusion nor disambiguates actions, confirming the redundancy of the stored representation. In the other regime, the same intervention reliably steers the predicted action toward the donor history. These results show that steerability depends on how history is deployed rather than whether it is encoded. VLAs do not forget the past; they largely fail to represent it as information distinct from the present. Our findings suggest that future memory augmentation should inject information unique to the past rather than simply more history.
- Abstract(参考訳): 凍結した視覚-言語-アクションモデル(VLA)は、すべての決定ステップで最近の観察を受信するが、以前の作業では、既存の履歴がどのように表現され、使用されるのかを尋ねるのではなく、メモリの追加に重点を置いてきた。
層分解線形探索と因果相互干渉による2つのVLAの時間軸について検討した。
私たちは3つの部分の解離を見つけます。
まず、過去フレームのコンテンツは、ネットワーク全体でリニアにデオード可能である。
第2に、現在のフレームを超えて歴史に固有の情報がほとんど存在せず、保存された歴史が現在の重複したコピーであることを示している。
第3に、履歴は現在のフレームが大幅に劣化した場合にのみ因果的にデプロイされるが、アクションの読み出しはネットワーク経由の履歴への依存を徐々に失う。
すべてのモデルがヒストリをエンコードするが、そのデプロイメント戦略は異なる。同じ閉塞の下では、あるアーキテクチャはフォールバックとしてヒストリに依存する傾向にあり、他方はそれに依存しない。
さらに、これらの制度を区別する訓練不要の時間的展開監査を導入する。
フォールバック方式では、再注入履歴は隠蔽や曖昧な動作を修復せず、格納された表現の冗長性を確認する。
他の体制では、同じ介入が、ドナー履歴に対する予測されたアクションを確実に操縦する。
これらの結果から、ステアビリティは、コード化されるかどうかよりも、履歴のデプロイ方法に依存することが分かる。
VLAは過去を忘れず、現在とは異なる情報として表すことができない。
以上の結果から,記憶の増強は,単に過去の情報よりも,過去の情報に独特な情報を注入すべきであることが示唆された。
関連論文リスト
- Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control [33.5619212312672]
家庭などの部分的に観測可能な環境で動く汎用ロボットは、自律性をサポートするために記憶を必要とする。
本稿では,長期制御のための注意に基づくメモリ検索機構を備えたビジュモータポリシーであるHALOを紹介する。
論文 参考訳(メタデータ) (2026-06-23T20:07:23Z) - Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation [89.70897512515477]
アクション制御された画像対ビデオ生成は、インタラクティブな世界シミュレーションにおいて有望なパラダイムであり、各制御信号が即時視覚応答を誘発する。
長時間の自己回帰的なロールアウトに対する視覚的忠実さと3D一貫性を維持することは依然として難しい。
既存の3D認識手法は、textitLatent--RGB Cyclingからの情報損失と、textiterror-free仮説によって引き起こされるトレーニング-推論ギャップという2つの障害により、破滅的なドリフトに悩まされることが多い。
textbfRobust Dreamerという,メモリ拡張フレームワークについて紹介する。
論文 参考訳(メタデータ) (2026-05-29T05:21:33Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation [73.84423888025171]
オートレグレッシブ(AR)ビデオ拡散は,近年,長大なビデオ生成において有望なパラダイムとして浮上している。
時間的劣化が進行しているため, 生成から微小スケールの地平線への延長は依然として困難であることを示す。
本稿では,AR拡散のための時間記憶機構であるRelax Forcingを紹介する。
論文 参考訳(メタデータ) (2026-03-22T18:59:24Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z) - A Generative Adaptive Replay Continual Learning Model for Temporal Knowledge Graph Reasoning [24.377657990045503]
本稿では,歴史的実体分布表現を生成し,適応的に再生できるDeep Generative Adaptive Replay(DGAR)手法を提案する。
実験の結果, DGARは, 忘れの推論や緩和において, ベースラインを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2025-06-04T15:44:50Z) - Exploring the Limits of Historical Information for Temporal Knowledge
Graph Extrapolation [59.417443739208146]
本稿では,歴史的コントラスト学習の新しい学習枠組みに基づくイベント予測モデルを提案する。
CENETは、最も潜在的なエンティティを識別するために、歴史的および非歴史的依存関係の両方を学ぶ。
提案したモデルを5つのベンチマークグラフで評価する。
論文 参考訳(メタデータ) (2023-08-29T03:26:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。