論文の概要: Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies
- arxiv url: http://arxiv.org/abs/2608.04692v1
- Date: Wed, 05 Aug 2026 10:59:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.831713
- Title: Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies
- Title(参考訳): VLA政策におけるタスクベクター否定の閉ざされたターゲット・アンド・コントロル監査
- Authors: Shaoguang Wang, Weiyu Guo, Rushi Dai, Yiren Zhao, Yandong Guo, Hui Xiong,
- Abstract要約: タスクベクトル算術は、モデルを修正するためのクローズドフォームな方法を提供するが、クローズドループロボット制御において、その振る舞いの局所性は未だ不明である。
マルチタスク・ビジョン・ランゲージ・アクション(VLA: Multitask Vision-Language-action)ポリシーから,タスク・ベクターごとのタスク・ベクター・サブトラクションのターゲット・アンド・コントロール・監査を行う。
- 参考スコア(独自算出の注目度): 33.432377306905735
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Task-vector arithmetic offers a closed-form way to modify a model, yet its behavioral locality remains unclear in closed-loop robot control. We present a target-and-control audit of per-skill task-vector subtraction from multitask vision-language-action (VLA) policies. Across all ten LIBERO-Goal skills, subtraction produces three qualitatively different regimes: target-control separation for five skills, resistance for three, and global collapse for two. On held-out initial states, the five suppressible targets remain at 0% success; however, mean baseline-normalized control retention is only 52%, and each target-suppressing edit materially harms at least one nominally unrelated control. Additional Goal panels show separation across tested policies with continuous-regression, discrete-token, and flow-matching action heads, whereas we observe no clean separation on Spatial and control collapse on the tested Object and Long-horizon panels. Mean task-vector cosine does not account for this variation. A matched-norm control identifies a local sign asymmetry around one Goal anchor, while multi-vector outcomes vary with anchor and scale. Retain-aware gradient baselines provide data-dependent comparators but require removal-time data and optimization; subtraction is data- and gradient-free only at edit time, assuming precomputed expert deltas. Finally, a single-skill relearning probe is consistent with behavioral masking, not certified unlearning. These results characterize task-vector subtraction as a fast but brittle intervention and underscore the need for closed-loop target-and-control evaluation when assessing locality in embodied model editing.
- Abstract(参考訳): タスクベクトル算術は、モデルを修正するためのクローズドフォームな方法を提供するが、クローズドループロボット制御において、その振る舞いの局所性は未だ不明である。
マルチタスク・ビジョン・ランゲージ・アクション(VLA: Multitask Vision-Language-action)ポリシーから,タスク・ベクターごとのタスク・ベクター・サブトラクションのターゲット・アンド・コントロール・監査を行う。
LIBERO-Goalスキルは10種類あり、サブトラクションは5つのスキルに対する目標制御分離、3つのスキルに対する抵抗、2つのグローバル崩壊という、質的に異なる3つのレギュレーションを生み出している。
保持状態の初期状態では、5つの抑制可能な目標が0%の成功にとどまっているが、平均ベースライン正規化コントロール保持率は52%に過ぎず、各目標抑制編集は、名目上は無関係なコントロールを少なくとも1つ与える。
追加のゴールパネルでは, 連続回帰, 離散トケン, フローマッチングアクションヘッドによるテストポリシ間の分離が見られたが, テスト対象パネルとロングホライゾンパネルの空間的・制御的崩壊の明確な分離は観察されなかった。
平均的なタスクベクトルコサインは、このバリエーションを説明できない。
一致したノルム制御は、1つのゴールアンカーの周囲の局所的な符号非対称性を識別するが、マルチベクトルの結果はアンカーとスケールによって異なる。
Retain-Aware Gragientベースラインは、データ依存のコンパレータを提供するが、削除時のデータと最適化を必要とする。
最後に、シングルスキルの再学習プローブは、認定されていない未学習者ではなく、行動マスキングと一致している。
これらの結果は,タスクベクトルサブトラクションを高速だが不安定な介入として特徴付け,エンボディドモデル編集における局所性を評価する際に,クローズドループのターゲット・アンド・コントロール評価の必要性を強調した。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models [0.4783156204372467]
アクティベーションステアリングは、推論時に内部アクティベーションを編集することでモデル動作を制御する。
入力側双対について検討し、流動的なプロンプトを最適化し、選択した内部潜伏剤をゼロに駆動する。
論文 参考訳(メタデータ) (2026-07-28T16:01:48Z) - The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs [21.905558014939327]
視覚言語モデル(VLM)は、依然として基本的なオブジェクトカウントに苦戦している。
内部知識の欠如や内部表現と言語出力のギャップを反映しているかどうかを考察する。
本研究では,内部誤差検出器が故障を予測した場合のみモデルを選択的に再起動する自己補正法を提案する。
論文 参考訳(メタデータ) (2026-07-10T15:50:54Z) - Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization [64.83565413108789]
サイクル自己学習(CST)は、標準自己学習フレームワークの共有分類器の仮定を破る。
CSTは、ターゲットの擬似ラベルでトレーニングすることで、ラベルなしのターゲットデータを悪用する。
論文 参考訳(メタデータ) (2026-06-30T09:05:30Z) - Simple Supervision Is Hard to Beat: A Bitter Lesson from Sparse Target Labels in Domain-Adaptive Object Detection [15.036291423058847]
ソース自由領域適応オブジェクト検出は、典型的には擬似ラベルを用いた教師学生の自己学習を通じて、ソース学習された検出器をラベルなしのターゲットドメインに適応させる。
我々はRandom-Target Supervised Mixing (RTSM)を紹介した。これは従来の未ラベル適応ブランチをそのまま残しながら、教師付き検出損失を通じてアノテーションを組み込むシンプルなアンカーである。
論文 参考訳(メタデータ) (2026-06-29T18:21:09Z) - A Held-Out Transition-Pair Falsifier for Long-Horizon Non-Abelian State Tracking [0.5076419064097734]
有限非アベリア群追跡のためのホールドアウト遷移ペアファルシファイアを導入する。
制御された$S_3 times S_3$ベンチマークでは、長さ8列のみに基づいてトレーニングされた投影されたリカレント状態モデルがエラーのない最終状態予測を生成する。
論文 参考訳(メタデータ) (2026-06-05T13:26:41Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。