論文の概要: Closed-Loop Neural Activation Control in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2606.00269v1
- Date: Fri, 29 May 2026 18:59:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.193479
- Title: Closed-Loop Neural Activation Control in Vision-Language-Action Models
- Title(参考訳): 視覚・言語・行動モデルにおける閉ループニューラルアクティベーション制御
- Authors: Abhijith Babu, Ramneet Kaur, Nathaniel D. Bastian, Olivera Kotevska, Susmit Jha, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy,
- Abstract要約: 本稿では,静的干渉強度を適応時間変化制御信号に置き換えるクローズドループフレームワークを提案する。
我々はこのフレームワークをPIDと強化学習ベースのコントローラの両方でインスタンス化する。
実験により、残留STEERは固定係数ベースラインよりも安定な概念規制とステアリングタスク成功トレードオフを実現することが示された。
- 参考スコア(独自算出の注目度): 19.22723477431829
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models can be steered at test time by intervening on semantically meaningful internal directions, but existing methods use a fixed steering coefficient, effectively operating in open loop. This is poorly suited to embodied control, where task state and concept error evolve over time, often causing overcorrection, oscillation, and reduced task success, especially for temporal behaviors such as speed and smoothness. We propose CTRL-STEER, a closed-loop framework that replaces static intervention strength with adaptive, time-varying control signals. The key idea is to decouple representation from regulation: rather than assuming temporal concepts are directly controlled by individual neurons, we steer along motion-aligned residual directions while a feedback controller adjusts intervention magnitude online. We instantiate this framework with both PID and reinforcement learning based controllers. Experiments with a fine-tuned OpenVLA policy on four LIBERO task suites show that CTRL-STEER achieves more stable concept regulation and a better steering-task success trade-off than fixed-coefficient baselines, without modifying or retraining the base model.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、意味論的に意味のある内部方向を介入することで、テスト時に操舵することができるが、既存の手法では固定ステアリング係数を使用し、事実上開ループで作動する。
これは、タスクの状態と概念的エラーが時間とともに進化し、しばしば過度な補正、振動、タスク成功の減少を引き起こす、特にスピードや滑らかさのような時間的行動に適していない。
静的干渉強度を適応的・時間変化制御信号に置き換える閉ループフレームワークであるCTRL-STEERを提案する。
時間的概念が個々のニューロンによって直接制御されていると仮定するのではなく、我々は、フィードバックコントローラがオンラインで介入の規模を調整している間、動きに沿った残留方向に沿って操縦する。
我々はこのフレームワークをPIDと強化学習ベースのコントローラの両方でインスタンス化する。
4つのLIBEROタスクスイートで調整されたOpenVLAポリシーの実験により、CTRL-STEERは、ベースモデルの変更や再訓練をすることなく、より安定した概念規制と、固定係数ベースラインよりも優れたステアリングタスク成功トレードオフを実現している。
関連論文リスト
- SteeringDiffusion: A Bottlenecked Activation Control Interface for Diffusion Models [1.9336815376402718]
SteeringDiffusionは、拡散モデルのためのボトルネック化されたアクティベーションレベル制御インターフェースである。
ゼロアワード設計は、ゼロスケールでのベースモデルへの正確な同値性を保証する。
安定拡散1.5およびSDXLに関する実験を通じて、ステアリング拡散は滑らかで単調なコンテンツスタイルのトレードオフを生成することを示した。
論文 参考訳(メタデータ) (2026-05-03T00:29:10Z) - Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control [2.752817022620644]
推論時間LLMアライメント法は、生成中のアクティベーションを直接修正することで、微調整の代替となる。
複数のLLMアーキテクチャとスケールの層ワイドダイナミクスが局所線形モデルによってよく近似されていることを示す。
我々は, ステアリング性能の正式な保証を可能にするために, セットポイント追従誤差の理論的境界を導出する。
論文 参考訳(メタデータ) (2026-04-21T03:09:46Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models [34.57464032562792]
視覚言語アクション(VLA)モデルは印象的なゼロショット操作を可能にするが、その推論スタックは応答性のあるWebデモには重すぎることが多い。
モデルチェックポイントの再トレーニングや変更なしに既存のVLAコントローラにプラグインできる軽量推論ラッパーであるBLURRを提案する。
論文 参考訳(メタデータ) (2025-12-12T18:30:45Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Activation Steering with a Feedback Controller [4.609594868699996]
Proportional-Integral-Derivative (PID) Steeringは、大きな言語モデルにおけるアクティベーションステアリングに完全なPIDコントローラを利用する、原則化されたフレームワークである。
PIDステアリングは既存のアプローチを一貫して上回り、より堅牢で信頼性の高い行動制御を実現する。
論文 参考訳(メタデータ) (2025-10-05T18:05:28Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - Optimal PID and Antiwindup Control Design as a Reinforcement Learning
Problem [3.131740922192114]
DRL制御法の解釈可能性に着目した。
特に、線形固定構造コントローラをアクター・クリティカル・フレームワークに埋め込まれた浅層ニューラルネットワークとみなす。
論文 参考訳(メタデータ) (2020-05-10T01:05:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。