論文の概要: DiMaS: Distribution Matching for Steering Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2607.14280v1
- Date: Wed, 15 Jul 2026 18:39:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.887912
- Title: DiMaS: Distribution Matching for Steering Vision-Language-Action Models
- Title(参考訳): DiMaS:ステアリング・ビジョン・ランゲージ・アクションモデルのための分布マッチング
- Abstract要約: フローマッチング視覚言語アクション(VLA)モデルは、ロボット操作の強力なポリシーとして登場した。
行動制御は、ロボットが内部表現に介入してタスクを実行する方法を管理する能力である。
本稿では,フローマッチングVLAに適した分散マッチングステアリング戦略であるDiMaSを提案する。
- 参考スコア(独自算出の注目度): 41.9662194189542
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Flow-matching-based vision-language-action (VLA) models have emerged as powerful policies for robotic manipulation, yet a critical capability remains underexplored: fine-grained behavioral control, the ability to govern how a robot performs a task by intervening on its internal representations. Representation steering is a well-established interpretability tool for language and vision-language models, where behavioral features are typically encoded as linear directions, but we show that these classic methods fall short in VLAs. We propose DiMaS, a Distribution-Matching Steering strategy tailored to flow-matching VLAs, which transports between representation distributions rather than shifting along a fixed direction, and show that it effectively controls behavior across two state-of-the-art VLAs. We further examine the generalizability of this strategy as the tasks it is learned from and evaluated on grow increasingly dissimilar, characterizing where behavioral control transfers and where it weakens. Finally, through an analysis of the representation structure of the action expert, we explain why classical linear steering falls short in the visuomotor setting: behavioral features are linearly decodable but not linearly steerable, which motivates the distribution-matching design of DiMaS. Our code is publicly available at https://github.com/pegah-kh/dimas, with additional results and videos at https://pegah-kh.github.io/dimas/
- Abstract(参考訳): フローマッチングに基づく視覚言語アクション(VLA)モデルは、ロボット操作の強力なポリシーとして登場したが、重要な能力はまだ探索されていない。
Representation steeringは言語と視覚言語モデルのためのよく確立された解釈可能性ツールであり、行動的特徴は典型的には線形方向として符号化されるが、これらの古典的手法はVLAでは不足していることを示す。
本研究では, フローマッチングVLAに適した分散マッチングステアリング戦略であるDiMaSを提案し, 2つの最先端VLAの挙動を効果的に制御できることを示す。
さらに,この戦略の一般化可能性について検討し,行動制御がどこに移行し,どこが弱まるのかを特徴付けるとともに,成長する相違点について評価する。
最後に、アクションエキスパートの表現構造の分析を通して、古典的線形ステアリングがビジュモータ設定で不足している理由を説明する。
私たちのコードはhttps://github.com/pegah-kh/dimasで公開されており、追加の結果とビデオはhttps://pegah-kh.github.io/dimas/で公開されています。
関連論文リスト
- Decoupling the Declarative from the Procedural in Vision-Language-Action Models [65.22639791239932]
オブジェクト固有のデモから振る舞いをクローンするように訓練されたポリシーは、そのオブジェクトを超えて一般化されなければならない。
情報フローを再構成した新しいビジョン・ランゲージ・アクションモデルであるw$2$VLAを提案する。
最先端のVLAとは異なり、我々のモジュラーアプローチは知識表現の分離に成功している。
論文 参考訳(メタデータ) (2026-06-19T14:43:58Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models [15.486973209713954]
GTA-VLA(Guide, Think, Act)はインタラクティブなビジョンランゲージ・アクション・フレームワークである。
ユーザがロボットポリシーを明示的な視覚的手がかりでガイドできるようにすることで、空間的に操作可能な具体的推論を可能にする。
論文 参考訳(メタデータ) (2026-05-13T14:58:29Z) - GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization [101.37117235471709]
本稿では,タスク関連要因に着目したアクション生成を支援するフレームワークである GuidedVLA を紹介する。
私たちの中核的な洞察は、アクションデコーダをモノリシックな学習者としてではなく、機能的なコンポーネントの集合として扱うことです。
この結果から,アクションデコーダ学習を明示的に指導することが,より堅牢で汎用的なVLAモデルを構築する上で有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2026-05-12T16:38:40Z) - Sparse Autoencoders Reveal Interpretable and Steerable Features in VLA Models [7.1750939299528795]
VLA(Vision-Language-Action)モデルが汎用ロボット操作のための有望なアプローチとして登場した。
VLAモデルの内部動作をよりよく理解するために,機械的解釈可能性技術を適用した。
本研究では,個々のSAEがロボット行動に因果的に影響を及ぼすことを示す。
論文 参考訳(メタデータ) (2026-03-19T17:42:05Z) - Observing and Controlling Features in Vision-Language-Action Models [20.193036403223903]
VLA(Vision-Language-Action Models)は、インボディードインテリジェンスに対する顕著な進歩を示している。
機能可観測性と機能可制御性という,2つの主要な概念を紹介し,分析する。
この結果から,ロボットの動作を確実に制御する,目標とする軽量な介入が可能であることが示唆された。
論文 参考訳(メタデータ) (2026-03-05T18:53:50Z) - Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future [125.92052530850425]
VLA(Vision-Language-Action)フレームワークは、認識と言語に基づく意思決定を統合する。
VLAフレームワークは、より解釈可能で、一般化可能で、人間に準拠した運転ポリシーへの道筋を提供する。
この研究は、人間と互換性のある自動運転システムを構築するための一貫性のある基盤を確立することを目的としている。
論文 参考訳(メタデータ) (2025-12-18T16:57:44Z) - Mechanistic interpretability for steering vision-language-action models [0.23371356738437823]
VLA(Vision-Language-Action)モデルは、一般のエンボディエージェントを実現するための有望な道である。
本稿では,VLAを内部表現で解釈し,操作するための最初のフレームワークを紹介する。
我々は、微調整、報酬信号、環境相互作用を伴わずに、リアルタイムに行動を調整する汎用的なアクティベーションステアリング手法を提案する。
論文 参考訳(メタデータ) (2025-08-30T03:01:57Z) - Analyzing the Generalization and Reliability of Steering Vectors [8.253773195379166]
ステアリングベクトルは分布内および分布外の両方にかなりの制限があることを示す。
分散において、ステアビリティは異なる入力間で高度に変動する。
アウト・オブ・ディストリビューション(out-of-distribution)、ステアリングベクトル(steering vector)はよく一般化されるが、いくつかの概念はプロンプトの合理的な変化に対して脆弱である。
論文 参考訳(メタデータ) (2024-07-17T08:32:03Z) - CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning [61.21923643289266]
カオス・オブ・マニピュレーション(Chain of Manipulations)は、視覚言語モデル(Vision-Language Models)が、エビデンスを段階的に解決するメカニズムである。
トレーニング後、モデルは外部ツールを介さずに、本質的な操作(グラウンド、ズームインなど)を積極的に行うことで、様々な視覚的問題を解決することができる。
トレーニングされたモデルである textbfCogCoM は、4つのカテゴリの9つのベンチマークで最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2024-02-06T18:43:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。