論文の概要: Continuous Conditioning of VLAs with Augmenting EMG and Visual Task Descriptors
- arxiv url: http://arxiv.org/abs/2610.01794v1
- Date: Thu, 01 Oct 2026 14:37:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.197207
- Title: Continuous Conditioning of VLAs with Augmenting EMG and Visual Task Descriptors
- Title(参考訳): EMGとビジュアルタスク記述子を付加したVLAの連続条件設定
- Abstract要約: Vision-Language-Actionモデルは、入力があるにもかかわらず、タスク情報を記述するために言語に強く依存する。
本仮説を検証するために, 電気生理学的条件付きVLA (EC-VLA) と, 画像入力に視覚的セグメンテーションアノテーションを組み込んだVLA (VA-VLA) の2つのモデルを提案する。
- 参考スコア(独自算出の注目度): 1.528980519479643
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models rely strongly on language for describing task information, despite having multimodal inputs. We hypothesize that other modalities in the state space may present opportunities for supplemental task conditioning, which may be particularly relevant in cluttered or otherwise ambiguous scenes. We introduce two tuned models to test this hypothesis: (1) an electrophysiology-conditioned VLA (EC-VLA) that incorporates 8-channel electromyography envelopes as continuous conditioning input concatenated to the proprioceptive vector, and (2) a visually-annotated VLA (VA-VLA) that incorporates visual segmentation annotations to the image inputs. On a cube-selection task evaluated across three participants, EC-VLA matches a language-prompted baseline in uncluttered, in-distribution conditions and substantially outperforms it in cluttered, out-of-distribution scenes. Similarly, VA-VLA shows modest improvements over a language-prompted baseline in in-distribution scenes with substantial improvement in cluttered, out-of-distribution trials. Together, these results provide strong evidence for the potential benefit of task-conditioning beyond language.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、マルチモーダル入力を持つにもかかわらず、タスク情報を記述する言語に強く依存する。
状態空間における他のモダリティは補足的タスク条件付けの機会を与える可能性があり、これは特に散らばったシーンやあいまいなシーンに関係しているかもしれないと仮定する。
本仮説を検証するために, 電気生理学的条件付きVLA (EC-VLA) と, 画像入力に視覚的セグメンテーションアノテーションを組み込んだ視覚的付加VLA (VA-VLA) の2つのモデルを提案する。
3人の参加者で評価された立方体選択タスクにおいて、EC-VLAは、散らばった、散らばった、散逸した、散逸した、散逸した、散逸したシーンにおいて、言語が生み出すベースラインと一致し、大幅に上回っている。
同様に、VA-VLAは、分散シーンにおける言語プロップされたベースラインよりもわずかに改善され、散布された配布外トライアルが大幅に改善された。
これらの結果は、言語以外のタスクコンディショニングの潜在的なメリットを示す強力な証拠となる。
関連論文リスト
- Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs [23.775293927578797]
Qwen-VL や LLaVA のような生成的視覚言語モデル (VLM) は、その事前学習分布に重なるタスクにおいて、強いゼロショット性能を達成する。
Inductive Visual Logic (IVL) は、モデルが生き残った記述能力から分類知識を構築する訓練不要のフレームワークである。
IVLは2つのVLMバックボーンで高い集計精度を達成し、解釈可能な特性追跡可能な予測を生成する。
論文 参考訳(メタデータ) (2026-09-29T18:25:04Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision [79.06371915084833]
本稿では,VLUAS(Vision-Language Unified Autoregressive Supervision)パラダイムを活用するフレームワークであるYoutu-VLを紹介する。
Youtu-VLは視覚的詳細と言語的内容の両方に統一的な自己回帰的監督を適用している。
我々は、このパラダイムを視覚中心のタスクに拡張し、標準のVLMがタスク固有の追加なしで視覚中心のタスクを実行できるようにした。
論文 参考訳(メタデータ) (2026-01-27T17:01:16Z) - VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set [80.50996301430108]
視覚言語表現のアライメントは、強いマルチモーダル推論能力を持つ現在のビジョン言語モデルを実現する。
視覚言語表現をその隠れアクティベーションにエンコードするスパースオートエンコーダVL-SAEを提案する。
解釈において、視覚と言語表現のアライメントは、意味論と概念を比較することで理解することができる。
論文 参考訳(メタデータ) (2025-10-24T10:29:31Z) - CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification [48.81250395291505]
最近のVision-Language-Actionモデルは、広範な後トレーニングを必要とし、高い計算オーバーヘッドをもたらす。
命令駆動型ルーティングとスパーシフィケーションを利用して効率と性能を両立させるフレームワークであるCogVLAを提案する。
CogVLAは、それぞれ97.4%と70.0%の成功率で最先端のパフォーマンスを達成し、トレーニングコストを2.5倍に、推論遅延を2.8倍に削減した。
論文 参考訳(メタデータ) (2025-08-28T17:50:58Z) - GLIPv2: Unifying Localization and Vision-Language Understanding [161.1770269829139]
本稿では,ローカライズタスクとビジョンランゲージ(VL)理解タスクの両方を提供する,基底VL理解モデルGLIPv2を提案する。
GLIPv2は、ローカライゼーション事前トレーニングとビジョン言語事前トレーニングを3つの事前トレーニングタスクで統合する。
一つのGLIPv2モデルが,様々なローカライゼーションおよび理解タスクにおいて,SoTAに近い性能を達成することを示す。
論文 参考訳(メタデータ) (2022-06-12T20:31:28Z) - PEVL: Position-enhanced Pre-training and Prompt Tuning for
Vision-language Models [127.17675443137064]
PEVLを導入し、明示的なオブジェクト位置モデリングによる視覚言語モデルの事前学習と迅速なチューニングを促進する。
PEVLは、統一言語モデリングフレームワークにおいて、離散化されたオブジェクトの位置と言語を再構成する。
PEVLは,表現理解や句の接頭など,位置感性のあるタスクに対して,最先端のパフォーマンスを実現することができることを示す。
論文 参考訳(メタデータ) (2022-05-23T10:17:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。