論文の概要: Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2608.04633v1
- Date: Wed, 05 Aug 2026 09:49:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.805276
- Title: Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models
- Title(参考訳): Mind-VLA:視覚言語行動モデルのための指示型空間表現アライメント
- Authors: Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng,
- Abstract要約: 本稿では,VLAモデルに対する命令対応空間表現アライメント手法であるMind-VLAを提案する。
具体的には、Mind-VLAはまず言語命令によって指定されたターゲットオブジェクトを取得し、そのターゲットオブジェクトのトリビューを作成し、対応するVAEおよびVGGT特徴を抽出する。
最後に、VLAモデルの潜在表現は、これらの特徴と整合して、命令対応の3D理解を可能にする。
- 参考スコア(独自算出の注目度): 31.93790484192547
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent Vision-Language-Action (VLA) methods improve generalization by aligning their representations with 3D scene geometry. However, these methods are fundamentally instruction-agnostic: the representations align the entire scene uniformly, neglecting the 3D geometry of the specific target object designated by the language instruction. This causes failures on fine-grained manipulation and target occlusion tasks, where success depends on accurate 3D understanding of the target object rather than the entire scene. To address this, we present Mind-VLA, an instruction-aware spatial representation alignment method for VLA models. Specifically, Mind-VLA first obtains the target object specified by the language instruction, then prepares its target-object tri-view and extracts the corresponding VAE and VGGT features. Finally, the latent representation of the VLA model is aligned with these features to enable instruction-aware 3D understanding. Mind-VLA reaches 93.9% on LIBERO and 4.47 on CALVIN with a compact 345M-parameter backbone. On real-robot tasks with target occlusion, Mind-VLA reaches 54% average success, outperforming the best-performing instruction-agnostic method in real-robot comparison by 32 percentage points. Code will be publicly available.
- Abstract(参考訳): 近年のVLA(Vision-Language-Action)法では,その表現を3次元シーン形状に整合させることで一般化が向上している。
表現はシーン全体を一様に整列し、言語命令によって指定された特定の対象物の3次元形状を無視する。
これにより、微粒な操作や対象の隠蔽タスクが失敗し、成功はシーン全体ではなく、ターゲット対象の正確な3D理解に依存する。
そこで本研究では,VLAモデルに対する命令対応空間表現アライメント手法であるMind-VLAを提案する。
具体的には、Mind-VLAはまず言語命令によって指定されたターゲットオブジェクトを取得し、そのターゲットオブジェクトのトリビューを作成し、対応するVAEおよびVGGT特徴を抽出する。
最後に、VLAモデルの潜在表現は、これらの特徴と整合して、命令対応の3D理解を可能にする。
Mind-VLAはLIBEROで93.9%、CALVINで4.47、コンパクトな345Mパラメーターバックボーンを持つ。
目標オクルージョンを持つ実ロボットタスクにおいて、Mind-VLAは平均成功率54%に達し、実ロボット比較において最良性能の命令非依存法を32ポイント上回った。
コードは公開されます。
関連論文リスト
- SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models [3.2119871428711875]
本研究では,目標対象の3D事前情報を提供するために,オブジェクト中心の3Dアライメントアライメントフレームワークを提案する。
具体的には、タスク関連オブジェクトをオブジェクト認識モデルでローカライズし、対応するオブジェクトマスクを生成し、SAM3Dを用いて高密度オブジェクトレベルの3D表現を抽出する。
実験は一貫して改善され、LIBEROでは99.1%、CALVINでは平均4.11が達成された。
論文 参考訳(メタデータ) (2026-07-28T16:05:32Z) - PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction [57.63073414949329]
我々は,階層的な3Dポイントクラウド表現をアクションデコーディングプロセスに直接統合する,デュアルシステム3D対応VLAポリシーであるPointACTを提案する。
PointACTは、効率的なボトルネックウィンドウ自己アテンションを備えたマルチスケールのポイントアクションインタラクション機構を採用し、進化するアクショントークンが局所的な幾何学的詳細とグローバルなシーン構造の両方に密に関与できるようにする。
論文 参考訳(メタデータ) (2026-05-20T17:10:31Z) - Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents [52.53348718474685]
VLM(Vision-Language Models)は、強力な視覚的推論能力を持つが、3D理解に苦慮している。
この閉ループプロセスに不可欠な3つの推論時間手法を導入する。
本手法は,対象物体のテキスト誘導目標6Dポーズの予測において,従来の手法を超越した手法である。
論文 参考訳(メタデータ) (2026-04-10T18:06:02Z) - IVRA: Improving Visual-Token Relations for Robot Action Policy with Training-Free Hint-Based Guidance [35.90972175891154]
多くのVision-Language-Action (VLA)モデルは、画像パッチを1Dトークンシーケンスに平坦化し、正確な操作に必要な2D空間キューを弱める。
我々は,モデルに組み込まれた視覚で既に利用可能な親和性ヒントを活用することにより,空間的理解を改善する軽量なトレーニング不要な手法を提案する。
論文 参考訳(メタデータ) (2026-01-22T18:57:13Z) - GLaD: Geometric Latent Distillation for Vision-Language-Action Models [106.53332923530245]
GLaDは、知識蒸留による事前学習中に3次元の幾何学的先行を組み込んだ幾何学的認識型視覚・言語・アクション(VLA)フレームワークである。
GLaDは4つのLIBEROタスクスイートの平均成功率は94.1%で、同じ事前トレーニングデータを使用するUniVLA(92.5%)を上回っている。
論文 参考訳(メタデータ) (2025-12-10T13:07:27Z) - Abstract 3D Perception for Spatial Intelligence in Vision-Language Models [100.13033631690114]
視覚言語モデル(VLM)は、空間認識や物理的理解といった3D関連課題に苦しむ。
我々は,VLMの幾何学的構造と物理力学を符号化するために,抽象的境界ボックスを利用するフレームワークであるSandboxVLMを紹介した。
提案手法は空間知能を常に向上させ,SAT Realの8.3%のゲインをベースライン法と比較して達成する。
論文 参考訳(メタデータ) (2025-11-14T04:16:09Z) - IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering [7.247417417159471]
視覚言語モデル(VLM)は記述的タスクに優れるが、視覚的な観察からシーンを真に理解しているかどうかは不明だ。
IR3D-Benchは、受動的認識よりも能動的生成による理解を実証するために、VLMに挑戦するベンチマークである。
論文 参考訳(メタデータ) (2025-06-29T17:02:57Z) - LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning [63.19329995235114]
主なボトルネックは、現在のシーン表現がパフォーマンスと効率のバランスをとるのに苦労していることです。
本稿では,トークンのオーバーヘッドを大幅に低減し,認識能力の強い,効率的なシーン表現であるコンデンス機能グリッド(CFG)を提案する。
実世界の4つの屋内ドメインと、キャプションや対話といった5つのタスクにまたがる700k3D-VLデータに基づいて訓練された3D VLMであるLEO-VLを紹介する。
論文 参考訳(メタデータ) (2025-06-11T16:56:34Z) - OG-VLA: 3D-Aware Vision Language Action Model via Orthographic Image Generation [68.11862866566817]
3D対応のポリシーは、精密なロボット操作タスクにおいて最先端のパフォーマンスを実現するが、見えない指示、シーン、オブジェクトへの一般化に苦慮している。
我々は,視覚言語行動モデル(VLA)の一般化強度と3D対応ポリシーの堅牢性を組み合わせた,新しいアーキテクチャと学習フレームワークであるOG-VLAを紹介する。
論文 参考訳(メタデータ) (2025-06-01T22:15:45Z) - PointVLA: Injecting the 3D World into Vision-Language-Action Models [10.758939578236582]
我々は,ポイントクラウド入力を必要とせずに,事前学習された視覚言語行動モデルを強化するフレームワークであるPointVLAを提案する。
本手法は,バニラ動作の専門家を凍結し,軽量なモジュールブロックを介して3次元特徴を注入する。
PointVLAは、シミュレーションと現実世界の両方のロボットタスクにおいて、最先端の2D模倣学習方法より優れています。
論文 参考訳(メタデータ) (2025-03-10T16:32:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。