論文の概要: Semantic Anchoring for Robotic Action Representations
- arxiv url: http://arxiv.org/abs/2607.13597v2
- Date: Sat, 18 Jul 2026 04:17:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.503156
- Title: Semantic Anchoring for Robotic Action Representations
- Title(参考訳): ロボット行動表現のための意味的アンコリング
- Authors: Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang,
- Abstract要約: Vision-Language-Action(VLA)モデルは、事前訓練されたVision-Language Modelからリッチなセマンティック表現を継承する。
本研究では,ロボットの動作表現が,事前訓練されたエンコーダによって捕捉された意味構造を保存するかどうかを検討する。
本稿では,表現を共有セマンティックチャネルとプライベートチャネルに分解しながら,アクション表現をセマンティック多様体にアンカーするプラグイン・アンド・プレイ方式を提案する。
- 参考スコア(独自算出の注目度): 23.2202795323942
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models inherit rich semantic representations from pretrained Vision-Language Models, yet fine-tuning on limited robot demonstrations degrades this structure and undermines generalization. A fundamental question therefore arises: what constitutes a good action representation? Inspired by the mirror neuron theory's insight that observation and execution share an intention-level encoding, we examine whether a robot's action representations preserve the semantic structure captured by pretrained encoders. Systematic probing confirms that this structure erodes during finetuning, and that its quality synchronizes with both task success and out-of-distribution generalization. We further introduce a plug-and-play method that anchors action representations to a semantic manifold while decomposing representations into a shared semantic channel and a private channel, all discarded at inference, leaving the deployed model unchanged. Validated on different VLA backbones across simulation and real-world benchmarks, our method yields up to +18.7% on real-world in-distribution tasks and +21.5% on out-of-distribution generalization.
- Abstract(参考訳): Vision-Language-Action(VLA)モデルは、事前訓練されたVision-Language Modelsからリッチなセマンティック表現を継承するが、限定的なロボットデモの微調整は、この構造を劣化させ、一般化を損なう。
良い行動表現を構成するものは何か?
観察と実行は意図的なエンコーディングを共有しているというミラーニューロン理論の洞察に触発され、ロボットの動作表現が予め訓練されたエンコーダによって捕捉された意味構造を保存するかどうかを検討する。
体系的探索は、この構造が微調整中に損なわれ、その品質がタスクの成功とアウト・オブ・ディストリビューションの一般化の両方と同期することを確認する。
さらに,表現を共有セマンティックチャネルとプライベートチャネルに分解しながら,アクション表現をセマンティック多様体にアンカーするプラグイン・アンド・プレイ方式を導入する。
シミュレーションと実世界のベンチマークで異なるVLAバックボーンで検証され、実世界の分散タスクでは+18.7%、アウト・オブ・ディストリビューションの一般化では+21.5%となる。
関連論文リスト
- Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - Decoupling the Declarative from the Procedural in Vision-Language-Action Models [65.22639791239932]
オブジェクト固有のデモから振る舞いをクローンするように訓練されたポリシーは、そのオブジェクトを超えて一般化されなければならない。
情報フローを再構成した新しいビジョン・ランゲージ・アクションモデルであるw$2$VLAを提案する。
最先端のVLAとは異なり、我々のモジュラーアプローチは知識表現の分離に成功している。
論文 参考訳(メタデータ) (2026-06-19T14:43:58Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations [26.678553477485362]
本稿では,ロボット操作に適応しながら,事前学習した特徴をよりよく保存するフレームワークを提案する。
提案手法では, (i) 事前学習された特徴を保持するために, 凍結したビジョンを持つデュアルエンコーダ設計と, (ii) モデルの事前学習領域に整合した文字列に連続的なアクションを投入する文字列ベースのアクショントークン化器, (iii) ロボットのデモンストレーションと,空間的推論とアプライアンスを強調する視覚言語データセットを組み合わせた協調学習戦略の3つのコンポーネントを導入している。
論文 参考訳(メタデータ) (2025-09-14T20:08:56Z) - DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge [41.030494146004806]
本稿では,逆動力学モデリングを実現するために,包括的世界知識予測を統合した新しいVLAフレームワークであるDreamVLAを提案する。
DreamVLAは、動的領域誘導の世界知識予測を導入し、空間的および意味的な手がかりと統合し、アクション計画のためのコンパクトで包括的な表現を提供する。
実世界とシミュレーション環境での実験では、ドリームVLAが実際のロボットタスクで76.7%の成功率を達成したことが示されている。
論文 参考訳(メタデータ) (2025-07-06T16:14:29Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。