論文の概要: Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA
- arxiv url: http://arxiv.org/abs/2607.26807v1
- Date: Wed, 29 Jul 2026 11:48:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.657016
- Title: Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA
- Title(参考訳): キネマティクスによる観測経路:MoE強化VLAにおけるキネマティクスを監督したエキスパートルーティング
- Authors: Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang,
- Abstract要約: ほとんどの意味的に異なる操作タスクは、複数のキネマティックなアーキタイプに還元される。
我々は、暗黙的な観測駆動のエキスパートルーティングから、明示的でキネマティックな専門家ディスパッチに移行する新しいパラダイムである、キネマティックスによる明示的ルーティング(KinRT)を提案する。
KinRTは実際には、トレーニング中の動作空間から推論時の観測空間にタスクキネマティクスを蒸留する非対称ブリッジ機構を導入している。
- 参考スコア(独自算出の注目度): 42.587518698312586
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: While MoE augments VLA via expert specialization, router suffers from ineffective expert routing owing to the kinematic heterogeneity of actions across manipulation tasks and, even worse, the unavailability of the kinematic signals at inference time. In this work, we first observe that most semantically distinct manipulation tasks reduce to multiple kinematic archetypes. Motivated by this finding, we propose Kinematics-supervised explicit routing (KinRT), a new paradigm that shifts from implicit, observation-driven expert routing to explicit, kinematics-guided expert dispatching. Specifically, we perform kinematic clustering on action trajectories into multiple kinematically coherent groups, whose IDs serve as ground truth to supervise the training of the router; at inference time, the router dispatches experts only using visual-language observations, without any reliance on action kinematics. KinRT actually introduces an asymmetric bridging mechanism that distills the task kinematics from the action space in training into the observation space at inference. In addition, to assess KinRT's cross-platform generalization, we build an economical, Do-It-Yourself robot (DIYRobot) platform from scratch using 3D-print technology ($<$ 2,000USD). Extensive experiments demonstrate KinRT's superiority over both dense and MoE-featured VLAs by more than 23.26% on RoboTwin benchmark and 20.27% on our introduced DIYRobot platform. Our code and DIYRobot platform will be open-sourced.
- Abstract(参考訳): MoEは専門家の専門化を通じてVLAを増強するが、ルータは操作タスク間の動作のキネマティックな不均一性や、さらに悪いことに、推論時にキネマティック信号が利用できないため、非効率なエキスパートルーティングに苦しむ。
本研究では、まず、意味的に異なる操作タスクが複数のキネマティックなアーキタイプに還元されることを観察する。
この発見に触発されたKinematics-supervised explicit routing (KinRT) は、暗黙的で観測駆動のエキスパートルーティングから、明示的でキネマティックな専門家ディスパッチへとシフトする新しいパラダイムである。
具体的には、動作軌跡を複数のキネマティックコヒーレントなグループに分類し、そのIDがルータのトレーニングを監督する根拠となる。
KinRTは実際には、トレーニング中の動作空間から推論時の観測空間にタスクキネマティクスを蒸留する非対称ブリッジ機構を導入している。
さらに、KinRTのクロスプラットフォームの一般化を評価するために、3Dプリント技術($2,000USD)を使って、経済的なDIYRobot(Do-It-Yourself Robot)プラットフォームをゼロから構築しました。
広範な実験により、KinRTは密度の高いVLAとMoEが備えるVLAよりも23.26%以上、DIYRobotプラットフォームで20.27%優位であることが示されている。
私たちのコードとDIYRobotプラットフォームはオープンソースになります。
関連論文リスト
- GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency [19.566368780107613]
GenVid2Robotは、生成されたビデオモーションを実行可能なリアルタイムロボット操作トラジェクトリに変換するフレームワークである。
実験により、GenVid2Robotは、視運動前兆を粗いメトリ幾何でグラウンドすることで、生成ビデオ誘導操作の信頼性を向上させることが示された。
論文 参考訳(メタデータ) (2026-07-10T08:32:47Z) - Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments [96.23886784364997]
身体的な知性は、操作やナビゲーションといった個々のタスクのための特別なモデルを通してしばしば研究される。
本稿では,Qwenの視覚言語モデリングスタックを連続的な動作と軌道生成に拡張した統一的な基礎モデルであるQwen-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-28T17:36:31Z) - Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons [69.87766750714945]
汎用ロボット報酬モデルは通常、専門家によるデモンストレーションから絶対的なタスク進捗を予測するために訓練される。
本稿では、軌道内進行監視と軌道間優先監視を組み合わせたスケーラブルな報酬モデリングフレームワークRobometerを紹介する。
ロビオメーターは、専門家データに報酬等級を固定するフレームレベルのプログレス・ロスと、グローバルな順序制約を課す軌跡比較優先損失という2つの目的で訓練されている。
論文 参考訳(メタデータ) (2026-03-02T17:38:58Z) - Repurposing Video Diffusion Transformers for Robust Point Tracking [35.486648006768256]
既存のメソッドは、フレームを独立して処理するResNetのような浅い畳み込みバックボーンに依存している。
ビデオトランスフォーマー(DiT)は本質的に、強力な点追跡能力を持ち、動的動作を頑健に扱う。
本研究は,ポイントトラッキングの有効かつ効率的な基盤として,ビデオDiT機能を検証する。
論文 参考訳(メタデータ) (2025-12-23T18:54:10Z) - RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics [53.053660003572965]
本稿では,3次元空間参照と計測の両方を初めて実現した3D対応VLMであるRoboTracerを提案する。
RoboTracerは、強化微調整により、多段階のメートル法推論を進める。
本稿では,空間的トレーシングを評価する上で困難なベンチマークであるTraceSpatial-Benchを提案する。
論文 参考訳(メタデータ) (2025-12-15T18:52:43Z) - Scaling Manipulation Learning with Visual Kinematic Chain Prediction [32.99644520625179]
本研究では,多様な環境下でのロボット学習における準静的動作の高精度かつ普遍的な表現として,視覚キネマティクス連鎖を提案する。
我々は,Calvin,RLBench,Open-X,および実際のロボット操作タスクにおいて,BC変換器に対するVKTの優れた性能を示す。
論文 参考訳(メタデータ) (2024-06-12T03:10:27Z) - An Effective Motion-Centric Paradigm for 3D Single Object Tracking in
Point Clouds [50.19288542498838]
LiDARポイントクラウド(LiDAR SOT)における3Dシングルオブジェクトトラッキングは、自動運転において重要な役割を果たす。
現在のアプローチはすべて、外観マッチングに基づくシームズパラダイムに従っている。
我々は新たな視点からLiDAR SOTを扱うための動き中心のパラダイムを導入する。
論文 参考訳(メタデータ) (2023-03-21T17:28:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。