論文の概要: Acting in Meters: Learning Metric Interactions for Precise Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2609.18243v2
- Date: Sun, 20 Sep 2026 10:01:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:28:59.961197
- Title: Acting in Meters: Learning Metric Interactions for Precise Robotic Manipulation
- Title(参考訳): 計測における行動:精密なロボットマニピュレーションのためのメトリックインタラクションの学習
- Abstract要約: Vision-Language-Action ModelsとWorld-Action Modelsは、高度な言語条件のロボット操作を持つ。
本稿では,オブジェクトレベルのインタラクションとシーンレベルのインタラクションを,共有メトリックスケールでモデル化するメトリクスインタラクションフレームワークを提案する。
LIBEROとRoboTwin 2.0の平均成功率は0.80と3.59ポイントである。
- 参考スコア(独自算出の注目度): 22.037123953765548
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action models and World-Action Models have advanced language-conditioned robotic manipulation, yet often leave metric relations among actions, objects, and scene geometry implicit. Human manipulation combines semantic understanding of task-relevant objects with spatial feedback that guides hand motion relative to objects and their surroundings. Inspired by this, we introduce a metric interaction framework that models object-level and scene-level interactions in physical Cartesian space at a shared metric scale. At the object level, Interaction-Centric Tokens (ICTs) explicitly represent end-effector pose trajectories relative to manipulated objects and are jointly denoised with actions, providing physically grounded interaction supervision. At the scene level, the Metric Action Interaction Field (MAIF) uses action and ICT queries to attend to metric scene point-cloud features and learns geometry-conditioned action corrections. Through two-stage adaptation, our framework improves diverse VLA and WAM baselines with a small number of additional parameters and training steps. Experiments demonstrate average success-rate gains of 0.80 and 3.59 percentage points on LIBERO and RoboTwin 2.0, respectively, alongside gains of 6.80 percentage points on real-world tasks and 7.45 percentage points on their out-of-distribution variants.
- Abstract(参考訳): ビジョン・ランゲージ・アクション・モデルとワールド・アクション・モデル(World-Action Models)は、高度な言語条件のロボット操作を持つが、アクション、オブジェクト、シーン幾何学間の距離関係を暗黙的に残すことが多い。
人間の操作は、タスク関連オブジェクトの意味的理解と、オブジェクトとその周辺に対する手の動きを導く空間的フィードバックを組み合わせる。
そこで本研究では,物理空間におけるオブジェクトレベルの相互作用とシーンレベルの相互作用を,共有メトリックスケールでモデル化するメトリクスインタラクションフレームワークを提案する。
オブジェクトレベルでは、Interaction-Centric Tokens(ICT)は、操作対象に対するエンドエフェクターのポーズの軌跡を明示的に表現し、アクションと共同で識別され、物理的に接地されたインタラクションの監視を提供する。
シーンレベルでは、メトリックアクションインタラクションフィールド(MAIF)は、アクションクエリとICTクエリを使用して、メトリックなシーンポイントクラウド機能に対応し、幾何学条件のアクション修正を学ぶ。
2段階の適応によって、我々のフレームワークは、少数の追加パラメータとトレーニングステップで、多様なVLAとWAMベースラインを改善します。
実験では、LIBEROとRoboTwin 2.0の平均成功率は0.80ポイント、RoboTwin 2.0の平均成功率は3.59ポイント、現実世界のタスクでは6.80ポイント、アウト・オブ・ディストリションの変種では7.45ポイントである。
関連論文リスト
- Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands [5.967530183571141]
本稿では、オブジェクト識別からアクション認識を分離し、正確な文法のない操作コマンドを生成するオブジェクト中心のビデオ理解フレームワークを提案する。
提案手法は,効率的なアクションビデオ分類のためのShift Modules (TSM) と,新しいtextbftemporalObject Selectionアルゴリズムを統合する。
論文 参考訳(メタデータ) (2026-06-15T09:36:44Z) - Articulated 3D Scene Graphs for Open-World Mobile Manipulation [55.97942733699124]
本報告では, セマンティックな3次元シーングラフを構築するためのフレームワークであるMoMa-SGについて述べる。
新たな統合的ツイスト推定法を用いて調音モデルを推定する。
また,Arti4D-Semanticデータセットについても紹介する。
論文 参考訳(メタデータ) (2026-02-18T10:40:35Z) - IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments [56.85804719947]
IAAOは知的エージェントのための明示的な3Dモデルを構築するフレームワークで,対話を通して環境内の明瞭な物体の理解を得る。
マスク特徴とビュー一貫性ラベルを多視点画像から抽出し,まず3次元ガウススティング(3DGS)を用いて各オブジェクト状態の階層的特徴とラベルフィールドを構築する。
次に、3Dガウスプリミティブ上でオブジェクトと部分レベルのクエリを実行し、静的および明瞭な要素を識別し、大域的な変換と局所的な調音パラメータをアベイランスとともに推定する。
論文 参考訳(メタデータ) (2025-04-09T12:36:48Z) - Articulated Object Manipulation using Online Axis Estimation with SAM2-Based Tracking [57.942404069484134]
アーティキュレートされたオブジェクト操作は、オブジェクトの軸を慎重に考慮する必要がある、正確なオブジェクトインタラクションを必要とする。
従来の研究では、対話的な知覚を用いて関節のある物体を操作するが、通常、オープンループのアプローチは相互作用のダイナミクスを見渡すことに悩まされる。
本稿では,対話的知覚と3次元点雲からのオンライン軸推定を統合したクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2024-09-24T17:59:56Z) - Learning Manipulation by Predicting Interaction [85.57297574510507]
本稿では,インタラクションを予測して操作を学習する一般的な事前学習パイプラインを提案する。
実験の結果,MPIは従来のロボットプラットフォームと比較して10%から64%向上していることがわかった。
論文 参考訳(メタデータ) (2024-06-01T13:28:31Z) - Text-driven Affordance Learning from Egocentric Vision [6.699930460835963]
ロボットのためのテキスト駆動型アベイランス学習手法を提案する。
我々は,テキストの指示に従って,自我中心の視点から接触点を学習し,軌道を操作することを目的としている。
われわれのアプローチは、現実のシナリオにおける空き学習の新しい標準として、複数の空き時間を扱う。
論文 参考訳(メタデータ) (2024-04-03T07:23:03Z) - GEARS: Local Geometry-aware Hand-object Interaction Synthesis [38.75942505771009]
本研究では, 相互作用領域近傍の局所物体形状を推定するための, 結合中心型センサを提案する。
学習の複雑さを軽減するための重要なステップとして、グローバルフレームからテンプレートハンドフレームにポイントを変換し、共有モジュールを使用して各関節のセンサ特徴を処理する。
これに続いて、異なる次元の関節間の相関を捉えることを目的とした知覚時間変換ネットワークが提供される。
論文 参考訳(メタデータ) (2024-04-02T09:18:52Z) - Localizing Active Objects from Egocentric Vision with Symbolic World
Knowledge [62.981429762309226]
タスクの指示をエゴセントリックな視点から積極的に下す能力は、AIエージェントがタスクを達成したり、人間をバーチャルに支援する上で不可欠である。
本稿では,現在進行中のオブジェクトの役割を学習し,指示から正確に抽出することで,アクティブなオブジェクトをローカライズするフレーズグラウンドモデルの性能を向上させることを提案する。
Ego4DおよびEpic-Kitchensデータセットに関するフレームワークの評価を行った。
論文 参考訳(メタデータ) (2023-10-23T16:14:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。