論文の概要: FRAM: Trajectory-Guided Visual Feature Selection for Compact Language-Conditioned Robot Manipulation
- arxiv url: http://arxiv.org/abs/2609.30965v2
- Date: Thu, 01 Oct 2026 02:03:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.339635
- Title: FRAM: Trajectory-Guided Visual Feature Selection for Compact Language-Conditioned Robot Manipulation
- Title(参考訳): FRAM:小型言語記述型ロボットマニピュレーションのための軌道誘導型視覚特徴選択
- Abstract要約: Future Representation Action Model (FRAM) は、将来のエンドエフェクタの軌道と現在の視覚入力を明示的に結びつける小さなポリシーである。
FRAMは、予測された軌跡の画像座標を空間ポインタとして使用し、現在の画像から動きに関連する局所的な視覚的特徴を読み取る。
- 参考スコア(独自算出の注目度): 1.8472148461613156
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action models achieve strong performance in robot manipulation, but often require large numbers of parameters. In this work, we propose the Future Representation Action Model (FRAM), a small policy that explicitly links the future end-effector trajectory to the current visual input. FRAM uses the image coordinates of the predicted trajectory as spatial pointers and reads local visual features related to the motion from the current image. This organizes the information for action generation into the reference position (Where), the visual state (What), and the future motion (Future). Trajectory labels are generated automatically from demonstrations and camera geometry, so no manual annotation is needed. With 138.7M parameters, including a frozen language encoder, FRAM reaches an average success rate of 92.2% over the four standard LIBERO suites, close to the 94.2% of $π_0$ with 3.3B parameters. Without extra training, it also reaches an average of 67.3% on LIBERO-Plus. Ablations confirm that both the future trajectory and the local visual features improve performance and robustness. On a real dual-arm UR5e, FRAM stacks cups using only wrist cameras, including choosing and switching between the left and right arms. These results show that selecting visual information based on future motion is an effective way to obtain both high performance and robustness in a small robot policy.
- Abstract(参考訳): ビジョン・ランゲージ・アクションモデルは、ロボット操作において高い性能を達成するが、しばしば大量のパラメータを必要とする。
本研究では,未来表現行動モデル (Future Representation Action Model, FRAM) を提案する。
FRAMは、予測された軌跡の画像座標を空間ポインタとして使用し、現在の画像から動きに関連する局所的な視覚的特徴を読み取る。
これにより、アクション生成のための情報を基準位置(Where)、視覚状態(What)、将来の動き(Future)に整理する。
軌道ラベルはデモやカメラ幾何学から自動的に生成されるため、手動のアノテーションは不要である。
フリーズ言語エンコーダを含む138.7Mのパラメータを持つFRAMは、標準の4つのLIBEROスイートの平均成功率は92.2%に達し、3.3Bパラメータを持つ$π_0$の94.2%に近い。
余分な訓練がなければ、LIBERO-Plusでは平均67.3%に達する。
アブレーションにより、将来の軌跡と局所的な視覚的特徴の両方が性能と堅牢性を向上させることが確認される。
実際のデュアルアームのUR5eでは、FRAMは左腕と右腕の切り替えを含む手首カメラのみを使用してカップを積み重ねる。
これらの結果から,将来の動きに基づく視覚情報の選択は,小型ロボット政策において,高い性能とロバスト性を両立させる効果的な方法であることが示唆された。
関連論文リスト
- AFUN: Towards an Affordance Foundation Model for Functionality Understanding [12.890216832485647]
我々は,機能理解のための手頃な基礎モデルに向けたステップとして,我々のモデルを提示する。
我々は、異種ロボット、人間、シミュレーション、現実世界のスキャンデータを共有価格スキーマに変換する大規模な標準化データパイプラインを構築します。
私たちのモデルは、4つのベンチマークから8つのテストセットにまたがる大きなマージンで、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-06-01T17:50:16Z) - GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation [54.671815855499034]
視覚言語アクション(VLA)ポリシーは、セマンティック先行をアクション生成に転送することで、言語条件のロボット操作を進化させた。
標準的な行動模倣学習は、しばしば明示的な3次元空間情報、密集した幾何学的監督、将来の環境進化の十分なモデリングを欠いている。
フィードフォワード3Dガウス世界モデルプラグインである textbfGaussianDream を提案する。
論文 参考訳(メタデータ) (2026-05-20T05:51:30Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - Articulated 3D Scene Graphs for Open-World Mobile Manipulation [55.97942733699124]
本報告では, セマンティックな3次元シーングラフを構築するためのフレームワークであるMoMa-SGについて述べる。
新たな統合的ツイスト推定法を用いて調音モデルを推定する。
また,Arti4D-Semanticデータセットについても紹介する。
論文 参考訳(メタデータ) (2026-02-18T10:40:35Z) - ArtiSG: Functional 3D Scene Graph Construction via Human-demonstrated Articulated Objects Manipulation [51.54082859171464]
ArtiSGは、人間のデモを構造化されたロボットメモリにエンコードすることで、機能的な3Dシーングラフを構築するフレームワークである。
本研究では,ArtiSGが機能的要素リコールおよび調音推定精度において,ベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2025-12-31T13:10:40Z) - Lightweight LiDAR-Camera 3D Dynamic Object Detection and Multi-Class Trajectory Prediction [7.415417400188903]
サービス移動ロボットは、タスクを実行している間に動的オブジェクトを避ける必要があることが多い。
本稿では,3次元物体検出と軌道予測のための軽量なマルチモーダルフレームワークを提案する。
本システムは,3次元空間における歩行者,車両,ライダーのリアルタイム認識を実現するために,LiDARとカメラ入力を統合している。
論文 参考訳(メタデータ) (2025-04-18T11:59:34Z) - RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation [10.54770475137596]
動作学習から視覚的特徴抽出を分離する革新的なアプローチであるRoboUniViewを提案する。
我々はまず、アクセスしやすいデータに基づいて事前学習することで、多視点ビューから統一されたビュー表現を学び、その後、この統合されたビュー表現からアクションを導出し、ロボット操作を制御する。
CALVINベンチマークの最先端性能を達成し、D$が93.0%から96.2%に、ABC$が92.2%から94.2%に、D$が93.0%から96.2%に向上した。
論文 参考訳(メタデータ) (2024-06-27T08:13:33Z) - Social-Transmotion: Promptable Human Trajectory Prediction [65.80068316170613]
Social-Transmotionは、多種多様な視覚的手がかりを利用して人間の行動を予測する、汎用トランスフォーマーベースのモデルである。
提案手法は,JTA,JRDB,歩行者,道路交通のサイクリスト,ETH-UCYなど,複数のデータセットで検証されている。
論文 参考訳(メタデータ) (2023-12-26T18:56:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。