論文の概要: FineART: Fine-Grained Annotated Robotic Trajectory Dataset and Vision-Language-Action Model for Bimanual Manipulation
- arxiv url: http://arxiv.org/abs/2609.36416v2
- Date: Wed, 30 Sep 2026 23:07:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.517544
- Title: FineART: Fine-Grained Annotated Robotic Trajectory Dataset and Vision-Language-Action Model for Bimanual Manipulation
- Title(参考訳): ファインアート:2次元マニピュレーションのための微粒化アノテート型ロボット軌道データセットとビジョン・ランゲージ・アクションモデル
- Abstract要約: FineARTは、40,543エピソード(1,718時間)と151タスクにわたる533,913サブタスクからなる、双方向操作データセットである。
FineART-VLAは視覚言語によるアクションポリシーで、アクションを導くための次のサブタスクを予測する。
- 参考スコア(独自算出の注目度): 5.032127588091453
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robots operating in real-world environments must often execute complex, multi-step bimanual tasks over long horizons rather than single, isolated actions. Current manipulation datasets struggle to support this capability: although single-arm datasets reach hundreds of thousands of trajectories, they typically provide only one high-level instruction per episode, while existing bimanual datasets with subtask labels annotate only part of their recorded hours. We present FineART, a densely annotated bimanual manipulation dataset comprising 40,543 episodes (1,718 hours) and 533,913 subtasks across 151 tasks. We also introduce FineART-VLA, a vision-language-action policy that predicts its own next subtask to guide its actions. Mid-training on FineART's subtask annotations raises FineART-VLA's success at following spatial instructions from 32.0% to 100.0%. With step-by-step human subtask guidance, it also raises success on unseen long-horizon tasks from 16.0% to 76.0%. Furthermore, after minimal fine-tuning on a new robot, the policy requires only one-tenth of the data needed by baselines without this mid-training and generalizes zero-shot to tasks unseen on the new hardware. We open-source the full dataset, model weights, and training code.
- Abstract(参考訳): 現実の環境で動くロボットは、単一の孤立したアクションではなく、長い地平線上で複雑な多段階のバイマニュアルタスクを実行する必要がある。
現在の操作データセットは、この機能をサポートするのに苦労している。シングルアームデータセットは数十万のトラジェクトリに達するが、通常、エピソード毎に1つのハイレベルなインストラクションしか提供せず、既存のサブタスクラベルを持つバイマニュアルデータセットは、記録された時間の一部をアノテートする。
我々は151タスクにわたる40,543エピソード(1,718時間)と533,913サブタスクからなる濃密な注釈付き双方向操作データセットであるFineARTを提案する。
また、ファインアート-VLAは、その行動の指針となる次のサブタスクを予測するヴィジュアル・ランゲージ・アクション・ポリシーである。
FineARTのサブタスクアノテーションのトレーニング中は、FineART-VLAが32.0%から100.0%まで空間命令に従うことで成功している。
ステップ・バイ・ステップのヒューマン・サブタスク・ガイダンスでは、16.0%から76.0%に到達している。
さらに、新しいロボットを最小限の微調整した後、この中級トレーニングなしでベースラインが必要とするデータの10分の1しか必要とせず、新しいハードウェアでは見えないタスクにゼロショットを一般化する。
完全なデータセット、モデルの重み付け、トレーニングコードをオープンソースにしています。
関連論文リスト
- Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization [66.06331553787281]
テキスト内ビデオガイダンスに従うことで、見知らぬタスクを実行する因果的ビデオアクションモデルであるZero-WAMを提案する。
我々はまた、8.6Kタスクにまたがる74.2Kの人間ロボットICLペアのデータセットであるHumanGenを提示する。
RoboTwin 2.0シミュレーションの7つの目に見えないタスクにおいて、Zero-WAMは47.0%の平均的な成功率を達成する。
論文 参考訳(メタデータ) (2026-08-26T17:59:34Z) - $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation [51.05516457377339]
ロングホライズンロボットの操作には、ロボットが個々のスキルを確実に実行し、拡張されたタスクに対してそれらを一貫性を持ってシーケンスする必要がある。
計算スケーリング可能な推論問題として高レベルサブタスク生成を定式化する階層型ロボット基盤モデルである$_0$-VLAを導入する。
低レベルポリシーは、生成されたサブタスクを複数のロボットエンボディメントにわたって実行する。
論文 参考訳(メタデータ) (2026-08-17T17:59:11Z) - FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning [74.25049012472502]
FLaReは、堅牢な事前訓練された表現、大規模なトレーニング、勾配安定化技術を統合する大規模な強化学習フレームワークである。
提案手法は,タスク完了に向けた事前訓練されたポリシーを整列し,これまで実証され,全く新しいタスクや実施状況において,最先端(SoTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-09-25T03:15:17Z) - LHManip: A Dataset for Long-Horizon Language-Grounded Manipulation Tasks in Cluttered Tabletop Environments [10.395448371001136]
本稿では,200エピソードからなるLong-Horizon Manipulationデータセットについて述べる。
タスクには、グルーピング、プッシュ、積み重ね、非常に散らかった環境でオブジェクトを投げるなど、複数のサブタスクが含まれる。
データセットは、Open X-Embodimentデータセットの一部を構成する176,278の観測-アクションペアで構成されている。
論文 参考訳(メタデータ) (2023-12-19T10:45:56Z) - iTAML: An Incremental Task-Agnostic Meta-learning Approach [123.10294801296926]
人間は経験が成長するにつれて、新しい知識を継続的に学ぶことができる。
ディープニューラルネットワークにおける以前の学習は、新しいタスクでトレーニングされたときにすぐに消えてしまう可能性がある。
遭遇した全てのタスク間の平衡を維持するために,新しいメタラーニング手法を導入する。
論文 参考訳(メタデータ) (2020-03-25T21:42:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。