論文の概要: Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation
- arxiv url: http://arxiv.org/abs/2608.22800v1
- Date: Mon, 24 Aug 2026 04:46:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.894572
- Title: Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation
- Title(参考訳): Triplet2Track: 信頼性のある長距離マニピュレーションのためのオブジェクト中心表現付き階層システム
- Abstract要約: Triplet-to-Track System (TTS)は、ロボットが収集したデータへの依存を減らすために人間のビデオを利用する、クローズドループの長距離模倣学習システムである。
TTSは、インスタンスグラウンドのトリガとしてハイレベルなサブゴールを表現し、実行時に連続トラックに変換し、オンラインのリプランニングのために観察からタスクの進捗を監視します。
- 参考スコア(独自算出の注目度): 14.246688157481143
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Ensuring reliability in uncertain environments remains difficult for long-horizon robotic manipulation. End-to-end VLA models are data-heavy and opaque, making diagnosis and verification difficult. Hierarchical pipelines are more interpretable, but their plans are often weakly grounded in observations, weakly aligned with low-level actions, and computed without online feedback, leading to open-loop behavior and hallucinations. To address these issues, we introduce the Triplet-to-Track System (TTS), a closed-loop long-horizon imitation learning system that uses human videos to reduce reliance on robot-collected data. TTS represents high-level subgoals as instance-grounded triplets, translates them into continuous track priors for execution, and monitors task progress from observations for online replanning. Across diverse real-world long-horizon tasks, TTS achieves a 74.8\% average success rate and supports object-level and compositional generalization.
- Abstract(参考訳): 不確実な環境での信頼性を確保することは、長期にわたるロボット操作にとって依然として困難である。
エンドツーエンドのVLAモデルはデータ重で不透明であり、診断と検証が困難である。
階層的なパイプラインはより解釈可能であるが、その計画はしばしば観測に弱く、低レベルのアクションと弱く一致し、オンラインフィードバックなしで計算され、オープンループの振る舞いや幻覚につながる。
これらの課題に対処するために,ロボットが収集したデータへの依存を減らすために,人間ビデオを用いた閉ループ長軸模倣学習システムであるTriplet-to-Track System (TTS)を導入する。
TTSは、インスタンスグラウンドのトリガとしてハイレベルなサブゴールを表現し、実行時に連続トラックに変換し、オンラインのリプランニングのために観察からタスクの進捗を監視します。
様々な現実世界の長距離タスクの中で、TSは74.8 %の成功率を達成し、オブジェクトレベルと構成の一般化をサポートする。
関連論文リスト
- Compiling and Benchmarking Task-State Horizons for Embodied Agents [2.8397380902242966]
最前線のエージェントモデルは、長い水平配置タスクのための高レベルプランナーとしてますます展開されている。
我々は、エージェントがタスク状態水平線(TSH)として追跡しなければならないタスク関連状態遷移のスパンを定義する。
状態遷移依存を実行可能なシンボルグラフに変換するロボットタスクコンパイラであるRoboGraphを紹介する。
論文 参考訳(メタデータ) (2026-08-08T09:45:01Z) - Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation [40.0334846364089]
VLA(Vision-Language-Action)モデルは、マルコフの自然が現在の観測にのみ依存するため、長い水平課題に苦しむ。
我々は,高レベルなVLMから低レベルなVLAへ,実行可能かつトラクタブルなサブタスクプランを伝達するフレームワークであるCortexを紹介する。
これにより、4k時間以上のオープンソースビデオデータの自動アノテーションと30時間のシミュレーションデータを生成することができる。
論文 参考訳(メタデータ) (2026-07-06T17:55:05Z) - Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents [58.49879338545782]
ロングホライゾンタスクは、現実のロボット展開では一般的なものだが、そのようなタスクの障害検出は未調査のままである。
動作条件付き世界モデルからの潜在表現を用いて、操作軌跡をモニタする故障検出フレームワークであるForesightを提案する。
この結果から, 動作条件付きワールドモデル埋め込みは, 長距離操作における信頼性のある故障監視のためのスケーラブルな表現を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-06-22T09:32:28Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - Critic in the Loop: A Tri-System VLA Framework for Robust Long-Horizon Manipulation [5.339854280045898]
Critic in the Loopは動的VLM-Expertスケジューリングによって駆動される適応的階層型フレームワークである。
中心となるのは、グローバル推論のためのVLM脳、リアクティブ実行のためのVLA小脳、軽量な視覚的批判を含む、バイオニックなTri-Systemアーキテクチャである。
我々のアーキテクチャは、人間にインスパイアされたルールをシームレスに統合し、無限の再試行ループを直感的に破る。
論文 参考訳(メタデータ) (2026-03-05T13:55:33Z) - V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks [6.820118518027692]
V-CAGEは、大規模なセマンティックアライメントデータセットを生成するクローズドループフレームワークである。
本研究では,シーン合成における幾何学的整合性を実現する文脈認識型インスタンス化機構を提案する。
また、階層的な命令分解モジュールを用いて、抽象意図と低レベル制御のギャップを埋める。
論文 参考訳(メタデータ) (2026-01-21T16:41:51Z) - RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics [53.053660003572965]
本稿では,3次元空間参照と計測の両方を初めて実現した3D対応VLMであるRoboTracerを提案する。
RoboTracerは、強化微調整により、多段階のメートル法推論を進める。
本稿では,空間的トレーシングを評価する上で困難なベンチマークであるTraceSpatial-Benchを提案する。
論文 参考訳(メタデータ) (2025-12-15T18:52:43Z) - Unsupervised Online 3D Instance Segmentation with Synthetic Sequences and Dynamic Loss [52.28880405119483]
教師なしのオンライン3Dインスタンスのセグメンテーションは、基本的だが難しい課題だ。
UNITのような既存の手法はこの方向に進んできたが、訓練の多様性が制限されているままである。
本稿では,合成点雲列生成によるトレーニング分布の強化を目的とした新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T08:53:27Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。