論文の概要: Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic
- arxiv url: http://arxiv.org/abs/2607.26770v1
- Date: Wed, 29 Jul 2026 11:12:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.648096
- Title: Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic
- Title(参考訳): 視覚-TL-Action:視覚的観察と時相論理からのニューロ・シンボリック軌道生成
- Authors: Zezhi Liu, Zhiwei Zheng, Hanqian Luo, Deyun Qin, Shizhen Wu, Yongchun Fang,
- Abstract要約: 時間論理(TL)は、長い水平ロボット作業の定式化のための構成言語を提供する。
マルチビュー画像から行動軌跡を生成するemphVision-TL-Actionを導入する。
我々は、Success@$K$を用いて、Kの少なくとも1つのサンプル軌道がTL仕様を満たすタスクの分数を評価する。
- 参考スコア(独自算出の注目度): 15.576345981549553
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Temporal logic (TL) provides a compositional language for the formulation of long horizon robotic tasks, but existing TL-conditioned trajectory generators can sidestep perception-to-symbol binding by encoding exact object geometry in the task graph. We introduce \emph{Vision-TL-Action}, which generates action trajectories from multi-view images, a coordinate-free TL syntax graph, and the robot initial state. TL-node tokens and spatial visual tokens are fused through bidirectional cross-attention, and the resulting representation conditions a flow-matching trajectory generator. Visual tokens are augmented only with normalized image-plane locations and camera-view identifiers, while a training-only predicate-to-region objective encourages grounding to referenced objects. Consistent with prior work in this domain, we evaluate the model using Success@$K$, the fraction of tasks for which at least one of K sampled trajectories satisfies the TL specification. On Panda task, our model achieves 67.45% Success@1024, compared with 59.11% for the oracle-state baseline. On AntMaze task, it achieves 96.35% Success@256, comparable to the oracle result of 96.88%. Resolution and intervention studies show that spatial detail depends on semantic grounding and predicate identity affects both attention and performance. These results demonstrate a direct mapping from visual observations and structured TL goals to action trajectories without requiring object geometry at inference. Code is available at https://github.com/AricLau07/vision-tl-action.
- Abstract(参考訳): 時間論理(TL)は、長い水平ロボット作業の定式化のための構成言語を提供するが、既存のTL条件の軌道生成器は、タスクグラフに正確なオブジェクト幾何学を符号化することで、知覚と記号の結合をサイドステップできる。
本稿では,多視点画像から行動軌跡を生成する「emph{Vision-TL-Action}」,座標自由なTL構文グラフ,ロボットの初期状態について紹介する。
TLノードトークンと空間的視覚トークンは双方向のクロスアテンションによって融合され、その結果の表現条件はフローマッチング・トラジェクトリ・ジェネレータである。
ビジュアルトークンは通常の画像プレーンの位置とカメラビュー識別子でのみ拡張され、トレーニングのみの述語から地域への目的は参照オブジェクトのグラウンド化を促進する。
この領域における先行研究と一致し、Success@K$ を用いてモデルを評価し、K の少なくとも 1 つのサンプル軌道が TL 仕様を満たすタスクの分数を評価する。
Pandaタスクでは、私たちのモデルは67.45%のSuccess@1024を達成するが、オラクルステートベースラインは59.11%である。
AntMazeタスクでは96.35%のSuccess@256が達成され、96.88%のオラクル結果に匹敵する。
解決と介入研究は、空間的詳細が意味的基盤に依存し、述語的アイデンティティが注意とパフォーマンスの両方に影響を与えることを示している。
これらの結果は,物体形状を推測することなく,視覚観測と構造化TL目標から行動軌跡への直接マッピングを示す。
コードはhttps://github.com/AricLau07/vision-tl-actionで入手できる。
関連論文リスト
- ReferTrack: Referring Then Tracking for Embodied Visual Tracking [13.368122578638847]
Embodied visual tracking (EVT) は、自然言語で記述された特定のターゲットを連続的に追従する移動体エージェントを必要とする。
ReferTrackは、1台の前方カメラでEVTをグラウンド化する参照then追跡パラダイムである。
このモデルでは、まずインデックス付き境界ボックスからターゲットを選択し、次に、この画像グラウンド決定で条件付けられた追跡経路をデコードする。
論文 参考訳(メタデータ) (2026-07-22T12:05:13Z) - Improving Node Representation by Boosting Target-Aware Contrastive Loss [10.73390567832967]
本稿では,ターゲット認識型コントラスト学習(Target-Aware Contrastive Learning,Target-Aware CL)を紹介する。
XTCLを最小化することにより、ターゲット認識CLは、ターゲットタスクとノード表現の間の相互情報を増加させる。
実験により、XTCLは2つのタスクの性能を著しく改善することを示した。
論文 参考訳(メタデータ) (2024-10-04T20:08:24Z) - AiluRus: A Scalable ViT Framework for Dense Prediction [95.1313839257891]
視覚変換器 (ViT) は、その優れた性能のため、視覚タスクの一般的なアーキテクチャとして登場した。
本稿では,画像の異なる領域に対して,その重要度に応じて適応分解能を適用することを提案する。
提案手法を3つの異なるデータセット上で評価し,有望な性能を観察する。
論文 参考訳(メタデータ) (2023-11-02T12:48:43Z) - UnsMOT: Unified Framework for Unsupervised Multi-Object Tracking with
Geometric Topology Guidance [6.577227592760559]
UnsMOTは、オブジェクトの外観と運動の特徴と幾何学的情報を組み合わせて、より正確なトラッキングを提供する新しいフレームワークである。
実験結果から, HOTA, IDF1, MOTAの計測値において, 最先端手法と比較して顕著な性能を示した。
論文 参考訳(メタデータ) (2023-09-03T04:58:12Z) - Towards Unified Token Learning for Vision-Language Tracking [65.96561538356315]
本稿では,VL追跡をトークン生成タスクとして用いた「textbfMMTrack」という,視覚言語(VL)追跡パイプラインを提案する。
提案フレームワークは,言語記述と境界ボックスを離散トークン列にシリアライズする。
この新しい設計パラダイムでは、全てのトークンクエリが望ましいターゲットを認識し、ターゲットの空間座標を直接予測するために必要となる。
論文 参考訳(メタデータ) (2023-08-27T13:17:34Z) - Tracking Objects and Activities with Attention for Temporal Sentence
Grounding [51.416914256782505]
時間文 (TSG) は、意味的に自然言語のクエリと一致した時間セグメントを、トリミングされていないセグメントでローカライズすることを目的としている。
本稿では,(A)マルチモーダル・検索空間を生成するクロスモーダル・ターゲット・ジェネレータと(B)マルチモーダル・ターゲットの動作を追跡し,クエリ関連セグメントを予測するテンポラル・センセント・トラッカーとを含む,新しいテンポラル・センセント・トラッカー・ネットワーク(TSTNet)を提案する。
論文 参考訳(メタデータ) (2023-02-21T16:42:52Z) - Learning to Generate Scene Graph from Natural Language Supervision [52.18175340725455]
シーングラフと呼ばれる画像内の局所化オブジェクトとその関係をグラフィカルに表現するために,画像と文のペアから学習する最初の方法の1つを提案する。
既製のオブジェクト検出器を利用してオブジェクトのインスタンスを識別し、ローカライズし、検出された領域のラベルとキャプションから解析された概念をマッチングし、シーングラフを学習するための"擬似ラベル"を作成する。
論文 参考訳(メタデータ) (2021-09-06T03:38:52Z) - TransMOT: Spatial-Temporal Graph Transformer for Multiple Object
Tracking [74.82415271960315]
映像内の物体間の空間的・時間的相互作用を効率的にモデル化するソリューションであるTransMOTを提案する。
TransMOTは従来のTransformerよりも計算効率が高いだけでなく、トラッキング精度も向上している。
提案手法は、MOT15、MOT16、MOT17、MOT20を含む複数のベンチマークデータセット上で評価される。
論文 参考訳(メタデータ) (2021-04-01T01:49:05Z) - A Graph-based Interactive Reasoning for Human-Object Interaction
Detection [71.50535113279551]
本稿では,HOIを推論するインタラクティブグラフ(Interactive Graph, in-Graph)という,グラフに基づくインタラクティブ推論モデルを提案する。
In-GraphNet と呼ばれる HOI を検出するための新しいフレームワークを構築した。
私たちのフレームワークはエンドツーエンドのトレーニングが可能で、人間のポーズのような高価なアノテーションはありません。
論文 参考訳(メタデータ) (2020-07-14T09:29:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。