論文の概要: Video2STL: Grounding VLM-Generated Temporal Specifications for Robot Learning
- arxiv url: http://arxiv.org/abs/2609.37519v1
- Date: Tue, 29 Sep 2026 13:10:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.533554
- Title: Video2STL: Grounding VLM-Generated Temporal Specifications for Robot Learning
- Title(参考訳): Video2STL:ロボット学習のためのVLM生成時間仕様
- Abstract要約: Video2STLは、観測のみの動画をパラメトリック信号時間論理(Parametric Signal Temporal Logic, STL)仕様に変換するフレームワークである。
視覚言語モデルは、エンボディメントに依存しないイベントトレースを抽出し、象徴的時間的仕様のバンクを構築する。
Video2STLのポリシーは、高速エネルギー効率の競争力を維持しながら、0.3ドルから2.1,mathrmm/sドルまでの速度で100%の成功を収める。
- 参考スコア(独自算出の注目度): 7.519777460088398
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video-based policy learning is particularly promising, as it illustrates target behaviors without requiring action annotations or embodiment-matched demonstrations. A central challenge is deciding what information should be transferred from the video to the robot. Existing approaches commonly convert visual observations into scalar similarity or value signals, or ask foundation models to directly generate reward code. These approaches can make the temporal structure of a task difficult to inspect, ground, and reuse. We present Video2STL, a framework that converts observation-only videos into parametric Signal Temporal Logic (STL) specifications and uses the resulting formal representation for robot learning. A vision-language model extracts an embodiment-independent semantic event trace and constructs a bank of symbolic temporal specifications. The model determines the task structure, while numerical predicate thresholds and temporal bounds are grounded from successful robot trajectories. For policy learning, we separate short- and long-timescale temporal information: short-horizon specifications provide dense rewards through rolling-window quantitative robustness, while a causal monitor over a retained long-horizon specification provides one-time progress rewards for valid temporal prefixes. The same representation supports cross-embodiment transfer from human or animal videos to robot control. Across four manipulation tasks, Video2STL achieves $85.8\%$ average success-once and $67.0\%$ success-at-end, compared with $81.5\%/59.5\%$ for native dense PPO and $65.0\%/42.3\%$ for Text2Reward; in quadruped locomotion, Qwen-3.8 and GPT-5.6-based Video2STL policies achieve $100\%$ success across velocities from $0.3$ to $2.1\,\mathrm{m/s}$ while remaining competitive in high-speed energy efficiency. Project webpage: \href{https://video2stl.github.io/}{video2stl}.
- Abstract(参考訳): ビデオベースのポリシー学習は特に有望であり、アクションアノテーションや具体化対応のデモを必要とせずに、ターゲットの動作を示す。
中心的な課題は、ビデオからロボットにどの情報を転送すべきかを決めることである。
既存のアプローチでは、視覚的観察をスカラー類似性や値信号に変換したり、ファンデーションモデルに報酬コードを直接生成するように求めたりするのが一般的である。
これらのアプローチは、タスクの時間的構造を検査、接地、再利用が困難にする可能性がある。
本稿では,ビデオのみをパラメトリック信号時間論理(Palmetric Signal Temporal Logic, STL)に変換するフレームワークであるVideo2STLについて述べる。
視覚言語モデルは、エンボディメントに依存しないセマンティックイベントトレースを抽出し、象徴的時間的仕様のバンクを構築する。
モデルがタスク構造を決定する一方で、数値的な述語しきい値と時間的境界は、成功したロボット軌道から導かれる。
政策学習では,短期・長期の時間的情報とを分離する: 短時間の時間的仕様は,転がり窓による量的堅牢性を通じて,厳密な報酬を与える一方,長期の期間的仕様に対する因果的な監視は,有効な時間的前置詞に対して1回進行報酬を与える。
同じ表現は、人間や動物のビデオからロボット制御への異体間移動をサポートする。
4つの操作タスクで、Video2STLは平均成功率$85.8\%、成功率$67.0\%、ネイティブな高密度PPOが$81.5\%/59.5\%、Text2Rewardが$6.0\%/42.3\%、四足歩行でQwen-3.8とGPT-5.6ベースのVideo2STLポリシーは、高速エネルギー効率の競争力を維持しながら、速度を巡って$100\%である。
プロジェクトWebページ: \href{https://video2stl.github.io/}{video2stl}
関連論文リスト
- From LLM-Generated Specifications to Learned Quadruped Locomotion [7.240440138551274]
四足歩行ロボットの動作ポリシーは、しばしば強化学習を用いて訓練される。
多くの場合、どの地域報酬が望ましいグローバルな行動を引き起こすかは定かではない。
本稿では,大言語モデル(LLM)が信号時間論理(PSTL)の仕様を生成することにより,このギャップを埋めることができるかどうかを検討する。
論文 参考訳(メタデータ) (2026-09-07T06:53:53Z) - DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control [16.562259973551786]
本稿では,ビデオ拡散変換器とアクション拡散変換器を結合したエンドツーエンドのビデオ・アクション・モデルであるDiT4DiTを紹介する。
DiT4DiTは、再構成後のフレームに頼る代わりに、ビデオ生成プロセスから中間的なデノイング機能を抽出する。
これは最先端の結果を達成し、LIBEROでは98.6%、RoboCasa GR1では50.8%という平均的な成功率に達した。
論文 参考訳(メタデータ) (2026-03-11T06:03:53Z) - Towards Universal Modal Tracking with Online Dense Temporal Token Learning [66.83607018706519]
オンライン高密度時間トークン学習を用いたユニバーサルビデオレベルのモダリティ認識追跡モデルを提案する。
モデルの入力をビデオシーケンスレベルに拡張し、よりリッチなビデオコンテキストを言語に近い視点から見ることを目的としている。
論文 参考訳(メタデータ) (2025-07-27T08:47:42Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - No Time to Waste: Squeeze Time into Channel for Mobile Video Understanding [38.60950616529459]
我々は,ビデオシーケンスの時間軸をチャネル次元に絞り込み,モバイルビデオ理解のための軽量なビデオ認識ネットワークであるtextitSqueezeTime を提案する。
提案されているSqueezeTimeは、非常に軽量で高速で、モバイルビデオ理解の精度が高い。
論文 参考訳(メタデータ) (2024-05-14T06:32:40Z) - $R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding [41.69321731689751]
ビデオの時間的グラウンドは、自然言語のクェリが与えられたビデオに関連性のあるクリップを埋めることを目的としている。
既存のVTGモデルは、フレームワイドのファイナルレイヤCLIP機能に基づいて構築されており、追加の時間バックボーンによって支援されている。
ビデオ時間的グラウンド化のためのパラメータとメモリ効率の変換学習フレームワークであるReversed Recurrent Tuning(R2$-Tuning)を提案する。
論文 参考訳(メタデータ) (2024-03-31T21:17:48Z) - SViTT: Temporal Learning of Sparse Video-Text Transformers [65.93031164906812]
SViTTは,多フレーム推論が可能な疎ビデオテキストアーキテクチャであり,注目度の高い単純変換器よりもはるかに低コストである。
SViTTは、自己注意におけるトークン間のクエリキー通信を制限するエッジ空間と、非形式的視覚トークンを破棄する空間の2つの形式を採用している。
論文 参考訳(メタデータ) (2023-04-18T08:17:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。