論文の概要: Directed Temporal Representations for Offline Visual Control
- arxiv url: http://arxiv.org/abs/2610.08960v1
- Date: Tue, 06 Oct 2026 18:26:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.553841
- Title: Directed Temporal Representations for Offline Visual Control
- Title(参考訳): オフライン視覚制御のための時間方向の指示表現
- Abstract要約: 本稿では,制御のための時間表現について紹介する。
凍結したLeWorldModel上で、オフラインのビジュアルトラジェクトリからこのような幾何学を学ぶ。
計画や直接政治のベースラインと比較して、目標条件の強い制御性能を達成する。
- 参考スコア(独自算出の注目度): 6.821224693665539
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Predictive world models provide compact visual representations for control. Control requires a latent geometry aligned with temporal reachability rather than predictive similarity alone. We introduce Directed Temporal Representations for Control (DTRC), which learns such a geometry from offline visual trajectories on top of frozen LeWorldModel (LeWM) features. DTRC constructs a directed temporal quasimetric over the learned control representation. Short-range temporal offsets calibrate the distance scale. Bootstrapped targets extend temporal reachability across longer horizons. Action-conditioned consistency aligns the representation with local transition dynamics. The resulting distance estimates temporal reaching cost, and its change across a transition defines goal-relative temporal progress. We use this progress signal as a temporal critic for direct goal-conditioned policy learning. Model-assisted targets provide an additional training-time refinement under behavior-support and dynamics-agreement constraints. Across ten visual control tasks, DTRC achieves strong goal-conditioned control performance relative to planning and direct-policy baselines. Held-out diagnostics on the four LeWM tasks show consistent short-range temporal calibration, task-dependent long-range and directional structure, and positive transition-level progress. Temporal supervision improves the same flow-policy parameterization across all four LeWM tasks, while the resulting policy acts directly without iterative trajectory search at test time.
- Abstract(参考訳): 予測世界モデルは、制御のためのコンパクトな視覚表現を提供する。
制御には、予測的類似性のみではなく、時間的到達性に整合した潜時幾何学が必要である。
凍結したLeWorldModel(LeWM)機能の上に,オフラインの視覚軌道からこのような幾何学を学習するDTRC(Directed Temporal Representations for Control)を導入する。
DTRCは、学習した制御表現の上に有向時間準メトリックを構成する。
短距離時間オフセットは距離スケールを校正する。
ブートストラップされたターゲットは、長い地平線を越えて時間的到達性を拡張する。
動作条件の整合性は、表現を局所的な遷移力学と整合させる。
結果として得られた距離は、時間的到達コストを推定し、その移行による変化は、目標相対的な時間的進行を定義する。
我々は、この進捗信号を、直接目標条件付き政策学習の時間的批判として利用する。
モデル支援ターゲットは、振る舞いサポートおよび動的集約制約の下で、追加のトレーニング時間改善を提供する。
DTRCは10の視覚的制御タスクを通して、計画や直接政治のベースラインに対して、目標条件の強い制御性能を達成する。
4つのLeWMタスクのヘルドアウト診断は、一貫した短距離時間的キャリブレーション、タスク依存の長距離方向および方向構造、および正の遷移段階の進行を示す。
時間的監督は、4つのLeWMタスクすべてで同じフローポリティクスパラメータ化を改善し、その結果のポリシーはテスト時に反復的な軌跡探索なしで直接作用する。
関連論文リスト
- EgoTSR++: Egocentric Spatiotemporal Reasoning for Task Progress Understanding [51.078675806865306]
VLM(Vision-Language Models)は、静的な視覚的理解において急速に進歩しているが、エゴセントリックなタスクがどのように進行しているかを判断しても信頼性が低い。
EgoTSR(EgoTSR)は,オーダーローバストなタスク・プログレス理解を診断・改善するための統合フレームワークである。
論文 参考訳(メタデータ) (2026-09-23T09:20:44Z) - DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer [86.4618122245946]
DyG$2$Tは動的モデリングフレームワークで、キーポイント表現を空間的に完了し、時間的に識別することでオブジェクトの運動軌跡を推定する。
合成データセットと実世界のデータセットの両方の実験は、DyG$2$Tが正確な動的モデリングと推論を実現することを示した。
論文 参考訳(メタデータ) (2026-08-19T03:44:28Z) - PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies [74.07190331264488]
本稿では,アクションチャンク予測ステップ毎に条件適応を行う軽量なLoRAパラメータ化を提案する。
PhaseLoRAはアクションエキスパートのLoRA左ファクタを変調し、有効な低ランク更新方向を時間とともに変更する。
その結果、連続的なVLAポリシーのための効果的な軽量PEFT軸として、軌道内コンディショニングが確立された。
論文 参考訳(メタデータ) (2026-08-15T15:32:08Z) - Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving [37.533498955258544]
本稿では,インスタンスレベルの残差をクラスレベルの遅延シフトに置き換える単一パス誘導機構を提案する。
我々はLCSがより強力なコマンドアテンデンスを実現しつつ、推論遅延を約50%削減できることを実証した。
論文 参考訳(メタデータ) (2026-07-31T19:32:28Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation [24.310993695214094]
SWAM(Spatial-Perceiving World Action Model)は,タスク中心の共同観測行動生成フレームワークである。
スタートとゴールのRGB観測が与えられた場合、SWAMはシングルパス推論を行い、中間のRGB-Dシーケンスと対応するアクショントラジェクトリを同時に生成する。
SWAMは、成功率、軌道精度、推論効率において、最先端の2段階プランナーを著しく上回っている。
論文 参考訳(メタデータ) (2026-06-29T07:43:47Z) - Towards Physically Consistent 4D Scene Reconstruction for Closed-loop Autonomous Driving Simulation [19.055975606481635]
高忠実なストリートシーンの再構築は、エンドツーエンドの自動運転シミュレーションにおいて重要である。
既存の3DGSメソッドとその4D拡張は、両方を同時に達成できない。
空間的識別性を回復するための直交射影勾配(OPG)を提案する。
論文 参考訳(メタデータ) (2026-05-20T11:09:53Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - PCSTracker: Long-Term Scene Flow Estimation for Point Cloud Sequences [20.800932584993706]
PCSTrackerは、ポイントクラウドシーケンスにおける一貫したシーンフロー推定のために特別に設計されたエンドツーエンドフレームワークである。
PCSTrackerは、長期のシーンフロー推定において最高の精度を達成し、32.5 FPSでリアルタイム性能を維持する。
論文 参考訳(メタデータ) (2026-03-20T08:45:27Z) - LWM-Temporal: Sparse Spatio-Temporal Attention for Wireless Channel Representation Learning [15.963908827464302]
LWM-Temporalは、モビリティによって引き起こされる進化を捉え、様々な下流タスクで再利用できるユニバーサルチャネル埋め込みを学習する。
LWM-Temporalは、角度遅延時間領域で動作し、スパース時空間注意(SSTA)を導入する
LWM-Temporalは、物理インフォームドマスキングのカリキュラムを用いて、自己教師型で事前訓練される。
論文 参考訳(メタデータ) (2026-02-22T17:41:24Z) - Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。