論文の概要: Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations
- arxiv url: http://arxiv.org/abs/2608.29434v1
- Date: Sat, 29 Aug 2026 20:41:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.959447
- Title: Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations
- Title(参考訳): 潜在計画は生存点雲を救えるか? 測地観測のためのアクション・コンディション付きJEPA世界モデル
- Abstract要約: JEPAワールドモデルは、ラテントスペースを制御するための実用的なルートにします。
0.3-15%のシーンポイントが移動し,3次元自己監督の幾何学的ショートカットによる潜伏予測化合物の時間的最適度が向上した。
標準的なJEPA設計を3つ挙げて、クラウド、フリーズエンコーダ、分散プライア、アクションセンシティブ、および安定なワールドモデルベンチマークを再センスします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: JEPA world models make latent-space planning a practical route to control, but they are built almost exclusively on images. Whether latent prediction survives geometric observations is unclear: point clouds are sparse, unordered, and self-occluded, and with 0.3-15% of scene points moving, the slow-feature optimum of latent prediction compounds with the geometric shortcut of 3D self-supervision. We lift three canonical JEPA designs to point clouds, frozen-encoder, distribution-prior, and action-sensitive, and re-sense the stable-worldmodel benchmark so that only the observation differs from the image baselines. All three plan without collapse: the distribution-prior model is statistically equivalent to its re-evaluated image counterpart on every benchmark, and the action-sensitive model attains the strongest result in our controlled comparison where the most geometry moves. Probing explains why: object positions are almost perfectly linearly decodable and attention falls on the few moving points. Planning withstands heavy dropout never seen in training, though range noise defeats the thinnest scene. Geometry finally makes a commanded 3D target a natural goal interface: we construct the goal latent from the target and the current latent, at no cost in success rate, without a goal observation.
- Abstract(参考訳): JEPAの世界モデルでは、ラテントスペースの計画が現実的な制御ルートとなっているが、ほとんどイメージ上に構築されている。
点雲は狭く、秩序がなく、自閉しており、シーンポイントの0.3-15%が移動しているため、3次元自己スーパービジョンの幾何学的ショートカットによる潜伏予測化合物の遅い時間的最適である。
標準的なJEPA設計を3つ挙げて、クラウド、フリーズエンコーダ、ディストリビューションプライア、アクションセンシティブに指定し、安定したワールドモデルベンチマークを再センスすることで、イメージベースラインと観察のみが異なるようにします。
分布優先モデルは各ベンチマークで再評価された画像と統計的に等価であり、最も幾何が動く制御された比較において、アクション感受性モデルが最も高い結果が得られる。
オブジェクトの位置はほぼ完全に直線的にデオード可能であり、注意は数少ない移動点に落ちます。
トレーニングで見ることのない重い落下に耐える計画だが、レンジノイズは最も薄いシーンを破る。
Geometryは最終的に、指示された3D目標を自然な目標インターフェースとし、目標と現在の目標から遅延した目標を、目標観測なしで、成功率の犠牲なしに構築する。
関連論文リスト
- UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling [24.745715007832953]
JEPA(Joint-Embedding Predictive Architectures)は、コンパクトな潜在空間における世界モデルの自己教師型学習のためのフレームワークとして登場した。
我々は,光度予測(画像レベルの変換)と時間的予測(映像レベルの次状態ダイナミクス)を協調的に学習する統合JEPAであるUniJEPAを提案する。
論文 参考訳(メタデータ) (2026-08-07T16:55:58Z) - J-LAW: Joint Localization and Actionable World Modeling via Coupled Latent Factor Graphs [5.78717443304847]
行動条件付き世界モデルは計画のためのコンパクトな潜在力学を学習するが、グローバルなメートル法一貫性は無視する。
J-LAW は、パラメータのポーズ、潜時世界状態、潜時ランドマークの埋め込みを協調的に最適化する結合因子グラフである。
MAP目標の確率的因子として,観察,行動条件予測,メートル法,ポーズ-潜時結合,潜時ループ閉鎖,潜時ランドマーク観察を行った。
論文 参考訳(メタデータ) (2026-06-27T03:39:44Z) - Lifting Embodied World Models for Planning and Control [59.09016913513998]
我々は、ハイレベルなアクションを低レベルなジョイントアクションのシーケンスにマッピングする軽量なポリシーを訓練する。
我々は、この枠組みを人間的な実施のためにインスタンス化し、ハイレベルなアクション空間を2次元のウェイポイントの小さなセットとして定義する。
昇降した世界モデルは,低レベルな関節空間で直接探索するよりもかなり優れていることを示す。
論文 参考訳(メタデータ) (2026-04-28T23:59:19Z) - Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors [47.080898117231435]
幾何学制御可能な3Dアセットとシーン生成にポイントクラウドを活用できる拡散ベースのフレームワークであるPoints-to-3Dを紹介する。
TRELLISフレームワーク内で、グローバルな構造的インペイントを学習するために設計されたタスク固有データに基づいてトレーニングされた構造的インペイントネットワークを用いて、ステージ化されたサンプリング戦略を用いて推論を行う。
オブジェクトとシーンシナリオの両方の実験は、レンダリング品質と幾何学的忠実度の観点から、最先端のベースラインよりも優れたパフォーマンスを一貫して示している。
論文 参考訳(メタデータ) (2026-03-19T11:33:27Z) - Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation [53.09168514034483]
バイマン操作は3次元幾何学を推論し、動作中にどのように進化するかを予測し、滑らかで協調された動きを生成するポリシーを必要とする。
本稿では,事前学習した3次元幾何学的基礎モデルに基づいて,バイマン操作を直接構築するフレームワークを提案する。
我々の政策は、幾何学的認識の潜伏子、2次元意味的特徴、およびプロプレセプションを統一状態表現に融合させ、拡散モデルを用いて将来のアクションチャンクと、密度の高いポイントマップにデコードする未来の3次元潜伏子を共同で予測する。
論文 参考訳(メタデータ) (2026-02-27T08:54:20Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - Into the Unknown: Towards using Generative Models for Sampling Priors of Environment Uncertainty for Planning in Configuration Spaces [28.37021202108478]
事前は部分的な可観測性の下での計画には不可欠だが、実際は入手が困難である。
本稿では, 大規模事前学習モデルを用いて, ゼロショット方式で事前生成を行う確率論的パイプラインを提案する。
我々は、ロボットが観測されていない対象物にナビゲートする必要がある戸口を通して部分的に見える部屋のMatterport3Dベンチマークを構築した。
論文 参考訳(メタデータ) (2025-10-13T05:08:48Z) - Adaptive Point-Prompt Tuning: Fine-Tuning Heterogeneous Foundation Models for 3D Point Cloud Analysis [51.37795317716487]
本稿では,パラメータの少ない事前学習モデルを微調整するAdaptive Point-Prompt Tuning (APPT)法を提案する。
局所幾何学を集約することで原点雲を点埋め込みに変換し、空間的特徴を捉える。
任意のモダリティのソース領域から3Dへの自己アテンションを校正するために,重みを点埋め込みモジュールと共有するプロンプトジェネレータを導入する。
論文 参考訳(メタデータ) (2025-08-30T06:02:21Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - Unsupervised 3D Point Cloud Completion via Multi-view Adversarial Learning [61.14132533712537]
MAL-UPCは、領域レベルとカテゴリ固有の幾何学的類似性の両方を効果的に活用するフレームワークである。
我々のMAL-UPCは3Dの完全な監視を一切必要とせず、トレーニングセットにおける一視点部分的な観察のみを必要とする。
論文 参考訳(メタデータ) (2024-07-13T06:53:39Z) - PointCA: Evaluating the Robustness of 3D Point Cloud Completion Models
Against Adversarial Examples [63.84378007819262]
本稿では,3次元クラウド完了モデルに対する最初の逆攻撃であるPointCAを提案する。
ポイントCAは、元のものと高い類似性を維持する逆点雲を生成することができる。
その結果,PointCAは77.9%から16.7%に低下し,その構造は0.01以下であることがわかった。
論文 参考訳(メタデータ) (2022-11-22T14:15:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。