論文の概要: SE(3) Neural Potential Fields for 6-DoF Trajectory Planning Directly from Images Without Explicit 3D Reconstruction
- arxiv url: http://arxiv.org/abs/2609.24864v1
- Date: Mon, 21 Sep 2026 16:35:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.016955
- Title: SE(3) Neural Potential Fields for 6-DoF Trajectory Planning Directly from Images Without Explicit 3D Reconstruction
- Title(参考訳): SE(3) 明示的な3次元再構成を伴わない画像から直接の6次元軌道計画のためのニューラルポテンシャル場
- Abstract要約: RGB画像から学習したSE(3)神経電位場をナビゲーション関数で教師する。
2つのテーブルトップシーンでは、UR10上で障害物ブロックされた開始から、各開始から3cm以内にフィールドが収束する。
この2つの場面で見事な成功は90.0%と40.0%である。
- 参考スコア(独自算出の注目度): 2.2340839344812857
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reaching a 6-DoF grasp pose in clutter requires a collision-free trajectory, conventionally obtained by reconstructing the scene in 3D and planning inside that reconstruction, at the cost of its accuracy and compute. Potential fields learned directly from images remove that dependency but inherit the classical weakness of artificial potential fields: where attractive and repulsive gradients cancel, the descent grazes the obstacle instead of going around it, and can stall short of the goal. We present an SE(3) neural potential field learned from posed RGB images and supervised with a navigation function, the geodesic distance to the grasp through free space recovered from those same images during training, which removes both failures. On two tabletop scenes, from obstacle-blocked starts executed on a UR10, the field converges within 3 cm of the grasp from every start and every path it executes is collision-free against the ground-truth geometry, against 25% and 0% under image supervision alone; mean clearance rises from under a centimeter to 8.6-8.8 cm and arm-link contacts fall from 20.6-50.4% to 2.7-5.5% of executed configurations. Executed grasp success is 90.0% and 40.0% on the two scenes, the residual failures being refusals of the Cartesian executor rather than of the field. Planning takes about 2 s against 67-133 s for RRT* on a reconstruction of the same images, though under a common offline harness the two are comparable: the deployed margin is the cost of collision-checking a dense reconstruction, not planner complexity.
- Abstract(参考訳): 6-DoFグリップポーズをクラッタに保持するには衝突のない軌道が必要であり、従来は3Dでシーンを再構築し、その再現を精度と計算のコストで計画する必要があった。
イメージから直接学習されたポテンシャル場は、その依存を除去するが、人工ポテンシャル場の古典的な弱点を継承する。
提案するSE(3)神経電位場は,RGB画像から学習し,ナビゲーション機能によって制御される。
2つのテーブルトップシーンでは、UR10上で障害物ブロックされた開始から、フィールドは開始から3cm以内に収束し、実行されたすべてのパスは、画像監督のみで25%と0%の地平線幾何学と衝突しない。
把握された成功は2つの場面で90.0%と40.0%であり、残りの失敗はフィールドではなく、カルテシアン執行官の拒絶である。
同じ画像の復元には67-133秒のRRT*に対して約2秒かかるが、共通のオフライン利用では2つに匹敵する: 配置されたマージンは、プランナーの複雑さではなく、密集した再構築を衝突チェックするコストである。
関連論文リスト
- UniPoint: Unified Point-Level Sensor Fusion for Humanoid Locomotion Across Challenging Terrains [5.891198839622618]
We present UniPoint, a humanoid whole-body locomotion framework built on multi-source point-level sensor fusion。
地形を意識した報酬、知覚劣化注入、ドメインランダム化を含む単一のトレーニングは、8種類の地形に対して1つのポリシーを生成し、微調整なしでRK3588に展開する。
DR02のヒューマノイドでは、70cmの高さのプラットフォーム、100cmの隙間、細いバリア、スパースまたは狭い足場で、9つの現実的な設定のそれぞれで20の試験が実施されている。
論文 参考訳(メタデータ) (2026-09-20T14:23:30Z) - SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion [41.64988244398264]
地表面の高密度化は行動クリティカルな詳細を円滑にし,時間的信用割当を欠く点の模倣という,2つの複合的な長軸不安定性の原因に対処する統合フレームワークSOLOを提案する。
そのクエリリコンストラクタ(QR)は、フーリエエンコードされたセルクエリを使用して、深さプロプリセプショントークンから空間的に特異的なエビデンスを検索し、鋭い地形境界を保存する。
Trajectory-Aware MSE (TA-MSE) 蒸留は、PPO報酬に対する次世代の教師と学生の意見の不一致を追加し、一般化アドバンテージ推定により、過去の行動に対する将来の不一致を伝播させる。
論文 参考訳(メタデータ) (2026-08-27T03:49:55Z) - Track-Leakage-Free Hold-Out Self-Validation for Photogrammetric Reconstruction: Protocol, Sensitivity, and Limits [0.0]
画像再構成のためのトラックレカジフリーホールドアウトプロトコルを定式化する。
我々は、5つの基準撮影、13のETH3Dレーザースキャンシーン、EuRoC飛行、30のIMC 2025シーンで評価した。
論文 参考訳(メタデータ) (2026-07-25T17:00:11Z) - Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning [48.438568700670835]
モデルから潜在的知識を読み出す標準的な方法は、視覚言語モデルがイメージに根ざしたものを体系的に上書きすることができる。
本研究では,空間的推論において,一直線因果制御によって露呈した探究と操舵の両方に誤差が見えないことを示す。
論文 参考訳(メタデータ) (2026-06-30T07:33:18Z) - RAP: 3D Rasterization Augmented End-to-End Planning [104.52778241744522]
エンド・ツー・エンドの列車政策の模擬学習は、専門家によるデモンストレーションでのみ行われる。
アノテーション付きプリミティブの軽量化により、コストのかかるレンダリングを置き換える3Dラスタライゼーションを提案する。
RAPは最先端のクローズドループとロングテールロバスト性を実現し、4つの主要なベンチマークで第1位となった。
論文 参考訳(メタデータ) (2025-10-05T19:31:24Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - Shape, Pose, and Appearance from a Single Image via Bootstrapped
Radiance Field Inversion [54.151979979158085]
提案手法では,自然画像に対する基本的エンドツーエンド再構築フレームワークを導入し,正確な地平のポーズが得られない。
そこで,モデルが解の第一の推算を生成するハイブリッド・インバージョン・スキームを適用する。
当社のフレームワークでは,イメージを10ステップでデレンダリングすることが可能で,現実的なシナリオで使用することが可能です。
論文 参考訳(メタデータ) (2022-11-21T17:42:42Z) - SO-Pose: Exploiting Self-Occlusion for Direct 6D Pose Estimation [98.83762558394345]
SO-Poseは、オブジェクトの6自由度(6DoF)をすべて、単一のRGBイメージから散らばった環境でポーズさせるフレームワークである。
本稿では,3次元オブジェクトの2層表現を確立するために,自己閉塞に関する新たな推論を導入する。
対応性,自己閉塞性,6次元ポーズを整列する層間合成により,精度とロバスト性をさらに向上させることができる。
論文 参考訳(メタデータ) (2021-08-18T19:49:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。