論文の概要: RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning
- arxiv url: http://arxiv.org/abs/2607.29622v1
- Date: Fri, 31 Jul 2026 16:56:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.818342
- Title: RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning
- Title(参考訳): RayViT:ビューポイント・ロバスト模倣学習のためのレイコンディション型視覚表現
- Authors: Qian Wang, Longrui Chen, Peiran Sun, Aleksandar Taranovic, Niklas Freymuth, Ge Li, Weiran Liao, C. F. Maximilian Nagy, Yucheng Tan, Tao Chen, Gerhard Neumann,
- Abstract要約: 我々は、カメラ幾何学を予め訓練されたViTバックボーンに注入する軽量アーキテクチャである、bf RobotextRay-conditioned Vision Transformer(RayViT)を提案する。
RayViTはカメラ幾何学をチャンカー線地図として表現し、それを線特徴に修正し、ゲートクロスアテンションを使用して線条件のクラストークンを生成する。
sim-とreal-robotタスクの実験では、RayViTはカメラの摂動下で約13パーセントのロバスト性を改善することが示されている。
- 参考スコア(独自算出の注目度): 59.07474327224552
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual imitation learning enables robots to acquire visuomotor skills directly from images, yet RGB observations lack explicit geometric cues, making learned policies brittle to camera perturbations. To address this, we propose \textbf{Ray-conditioned Vision Transformer Encoder (RayViT)}, a lightweight architecture that injects camera geometry into pretrained ViT backbones. RayViT represents camera geometry as a Plücker ray map, patchifies it into ray features, and uses gated cross-attention to produce a ray-conditioned class token. These ray features are added as dense positional embeddings, while the ray class token replaces the original ViT class token to provide a geometry-aware summary representation. We combine this approach with an auxiliary cosine similarity loss to consistently improve the performance and robustness for geometry-aware tokens. Experiments on sim- and real-robot tasks demonstrate that RayViT improves robustness by approximately 13 percentage points under camera perturbations in multi-task RoboCasa benchmark and by 1.78 average completed stages in real-world multi-task success rate compared to baselines.
- Abstract(参考訳): 視覚模倣学習は、ロボットが画像から直接視覚運動のスキルを習得することを可能にするが、RGB観察では明らかな幾何学的手がかりが欠如しており、学習方針がカメラの摂動に弱い。
そこで本研究では,カメラ形状を予め訓練したViTバックボーンに注入する軽量なアーキテクチャであるRayViT(textbf{Ray-conditioned Vision Transformer Encoder)を提案する。
RayViTはカメラ幾何学をPlücker ray mapとして表現し、それをレイ特徴にパッチし、ゲートクロスアテンションを使用してレイ条件のクラストークンを生成する。
これらのレイ特徴は密接な位置埋め込みとして追加され、一方、レイクラストークンは元のViTクラストークンを置き換え、幾何学的に認識された要約表現を提供する。
この手法と補助的なコサイン類似性損失を組み合わせることで、幾何認識トークンの性能とロバスト性を一貫して改善する。
sim-とreal-robotタスクの実験では、RayViTはマルチタスクのRoboCasaベンチマークでカメラの摂動で約13ポイント、実世界のマルチタスクの成功率で1.78ポイント、ロバスト性を改善することが示されている。
関連論文リスト
- G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models [3.704517635293094]
視覚言語アクション(VLA)モデルは、汎用ロボット操作において急速に進歩した。
それらの視覚トークンは、ロボットのカメラのキャリブレーションされた形状ではなく、2D画像座標に基づいている。
予め訓練されたVLAの視覚的ストリームに校正された構造を注入するカメラ対応幾何モジュールであるG$3$VLAを提案する。
論文 参考訳(メタデータ) (2026-06-23T12:02:36Z) - From Rays to Projections: Better Inputs for Feed-Forward View Synthesis [26.130973137744018]
フィードフォワードビュー合成モデルは、最小3次元誘導バイアスを持つ単一のパスで新しいビューを予測する。
既存の作業はカメラをシャーカー線マップとしてエンコードし、予測を任意の世界座標ゲージに結び付け、小さなカメラ変換に敏感にする。
本稿では,プロジェクティブ・コンディショニングを提案する。プロジェクティブ・コンディショニングは,プロジェクティブ・コンディショニングのパラメータを,安定な2次元入力を提供するターゲットビュー・プロジェクティブ・キューに置き換える。
論文 参考訳(メタデータ) (2026-01-08T17:03:44Z) - E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training [55.61379509038588]
E-RayZerは、ラベルのない画像から直接、真の3D認識表現を学習する、自己教師付き大規模3Dビジョンモデルである。
E-RayZerは直接3D空間で動作し、明示幾何学を用いて自己教師付き3D再構成を行う。
論文 参考訳(メタデータ) (2025-12-11T18:59:53Z) - RaySt3R: Predicting Novel Depth Maps for Zero-Shot Object Completion [49.933001840775816]
RaySt3Rは、新しいビュー合成問題として、3D形状の完成をリキャストする。
フィードフォワード変換器をトレーニングし、深度マップ、オブジェクトマスク、およびクエリ線に対する画素ごとの信頼スコアを予測する。
RaySt3Rは、これらの予測を複数のクエリビューに融合して、完全な3D形状を再構築する。
論文 参考訳(メタデータ) (2025-06-05T17:43:23Z) - LaRI: Layered Ray Intersections for Single-view 3D Geometric Reasoning [75.9814389360821]
層状光線交差(LaRI)は、1つの画像から未知の幾何学的推論を行う新しい方法である。
コンパクトで階層的な表現から恩恵を受けることで、LaRIは完全で効率的でビュー整合な幾何学的推論を可能にする。
3Dオブジェクトやシーンを含む、合成および実世界のデータのための完全なトレーニングデータ生成パイプラインを構築します。
論文 参考訳(メタデータ) (2025-04-25T15:31:29Z) - RangeViT: Towards Vision Transformers for 3D Semantic Segmentation in
Autonomous Driving [80.14669385741202]
視覚変換器(ViT)は多くの画像ベースのベンチマークで最先端の結果を得た。
ViTはトレーニングが難しいことで知られており、強力な表現を学ぶために大量のトレーニングデータを必要とする。
提案手法はRangeViTと呼ばれ,nuScenes や Semantic KITTI において既存のプロジェクションベースの手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-01-24T18:50:48Z) - Ray-ONet: Efficient 3D Reconstruction From A Single RGB Image [16.21925131245367]
モノクロ画像から詳細な3Dモデルを効率的に再構成するためのRay-ONetを提案する。
カメラ座標の画素からバックプロジェクションされた光線に沿った一連の占有確率を予測することにより、我々の方法であるRay-ONetは、Occupancy Networks (ONet)と比較して再構成精度を向上させる。
論文 参考訳(メタデータ) (2021-07-05T09:45:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。