論文の概要: LA-Pose: Latent Action Pretraining Meets Pose Estimation
- arxiv url: http://arxiv.org/abs/2604.27448v1
- Date: Thu, 30 Apr 2026 05:43:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.940144
- Title: LA-Pose: Latent Action Pretraining Meets Pose Estimation
- Title(参考訳): LA-Pose: 潜在行動事前トレーニングがポース推定に到達
- Authors: Zhengqing Wang, Saurabh Nair, Prajwal Chidananda, Pujith Kachana, Samuel Li, Matthew Brown, Yasutaka Furukawa,
- Abstract要約: 本稿では,自己監督型事前訓練のレンズによるカメラポーズ推定について再検討する。
我々は、ビデオからGenieに似た潜在動作表現を学ぶために、逆力と前方力のモデルを採用している。
LA-Poseと呼ばれるこの手法は、カメラポーズ推定器への入力として潜伏動作の特徴を再利用し、高品質な3Dアノテーションの限られたセットに基づいて微調整する。
- 参考スコア(独自算出の注目度): 14.57887023967546
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This paper revisits camera pose estimation through the lens of self-supervised pretraining, focusing on inverse-dynamics pretraining as a scalable alternative to the current trend of fully supervised training with 3D annotations. Concretely, we employ inverse- and forward-dynamics models to learn latent action representations, similar to Genie from large-scale driving videos. Our idea is simple yet effective. Existing methods use latent actions in their original capacity, that is, as action conditioning of world-models or as proxies of robot action parameters in policy networks. Our method, dubbed LA-Pose, repurposes the latent action features as inputs to a camera pose estimator, finetuned on a limited set of high-quality 3D annotations. This formulation enables accurate and generalizable pose prediction while maintaining feed-forward efficiency. Extensive experiments on driving benchmarks show that LA-Pose achieves competitive and even superior performance to state-of-the-art methods while using orders of magnitude less labeled data. Concretely, on the Waymo and PandaSet benchmarks, LA-Pose achieves over 10% higher pose accuracy than recent feed-forward methods. To our knowledge, this work is the first to demonstrate the power of inverse-dynamics self-supervised learning for pose estimation.
- Abstract(参考訳): 本稿では, 自己教師付き事前学習のレンズによるカメラのポーズ推定を, 3次元アノテーションによる教師付きトレーニングの現在の動向に対するスケーラブルな代替手段として, 逆力学事前学習に焦点をあてて再検討する。
具体的には,大規模ドライビングビデオのGenieと同様,逆力と前方力のモデルを用いて潜在動作表現を学習する。
私たちの考えは単純だが効果的だ。
既存の手法では、独自の能力、すなわち世界モデルのアクションコンディショニングやポリシーネットワークにおけるロボットアクションパラメータのプロキシとして潜時動作を使用する。
LA-Poseと呼ばれるこの手法は、カメラポーズ推定器への入力として潜伏動作の特徴を再利用し、高品質な3Dアノテーションの限られたセットに基づいて微調整する。
この定式化は、フィードフォワード効率を維持しつつ、正確で一般化可能なポーズ予測を可能にする。
運転ベンチマークに関する大規模な実験により、LA-Poseは、ラベル付きデータの桁数を桁違いに減らしながら、最先端の手法よりも競争力があり、さらに優れた性能を発揮することが示されている。
具体的には、WaymoとPandaSetのベンチマークでは、LA-Poseは最近のフィードフォワード法よりも10%高いポーズ精度を達成している。
我々の知る限り、この研究は、ポーズ推定のための逆力学自己教師型学習の力を示す最初のものである。
関連論文リスト
- Universal Pose Pretraining for Generalizable Vision-Language-Action Policies [83.39008378156647]
既存のVision-Language-Action(VLA)モデルは、しばしば機能崩壊と訓練効率の低下に悩まされる。
本稿では,VLAトレーニングを3次元空間前駆体抽出のための事前学習フェーズに分離する,分離されたパラダイムであるPose-VLAを提案する。
我々のフレームワークは2段階の事前学習パイプラインに従い、ポーズと動きのアライメントによる基本的な空間接地を確立する。
論文 参考訳(メタデータ) (2026-02-23T11:00:08Z) - An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training [50.71892161377806]
DFIT-OccWorldは、分離されたダイナミックフローとイメージアシストトレーニング戦略を活用する、効率的な3D占有世界モデルである。
提案モデルでは, 静止ボクセルはポーズ変換により容易に得られるのに対し, 既存のボクセルフローを用いて既存の観測を歪曲することで, 将来のダイナミックボクセルを予測できる。
論文 参考訳(メタデータ) (2024-12-18T12:10:33Z) - On the Benefits of 3D Pose and Tracking for Human Action Recognition [77.07134833715273]
動作認識のためのトラッキングと3Dポーズの利点を示す。
トラックレット上での3次元ポーズと文脈的外観を融合させることにより,ラグランジアン行動認識モデルを提案する。
提案手法は,AVA v2.2データセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2023-04-03T17:59:49Z) - PoseTriplet: Co-evolving 3D Human Pose Estimation, Imitation, and
Hallucination under Self-supervision [102.48681650013698]
既存の自己監督型3次元ポーズ推定スキームは、学習を導くための弱い監督に大きく依存している。
そこで我々は,2D-3Dのポーズペアを明示的に生成し,監督を増強する,新しい自己監督手法を提案する。
これは、ポーズ推定器とポーズ幻覚器を併用して学習する強化学習ベースの模倣器を導入することで可能となる。
論文 参考訳(メタデータ) (2022-03-29T14:45:53Z) - Distribution-Aware Single-Stage Models for Multi-Person 3D Pose
Estimation [29.430404703883084]
本稿では,多人数の3Dポーズ推定問題に対処する新しいDASモデルを提案する。
提案するDASモデルでは,3次元カメラ空間における人物位置と人体関節をワンパスで同時に位置決めする。
CMU Panoptic と MuPoTS-3D のベンチマークに関する総合的な実験は、提案したDASモデルの優れた効率を実証している。
論文 参考訳(メタデータ) (2022-03-15T07:30:27Z) - Reassessing the Limitations of CNN Methods for Camera Pose Regression [27.86655424544118]
本稿では,カメラのポーズを直接画像から復元できるモデルを提案する。
まず、レグレッションメソッドがまだ最先端にある理由を分析し、新しいアプローチでパフォーマンスギャップを埋める。
論文 参考訳(メタデータ) (2021-08-16T17:55:26Z) - AutoTrajectory: Label-free Trajectory Extraction and Prediction from
Videos using Dynamic Points [92.91569287889203]
軌道抽出と予測のための新しいラベルなしアルゴリズムAutoTrajectoryを提案する。
動画中の移動物体をよりよく捉えるために,ダイナミックポイントを導入する。
ビデオ内の歩行者などの移動物体を表すインスタンスポイントに動的ポイントを集約する。
論文 参考訳(メタデータ) (2020-07-11T08:43:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。