論文の概要: AgentSTAR: Agentic Shape Tracking and Reconstruction from Monocular Videos
- arxiv url: http://arxiv.org/abs/2609.24487v1
- Date: Mon, 21 Sep 2026 12:26:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.280308
- Title: AgentSTAR: Agentic Shape Tracking and Reconstruction from Monocular Videos
- Title(参考訳): AgentSTAR:単眼ビデオからのエージェント形状追跡と再構成
- Abstract要約: 本稿では, エージェント分析による映像からの形状復元と追跡手法を提案する。
形状と運動構造を含む構造化された3次元オブジェクトモデルを推定し、このモデルを用いて時間とともにオブジェクトのトラック推定を最適化する。
提案手法は, 物体の3次元位置追跡ベースラインの精度を著しく向上させる。
- 参考スコア(独自算出の注目度): 42.411236194709396
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In this work, we present a method for shape reconstruction and tracking from video via agentic analysis-by-synthesis. Unlike prior methods which first estimate dense pixel correspondences and then recover object motion from them, our method infers a structured 3D object model, including its geometry and kinematic structure, and uses this model to optimise object track estimates over time. In our optimisation loop, a Vision-Language Model (VLM) agent iteratively refines shape or generalised pose through a render-and-compare loop, combining coarse visual reasoning with numerical pose optimisation for precise state estimation. This structured formulation enables our method to track through large motion, articulation, and severe occlusion without relying on pixel-matching objectives. Quantitatively, on ARCTIC, our method substantially outperforms state-of-the-art 3D point-tracking baselines for articulated objects, and on HOT3D it outperforms all evaluated rigid-object tracking baselines.
- Abstract(参考訳): 本研究では,エージェント解析による映像からの形状復元と追跡を行う手法を提案する。
本手法は,まず高密度画素対応を推定し,そこからオブジェクトの動きを復元する従来の手法とは異なり,形状や運動構造を含む構造化された3次元オブジェクトモデルを推定し,時間とともにオブジェクトの追跡を最適化する。
我々の最適化ループにおいて、視覚言語モデル(VLM)エージェントは、粗い視覚推論と正確な状態推定のための数値ポーズ最適化を組み合わせたレンダリング・アンド・コンペアループを通じて、形状や一般化されたポーズを反復的に洗練する。
この構造的定式化により,画素マッチングの目的に頼らずに,大きな動き,調音,重篤な閉塞を追跡できる。
ARCTICでは,本手法は物体の3D点追跡ベースラインをほぼ上回り,HOT3Dでは全ての剛性物体追跡ベースラインを上回ります。
関連論文リスト
- Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors [61.34273238077091]
本稿では,物体の単一画像からオービタルビデオを生成する新しい手法を提案する。
本手法は,最先端の手法と比較して,視覚的品質,形状リアリズム,多視点整合性を実現している。
論文 参考訳(メタデータ) (2026-04-14T05:35:46Z) - OPFormer: Object Pose Estimation leveraging foundation model with geometric encoding [2.1987601456703474]
オブジェクト検出とポーズ推定をシームレスに統合する統合されたエンドツーエンドフレームワークを導入する。
当システムではまずCNOS検出器を用いて対象物体のローカライズを行う。
検出毎に、新しいポーズ推定モジュールOPFormerが正確な6Dポーズを推測する。
論文 参考訳(メタデータ) (2025-11-16T14:19:52Z) - HORT: Monocular Hand-held Objects Reconstruction with Transformers [61.36376511119355]
モノクロ画像から手持ちの物体を3Dで再構成することは、コンピュータビジョンにおいて重要な課題である。
ハンドヘルドオブジェクトの高密度な3次元点群を効率的に再構成するトランスフォーマーモデルを提案する。
提案手法は,高速な推測速度で最先端の精度を達成し,画像の幅を最適化する。
論文 参考訳(メタデータ) (2025-03-27T09:45:09Z) - ArticulatedGS: Self-supervised Digital Twin Modeling of Articulated Objects using 3D Gaussian Splatting [29.69981069695724]
RGBの出現と動きパラメータの推定により,部分レベルでの同時再構成の課題に対処する。
我々は3次元ガウス表現において、外観情報と幾何学情報の両方を同時に再構成する。
我々はArticulatedGSを紹介した。ArticulatedGSは自己監督型で総合的なフレームワークで、パートレベルで形状や外観を自律的にモデル化する。
論文 参考訳(メタデータ) (2025-03-11T07:56:12Z) - Sparse-view Pose Estimation and Reconstruction via Analysis by Generative Synthesis [25.898616784744377]
観察されたビューの少ないセットを考えると、その観察は完全な正確な3Dを得るのに十分な直接的な証拠を与えていないかもしれない。
a) 新規なビュー合成に基づく生成先行を光度目標と組み合わせて、推定された3Dの質を向上させる方法、(b) アウトレーヤを明示的に推論し、連続最適化に基づく戦略による離散探索を用いて補正する手法であるSparseAGSを提案する。
論文 参考訳(メタデータ) (2024-12-04T18:59:24Z) - Robust 3D Tracking with Quality-Aware Shape Completion [67.9748164949519]
そこで本研究では,高密度および完全点の雲からなる合成対象表現について,ロバストな3次元追跡のための形状完備化により正確に表現する。
具体的には, 形状が整ったボキセル化3次元追跡フレームワークを設計し, ノイズのある歴史的予測の悪影響を軽減するために, 品質に配慮した形状完備化機構を提案する。
論文 参考訳(メタデータ) (2023-12-17T04:50:24Z) - Learning Monocular Depth in Dynamic Scenes via Instance-Aware Projection
Consistency [114.02182755620784]
本稿では,複数の動的物体の6-DoF動作,エゴモーション,深度を,監督なしで一眼レフカメラで明示的にモデル化する,エンドツーエンドのジョイントトレーニングフレームワークを提案する。
筆者らのフレームワークは,最先端の深度・動き推定法より優れていた。
論文 参考訳(メタデータ) (2021-02-04T14:26:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。