論文の概要: EgoFound3R: End-to-End Egocentric Hand Reconstruction in World Space with Point-Wise Interaction Attributes
- arxiv url: http://arxiv.org/abs/2610.01210v2
- Date: Sat, 03 Oct 2026 02:17:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.514746
- Title: EgoFound3R: End-to-End Egocentric Hand Reconstruction in World Space with Point-Wise Interaction Attributes
- Title(参考訳): EgoFound3R:ポイントワイズ相互作用属性を用いた世界空間におけるエンドツーエンドエゴセントリックハンド再構成
- Abstract要約: EgoFound3Rは、世界空間の手の幾何学を、シーンと共有するメートル法スケールで推定する統一的なエンドツーエンドモデルである。
平均結合位置誤差(MPJPE)を43.2%、22.4%、11.6%削減する。
また、同じパスのジオメトリと並行して点の接触と距離を予測し、スループットはおよそ6倍に向上する。
- 参考スコア(独自算出の注目度): 18.6677210357203
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Egocentric video has become a primary source of supervision for embodied models, and its value rests on recovering hand motion in world coordinates, which camera motion and hand occlusion make difficult. Existing reconstruction pipelines typically separate hand and scene estimation, leave interaction attributes to separate task-specific models, and invoke several models per video, so no prior reconstruction model estimates these attributes and throughput becomes a practical constraint on large-scale annotation. We therefore introduce EgoFound3R, a unified end-to-end model that estimates world-space hand geometry in a metric scale shared with the scene, and predicts point-wise interaction attributes, including visibility, contact, and distance. The model integrates three designs: (i) structured hand prompts that transfer pretrained geometric priors to world-space hand reconstruction; (ii) an explicit hand representation that decodes hand geometry and interaction attributes; and (iii) a shared-parameter multi-rate design that lowers inference cost. Together, these designs predict hand geometry and point-wise attributes in one pass. On OakInk-v2, TACO, and HOI4D, EgoFound3R reduces the mean per-joint position error (MPJPE) by 43.2%, 22.4%, and 11.6% over previous methods and predicts point-wise contact and distance alongside the geometry in the same pass, while attaining approximately 6x higher throughput.
- Abstract(参考訳): エゴセントリックビデオは、エンボディードモデルの主要な監督源となり、その価値は、カメラモーションとハンドオクルージョンが困難な世界座標における手の動きの回復にかかっている。
既存の再構成パイプラインは通常、手動とシーンの推定を分離し、インタラクション属性をタスク固有の別のモデルに残し、ビデオ毎に複数のモデルを呼び出すため、以前の再構成モデルではこれらの属性を推定せず、スループットは大規模アノテーションの実用的な制約となる。
そこで我々は,現場と共有する距離スケールで世界空間の手形状を推定する統合エンドツーエンドモデルであるEgoFound3Rを導入し,可視性,接触性,距離などの点間相互作用特性を予測する。
モデルは3つの設計を統合します。
(i)既修の幾何学的先行を世界空間のハンドコンストラクションに転送する構造化ハンドプロンプト
二 手形状及び相互作用属性を復号する明示的な手表現
三 推論コストを下げる共有パラメータのマルチレート設計。
これらの設計は、ハンドジオメトリとポイントワイド属性を1パスで予測する。
OakInk-v2, TACO, HOI4D では、EgoFound3R は平均結合位置誤差 (MPJPE) を 43.2%, 22.4%, 11.6% で削減し、同じパスの幾何に沿った点接触と距離を予測し、スループットはおよそ6倍に向上した。
関連論文リスト
- RelationVGGT: Visual Geometry Transformers for 3D Spatial Relation Segmentation [60.646139728534195]
フィードフォワードでポーズフリーなマルチビュー設定で3次元空間関係のセグメンテーションを定式化する。
視覚基盤モデルから意味的特徴と3次元幾何学基礎モデルからの幾何認識表現を統合する新しいフィードフォワードフレームワークであるRelationVGGTを提案する。
論文 参考訳(メタデータ) (2026-10-01T03:00:27Z) - Reliev3R: Relieving Feed-forward Reconstruction from Multi-View Geometric Annotations [98.66466590444553]
コスト制約のない多視点幾何アノテーションを使わずにFFRMをスクラッチからトレーニングするための弱教師付きパラダイムであるReliev3Rを提案する。
Reliev3Rのコアでは、多視点幾何整合性の監視を容易にするために、曖昧さを意識した相対深度損失と三角法に基づく再射損失を設計する。
論文 参考訳(メタデータ) (2026-04-01T06:46:54Z) - Geo6DPose: Fast Zero-Shot 6D Object Pose Estimation via Geometry-Filtered Feature Matching [0.0]
Geo6DPoseは、ゼロショット6Dポーズ推定のための軽量で、完全にローカルで、トレーニング不要なパイプラインである。
Geo6DPoseは、1つのコモディティGPU上で、はるかに大きなゼロショットベースラインの平均リコールをマッチングしながら、サブ秒の推論を実現する。
論文 参考訳(メタデータ) (2025-12-11T14:20:17Z) - MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation [28.75149480374178]
MEgoHandは、エゴセントリックなRGB、テキスト、初期手ポーズから物理的にプラウジブルなハンドオブジェクトインタラクションを合成するフレームワークである。
手首の翻訳誤差と関節回転誤差の大幅な低減を実現し、手首の微細な関節構造を正確にモデル化する能力を強調している。
論文 参考訳(メタデータ) (2025-05-22T12:37:47Z) - GRACE: Estimating Geometry-level 3D Human-Scene Contact from 2D Images [54.602947113980655]
人景接触の幾何レベルを推定することは、特定の接触面点を3次元の人間ジオメトリに接することを目的としている。
GRACE(Geometry-level Reasoning for 3D Human-scene Contact Estimation)は,3次元接触推定のための新しいパラダイムである。
ポイントクラウドエンコーダ/デコーダアーキテクチャと階層的特徴抽出と融合モジュールが組み込まれている。
論文 参考訳(メタデータ) (2025-05-10T09:25:46Z) - DICE: End-to-end Deformation Capture of Hand-Face Interactions from a Single Image [98.29284902879652]
DICEは1枚の画像から変形認識による手と顔のインタラクションを再現する最初のエンドツーエンド手法である。
ローカルな変形場とグローバルなメッシュ位置の回帰を2つのネットワークブランチに切り離すことが特徴である。
標準的なベンチマークと、精度と物理的妥当性の点から見れば、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-06-26T00:08:29Z) - 3D Hand Reconstruction via Aggregating Intra and Inter Graphs Guided by
Prior Knowledge for Hand-Object Interaction Scenario [8.364378460776832]
モデルベースおよびモデルフリーアプローチの利点を生かした3次元ハンドリコンストラクションネットワークを提案する。
まず,2次元関節から直接のMANOポーズパラメータ回帰モジュールを提案する。
論文 参考訳(メタデータ) (2024-03-04T05:11:26Z) - D-SCo: Dual-Stream Conditional Diffusion for Monocular Hand-Held Object Reconstruction [74.49121940466675]
モノクローナルハンドヘルドオブジェクト再構成のためのCentroid-fixed dual-stream conditionalfusionを導入する。
まず、対象のセントロイドがずれることを避けるために、手動制約付きセントロイド固定パラダイムを用いる。
第2に、意味的および幾何学的に手動物体の相互作用をモデル化するための二重ストリームデノイザを導入する。
論文 参考訳(メタデータ) (2023-11-23T20:14:50Z) - End-to-end Weakly-supervised Single-stage Multiple 3D Hand Mesh
Reconstruction from a Single RGB Image [9.238322841389994]
複数手再構成のための単一段パイプラインを提案する。
具体的には,複数ヘッドのオートエンコーダ構造を設計し,各ヘッドネットワークが同じ特徴マップを共有し,ハンドセンター,ポーズ,テクスチャを出力する。
本手法は,弱教師付き手法と完全教師付き手法の両方において,最先端のモデルベース手法よりも優れる。
論文 参考訳(メタデータ) (2022-04-18T03:57:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。