論文の概要: WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation
- arxiv url: http://arxiv.org/abs/2605.30671v1
- Date: Fri, 29 May 2026 00:04:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.298047
- Title: WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation
- Title(参考訳): WristCompass:エゴカメラ指向のための学習可能な視覚概念としてのキネマティック結合
- Abstract要約: シーン幾何学が欠如している場合に正確に存在する別の視覚概念を同定する。
この概念はコンパクトである(4Dインターブラストは116Dのフルキーポイントよりも優れており、時間的(フレーム単位の検索ではなく、短いウィンドウ上でGRUを要求)、シーンの外観よりも解剖学に根ざしているため、データセット間でゼロショットを転送する)。
- 参考スコア(独自算出の注目度): 1.3135750017147134
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recovering ego-camera orientation from manipulation video is a prerequisite for disentangling hand motion from camera motion, a key step in imitation learning from egocentric demonstrations. The obvious approach, inferring orientation from scene geometry, fails when hands occlude the frame: VGGT, a 1B-parameter scene reconstruction model, scores worse than a constant predictor on the TACO benchmark. We identify an alternative visual concept that is present precisely when scene geometry is absent: kinematic coupling dynamics, the structured physical relationship between wrist motion and camera orientation imposed by the arm-shoulder-head chain. We find that this concept is compact (4D inter-wrist features outperform 126D full hand keypoints), temporal (requiring a GRU over short windows rather than per-frame retrieval), and physically grounded (transferring zero-shot across datasets because it is rooted in anatomy rather than scene appearance). Trained only on tabletop manipulation, WristCompass transfers zero-shot to Epic Kitchens cooking video, achieving 14.3$^\circ$ median geodesic error and approaching the performance of a 1B-parameter scene model at 200K GRU parameters.
- Abstract(参考訳): 操作ビデオからエゴカメラの向きを復元することは、カメラの動きから手の動きを遠ざけるための必須条件である。
1Bパラメータシーン再構成モデルであるVGGTは、TACOベンチマークの定値予測よりも低いスコアを出力する。
動力学的結合力学, 手首の動きとアーム・ショルダーヘッドチェーンが課すカメラ配向の物理的構造の関係について, シーン幾何学が欠如している場合に正確に存在する別の視覚概念を同定する。
この概念はコンパクト(4Dインターリストは116Dのフルキーポイントより優れている)、時間的(フレーム単位の検索よりも短いウィンドウ上でGRUを要求)、物理的グラウンド(シーンの外観よりも解剖学に根ざしているため、データセット間でゼロショットを転送する)である。
テーブルトップ操作のみで訓練されたWristCompassは、ゼロショットをEpic Kitchensの調理ビデオに転送し、中央値の測地誤差を14.3$^\circ$し、200K GRUパラメータで1Bパラメータのシーンモデルの性能に近づく。
関連論文リスト
- MINT: A Unified Model for World-Space Camera and Hand Motion Estimation from Scalable Egocentric Pipeline Supervision [12.312144883974566]
我々は、エゴ中心のRGBビデオから世界空間のハンドモーション再構成のための基礎モデルであるMINTを紹介する。
Mintは、カメラの軌跡、視野ビュー、カメラフレームのハンドステート、フレーム単位のハンドオブザーバビリティを共同で予測する。
これは明示的な座標アノテーションによって世界空間の手の動きを生成する。
論文 参考訳(メタデータ) (2026-09-04T10:05:11Z) - Seeing the World and the Self from Egocentric Video [9.841166134702467]
既存の手法では、シーン再構成と動き推定を別々に扱う。
決定論的幾何再構成と幾何条件の運動生成を結合した統合フレームワークRESELFを提案する。
実験により、RESELFは個々のタスク用に設計された最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2026-09-01T14:10:13Z) - HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control [51.913695868638634]
We present HandsOnWorld, a framework for hand-control egocentric video generation that for multi-view and marker-based motion capture, learning from unconstrained monocular video。
EgoVid-Proは、クリーンでプロタゴニストのみのハンドトラジェクトリのデータセットで、103Kのクリップと、さまざまな日常シーンの約1200万フレームにまたがる。
また, カメラから手表面への3次元光線表現, カメラと手の動きを表現レベルで切り離す3次元ハンドマップを提案する。
論文 参考訳(メタデータ) (2026-07-02T12:14:02Z) - VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes [71.14444761145435]
知覚に基づくヒューマノイド・ロコ・マニピュレーションは、自我中心の観察とタスク・インストラクションを全身の動きに結びつける必要がある。
既存のデータソースがこれを完全に提供するものはありません。
このボトルネックに対処するために、再構成シーンで視覚・言語・運動学を総合的に指導する手法を提案する。
論文 参考訳(メタデータ) (2026-06-29T17:59:55Z) - E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control [24.385592831884797]
E$3$Cは、自己中心型生成のための制御可能なビデオ拡散フレームワークである。
永続的なシーン構造を人間駆動のダイナミックスから切り離す構造的でコンパクトな条件を構築する。
E$3$Cは、視覚的忠実度、カメラモーションの精度、オブジェクトの一貫性、強力なベースラインに対するエゴとエクソの人間のコントロールを改善する。
論文 参考訳(メタデータ) (2026-05-25T20:13:16Z) - PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution [0.6345523830122167]
MM-Convは、全体モーションキャプチャーと3Dシーングラフとともに、ダイアディックVRインタラクションから自然なコ音声ジェスチャーをキャプチャする。
我々は、ポーズとテキストの経路が学習パラメータを共有できない非結合のレイトフュージョンアーキテクチャを用いて、ポーズ言語融合を評価する。
論文 参考訳(メタデータ) (2026-05-23T15:20:04Z) - Articulation in Prime: Primitive-Based Articulated Object Understanding from a Single Casual Video [18.06685620402906]
モノクロビデオから3次元物体の3Dキネマティクスを取得することは、コンピュータビジョンにおける根本的な課題である。
本稿では,対象理解を原始的適合問題として扱うカテゴリ非依存の最適化フレームワークを提案する。
また,AiP-synth と AiP-real のベンチマークも提案する。
論文 参考訳(メタデータ) (2026-05-18T16:52:41Z) - ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes [55.32681167870698]
Video-informed Pose Spaces (ViPS)は、自動リップメッシュのための有効な調律の潜時分布を検出するフィードフォワードフレームワークである。
ViPSは生成ビデオの先行値を所定のリグパラメータ化上の普遍分布に転送する。
評価の結果,VPSは,合成アーティストが作成した4Dデータに基づいて訓練した最先端の手法の性能と,妥当性と多様性の両面で一致していることがわかった。
論文 参考訳(メタデータ) (2026-04-19T21:21:11Z) - Geometry-Guided Camera Motion Understanding in VideoLLMs [8.928448861727274]
カメラモーションは、視覚知覚と撮影スタイルを形作る基本的な幾何学的信号である。
現在のビデオ対応視覚注入モデル(VideoLLMs)は、明確に表現されることがほとんどなく、しばしば細かい動きプリミティブで失敗する。
カメラ動作を制約対応マルチラベル認識として定式化する。
実験では、改良されたモーション認識と、よりカメラ対応のモデル応答が示される。
論文 参考訳(メタデータ) (2026-03-13T16:13:09Z) - Zero-shot Reconstruction of In-Scene Object Manipulation from Video [47.13702503259619]
モノクロRGBビデオからシーン内オブジェクト操作を再構築する問題に対処する最初のシステムを構築した。
不用意なシーン再構築、不明瞭な手・物体の深さ、物理的に妥当な相互作用の必要性により、これは困難である。
論文 参考訳(メタデータ) (2025-12-22T18:58:29Z) - DVGT: Driving Visual Geometry Transformer [63.38483879291505]
駆動対象の高密度幾何知覚モデルは、異なるシナリオやカメラ構成に適応することができる。
提案するドライビング・ビジュアル・ジオメトリ・トランスフォーマ (DVGT) は, 広義の高密度な3Dポイントマップを, 複数視点の視覚入力の列から再構成する。
DVGTには、任意のカメラ構成のフレキシブルな処理を可能にする、明示的な3D幾何学的事前処理がない。
論文 参考訳(メタデータ) (2025-12-18T18:59:57Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z) - PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control [67.17998939712326]
本稿では,ロボットの状態推定と制御を単一のフレームワーク内で統一する条件拡散モデルPoseDiffを提案する。
中心となるPoseDiffは、生の視覚を3Dキーポイントや関節角などの構造化されたロボットの状態にマッピングする。
この基盤の上に構築されたPoseDiffは、ビデオからアクションへの逆ダイナミクスに自然に拡張する。
論文 参考訳(メタデータ) (2025-09-29T10:55:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。