論文の概要: Velox: Learning Representations of 4D Geometry and Appearance
- arxiv url: http://arxiv.org/abs/2605.04527v1
- Date: Wed, 06 May 2026 06:12:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.667225
- Title: Velox: Learning Representations of 4D Geometry and Appearance
- Title(参考訳): Velox: 4次元幾何学と外観の学習表現
- Abstract要約: 物体の形状と外観を忠実に捉えた記述的かつ忠実な4次元オブジェクトの潜在表現を学習するためのフレームワークを提案する。
我々は,3つの下流タスク – 映像から4D生成,3次元トラッキング,および画像から4D生成による布地シミュレーション – で評価を行った。
- 参考スコア(独自算出の注目度): 37.12487786007913
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We introduce a framework for learning latent representations of 4D objects which are descriptive, faithfully capturing object geometry and appearance; compressive, aiding in downstream efficiency; and accessible, requiring minimal input, i.e., an unstructured dynamic point cloud, to construct. Specifically, Velox trains an encoder to compress spatiotemporal color point clouds into a set of dynamic shape tokens. These tokens are supervised using two complementary decoders: a 4D surface decoder, which models the time-varying surface distribution capturing the geometry; and a Gaussian decoder, which maps the tokens to 3D Gaussians, helping learn appearance. To demonstrate the utility of our representation, we evaluate it across three downstream tasks -- video-to-4D generation, 3D tracking, and cloth simulation via image-to-4D generation -- and observe strong performances in all settings.
- Abstract(参考訳): 本研究では, 物体の形状と外観を忠実に捉え, 圧縮的, 下流の効率を補助し, 最小限の入力を必要とする4Dオブジェクトの潜在表現を学習するためのフレームワークを提案する。
具体的には、Veloxはエンコーダを訓練し、時空間色点の雲を動的形状のトークンの集合に圧縮する。
これらのトークンは2つの補完的なデコーダを用いて管理される: 4D曲面デコーダは幾何学を捉えた時間変化の表面分布をモデル化し、ガウスデコーダはトークンを3Dガウスにマッピングし、外観の学習を支援する。
表現の有用性を実証するため,映像から4D生成,3Dトラッキング,画像から4D生成による布のシミュレーションという3つの下流タスクで評価し,すべての設定で強いパフォーマンスを観察する。
関連論文リスト
- VideoTok4D: A 4D-Aware Video Tokenizer for Compact World Representation [21.308618722721388]
ビデオトークンーは現代のビデオモデリングの基盤として登場した。
コンパクトな世界表現のための新しい4D対応ビデオトークンであるVideoTok4Dを提案する。
論文 参考訳(メタデータ) (2026-09-11T14:03:02Z) - CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes [2.5603340362916938]
我々は,ダイナミックポイントクラウド上で直接動作する最初の基礎的な4DビジョンエンコーダであるCL4Dを紹介する。
動的幾何表現に基づいて言語生成を行う4次元視覚言語モデルである4DVLMを導入する。
CL4Dは最先端の性能を達成し、従来の手法よりも約16.75%向上した。
論文 参考訳(メタデータ) (2026-08-19T09:37:15Z) - Syn4D: A Multiview Synthetic 4D Dataset [92.50132053229817]
モノクロビデオからの動的シーンの3D再構成と追跡は、コンピュータビジョンにおいて重要な課題である。
この制限に対処するために、マルチビュー合成動的シーンであるSyn4Dを紹介する。
Syn4Dの主な特徴は、任意のピクセルを3Dに切り離すことである。
論文 参考訳(メタデータ) (2026-05-06T17:59:55Z) - Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models [79.06910348413861]
Diff4Splatは、単一の画像から制御可能で明示的な4Dシーンを合成するフィードフォワード方式である。
単一の入力画像、カメラ軌跡、オプションのテキストプロンプトが与えられた場合、Diff4Splatは外見、幾何学、動きを符号化する変形可能な3Dガウス場を直接予測する。
論文 参考訳(メタデータ) (2025-11-01T11:16:25Z) - Easi3R: Estimating Disentangled Motion from DUSt3R Without Training [69.51086319339662]
Easi3Rは,4次元再構成のための簡易かつ効率的なトレーニングフリー手法である。
提案手法は,事前学習やネットワークファインチューニングの必要性を排除し,推論中の注意適応を適用した。
実世界のダイナミックビデオの実験では、従来の最先端手法よりも軽量な注意適応が著しく優れていたことが示されている。
論文 参考訳(メタデータ) (2025-03-31T17:59:58Z) - 4D Panoptic Scene Graph Generation [102.22082008976228]
ダイナミックな4次元世界において知覚される生の視覚データをブリッジし,高レベルの視覚的理解を実現する新しい表現である4D Panoptic Scene Graph (PSG-4D)を紹介する。
具体的には、PSG-4Dは、リッチな4D知覚データをノードに抽象化し、正確な位置とステータス情報を持つエンティティとエッジを表現し、時間的関係をキャプチャする。
そこで我々は,PSG4DFormerを提案する。PSG4DFormerはトランスフォーマーベースのモデルで,空間分割マスクを予測し,時間軸に沿ってマスクをトラックし,対応するシーングラフを生成する。
論文 参考訳(メタデータ) (2024-05-16T17:56:55Z) - Learning Coherent Matrixized Representation in Latent Space for Volumetric 4D Generation [48.671462912294594]
本研究では,空間次元と時間次元をまたいだ形状と色を動的に変化させた4次元配列を生成する枠組みを提案する。
まず、コヒーレントな3次元形状と色モデリングを用いて、各3次元形状フレームの形状と色を潜在空間にエンコードする。
次に,効率的な拡散モデル演算が可能な行列化4次元シーケンス表現を提案する。
論文 参考訳(メタデータ) (2024-03-20T01:59:43Z) - 4DGen: Grounded 4D Content Generation with Spatial-temporal Consistency [118.15258850780417]
textbf4DGenは、4Dコンテンツ作成のための新しいフレームワークである。
我々のパイプラインは、制御可能な4D生成を容易にし、ユーザがモノクロビデオで動きを指定したり、画像から映像への世代を適用できる。
既存のビデオから4Dのベースラインと比較すると,入力信号の忠実な再構成には優れた結果が得られる。
論文 参考訳(メタデータ) (2023-12-28T18:53:39Z) - Im4D: High-Fidelity and Real-Time Novel View Synthesis for Dynamic
Scenes [69.52540205439989]
グリッドベースの幾何表現と多視点画像に基づく外観表現からなるハイブリッド表現であるIm4Dを紹介する。
画像の特徴から3Dポイントの色を予測することを学習する,オリジナルのマルチビュービデオとネットワークによってシーンの外観を表現する。
我々は,512x512画像に対して,79.8 FPSのリアルタイムレンダリングを実現しつつ,レンダリング品質が向上し,効率よくトレーニングできるIm4Dの最先端性能を示す。
論文 参考訳(メタデータ) (2023-10-12T17:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。