論文の概要: ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference
- arxiv url: http://arxiv.org/abs/2608.12232v1
- Date: Wed, 12 Aug 2026 16:28:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.636652
- Title: ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference
- Title(参考訳): ScaleVid: メッシュフリー推論による幾何学的ビデオオブジェクトのスケーリング
- Abstract要約: 幾何学を意識したビデオオブジェクトのスケーリングは、幾何学的妥当性、時間的コヒーレンス、背景の一貫性を保ちながら、オブジェクト中心の軸に沿ってオブジェクトを異方的にリサイズすることを目的としている。
本研究では、背景保存とリアルな映像合成から、幾何学的に認識された前景変換を分離する2段階のトレーニングフレームワークを提案する。
どちらの段階でも、幾何学的に乱れた擬似ソースは実際のビデオから構築され、元の完全ビデオは再構築対象として保持される。
- 参考スコア(独自算出の注目度): 13.10996719828907
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Geometry-aware video object scaling aims to anisotropically resize the object along object-centric axes while preserving geometric plausibility, temporal coherence, and background consistency. Existing text-guided methods mainly operate in the 2D image plane, while depth-guided approaches provide coarse control and mesh-based methods require costly 3D reconstruction. We present a progressive two-stage training framework that decouples geometry-aware foreground transformation from background preservation and realistic video composition, without mesh-pixel alignment and explicit 3D reconstruction at inference. In both stages, geometrically perturbed pseudo-sources are constructed from real videos, while the original complete videos are retained as reconstruction targets. The first stage uses planar transformations to learn robust foreground-background composition, whereas the second introduces object-centric 3D deformation guidance for geometry-aware scaling. This pseudo-source reconstruction formulation enables real-video synthesis without paired real-world scaling targets. We construct complementary paired-geometry and real-background benchmarks and further evaluate on in-the-wild videos. Extensive experiments demonstrate superior geometric consistency, foreground fidelity, and background preservation, together with faster and more practical inference than methods requiring explicit 3D reconstruction.
- Abstract(参考訳): 幾何学を意識したビデオオブジェクトのスケーリングは、幾何学的妥当性、時間的コヒーレンス、背景の一貫性を保ちながら、オブジェクト中心の軸に沿ってオブジェクトを異方的にリサイズすることを目的としている。
既存のテキスト誘導方式は主に2次元画像平面で動作するが、奥行き誘導方式は粗い制御を提供し、メッシュベースの手法ではコストがかかる。
メッシュ・ピクセルアライメントや推論時の明示的な3次元再構成を伴わず、背景の保存やリアルな映像構成から幾何学的に認識されたフォアグラウンド変換を分離するプログレッシブな2段階トレーニングフレームワークを提案する。
どちらの段階でも、幾何学的に乱れた擬似ソースは実際のビデオから構築され、元の完全ビデオは再構築対象として保持される。
第1段階は平面変換を用いて、頑健な前景-背景構成を学習し、第2段階は、幾何学的スケーリングのためのオブジェクト中心の3次元変形ガイダンスを導入する。
この擬似ソース再構成定式化は、ペアの実際のスケーリングターゲットを使わずに、実ビデオ合成を可能にする。
我々は,相補的なペア付き幾何と実背景のベンチマークを構築し,その映像についてさらに評価する。
広汎な実験は、3次元再構成を必要とする方法よりも高速で実用的な推論とともに、優れた幾何学的整合性、前景の忠実さ、背景保存を示す。
関連論文リスト
- IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer [64.5765465030666]
オンライン4Dシーン理解のためのストリーミングインスタンスグラウンド幾何変換器IGGT4Dを提案する。
IGGT4Dは、ビデオフレームを逐次処理し、因果時空間モデリングを通じて歴史的コンテキストを再利用し、カメラモーション、幾何学、オブジェクトアイデンティティの統一表現を漸進的に更新する。
3次元再構成、ポーズ推定、例空間追跡、オープンボキャブラリセグメンテーションの実験は、IGGT4Dが既存のストリーミングベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2026-07-21T16:00:01Z) - Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video [69.94904173314505]
2つのステージ上に構築された幾何グラウンドのフレームワークであるGround4Dを提案する。
まず,モノクロ映像から複数視点の立体形状とカメラポーズを再構成する。
第2に,動的ガウススプラッティングによる幾何整合性を考慮した改良を行う。
論文 参考訳(メタデータ) (2026-06-27T09:27:42Z) - Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors [61.34273238077091]
本稿では,物体の単一画像からオービタルビデオを生成する新しい手法を提案する。
本手法は,最先端の手法と比較して,視覚的品質,形状リアリズム,多視点整合性を実現している。
論文 参考訳(メタデータ) (2026-04-14T05:35:46Z) - Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video [76.32954467706581]
本稿では,生のビデオストリームからGEometric foundationモデルのスケーラブル適応を行うフレームワークであるSAGEを提案する。
階層的なマイニングパイプラインを使用して、ビデオをトレーニングトラジェクトリやハイブリッド監視に変換します。
実験の結果、SAGEはゼロショットの一般化を著しく向上し、チェムファー距離を20-42%削減した。
論文 参考訳(メタデータ) (2026-02-08T09:53:21Z) - IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction [82.53307702809606]
人間は自然に3次元世界の幾何学的構造と意味的内容を中間次元として知覚する。
本稿では,空間再構成とインスタンスレベルの文脈理解の両面での知識を統合するために,IGGT (InstanceGrounded Geometry Transformer) を提案する。
論文 参考訳(メタデータ) (2025-10-26T14:57:44Z) - Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling [29.723534231743038]
本稿では,映像拡散モデルと物理世界の3次元的性質のギャップを埋めるために,幾何学的強制法を提案する。
我々の重要な洞察は、事前訓練された幾何学基礎モデルの特徴と整列することで、モデル中間表現を幾何学的構造へ導くことである。
我々は、カメラビューコンディショニングとアクションコンディショニングの両方のビデオ生成タスクにおいて、Geometry Forcingを評価する。
論文 参考訳(メタデータ) (2025-07-10T17:55:08Z) - FLARE: Feed-forward Geometry, Appearance and Camera Estimation from Uncalibrated Sparse Views [100.45129752375658]
FLAREは、高品質カメラのポーズと3次元幾何を、補正されていないスパースビュー画像から推定するために設計されたフィードフォワードモデルである。
本ソリューションでは,3次元構造を2次元画像平面にマッピングする上で,カメラポーズが重要なブリッジとして機能するケースケード学習パラダイムを特徴とする。
論文 参考訳(メタデータ) (2025-02-17T18:54:05Z) - Geometry-guided Feature Learning and Fusion for Indoor Scene Reconstruction [14.225228781008209]
本稿では3次元シーン再構成のための新しい幾何学的統合機構を提案する。
提案手法は,特徴学習,特徴融合,ネットワーク監視という3段階の3次元幾何学を取り入れている。
論文 参考訳(メタデータ) (2024-08-28T08:02:47Z) - LIST: Learning Implicitly from Spatial Transformers for Single-View 3D
Reconstruction [5.107705550575662]
Listは、局所的およびグローバルな画像特徴を活用して、単一の画像から3Dオブジェクトの幾何学的および位相的構造を再構築する、新しいニューラルネットワークである。
合成画像と実世界の画像から3Dオブジェクトを再構成する際のモデルの有用性を示す。
論文 参考訳(メタデータ) (2023-07-23T01:01:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。