FuguReport

Video Generative Models as Geometry Learner

著者 Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng
所属 University of Surrey / Imperial College London / Independent Researcher
カテゴリ Method / Generative Modeling / Video-based geometric learning framework, Task / Geometry Estimation / Joint modeling of images and geometry, Application / Data Efficiency / Unified data-efficient geometric inference
ライセンス CC BY 4.0

Abstractの概要

本論文では、事前学習済みの動画生成モデルを深度および法線予測に再利用する、単眼ジオメトリ推定のための統合フレームワーク「GeoNeXt」を提案します。各ジオメトリタスクに対して個別に画像拡散モデルを適用する代わりに、本手法ではジオメトリを次フレーム生成として定式化し、入力RGB画像に条件付けられた後続フレームとして深度と法線を扱います。この手法は、外観とジオメトリが共有の軌跡に沿って再構成されるように画像・深度・法線の潜在変数を共同でノイズ除去し、事前学習済み動画モデルへの軽量な適応のみを必要とします。HypersimおよびVirtual KITTI 2の約5.9万件の合成サンプルで学習されたGeoNeXtは、多様な実世界の深度および法線ベンチマークにおいて強力なゼロショット汎化性能を示します。

新規性

主な新規性は、深度および法線推定を次フレーム生成として捉えることで、事前学習済み動画拡散モデルを統合的なジオメトリ学習器として活用する点にあります。これにより、大幅なアーキテクチャ変更や個別のタスク固有ネットワークを必要とせず、画像とジオメトリの共同モデリングに向けて時間的なフレーム間事前知識を再利用することが可能になります。

成果

5つのゼロショット深度ベンチマークにおいて、GeoNeXtは20.8万件のサンプルを用いたGeoWizardに対してわずか5.9万件の学習サンプルしか使用していないにもかかわらず、報告されたすべてのデータセットで統合生成ベースラインであるGeoWizardを上回り、KITTIでAbsRel/δ1が8.2/92.6、ETH3Dで5.6/97.2を達成しました。5つの法線ベンチマークにおいても一貫してGeoWizardより改善し、iBims-1での平均角度誤差/11.25°精度は16.4/69.2、Sintelでは33.0/21.5を記録しました。アブレーション実験により、入力画像の共同再構成および深度と法線の共同学習が性能に不可欠である一方、深度と法線の再構成順序に対しては頑健であることが確認されました。

論文の注目点

  1. GeoNeXtは単眼深度および法線推定を画像から動画への次フレーム生成として定式化し、事前学習済み動画拡散モデル内での画像の外観とジオメトリの統合モデリングを可能にする。
  2. 本手法はノイズ除去U-Netのみを軽量に適応させてファインチューニングし、約5.9万件の合成サンプルで学習しながらも多様な実世界ベンチマークへゼロショットで汎化する。
  3. 実験結果は従来の統合生成モデルに対する一貫した向上と大規模な識別モデルベースラインに対する競争力のある精度を示しており、共同生成設計を検証するアブレーション研究によっても裏付けられている。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。