論文の概要: Video Generation Models are General-Purpose Vision Learners
- arxiv url: http://arxiv.org/abs/2607.09024v1
- Date: Fri, 10 Jul 2026 01:09:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.762493
- Title: Video Generation Models are General-Purpose Vision Learners
- Title(参考訳): 汎用視覚学習者のための映像生成モデル
- Authors: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu,
- Abstract要約: 我々は、大規模なテキスト・ビデオ生成がコンピュータビジョンのための強力な事前学習パラダイムであると主張している。
我々は、予め訓練されたビデオ拡散バックボーンを利用してフィードフォワード知覚モデルを定義するGenCeptionを紹介する。
実証的な結果から、GenCeptionは様々なタスクで最先端のパフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 62.28137589984863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Driven by next-token prediction, NLP shifted from task-specific models into powerful generalist foundation models. What, then, is the equivalent catalyst needed to achieve a general-purpose model in computer vision? In this paper, we contend that large-scale text-to-video generation serves as a strong pre-training paradigm for computer vision, providing the necessary spatiotemporal priors, vision-language alignment, and scalability required for general visual intelligence. We introduce GenCeption, which leverages a pre-trained video generative diffusion backbone to define a feed-forward perception model, capable of performing various vision tasks steered by text instructions. Empirical results demonstrate that GenCeption achieves state-of-the-art performance across a diverse suite of tasks, including depth, surface normal, and camera pose estimation, expression-referring segmentation, and 3D keypoint prediction, often matching or surpassing specialized models (e.g. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, and Lotus-2). Furthermore, the video generative pretrained backbone outperforms alternative pretraining paradigms (e.g., V-JEPA, and Video MAE) under comparable settings. Importantly, GenCeption exhibits preliminary data and model scaling properties along with exceptional data efficiency, where it achieves comparable performance with leading models like D4RT and VGGT-Omega with 7 to 500 less training data. Finally, GenCeption also exhibits intriguing emergent behaviors: a model trained exclusively on synthetic human videos generalizes to real-world footage and out-of-distribution object categories (e.g., animals and robots). These findings suggest that video generation is not merely a synthesis tool, but a foundational path toward generalist vision intelligence for the physical world. Project page: https://genception.github.io
- Abstract(参考訳): 次世代の予測によって、NLPはタスク固有のモデルから強力なジェネラリスト基礎モデルへと移行した。
では、コンピュータビジョンの汎用モデルを実現する上で、同等の触媒は何か?
本稿では,大規模なテキスト・ビデオ生成がコンピュータビジョンのための強力な事前学習パラダイムであり,汎用的な視覚知能に必要な時空間前処理,視覚言語アライメント,スケーラビリティを実現することを主張する。
我々は、予め訓練されたビデオ生成拡散バックボーンを利用してフィードフォワード知覚モデルを定義するGenCeptionを紹介する。
実証的な結果から、GenCeptionは、深度、表面の正常度、カメラのポーズ推定、式参照セグメンテーション、および3Dキーポイント予測など、様々なタスク(例えば、DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, Lotus-2)で最先端のパフォーマンスを実現している。
さらに、ビデオ生成事前学習バックボーンは、同等の設定下で、代替事前学習パラダイム(例えば、V-JEPA、ビデオMAE)よりも優れています。
GenCeptionは、D4RTやVGGT-Omegaといった主要なモデルと同等のパフォーマンスを、7から500のトレーニングデータで達成している。
GenCeptionは、人間の合成ビデオに特化して訓練されたモデルで、現実世界の映像やアウト・オブ・ディストリビューション(動物やロボットなど)のカテゴリーに一般化されている。
これらの結果は、ビデオ生成は単なる合成ツールではなく、物理世界における汎用的な視覚知能への基礎的な道であることを示している。
プロジェクトページ: https://genception.github.io
関連論文リスト
- From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models [65.05130114320734]
一般化可能なロボット制御の基礎は、広く採用されている視覚言語やビデオモデルではなく、視覚幾何学のバックボーンであるべきだと我々は主張する。
本研究では,事前訓練されたネイティブ3次元表現上でのアクション生成を直接条件付きで行うビジョン・ジオメトリ・アクション・モデルを提案する。
具体的には、VGAは従来の言語やビデオのバックボーンを事前訓練された3Dワールドモデルに置き換え、シームレスな視覚と幾何学のマッピングを確立する。
論文 参考訳(メタデータ) (2026-04-14T15:57:16Z) - Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining [28.30092786035367]
DeFIはビジュアルフォワードと逆ダイナミクスを分離し、各データソースを利用するための新しいフレームワークである。
今後の予測のために,多種多様な人・ロボットビデオで事前訓練された一般フォワード・ダイナミクス・モデル(GFDM)と,ラベルなしビデオ遷移から潜伏行動を予測するための自己教師付き学習によって訓練された一般逆ダイナミクス・モデル(GIDM)を紹介する。
CALVIN ABC-D と SimplerEnv の実験では、DeFI は CALVIN の平均タスク長 4.51 に達し、SimplerEnv-Frac は 51.2% 成功した。
論文 参考訳(メタデータ) (2026-03-27T17:20:10Z) - THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond [22.66024130777808]
人中心認識のための統合ビデオ基盤モデルTHFMを提案する。
我々のモデルは、様々なベンチマークで最先端の専門モデルを超えているか、あるいは超えている。
例えば、シーン内の1人の人間で動画をトレーニングしたモデルは、複数の人間や、人為的なキャラクターや動物のような他のオブジェクトクラスに一般化する。
論文 参考訳(メタデータ) (2026-03-26T20:28:40Z) - From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models [65.0487600936788]
ビデオ拡散モデル(VDM)は高品質なコンテンツを合成できる強力な生成ツールとして登場した。
我々は、VDMが自然に構造化された表現を探索し、視覚世界を暗黙的に理解することを主張する。
提案手法は,各タスクを視覚遷移に変換し,短い入力シーケンス上でLoRA重みのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-06-08T20:52:34Z) - Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations [19.45821593625599]
ビデオ拡散モデル(VDM)は、将来のフレームを予測し、物理的な世界を強く理解する能力を示す。
本稿では,VDM内の将来予測表現を条件とした暗黙的逆ダイナミクスモデル(VPP)を学習するビデオ予測ポリシーを提案する。
VPPはCalvin ABC-Dの一般化ベンチマークを18.6%改善した。
論文 参考訳(メタデータ) (2024-12-19T12:48:40Z) - Predicting Long-horizon Futures by Conditioning on Geometry and Time [49.86180975196375]
我々は,過去を前提とした将来のセンサ観測の課題を探求する。
マルチモーダリティを扱える画像拡散モデルの大規模事前学習を活用する。
我々は、屋内と屋外のシーンにまたがる多様なビデオのセットについて、ビデオ予測のためのベンチマークを作成する。
論文 参考訳(メタデータ) (2024-04-17T16:56:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。