論文の概要: CoaG: Cylinders on a Grid for Coarse 3D Layout Control in Video Generation
- arxiv url: http://arxiv.org/abs/2609.24208v2
- Date: Wed, 23 Sep 2026 22:39:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.29948
- Title: CoaG: Cylinders on a Grid for Coarse 3D Layout Control in Video Generation
- Title(参考訳): CoaG:ビデオ生成における粗い3次元レイアウト制御のためのグリッド上のシリンダ
- Abstract要約: ユーザーは地面にグリッドを描き、各人が立つべきシリンダーを1つ設置し、シリンダーとカメラを81フレーム以上移動させる。
1935年に訓練されたWan2.2-Fun-Controlのロラは、ホールドアウトクリップのレイアウトとカメラパスに従っている。
- 参考スコア(独自算出の注目度): 3.358194374099428
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We ask how little geometry a person has to draw to control both where people stand and where the camera moves in a generated video. Our answer is a ground plane and one cylinder per person. A user draws a grid on the ground, places one cylinder where each person should stand, moves the cylinders and the camera over 81 frames, and the model renders a photoreal video in which the people occupy the cylinders' positions, move as the cylinders move, and are seen from the drawn camera. Appearance comes from a text prompt and a background reference image; layout and motion come from the geometry. Because no dataset pairs such a signal with video, we build the pairs ourselves: an automatic engine writes 2000 captions from a combinatorial seed, generates a clip for each with a text-to-video model, and lifts every clip back to its geometry with person tracking, background inpainting, an agentic ground-mask loop, feed-forward multi-view reconstruction and a plane fit, with no real footage and no manual labels. A LoRA on Wan2.2-Fun-Control trained on 1935 such tuples follows drawn layouts and camera paths on hold-out clips: the generated people match the cylinders' count, order, position and height, the text changes who they are, the reference image changes where they are, and dolly-in, orbit, pan and crane paths are followed, dolly-out only weakly.
- Abstract(参考訳): 私たちは、人が立っている場所と、生成されたビデオの中でカメラがどこに動くかの両方を制御するために、どれだけの幾何学的図形を描かなければならないかを尋ねる。
私たちの答えは、地上平面と1人あたりのシリンダーです。
ユーザは、地面にグリッドを描き、各人が立つべき1つのシリンダーを配置し、シリンダーとカメラを81フレーム以上移動させ、シリンダーの位置を占有し、シリンダーが動くにつれて動き、描画されたカメラから見えるフォトリアルビデオを表示する。
外観はテキストプロンプトと背景参照画像からきており、レイアウトと動きは幾何学から来ている。
自動エンジンは、合成シードから2000のキャプションを書き、テキストからビデオまでのモデルでそれぞれのクリップを生成し、人の追跡、背景の塗り絵、エージェント的なグラウンドマスクのループ、フィードフォワードのマルチビューの再構築、そして実際の映像や手動のラベルなしで、すべてのクリップをジオメトリーに戻す。
1935年に訓練されたWan2.2-Fun-ControlのLoRAは、これらのタプルを描画されたレイアウトとカメラのパスに追従する: 生成された人々はシリンダーの数、順序、位置、高さ、テキストの変更、それらがどこにあるかの参照画像の変更、そしてドリーイン、軌道、パン、クレーンのパスが追従され、ドリーアウトは弱かった。
関連論文リスト
- RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space [28.70181587812075]
本研究では,外見,背景,軌道からの動作を明示的に分離する枠組みを提案する。
本手法は,要素ワイド制御性と全映像品質の両面において,最先端性能を実現する。
論文 参考訳(メタデータ) (2025-08-12T03:02:23Z) - SketchVideo: Sketch-based Video Generation and Editing [51.99066098393491]
本研究では,映像生成のためのスケッチベースの空間・動き制御の実現と,実・合成ビデオのきめ細かい編集を支援することを目的とする。
DiTビデオ生成モデルに基づいて、スキップされたDiTブロックの残像を予測するスケッチ制御ブロックを用いたメモリ効率の高い制御構造を提案する。
スケッチベースのビデオ編集では,新たに編集したコンテンツとオリジナルビデオの空間的特徴と動的動作との整合性を維持するビデオ挿入モジュールを設計する。
論文 参考訳(メタデータ) (2025-03-30T02:44:09Z) - LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis [80.2461057573121]
本研究では,新しい次元,すなわち深度次元との相互作用を増大させ,ユーザが軌道上の各点に対して相対的な深度を割り当てることを許す。
本稿では,オブジェクトマスクを数個のクラスタポイントに抽象化することで,画像から映像への3次元トラジェクトリ制御の先駆的手法を提案する。
静的画像から実写映像を生成する際の物体の動きを正確に操作する手法であるLeviTorの有効性を検証する実験を行った。
論文 参考訳(メタデータ) (2024-12-19T18:59:56Z) - Video Autoencoder: self-supervised disentanglement of static 3D
structure and motion [60.58836145375273]
ビデオから3次元構造とカメラポーズの遠心分離表現を学習するために,ビデオオートエンコーダを提案する。
この表現は、新しいビュー合成、カメラポーズ推定、動きの追従によるビデオ生成など、様々なタスクに適用することができる。
論文 参考訳(メタデータ) (2021-10-06T17:57:42Z) - Layered Neural Atlases for Consistent Video Editing [37.69447642502351]
本稿では,入力映像を層状2次元アトラスに分解する手法を提案する。
ビデオの各画素について,各アトラスの対応する2次元座標を推定する。
我々は、アトラスを解釈可能で意味論的に設計し、アトラス領域での簡単かつ直感的な編集を容易にする。
論文 参考訳(メタデータ) (2021-09-23T14:58:59Z) - Self-Supervised Equivariant Scene Synthesis from Video [84.15595573718925]
本稿では,映像からシーン表現を学習するフレームワークを提案する。
トレーニング後、画像エンコーディングをリアルタイムで操作して、非表示のコンポーネントの組み合わせを生成することができる。
背景を持つMNISTの移動、2Dビデオゲームのスプライト、ファッションモデリングの3つのデータセットで結果を示す。
論文 参考訳(メタデータ) (2021-02-01T14:17:31Z) - Multi-Plane Program Induction with 3D Box Priors [110.6726150681556]
1つの画像からプログラムライクなシーン表現を推論するBox Program Injection (BPI)を提案する。
BPIは同時に、複数の2次元平面上の繰り返し構造、平面の3次元位置と向き、およびカメラパラメータをモデル化する。
ニューラルネットワークを使って、点の消滅やワイヤーフレーム線などの視覚的手がかりを推論し、検索ベースのアルゴリズムを誘導し、最もよく画像を説明するプログラムを見つける。
論文 参考訳(メタデータ) (2020-11-19T18:07:46Z) - Layered Neural Rendering for Retiming People in Video [108.85428504808318]
そこで本研究では,通常の自然ビデオで人々をリタイピングする手法を提案する。
異なる動きを時間的に調整したり、特定の動作の速度を変更したり、選択した人々をビデオから完全に「排除」したりできます。
このモデルの主な特徴は、入力ビデオ中の各人物の直接の動きを分離するだけでなく、各人物が生成するシーンの変化と自動的に関連付けることである。
論文 参考訳(メタデータ) (2020-09-16T17:48:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。