論文の概要: GraphVid: Interactive Graph-Controllable Video Generation
- arxiv url: http://arxiv.org/abs/2607.21580v1
- Date: Thu, 23 Jul 2026 17:56:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.514069
- Title: GraphVid: Interactive Graph-Controllable Video Generation
- Title(参考訳): GraphVid: インタラクティブなグラフ編集可能なビデオ生成
- Authors: Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu, Adheesh Juvekar, Muntasir Waheed, Ismini Lourentzou,
- Abstract要約: GraphVidは、構造化された相互作用グラフによるインタラクティブな制御を可能にする、グラフ条件の画像-ビデオ生成モデルである。
GraphVidは強力なコントロール性とビデオ品質を提供する。
Motion-I2Vと比較して、GraphVidはFIDを39.9%、FVDを37.6%削減する。
- 参考スコア(独自算出の注目度): 5.441104170074003
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Controllable video generation remains challenging due to the difficulty of specifying precise multi-object interactions using text prompts or motion-control inputs that primarily constrain pixel movement. In practice, trajectory-based control often requires users to draw accurate tracks for multiple objects, which scales poorly with scene complexity and becomes ambiguous under occlusion or overlap. To enable flexible yet precise multi-subject control, we introduce $\textbf{GraphVid}$, a graph-conditioned image-to-video generation model that enables interactive control through structured interaction graphs. We further curate $\textbf{GraphVid-Bench}$, a large-scale interaction-centric video dataset with structured relational annotations to enable training of interaction-aware video generation models. Despite using substantially less training data and fewer trainable parameters than prior motion-control methods, GraphVid delivers strong controllability and video quality. Compared with Motion-I2V, GraphVid reduces FID by up to 39.9% and FVD by 37.6%, while improving PSNR (9.87=>15.98) and SSIM (0.38=>0.61). Our results highlight the potential of structured semantic interfaces as a powerful paradigm for controllable video generation.
- Abstract(参考訳): 制御可能なビデオ生成は、テキストプロンプトや、主にピクセルの動きを制限するモーションコントロール入力を使って、正確なマルチオブジェクトインタラクションを特定するのが難しいため、依然として困難である。
実際には、トラジェクトリベースの制御では、ユーザーは複数のオブジェクトの正確なトラックを描画する必要があることが多い。
フレキシブルかつ高精度なマルチオブジェクト制御を実現するために、構造化相互作用グラフによるインタラクティブな制御を可能にするグラフ条件付き画像-ビデオ生成モデルである$\textbf{GraphVid}$を導入する。
さらに、構造化されたリレーショナルアノテーションを備えた大規模インタラクション中心のビデオデータセットである$\textbf{GraphVid-Bench}$をキュレートし、インタラクション対応のビデオ生成モデルのトレーニングを可能にする。
トレーニングデータの使用量が大幅に少なく、従来のモーションコントロール手法よりもトレーニング可能なパラメータが少ないにもかかわらず、GraphVidは強力な制御性とビデオ品質を提供する。
Motion-I2Vと比較して、GraphVidはFIDを39.9%、FVDを37.6%削減し、PSNR(9.87=>15.98)とSSIM(0.38=>0.61)を改善した。
本結果は,制御可能なビデオ生成のための強力なパラダイムとして,構造化セマンティックインタフェースの可能性を強調した。
関連論文リスト
- SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models [0.25489046505746704]
SceneGraphVLMは、小さな視覚言語モデルを用いた画像および映像シーングラフ生成のためのコンパクトな方法である。
SceneGraphVLMはトークン効率のTOONフォーマットでグラフをシリアライズし、2段階でモデルをトレーニングする。
SceneGraphVLM on PSG, PVSG, Action Genome。
論文 参考訳(メタデータ) (2026-05-13T15:27:41Z) - MultiCOIN: Multi-Modal COntrollable Video INbetweening [46.37499813275259]
マルチモーダル制御を実現するMultiCOINを紹介した。
DiTとマルチモーダルコントロールの互換性を確保するため、すべてのモーションコントロールを共通スパース表現にマッピングする。
また,モデルがマルチモーダル制御を円滑に学習できるように,段階的な学習戦略を提案する。
論文 参考訳(メタデータ) (2025-10-09T17:59:27Z) - Tracktention: Leveraging Point Tracking to Attend Videos Faster and Better [61.381599921020175]
時間的一貫性は、出力が一貫性があり、アーティファクトがないことを保証するために、ビデオ予測において重要である。
時間的注意や3D畳み込みといった伝統的な手法は、重要な物体の動きに苦しむことがある。
本稿では,ポイントトラックを用いた動き情報を明示的に統合する新しいアーキテクチャコンポーネントであるトラックキート・レイヤを提案する。
論文 参考訳(メタデータ) (2025-03-25T17:58:48Z) - Understanding Long Videos via LLM-Powered Entity Relation Graphs [51.13422967711056]
GraphVideoAgentは、ビデオシーケンスを通して視覚的エンティティ間の進化する関係をマップし、監視するフレームワークである。
当社の手法は,業界ベンチマークと比較した場合,顕著な効果を示す。
論文 参考訳(メタデータ) (2025-01-27T10:57:24Z) - MotionBridge: Dynamic Video Inbetweening with Flexible Controls [29.029643539300434]
我々はMotionBridgeを紹介した。
トラジェクティブストローク、ビデオ編集マスク、ガイドピクセル、テキストビデオなど、柔軟なコントロールが可能だ。
このようなマルチモーダル制御は、よりダイナミックでカスタマイズ可能で、文脈的に正確な視覚的物語を可能にする。
論文 参考訳(メタデータ) (2024-12-17T18:59:33Z) - EasyControl: Transfer ControlNet to Video Diffusion for Controllable Generation and Interpolation [73.80275802696815]
本稿では、ビデオ生成のためのEasyControlというユニバーサルフレームワークを提案する。
提案手法により,ユーザーは単一の条件マップで映像生成を制御できる。
その結果,UCF101とMSR-VTTのFVDおよびISが向上した。
論文 参考訳(メタデータ) (2024-08-23T11:48:29Z) - TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models [75.20168902300166]
微粒な軌跡条件の運動制御が可能な新しい映像生成フレームワークであるTrackDiffusionを提案する。
TrackDiffusionの重要なコンポーネントは、複数のオブジェクトのフレーム間の一貫性を明確に保証するインスタンスエンハンサーである。
TrackDiffusionによって生成されたビデオシーケンスは、視覚知覚モデルのトレーニングデータとして使用できる。
論文 参考訳(メタデータ) (2023-12-01T15:24:38Z) - ControlVideo: Training-free Controllable Text-to-Video Generation [117.06302461557044]
ControlVideoは、自然で効率的なテキスト・ビデオ生成を可能にするフレームワークである。
NVIDIA 2080Tiを使って、ショートビデオとロングビデオの両方を数分で生成する。
論文 参考訳(メタデータ) (2023-05-22T14:48:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。