論文の概要: Autoregressive Modeling of Film with Applications in Video Montage
- arxiv url: http://arxiv.org/abs/2607.14645v2
- Date: Mon, 20 Jul 2026 15:29:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.622483
- Title: Autoregressive Modeling of Film with Applications in Video Montage
- Title(参考訳): ビデオモンタージュにおけるフィルムの自己回帰モデリング
- Authors: Marcelo Sandoval-Castañeda, Fabian Caba Heilbron, Shiry Ginosar, Bryan Russell, Josef Sivic, Alexei A. Efros, Greg Shakhnarovich,
- Abstract要約: FilmGPTは、生の「見ることができない」映像をコヒーレントな映画シーケンスに変換するために設計された自動回帰トランスフォーマーである。
現代LLMの言語学習にインスパイアされた我々は、大規模な映画コーパスに長文の自己回帰変換器を訓練する。
本研究では,ユーザによる全フィルム編集作業において,映像制約付き復号アルゴリズムの評価を行い,FilmGPTをベースとした編集が従来の手法よりも大幅に優れていたことを見出した。
- 参考スコア(独自算出の注目度): 55.93893329580228
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This work introduces FilmGPT, an autoregressive transformer designed to address the challenge of video montage--turning a collection of raw, "unwatchable" footage into coherent cinematic sequences. Inspired by language learning in modern LLMs, we train a long-context autoregressive transformer on a large corpus of movies. The aim is to implicitly capture the "grammar" of film directly from data rather than from hand-coded rules. Unlike other generative models, FilmGPT does not generate any new video frames. Instead, at inference time, we introduce a footage-constrained decoding algorithm to select the best next shot from the input raw footage according to the statistical patterns learned from films. We first evaluate these learned statistics directly by using the FilmGPT autoregressive model for next shot prediction on a standard benchmark of shot sequence ordering, outperforming the previous state of the art. We then evaluate our footage-constrained decoding algorithm on the full film editing task via a user study, and find that our FilmGPT-based editing significantly outperforms previous approaches. Finally, we demonstrate the applicability of FilmGPT to a wide range of applications in video montage, from automatic video segment trimming to human-in-the-loop film editing.
- Abstract(参考訳): この研究は、ビデオモンタージュの課題に対処するために設計された自動回帰トランスフォーマーであるFilmGPTを導入し、生の「見ることができない」映像の集合をコヒーレントなシネマシークエンスに変換する。
現代LLMの言語学習にインスパイアされた我々は、大規模な映画コーパスに長文の自己回帰変換器を訓練する。
目的は、手書きのルールではなく、データから直接、フィルムの"文法"を暗黙的にキャプチャすることである。
他の生成モデルとは異なり、FilmGPTは新しいビデオフレームは生成しない。
その代わり,本研究では,映像から得られた統計的パターンに従って,入力された生の映像から最適な次のショットを選択するために,映像制約付き復号アルゴリズムを導入する。
我々はまず,次のショット予測のためのFilmGPT自動回帰モデルを用いて,これらの学習統計を直接評価する。
次に,ユーザによる全フィルム編集作業において,映像制約付き復号アルゴリズムの評価を行い,FilmGPTに基づく編集が従来の手法よりも大幅に優れていたことを見出した。
最後に、自動ビデオセグメントトリミングからヒューマン・イン・ザ・ループ・フィルム編集まで、ビデオモンタージュの幅広い応用にFilmGPTが適用可能であることを示す。
関連論文リスト
- ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions [46.3918771233715]
ShotDirectorは、パラメータレベルのカメラ制御と階層的な編集パターン認識プロンプトを統合する効率的なフレームワークである。
本フレームワークは,パラメータレベルの条件と高レベルの意味指導を効果的に組み合わせ,フィルムのような制御可能なショット遷移を実現する。
論文 参考訳(メタデータ) (2025-12-11T05:05:07Z) - ESA: Energy-Based Shot Assembly Optimization for Automatic Video Editing [12.967240894970098]
ショットアセンブリは、映画制作とビデオ編集において重要なステップである。
伝統的に、このプロセスは経験豊富な編集者によって手動で実行される。
本稿では,映像合成のためのエネルギーベース最適化手法を提案する。
論文 参考訳(メタデータ) (2025-11-04T11:48:22Z) - CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models [28.224969852134606]
我々は,コヒーレントなマルチショットビデオを生成するためのフレームワークであるCineTransを紹介した。
CineTransは、フィルム編集スタイルに固執しながら、不安定な遷移やナイーブな結合を避けながら、シネマティックなマルチショットシーケンスを生成する。
論文 参考訳(メタデータ) (2025-08-15T13:58:22Z) - EditIQ: Automated Cinematic Editing of Static Wide-Angle Videos via Dialogue Interpretation and Saliency Cues [6.844857856353673]
我々は、静止画、大視野、高解像度カメラで撮影されたシーンを撮影的に編集する、完全に自動化されたフレームワークEditIQを提案する。
静的カメラフィードから、EditIQは最初、複数の仮想フィードを生成し、カメラマンのチームをエミュレートする。
これらの仮想カメラショットは後に自動編集アルゴリズムを用いて組み立てられ、その目的は視聴者に最も鮮明なシーンコンテンツを提示することである。
論文 参考訳(メタデータ) (2025-02-04T09:45:52Z) - Video Decomposition Prior: A Methodology to Decompose Videos into Layers [74.36790196133505]
本稿では,プロのビデオ編集の実践からインスピレーションを得た,VDP以前の新しいビデオ分解手法を提案する。
VDPフレームワークは、ビデオシーケンスを複数のRGBレイヤと関連する不透明度レベルに分解する。
ビデオオブジェクトのセグメンテーション、デハジング、リライティングといったタスクに対処する。
論文 参考訳(メタデータ) (2024-12-06T10:35:45Z) - Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image
Diffusion Models [65.268245109828]
Ground-A-Videoは、マルチ属性ビデオ編集のためのビデオからビデオへの変換フレームワークである。
トレーニング不要な方法で、時間的に一貫した入力ビデオの編集を可能にする。
実験と応用により、Ground-A-Videoのゼロショットキャパシティは、編集精度とフレームの整合性の観点から、他のベースライン手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2023-10-02T11:28:37Z) - Dreamix: Video Diffusion Models are General Video Editors [22.127604561922897]
テキスト駆動画像とビデオ拡散モデルは最近、前例のない世代のリアリズムを達成した。
一般的なビデオのテキストベースの動きと外観編集を行うことができる最初の拡散ベース手法を提案する。
論文 参考訳(メタデータ) (2023-02-02T18:58:58Z) - The Anatomy of Video Editing: A Dataset and Benchmark Suite for
AI-Assisted Video Editing [90.59584961661345]
この研究は、AIによるビデオ編集の研究を促進するために、データセットとベンチマークであるビデオ編集の解剖学を導入している。
本ベンチマークスイートでは,映像の自動撮影やビデオ組み立て支援など,視覚効果以外の映像編集作業に重点を置いている。
これらの前線の研究を可能にするために、196176年の映画シーンから採取した150万枚以上のタグと、撮影技術に関する概念を注釈付けした。
論文 参考訳(メタデータ) (2022-07-20T10:53:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。