論文の概要: ViMax: Agentic Video Generation
- arxiv url: http://arxiv.org/abs/2606.07649v1
- Date: Tue, 02 Jun 2026 12:55:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.187218
- Title: ViMax: Agentic Video Generation
- Title(参考訳): ViMax: エージェントビデオ生成
- Authors: Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang,
- Abstract要約: ロングフォームビデオ生成には、体系的な物語計画と視覚的一貫性が必要である。
我々のフレームワークは、グローバルなストーリーコヒーレンスのための検索強化世代を備えた階層的な物語エンジンを採用している。
VLM誘導エージェントは、物語のコヒーレンスと視覚的忠実さの両方を継続的に監視し、洗練する。
- 参考スコア(独自算出の注目度): 55.546794487716646
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-form video generation requires systematic narrative planning and visual consistency that current short-clip methods cannot provide. Existing methods generate isolated sequences without narrative structure and lack mechanisms for maintaining character and environmental consistency across scenes. We present ViMax, an agentic video generation framework that addresses video creation through coordinated multi-agent collaboration where specialized components negotiate narrative decisions, visual continuity, and production quality. Our framework employs a hierarchical narrative engine with retrieval-augmented generation for global story coherence and a dependency-aware visual consistency mechanism that tracks character and environmental states across temporal boundaries, while VLM-guided agents continuously monitor and refine both narrative coherence and visual fidelity. The framework enables coordinated agent collaboration to generate extended narrative content. This maintains both storytelling integrity and visual coherence across multi-scene timelines.
- Abstract(参考訳): ロングフォームビデオ生成は、現在のショートクリップ法では提供できないような、体系的な物語計画と視覚的一貫性を必要とする。
既存の手法では、物語構造を持たず、シーン間のキャラクタと環境の整合性を維持するメカニズムが欠如している。
協調型マルチエージェントコラボレーションによる映像生成を支援するエージェントビデオ生成フレームワークであるViMaxについて述べる。
我々のフレームワークでは,グローバルなストーリーコヒーレンスに対する検索拡張生成と,時間的境界を越えたキャラクタ状態と環境状態を追跡する依存性を考慮した視覚的一貫性機構を備えた階層型物語エンジンを採用し,VLM誘導エージェントは物語コヒーレンスと視覚的忠実さの両方を継続的に監視・改善する。
このフレームワークは、協調エージェントの協調により、拡張された物語コンテンツを生成する。
これはストーリーテリングの整合性と、マルチシーンのタイムラインにおける視覚的コヒーレンスの両方を維持している。
関連論文リスト
- Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration [61.98029663481308]
Soap2SoapはDualBridgeメカニズムを通じて長期の視覚的一貫性を強制するマルチエージェントフレームワークである。
クローズドループ検証エージェントは、識別、安定性、アライメントを監査し、選択的再生を誘導する。
論文 参考訳(メタデータ) (2026-05-17T12:38:21Z) - CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation [9.91271343855315]
CoAgentは、コヒーレントなビデオ生成のためのフレームワークで、プラン合成の検証パイプラインとしてプロセスを定式化している。
Storyboard Plannerは、入力を明示的な実体、空間的関係、時間的手がかりで構造化されたショットレベルのプランに分解する。
Global Context Managerは、エンティティレベルのメモリを維持して、ショット間の外観とアイデンティティの整合性を維持する。
ペーシング対応エディタは、所望の物語の流れに合わせて時間リズムと遷移を洗練する。
論文 参考訳(メタデータ) (2025-12-27T09:38:34Z) - StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration [88.94832383850533]
CSVG(Customized Storytelling Video Generation)のためのマルチエージェントフレームワークを提案する。
StoryAgentはCSVGを特殊エージェントに割り当てられた個別のサブタスクに分解し、プロの制作プロセスを反映する。
具体的には、撮影時間内整合性を高めるために、カスタマイズされたイメージ・ツー・ビデオ(I2V)手法であるLoRA-BEを導入する。
コントリビューションには、ビデオ生成タスクのための汎用フレームワークであるStoryAgentの導入や、プロタゴニストの一貫性を維持するための新しい技術が含まれている。
論文 参考訳(メタデータ) (2024-11-07T18:00:33Z) - MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence [62.72540590546812]
MovieDreamerは、自己回帰モデルの強みと拡散ベースのレンダリングを統合する、新しい階層的なフレームワークである。
様々な映画ジャンルにまたがって実験を行い、そのアプローチが優れた視覚的・物語的品質を実現することを示す。
論文 参考訳(メタデータ) (2024-07-23T17:17:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。