論文の概要: VideoGen-Agent: Reinforcing Video Generation Agents
- arxiv url: http://arxiv.org/abs/2609.24997v2
- Date: Tue, 29 Sep 2026 07:10:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.518829
- Title: VideoGen-Agent: Reinforcing Video Generation Agents
- Title(参考訳): VideoGen-Agent: ビデオ生成エージェントの強化
- Abstract要約: VideoGen-Agentはマルチタスクエージェント強化学習を通じて訓練されたマルチモーダルエージェントである。
カテゴリ対応ハイブリッド報酬は、ツールコールの妥当性、タスクに適したツール使用、生成ビデオ品質を評価する。
VABenchでは、VideoGen-Agentは基本となるテキスト・ビデオ・ジェネレータを19.1ポイント改善した。
- 参考スコア(独自算出の注目度): 86.32111232820654
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in video generative models have enabled high-fidelity, temporally coherent video generation. However, these models often struggle to satisfy prompts requiring specialized knowledge, specific identities, physical consistency, or ordered events. In this paper, we present VideoGen-Agent, a multimodal agent trained through multitask agentic reinforcement learning to use external tools for video generation. The agent coordinates augmentation, generation, and verification tools through multi-turn interactions, using the prompt and intermediate observations to guide its decisions. We train a shared policy on a category-balanced dataset spanning six tasks. Supervised fine-tuning on teacher-generated trajectories establishes tool-use behavior, which is then refined through reinforcement learning. A category-aware hybrid reward evaluates tool-call validity, task-appropriate tool use, and generated video quality. We further introduce VABench, a held-out benchmark of 600 prompts covering procedural knowledge, single- and multi-entity identity preservation, physical consistency, scene composition, and multi-shot temporal structure. On VABench, VideoGen-Agent improves over its base text-to-video generator by 19.1 points, from 56.5 to 75.6. Upgrading the generation tools further raises the score to 86.1 without additional agent training. Human raters prefer the upgraded configuration over the strongest standalone baseline in 84.3% of comparisons. These results support learning tool use across video-generation tasks and show that the trained agent can benefit from subsequent advances in generation tools. Project page: https://andyca111.github.io/VideoGen_Agent/
- Abstract(参考訳): 映像生成モデルの最近の進歩は、高忠実で時間的コヒーレントな映像生成を可能にしている。
しかしながら、これらのモデルは、特別な知識、特定のアイデンティティ、物理的な一貫性、順序付けられたイベントを必要とするプロンプトを満たすのに苦労することが多い。
本稿では,マルチタスクエージェント強化学習を通じて訓練されたマルチモーダルエージェントであるVideoGen-Agentについて述べる。
エージェントは、プロンプトと中間観察を用いて、マルチターンインタラクションを通じて拡張、生成、検証ツールを調整し、その決定を導出する。
6つのタスクにまたがるカテゴリバランスデータセットに対して、共有ポリシをトレーニングします。
教師が生成した軌跡の微調整によって道具の使用行動が確立され、強化学習によって洗練される。
カテゴリ対応ハイブリッド報酬は、ツールコールの妥当性、タスクに適したツール使用、生成ビデオ品質を評価する。
さらに,600個のプロンプトのホールドアウトベンチマークであるVABenchを紹介した。
VABenchでは、VideoGen-Agentは基本となるテキスト・ビデオ・ジェネレータを56.5から75.6まで19.1ポイント改善した。
生成ツールのアップグレードにより、追加のエージェントトレーニングなしで86.1までスコアが上昇する。
人間のラッカーは84.3%の比較において最強のスタンドアロンベースラインよりもアップグレードされた構成を好む。
これらの結果は、ビデオ生成タスクにおける学習ツールの使用を支援し、訓練されたエージェントがその後の生成ツールの進歩の恩恵を受けることを示す。
プロジェクトページ: https://andyca111.github.io/VideoGen_Agent/
関連論文リスト
- VideoResearcher: Self-Improving Tool Design for Long-Video Understanding [48.056230109444016]
VideoResearcherは、ビデオ理解のためのツールを自律的に設計、テスト、洗練する、トレーニング不要のマルチエージェントフレームワークである。
自己改善剤の最先端性能を達成し、人間設計の上界にアプローチする。
論文 参考訳(メタデータ) (2026-09-17T04:04:23Z) - VideoAgent: All-in-One Framework for Video Understanding and Editing [26.019384130449733]
VideoAgentはビデオ編集のためのオールインワンのエージェントフレームワークである。
我々は、コヒーレントな物語のための撮影計画エージェントを用いた自動撮影を作成する。
Intent parsing filters relevant tools while textual-gradient graph optimizationsasse editing pipelines。
論文 参考訳(メタデータ) (2026-06-22T13:37:08Z) - VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation [31.298725533176253]
我々は、長時間のビデオ生成のスキルを評価し、進化させるエージェントハーネスとベンチマークであるVideoWeaverを紹介した。
エージェント・アズ・ジャッジは実行トレースと最終ビデオの両方を検査し、そのスコアをメタデータや中間ファイルなどのエビデンスに根拠付ける。
基礎的スキルのみを用いることよりも,明示的な構成スキルが生成プロセスを改善することが判明した。
論文 参考訳(メタデータ) (2026-06-06T10:35:28Z) - GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning [54.42973725693]
我々は,エージェント型マルチモーダルモデルを用いて,視覚的理解と生成を統一したGenAgentを導入する。
GenAgentはGenEval++とWISEのベースジェネレータ(FLUX.1-dev)のパフォーマンスを大幅に向上させる。
本フレームワークは,1) 様々な機能を持つジェネレータへのクロスツール一般化,2) インタラクションラウンド間で一貫した改善を伴うテスト時間スケーリング,3) タスクに自動的に適応するタスク適応推論の3つの重要な特性を示す。
論文 参考訳(メタデータ) (2026-01-26T14:49:04Z) - UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist [107.04196084992907]
次世代ビデオジェネラリストのためのオールニ対応マルチエージェントフレームワークUniVAを紹介する。
UniVAはPlan-and-Actのデュアルエージェントアーキテクチャを採用しており、高度に自動化されプロアクティブなワークフローを駆動している。
また、理解、編集、セグメンテーション、生成にまたがるマルチステップビデオタスクのベンチマークスイートUniVA-Benchについても紹介する。
論文 参考訳(メタデータ) (2025-11-11T17:58:13Z) - Hollywood Town: Long-Video Generation via Cross-Modal Multi-Agent Orchestration [73.65102758687289]
本研究は,マルチエージェントコラボレーションを改善するための3つのイノベーションを紹介する。
まず、長いビデオ生成のための階層型グラフベースのマルチエージェントフレームワークであるOmniAgentを提案する。
第2に,文脈工学にヒントを得たハイパーグラフノードを提案する。
論文 参考訳(メタデータ) (2025-10-25T20:34:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。