論文の概要: VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation
- arxiv url: http://arxiv.org/abs/2606.08091v1
- Date: Sat, 06 Jun 2026 10:35:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.772077
- Title: VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation
- Title(参考訳): VideoWeaver: エージェントビデオ生成のためのスキルの評価と進化
- Authors: Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu,
- Abstract要約: 我々は、長時間のビデオ生成のスキルを評価し、進化させるエージェントハーネスとベンチマークであるVideoWeaverを紹介した。
エージェント・アズ・ジャッジは実行トレースと最終ビデオの両方を検査し、そのスコアをメタデータや中間ファイルなどのエビデンスに根拠付ける。
基礎的スキルのみを用いることよりも,明示的な構成スキルが生成プロセスを改善することが判明した。
- 参考スコア(独自算出の注目度): 31.298725533176253
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent agent frameworks such as Claude Code, Codex, and OpenClaw are strong at tool use and orchestration, but whether they can handle long video generation, a long-horizon multimodal task, remains underexplored. Unlike earlier video agents whose pipeline is handcrafted, these frameworks can build and refine their own workflows. We introduce VideoWeaver, an agent harness and benchmark that evaluates and evolves skills for long video generation, where an agent turns a single instruction into a long video by composing foundation skills into its own workflow rather than following a predefined pipeline. The benchmark has 16 task categories and 285 cases, with references spanning text, image, audio, video, and their combinations. Because errors can arise at any stage and not just in the final video, we propose an agent-as-judge that inspects both the execution trace and the final video, grounding its scores in evidence such as metadata and intermediate files. Using this feedback, we further design a skill evolution algorithm that refines and merges the agent's skills. Across multiple frameworks and models, we find that an explicit composition skill improves the generation process over using foundation skills alone, that skill evolution further improves output quality, and that performance varies notably across harness and model choices. The proposed agent-as-judge also aligns well with human judgments, especially on process metrics. Code and dataset is available at https://github.com/JianhuiWei7/VideoWeaver
- Abstract(参考訳): Claude Code、Codex、OpenClawといった最近のエージェントフレームワークは、ツールの使用とオーケストレーションが得意だが、長い水平マルチモーダルタスクである長時間のビデオ生成を処理できるかどうかは未定である。
パイプラインを手作りした以前のビデオエージェントとは異なり、これらのフレームワークは独自のワークフローを構築して洗練することができる。
エージェントは、事前に定義されたパイプラインに従うのではなく、基礎的なスキルを独自のワークフローに構成することで、単一の命令を長いビデオに変換する。
ベンチマークには16のタスクカテゴリと285のケースがあり、テキスト、画像、オーディオ、ビデオ、それらの組み合わせにまたがる参照がある。
最終ビデオだけでなく、どの段階でもエラーが発生するため、実行トレースと最終ビデオの両方を検査し、そのスコアをメタデータや中間ファイルなどのエビデンスに根拠付けるエージェント・アズ・ジャッジを提案する。
このフィードバックを用いて、エージェントのスキルを洗練・統合するスキル進化アルゴリズムをさらに設計する。
複数のフレームワークやモデルにまたがって、明示的な構成スキルは基礎スキルのみを使用することよりも生成プロセスを改善し、スキルの進化は出力品質をさらに改善し、パフォーマンスはハーネスやモデルの選択によって顕著に異なります。
提案したエージェント・アズ・ジャッジは、特にプロセスメトリクスに関して、人間の判断とよく一致している。
コードとデータセットはhttps://github.com/JianhuiWei7/VideoWeaverで入手できる。
関連論文リスト
- Sandboxed Coding Agents are Competitive Omni-modal Task Solvers [22.269016330825128]
テキスト・イメージ・アクセスとサンドボックス・ツール・ユース・インタフェースしか持たないコーディング・エージェントがSOTAネイティブ・オムニモーダル・モデルと一致することを示す。
私たちの軌道分析は、その強みがコードを書き、関連する証拠を抽出するためのツールを編成することに由来することを示唆しています。
我々は,OmniCodingトラジェクトリデータセットと検証可能な報酬を含むトレーニングレシピであるCode-Xを紹介し,Qwen-3.5-9BとQwen-3.6-27Bのベースラインを提供する。
論文 参考訳(メタデータ) (2026-05-30T07:04:27Z) - CutClaw: Agentic Hours-Long Video Editing via Music Synchronization [96.62825277039117]
CutClawは、数時間の生の映像を意味のある短いビデオに編集するために設計された、自律的なマルチエージェントフレームワークだ。
同期音楽の動画を制作し、指示と視覚的に魅力的な外観が続く。
われわれは、CutClawが高品質なリズムアライメントビデオを生成する際に、最先端のベースラインを大幅に上回っていることを示すための詳細な実験を行っている。
論文 参考訳(メタデータ) (2026-03-31T12:25:53Z) - UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist [107.04196084992907]
次世代ビデオジェネラリストのためのオールニ対応マルチエージェントフレームワークUniVAを紹介する。
UniVAはPlan-and-Actのデュアルエージェントアーキテクチャを採用しており、高度に自動化されプロアクティブなワークフローを駆動している。
また、理解、編集、セグメンテーション、生成にまたがるマルチステップビデオタスクのベンチマークスイートUniVA-Benchについても紹介する。
論文 参考訳(メタデータ) (2025-11-11T17:58:13Z) - CAViAR: Critic-Augmented Video Agentic Reasoning [90.48729440775223]
より複雑なビデオ推論を行うために、知覚能力を利用することができますか?
我々は,ビデオモジュールをサブエージェントやツールとして利用できる大規模言語モデルエージェントを開発した。
我々は,我々のエージェントと批評家の組み合わせが,データセット上で高い性能を達成することを示す。
論文 参考訳(メタデータ) (2025-09-09T17:59:39Z) - Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding [60.88843818016968]
長時間のビデオ理解は時間空間の複雑さと質問応答の難しさによって大きな課題を呈する。
セグメント化されたビデオクリップ上でのエージェント検索戦略を活用するために,Deep Video Discovery (DVD) エージェントを提案する。
当社のDVDエージェントは,LVBenchデータセット上での最先端性能を実現し,74.2%の精度を実現した。
論文 参考訳(メタデータ) (2025-05-23T16:37:36Z) - StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration [88.94832383850533]
CSVG(Customized Storytelling Video Generation)のためのマルチエージェントフレームワークを提案する。
StoryAgentはCSVGを特殊エージェントに割り当てられた個別のサブタスクに分解し、プロの制作プロセスを反映する。
具体的には、撮影時間内整合性を高めるために、カスタマイズされたイメージ・ツー・ビデオ(I2V)手法であるLoRA-BEを導入する。
コントリビューションには、ビデオ生成タスクのための汎用フレームワークであるStoryAgentの導入や、プロタゴニストの一貫性を維持するための新しい技術が含まれている。
論文 参考訳(メタデータ) (2024-11-07T18:00:33Z) - Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs [20.168429351519055]
ビデオ理解はマルチモーダル大言語モデル(LMLM)にとって重要な次のステップである
合成ビデオ生成によるベンチマーク構築フレームワークであるVideoNIAH(Video Needle In A Haystack)を提案する。
我々は、プロプライエタリモデルとオープンソースモデルの両方を包括的に評価し、ビデオ理解能力の重大な違いを明らかにする。
論文 参考訳(メタデータ) (2024-06-13T17:50:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。