論文の概要: Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence
- arxiv url: http://arxiv.org/abs/2608.12290v1
- Date: Wed, 12 Aug 2026 17:35:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.661543
- Title: Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence
- Title(参考訳): Beyond Trial-and-Error: Image-to-Video Adherenceのためのエージェント最適化
- Abstract要約: Black-box Image-to-Video (I2V)モデルは、自動コンテンツ作成に強力な機能を提供する。
きめ細かい制御と信頼性の欠如は、プロのビデオ制作において大きな課題をもたらす。
我々はAgenic Self-Improvementフレームワークを導入し、動画をクローズドループでゴール指向の最適化に再構成する。
- 参考スコア(独自算出の注目度): 2.512325213832099
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern black-box Image-to-Video (I2V) models offer powerful capabilities in automated content creation, yet their lack of fine-grained control and reliability presents significant challenges in professional workflows. Their inherent stochasticity causes minor variations in textual prompts or hyperparameters to yield drastically different outputs often necessitating inefficient, brute-force trial-and-error processes. To address these limitations, we introduce the ``Agentic Self-Improvement" framework, which reframes video synthesis into a closed-loop, goal-directed optimization. Our framework systematically navigates the generation parameter space using a novel two-stage approach. In the first stage, an iterative prompt optimization loop uses a multimodal Large Language Model (mLLM) to refine the input prompt. This refinement implements two automated evaluations: Davidsonian Scene Graph (DSG) queries ensure semantic adherence, and Common Mistake Questions (CMQ) for artifact detection. At the second stage, we use Bayesian optimization to efficiently co-optimize stochastic seeds and CFG scales. This search is guided by a suite of quality metrics, including the novel Video-Text Adherence (VTA) score derived from the DSG and CMQ evaluations. Our framework significantly outperforms unguided search methods: in human preference studies, videos generated via our agentic approach were strongly preferred over baseline outputs, achieving win rates up to 69\%. This work provides a practical and extensible methodology for enhancing the predictability and control of state-of-the-art video generation models, moving the field beyond speculative curiosities toward reliable, production-ready tools.
- Abstract(参考訳): 現代のブラックボックスイメージ・トゥ・ビデオ(I2V)モデルは、自動コンテンツ作成において強力な能力を提供するが、細かい制御と信頼性の欠如は、プロのワークフローにおいて大きな課題をもたらす。
その固有の確率性は、テキストのプロンプトやハイパーパラメータの微妙な変化を引き起こし、しばしば非効率で残酷な試行錯誤プロセスを必要とするアウトプットを劇的に異なるものにする。
これらの制約に対処するために,ビデオ合成をクローズドループでゴール指向の最適化に再構成する ‘Agentic Self-Improvement’ フレームワークを導入する。
本フレームワークは,新しい2段階アプローチを用いて,生成パラメータ空間を体系的にナビゲートする。
最初の段階では、反復的なプロンプト最適化ループは、入力プロンプトを洗練させるためにマルチモーダルなLarge Language Model (mLLM) を使用する。
Davidsonian Scene Graph(DSG)クエリはセマンティックアテンデンスを保証し、Common Mistake Questions(CMQ)はアーティファクト検出のためのものだ。
第2段階では、ベイズ最適化を用いて確率的種子とCFGスケールを効率的に最適化する。
このサーチは、DSGとCMQの評価から得られた新しいビデオ・テキスト・アヒーレンス(VTA)スコアを含む、一連の品質指標によって導かれる。
ヒトの嗜好調査では,エージェント的手法を用いて生成した動画は,ベースライン出力よりも強く好まれ,最大69%の勝利率を達成できた。
この研究は、最先端のビデオ生成モデルの予測可能性と制御を強化するための実用的で拡張可能な方法論を提供する。
関連論文リスト
- Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding [98.3098451637867]
Video-MME-v2は、ビデオ理解の堅牢性と忠実さを厳格に評価するために設計された総合的なベンチマークである。
データ品質を保証するため、Video-MME-v2は厳格に制御された人間のアノテーションパイプラインを通して構築される。
論文 参考訳(メタデータ) (2026-04-06T17:59:56Z) - VQQA: An Agentic Approach for Video Evaluation and Quality Improvement [36.312552904481414]
本稿では,VQQA (Video Quality Question Answering) について述べる。
VQQAは、従来の受動的評価指標を人間解釈可能で行動可能なフィードバックに置き換える。
本手法は, ベニラ生成に対するT2V-CompBenchの+11.57%, VBench2の+8.43%の絶対改善を実現する。
論文 参考訳(メタデータ) (2026-03-12T18:00:00Z) - VIPER: Process-aware Evaluation for Generative Video Reasoning [64.86465792516658]
我々は、時間的、構造的、象徴的、空間的、物理的、計画的推論にまたがる16のタスクにまたがる包括的なベンチマークVIPERを紹介する。
実験の結果,現状の映像モデルでは約20%のPOC@1.0しか達成できず,良好な結果が得られた。
論文 参考訳(メタデータ) (2025-12-31T16:31:59Z) - VDOT: Efficient Unified Video Creation via Optimal Transport Distillation [70.02065520468726]
本稿では,VDOT という名前の効率的な統合ビデオ生成モデルを提案する。
我々は,実測値分布と偽測値分布の差分を最適化するために,新しい計算最適輸送(OT)技術を用いる。
統合ビデオ生成モデルの訓練を支援するため,ビデオデータアノテーションとフィルタリングのための完全自動パイプラインを提案する。
論文 参考訳(メタデータ) (2025-12-07T11:31:00Z) - CAMP-VQA: Caption-Embedded Multimodal Perception for No-Reference Quality Assessment of Compressed Video [9.172799792564009]
本稿では,大規模モデルの意味理解機能を活用した新しいNR-VQAフレームワークであるCAMP-VQAを提案する。
本手法では,フレーム間変動から抽出したキーフラグメントを統合する品質対応ビデオメタデータ機構を提案する。
我々のモデルは既存のNR-VQA法を一貫して上回り、手作業の細かいアノテーションを使わずに精度の向上を実現している。
論文 参考訳(メタデータ) (2025-11-10T16:37:47Z) - GenPilot: A Multi-Agent System for Test-Time Prompt Optimization in Image Generation [13.197958581564256]
本稿では,入力テキストを直接操作するテスト時間プロンプト最適化手法を提案する。
私たちのアプローチは、モデルに依存しず、解釈可能で、長く複雑なプロンプトを扱うのに適しています。
論文 参考訳(メタデータ) (2025-10-08T16:51:52Z) - SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution [46.311223206965934]
後続の超解像モデルの設計原理について検討し,その設計原理について検討する。
まず、ベースモデルの出力特性をよりよく模倣し、VSRモデルと上流ジェネレータとの整合性を確保するための2つのトレーニングペアを生成する方法を提案する。
第2に,(1)時間ステップサンプリング戦略,(2)低分解能(LR)入力に対する雑音増強効果の系統的解析を通じて,VSRモデル行動に対する批判的洞察を提供する。
論文 参考訳(メタデータ) (2025-06-24T17:57:26Z) - ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding [71.654781631463]
ReAgent-Vは、新しいエージェントビデオ理解フレームワークである。
推論中に効率の良いフレーム選択とリアルタイムの報酬生成を統合する。
12のデータセットに対する大規模な実験は、一般化と推論において大きな成果を上げている。
論文 参考訳(メタデータ) (2025-06-02T04:23:21Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM [54.2320450886902]
テキスト・ビデオ・モデルは高品質のテキスト・ビデオ・ペアを最適化することで顕著な進歩を遂げた。
現在の精製の自動化手法は、モダリティ・一貫性、コスト分散、モデルウナウエアといった課題に直面する。
Prompt-A-Videoは、特定のビデオ拡散モデルに合わせた、ビデオ中心、労働自由、調整されたプロンプトの製作に優れる。
論文 参考訳(メタデータ) (2024-12-19T18:32:21Z) - Saliency-Guided DETR for Moment Retrieval and Highlight Detection [41.94295877935867]
既存のビデオモーメント検索とハイライト検出のアプローチでは、テキストとビデオの機能を効率的に調整することはできない。
このようなアライメントのために設計された最近の基礎的ビデオモデルを利用する新しいアーキテクチャを提案する。
さらに改良するために,大規模かつ高品質なプレトレーニングデータセットであるInterVid-MRを開発した。
論文 参考訳(メタデータ) (2024-10-02T14:53:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。