論文の概要: Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
- arxiv url: http://arxiv.org/abs/2608.20749v1
- Date: Fri, 21 Aug 2026 05:19:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.407614
- Title: Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
- Title(参考訳): エージェント強化と意味修復によるアイデンティティ保存型テキスト・ビデオ生成
- Authors: Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu,
- Abstract要約: アイデンティティ保存ビデオ生成は、対象者の視覚的アイデンティティを維持しながら、自然言語による指示に従うビデオを合成することを目的としている。
最近の商用ビデオ生成モデルは、強い視覚的品質とモーションリアリズムを達成したが、それでもアイデンティティドリフト、不完全な指示、複雑なプロンプトの下での視覚的詳細の欠如に悩まされている。
本稿では,アイデンティティ保存ビデオ生成のための軽量化フレームワークであるAgentic Enhancement and Semantic repair (AESR)を提案する。
- 参考スコア(独自算出の注目度): 45.2703318705447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Identity-preserving video generation aims to synthesize videos that follow natural-language instructions while maintaining the visual identity of a given subject. Recent commercial video generation models have achieved strong visual quality and motion realism, but they still suffer from identity drift, incomplete instruction following, and missing visual details under complex prompts. Since these models are usually closed-source black boxes, directly improving them through parameter optimization is often infeasible. We therefore propose Agentic Enhancement and Semantic Repair (AESR), a lightweight enhancement framework for identity-preserving video generation. To improve prompt construction before generation and mitigate the above failures, AESR introduces a global agentic prompt enhancement module. This module learns model-specific prompting formats from official documentation, acquires human-centered video generation priors from human-interaction data, and accumulates test-domain identity-preserving generation experience into a reusable playbook through an agentic loop. To further repair errors in videos generated with enhanced prompts, AESR introduces a sample-level visual semantic repair module, which uses a VLM to locate erroneous video segments and design repair instructions, edits selected frames into explicit visual references, and guides a video editing model to fix local semantic or identity-related errors. We also adopt a lightweight Mixture-of-Experts selection strategy to choose reliable outputs from different generation and refinement paths. Under the official evaluation protocol of the ACM MM 2026 Identity-Preserving Video Generation Challenge, our system MIPL\_Video ranked first in Track 1, demonstrating the effectiveness of AESR for practical identity-preserving video generation. The code is available at https://github.com/oceanflowlab/AESR.
- Abstract(参考訳): アイデンティティ保存ビデオ生成は、対象者の視覚的アイデンティティを維持しながら、自然言語による指示に従うビデオを合成することを目的としている。
最近の商用ビデオ生成モデルは、強い視覚的品質とモーションリアリズムを達成したが、それでもアイデンティティドリフト、不完全な指示、複雑なプロンプトの下での視覚的詳細の欠如に悩まされている。
これらのモデルは通常、クローズドソースのブラックボックスであるため、パラメータ最適化によって直接改善することは不可能であることが多い。
そこで我々は,アイデンティティ保存ビデオ生成のための軽量化フレームワークであるAgentic Enhancement and Semantic repair (AESR)を提案する。
AESRは、上記の障害を発生させ緩和する前の迅速な構築を改善するため、グローバルエージェントプロンプト拡張モジュールを導入している。
このモジュールは、公式文書からモデル固有のプロンプトフォーマットを学習し、ヒューマンインタラクションデータから人間中心のビデオ生成先行情報を取得し、エージェントループを介してテストドメインID保存生成エクスペリエンスを再利用可能なプレイブックに蓄積する。
改良されたプロンプトで生成されたビデオのエラーを更に修復するために、AESRはサンプルレベルの視覚的セマンティック修復モジュールを導入し、VLMを使用してビデオセグメントの特定と設計の修正命令を行い、選択したフレームを明示的なビジュアル参照に編集し、ローカルなセマンティックやアイデンティティ関連のエラーを修正するためにビデオ編集モデルをガイドする。
また、異なる生成経路と精製経路から信頼性の高い出力を選択するために、軽量なMixture-of-Experts選択戦略を採用する。
ACM MM 2026 Identity-Preserving Video Generation Challenge の公式評価プロトコルに基づき,本システムMIPL\_Video がトラック1にランクインし,AESR の実用的アイデンティティ保存ビデオ生成における有効性を実証した。
コードはhttps://github.com/oceanflowlab/AESRで公開されている。
関連論文リスト
- Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment [20.811984469709508]
Auraは、高忠実でアイデンティティに一貫性のあるビデオ生成のための統一されたフレームワークである。
本稿では,映像コンテンツの密度と構造を記述したAIディレクターレベルのキャプションを紹介する。
専用データ構築パイプラインを通じて高品質なビデオオブジェクト画像データセットを構築する。
論文 参考訳(メタデータ) (2026-07-05T13:54:33Z) - ReConFuse: Reconstruction-Error Guided Semantic Fusion for AI-Generated Video Detection [10.547980601243518]
ビデオレベルのAI生成ビデオ検出のための再構成誘導型セマンティックフュージョンフレームワークReConFuseを提案する。
ReConFuseは、WF-VAE再構成ビデオから再構成エラーキューを抽出し、それらを多フレームセマンティック特徴と整列させ、Mambaベースのモジュールを使用してビデオレベルの分類のための時間的進化をモデル化する。
論文 参考訳(メタデータ) (2026-06-03T10:35:47Z) - MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration [62.929029990341796]
実世界のビデオは、ノイズ、圧縮アーティファクト、低照度歪みなどの複雑な劣化に悩まされることが多い。
3つの協調エージェントによる人間のプロの推論・処理手順を模倣したMoA-VRを提案する。
具体的には、大規模かつ高解像度なビデオ劣化認識ベンチマークを構築し、視覚言語モデル(VLM)による劣化識別子を構築する。
論文 参考訳(メタデータ) (2025-10-09T17:42:51Z) - Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement [58.85593321752693]
アイデンティティ保存型テキスト・ツー・ビデオ(IPT2V)生成は、参照対象画像とテキストプロンプトの両方に忠実なビデオを生成する。
本稿では,映像記述と参照画像のセマンティックギャップを橋渡しする,トレーニングフリープロンプト,イメージ,ガイダンス拡張フレームワークを提案する。
ACM Multimedia 2025 Identity-Preserving Video Generation Challengeで優勝した。
論文 参考訳(メタデータ) (2025-09-01T11:03:13Z) - VideoRepair: Improving Text-to-Video Generation via Misalignment Evaluation and Localized Refinement [63.4357918830628]
VideoRepairは、モデルに依存しない、トレーニングなしのビデオリファインメントフレームワークである。
微粒なテキストビデオの誤りを特定し、明示的な空間的およびテキスト的フィードバックを生成する。
VideoRepairは、テキストとビデオのアライメントの指標で、最近のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2024-11-22T18:31:47Z) - MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing [90.06041718086317]
我々は、高忠実度ビデオ生成と編集の両方のタスクに対して、MagDiffと呼ばれる統合多重配位拡散を提案する。
提案したMagDiffは、主観駆動アライメント、適応プロンプトアライメント、高忠実アライメントを含む3種類のアライメントを導入している。
論文 参考訳(メタデータ) (2023-11-29T03:36:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。