論文の概要: Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation
- arxiv url: http://arxiv.org/abs/2607.17985v1
- Date: Mon, 20 Jul 2026 14:16:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.656904
- Title: Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation
- Title(参考訳): シークエンシャル・アクション・ビデオ生成のためのキーフレームアンコレッドID保存
- Authors: Zhenjie Liu, Binyan Chen, Hao Chen, Tong Pan, Shangfei Wang,
- Abstract要約: IPVG26チャレンジは、このフレームワークを単一の全体的プロンプトから時間的に構造化された仕様まで拡張している。
この時間構造は、以前のアイデンティティ保存生成タスクで遭遇しなかった課題を示す。
私たちはこの課題に,トレーニング不要で3段階のパイプラインフレームワークで対処しています。
- 参考スコア(独自算出の注目度): 10.89407870318018
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Identity-preserving text-to-video generation aims to synthesize a video that accurately follows a textual description while maintaining the recognizability of a user-specified subject throughout. The IPVG26 challenge extends this framework from a single holistic prompt to a temporally structured specification. The model additionally receives a sequence of timestamped action captions and must render the subject performing these actions in the specified order. This temporal structure presents a challenge not encountered in previous identity-preserving generation tasks, as the subject must continuously perform a scripted sequence of distinct actions while maintaining a consistent identity. However, end-to-end video generators are prone to appearance drift as motion accumulates and the depicted actions change. We address this challenge with a training-free, three-stage pipeline framework. An action-aware prompt polishment stage first rewrites the inputs into image-generation prompts that specify the terminal state of each action. An identity-preserving generation stage then produces the keyframe sequence by conditioning each frame jointly on the reference identity and its predecessor, thereby decoupling time-invariant appearance from time-varying pose. Finally, an identity-aware inference enhancement stage synthesizes the intermediate segments using multi-reference guidance and identity-driven noise searching, both of which reinforce identity fidelity during sampling. Our method ranked third on the official Track 2 leaderboard, demonstrating competitive performance and strong generality.
- Abstract(参考訳): アイデンティティ保存型テキスト・ツー・ビデオ生成は,ユーザ特定対象の認識性を維持しつつ,テキスト記述を正確に追従するビデオの合成を目的としている。
IPVG26チャレンジは、このフレームワークを単一の全体的プロンプトから時間的に構造化された仕様まで拡張している。
モデルは同時に、タイムスタンプされたアクションキャプションのシーケンスを受け取り、これらのアクションを実行する被験者を指定された順序でレンダリングする必要があります。
この時間構造は、被験者が一貫したアイデンティティを維持しながら、異なるアクションのスクリプト化されたシーケンスを継続的に実行しなければならないため、以前のアイデンティティ保存生成タスクで遭遇しない課題を示す。
しかし、動きが蓄積し、描写された動作が変化するにつれて、エンド・ツー・エンドのビデオジェネレータは出現しがちである。
私たちはこの課題に,トレーニング不要で3段階のパイプラインフレームワークで対処しています。
アクション対応プロンプト研磨ステージは、まず、各アクションの端末状態を指定する画像生成プロンプトに入力を書き換える。
次に、ID保存生成ステージは、各フレームを基準IDとその前駆体に共同で条件付けしてキーフレームシーケンスを生成し、時間変動ポーズから時間不変の外観を分離する。
最後に、同一性認識推論拡張段階は、サンプリング中の同一性を高める多参照誘導と同一性駆動雑音探索を用いて中間セグメントを合成する。
我々の手法は公式のトラック2のリーダーボードで3位にランクインし、競争性能と強い一般性を実証した。
関連論文リスト
- Customizing Video Portraits via Identity-ActionDecoupling [32.57069491938664]
IPT2V(Identity-Preserving Text-to-Video Generation)は、参照画像とテキスト記述から時間的コヒーレントな映像を合成する。
この問題を解決するために、ID-Action Decouplingフレームワークと2つの損失関数Identity Decoupling LossとText Alignment Lossを導入します。
論文 参考訳(メタデータ) (2026-06-21T05:56:28Z) - Closed-Loop Triplet Synergistic Generation for Long-Form Video [61.88597038104749]
CoSyTriGenは、クローズドループビジュアル-テキスト-メモリのシナジープロセスとしてマルチショット長ビデオ生成を定式化するエージェントフレームワークである。
この三重項に対して視覚言語モデルに基づくアナライザが原因となり、2つの経路に沿ってプロンプトとメモリの両方を更新する。
StoryBenchベンチマークの実験では、代表法よりもクロスショット一貫性、即効性、撮影連続性を大幅に改善した。
論文 参考訳(メタデータ) (2026-06-15T03:56:43Z) - Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation [55.94507360511886]
我々は,任意の文字にスケール可能なトランスフォーマーベースのビデオ生成フレームワークであるAnyCrowdを提案する。
具体的には、まず、DiT処理に先立って文字インスタンスを独立してエンコードするIILR(Instance-Isolated Latent Representation)を導入し、遅延IDの絡み込みを防止する。
この不整合表現に基づいて、さらに、(i)インスタンス認識フォアグラウンドアテンション、(ii)背景中心の相互作用、(iii)世界背景調整に自己注意を分解することで、運転ポーズにアイデンティティを結合するトリステージデカップリングアテンション(TSDA)を提案する。
論文 参考訳(メタデータ) (2026-03-16T15:25:04Z) - BeyondFacial: Identity-Preserving Personalized Generation Beyond Facial Close-ups [22.017690133402912]
アイデンティティ保存型パーソナライズドジェネレーション(I)は、高度な映画制作と芸術的創造力を持っているが、既存のアプローチは顔領域を過度に強調している。
これらの手法は、複雑なテキストプロンプトの下での視覚的ナラティビティの弱さと意味的一貫性の弱さに悩まされる。
本稿では,顔のクローズアップの制約を断ち切るI手法を提案する。
論文 参考訳(メタデータ) (2025-11-15T01:56:14Z) - Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations [131.33758144860988]
アイデンティティ保存型テキスト・ツー・ビデオ(IPT2V)生成は、一貫した人間のアイデンティティを持つ高忠実度ビデオを作成することを目的としている。
現在のエンドツーエンドフレームワークは、重要な空間的・時間的トレードオフを被る。
本稿では,表現をレイアウトの空間的特徴と運動力学の時間的特徴に分解する,シンプルで効果的な空間時空間分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-07T06:54:44Z) - Proteus-ID: ID-Consistent and Motion-Coherent Video Customization [17.792780924370103]
ビデオアイデンティティのカスタマイズは、単一の参照画像とテキストプロンプトを与えられた特定の主題の現実的で時間的に整合したビデオを合成しようとする。
この課題は、説明された外観や動作と整合しながらアイデンティティの整合性を維持すること、非現実的な剛性のない自然な流体運動を生成することである。
Proteus-IDは、アイデンティティ一貫性とモーションコヒーレントなビデオカスタマイズのための、新しい拡散ベースのフレームワークである。
論文 参考訳(メタデータ) (2025-06-30T11:05:32Z) - Identity-Aware Multi-Sentence Video Description [105.13845996039277]
本稿では,一組のクリップ内に一貫した人物の身元を予測することを目的とした,身元確認の補助的タスクを提案する。
鍵となるコンポーネントの1つは、性別を意識したテキスト表現であり、メインモデルにおける追加の性別予測目標である。
実験の結果,提案したフィリング・イン・ザ・アイデンティティ・モデルは,いくつかのベースラインや最近の研究よりも優れていることがわかった。
論文 参考訳(メタデータ) (2020-08-22T09:50:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。