論文の概要: CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation
- arxiv url: http://arxiv.org/abs/2608.03046v1
- Date: Tue, 04 Aug 2026 02:55:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.002387
- Title: CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation
- Title(参考訳): CAPE-T2V:テキスト・ビデオ・ジェネレーションにおける2面コンディショニングアライメントに対するキャピタアンコレットプロンプトの強化
- Abstract要約: テキスト・トゥ・ビデオ(T2V)拡散変換器(DiT)は詳細なビデオキャプションで訓練されるが、推論はプロンプト・エンハンサー(PE)によって書き直されるユーザープロンプトに依存していることが多い。
本稿では,2段階のキャピタ-アンコレッド・プロンプト・エンハンスメント・フレームワークであるCAPE-T2Vについて紹介する。
同じキャプションスキーマを使用したベースラインとは対照的に、CAPE-T2VはStoryEval、VBench-2.0、T2V-CompBenchにおいて、Wan2.2とLTX-2.3の合計スコアを達成している。
- 参考スコア(独自算出の注目度): 5.8203116670993325
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-video (T2V) diffusion transformers (DiTs) are trained with detailed video captions, whereas inference often relies on user prompts rewritten by a prompt enhancer (PE). Prior work has improved generation by optimizing the PE, the DiT, or both; some methods have also sought to narrow the training-inference mismatch through shared schemas. Yet even within a shared schema, inference-time PE outputs and DiT training captions may still differ in detail selection, information organization, descriptive granularity, and phrasing. We refer to this residual mismatch as the PE-Caption gap and introduce CAPE-T2V, a two-step Captioner-Anchored Prompt Enhancement framework toward two-sided conditioning alignment in T2V generation. First, CAPE-T2V constructs three types of PE training examples, pairing captioner-generated targets with concise source captions, detailed source captions, or pseudo user prompts derived from those targets. It then fine-tunes the PE to map each input to its paired target. Second, CAPE-T2V fine-tunes the DiT on video-derived captions rewritten by the Anchored PE; the same PE rewrites user prompts at inference. Relative to a baseline using the same caption schema, CAPE-T2V achieves higher aggregate scores on StoryEval, VBench-2.0, and T2V-CompBench across Wan2.2 and LTX-2.3. Further, CAPE-T2V exhibits a smaller PE-Caption gap than the baseline: its DiT fine-tuning captions are closer in distribution to inference-time PE outputs, as measured by squared maximum mean discrepancy in a fixed embedding space. Overall, these results support CAPE-T2V as an effective approach to mitigating the PE-Caption gap. The project is available at https://github.com/yizzz927/CAPE-T2V.
- Abstract(参考訳): テキスト・トゥ・ビデオ(T2V)拡散変換器(DiT)は詳細なビデオキャプションで訓練されるが、推論はプロンプト・エンハンサー(PE)によって書き直されるユーザープロンプトに依存していることが多い。
以前の作業では、PE、DiT、あるいは両方を最適化することで生成を改善していた。
しかし、共有スキーマ内でも、推論時PE出力とDiTトレーニングキャプションは、詳細の選択、情報組織、記述的な粒度、フレーズによっては相変わらず異なる可能性がある。
本稿では、この残留ミスマッチをPE-Caption gapと呼び、T2V生成における2段階の条件付けアライメントに向けた2段階のCaptioner-Anchored Prompt EnhancementフレームワークであるCAPE-T2Vを導入する。
まず、CAPE-T2Vは、3種類のPEトレーニング例を構築し、キャプタ生成ターゲットと簡潔なソースキャプション、詳細なソースキャプタ、またはそれらのターゲットから派生した擬似ユーザプロンプトをペアリングする。
その後、PEを微調整して各入力をペアのターゲットにマッピングする。
次に、CAPE-T2Vは、Anchored PEによって書き直されたビデオ由来のキャプションでDiTを微調整する。
同じキャプションスキーマを使用したベースラインとは対照的に、CAPE-T2VはStoryEval、VBench-2.0、T2V-CompBenchにおいて、Wan2.2とLTX-2.3の合計スコアを達成している。
さらに、CAPE-T2Vはベースラインよりも小さいPE-Captionギャップを示し、そのDiT微細調整キャプションは、固定埋め込み空間における2乗平均誤差によって測定されるように、推定時間PE出力に分布する。
これらの結果は,CAPE-T2VがPE-Captionギャップの緩和に有効なアプローチであることを示す。
このプロジェクトはhttps://github.com/yizzz927/CAPE-T2Vで入手できる。
関連論文リスト
- LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning [44.00535468968033]
リモートセンシング画像変化キャプション(RSICC)は、ペア化されたリモートセンシング画像(RSI)間の意味的変化の記述を生成する
LBTCapは、双方向トランスフォーマー上に構築された軽量RSICCフレームワークで、ペアリングされたRSIの効率的な処理のために、事前および変更後の機能を共同でモデル化する。
LBTCapは、パラメータをはるかに少なくし、推論速度を著しく高くしながら、最先端の手法の精度と一致または緊密に接近していることを示す実験である。
論文 参考訳(メタデータ) (2026-07-03T13:38:38Z) - CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning [86.9494763617273]
本稿では,Captioning Reinforcement Learning++ (CapRL++)を紹介した。
本稿では,CapRL++が高密度キャプション品質を向上し,空間的・時間的理解などのタスクにおけるキャプションベースの事前訓練を強化していることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:09:20Z) - Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning [3.944710336786154]
VLM(Vision-Language Models)は、命令の追従とオープンエンドの視覚言語推論において強力な性能を示す。
彼らはしばしば、視覚的証拠に弱く根ざした流動的な出力を生成する。
本稿では,世代間における言語的情報性と視覚的忠実性のバランスをとるためのデコードフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T16:18:31Z) - ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing [128.8346376825612]
高品質画像キャプションの主な課題は、LVLMの固有のバイアスにある。
本稿では,キャプションを継続的に強化・校正し,推論予算を増大させる,スケーラブルなデバイアス付きキャプション戦略を提案する。
450KイメージにScaleCapをアノテートし、LVLMプレトレーニングに使用することで、11の広く使用されているベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-06-24T17:59:55Z) - VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation [44.05151169366881]
本稿では,T2V生成に特化して設計されたビデオキャプション評価手法であるVidCapBenchを紹介する。
VidCapBenchは、収集された各ビデオと、ビデオの美学、コンテンツ、動き、および物理法則に関する重要な情報とを関連付ける。
既存のビデオキャプション評価手法と比較して, VidCapBench の安定性と包括性を示した。
論文 参考訳(メタデータ) (2025-02-18T11:42:17Z) - RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning [77.59074909960913]
Retrieval-Enhanced Test-Time Adaptation (RETTA) と呼ばれる新しいゼロショットビデオキャプションフレームワークを提案する。
一般的なビデオテキスト検索モデルXCLIP、一般的な画像テキストマッチングモデルCLIP、テキストアライメントモデルAnglE、テキスト生成モデルGPT-2の4つのキーモデルを用いてビデオとテキストをブリッジする。
そこで本研究では,GPT-2,XCLIP,CLIP,AnglEの4つのフリーズモデルにおいて,学習可能なトークンを通信媒体として用いることを提案する。
論文 参考訳(メタデータ) (2024-05-11T16:22:00Z) - Understanding Token-level Topological Structures in Transformer-based Time Series Forecasting [52.364260925700485]
Transformer-based method has achieved state-of-the-art performance in time series forecasting (TSF)
既存のトランスフォーマーが中間層全体を通してトークン間の固有位相構造を完全に活用しているかどうかは不明である。
トークンレベルのトポロジを明示的にかつ適応的に保存するトランスフォーマーベースの新しいTSF手法であるトポロジ拡張法(TEM)を提案する。
論文 参考訳(メタデータ) (2024-04-16T07:21:39Z) - Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation [72.90144343056227]
ビデオ理解タスクのためのテキスト・ツー・ビデオ拡散モデル(T2V)から生成した視覚的表現について検討する。
固定されたT2Vモデル上に構築された専用コンポーネントを備えた新しいフレームワーク「VD-IT」を紹介する。
我々のVD-ITは、既存の最先端手法を超越して、非常に競争力のある結果を得る。
論文 参考訳(メタデータ) (2024-03-18T17:59:58Z) - Paraphrasing Is All You Need for Novel Object Captioning [126.66301869607656]
新たな物体キャプション (NOC) は, 訓練中に真実のキャプションを観察することなく, 対象を含む画像を記述することを目的としている。
本稿では,NOC の2段階学習フレームワークである Paraphrasing-to-Captioning (P2C) について述べる。
論文 参考訳(メタデータ) (2022-09-25T22:56:04Z) - ProsoSpeech: Enhancing Prosody With Quantized Vector Pre-training in
Text-to-Speech [96.0009517132463]
音声の低周波帯域を定量化し、潜在韻律ベクトル(LPV)における韻律特性を圧縮する単語レベル韻律エンコーダを提案する。
次に、LPV予測器を導入し、与えられた単語列を予測し、高品質なTSデータセットで微調整する。
実験結果から, ProsoSpeechはベースライン法と比較してよりリッチな韻律で音声を生成することができることがわかった。
論文 参考訳(メタデータ) (2022-02-16T01:42:32Z) - End-to-End Dense Video Captioning with Parallel Decoding [53.34238344647624]
パラレルデコーディング(PDVC)を用いたエンドツーエンドの高精細動画キャプションのための簡易かつ効果的なフレームワークを提案する。
PDVCは、ビデオをビデオの内容の全体的理解の下で、正確にいくつかのイベントに分類する。
ActivityNet CaptionsとYouCook2の実験は、PDVCが高品質なキャプション結果を生成することができることを示している。
論文 参考訳(メタデータ) (2021-08-17T17:39:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。