論文の概要: Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling
- arxiv url: http://arxiv.org/abs/2608.27280v1
- Date: Thu, 27 Aug 2026 15:53:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.477189
- Title: Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling
- Title(参考訳): サイドカー: キャラクタ一貫性のない自由形ビジュアルストーリーテリングのためのトレーニングフリーセマンティックリユース
- Abstract要約: フリーフォームのストーリー生成では、文字は最初に導入されたときにのみ完全に記述され、後にタイプレベルの言及や代名詞によって参照される。
textbfSidecarは、初期記述からエンティティレベルの情報を保存し、欠落したセマンティクスを後続の迅速な埋め込みに注入する、プラグインとプレイのセマンティクス拡張モジュールである。
FreeStoryBenchの実験では、Sidecarは複数のSDXLとFLUXベースのベースラインにまたがって、計算オーバーヘッドを無視して、プロンプトイメージアライメントとキャラクタ一貫性を一貫して改善している。
- 参考スコア(独自算出の注目度): 5.249739038963074
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Visual storytelling requires generating images that follow a narrative while preserving consistent character identities across frames. In free-form story generation, a character is fully described only when first introduced and is later referred to by a type-level mention or pronoun. Although this setting better reflects natural storytelling, later prompts may omit important identity-related semantics, making character consistency more difficult to maintain. We propose \textbf{Sidecar}, a plug-and-play semantic augmentation module that preserves entity-level information from the initial description and injects the missing semantics into later prompt embeddings. Sidecar requires no additional training and does not modify the architecture of the base diffusion model. Experiments on FreeStoryBench show that Sidecar consistently improves prompt-image alignment and character consistency across multiple SDXL- and FLUX-based baselines, with negligible computational overhead.
- Abstract(参考訳): ビジュアルストーリーテリングでは、フレーム間の一貫したキャラクタIDを保持しながら、物語に従うイメージを生成する必要がある。
フリーフォームのストーリー生成では、文字は最初に導入されたときにのみ完全に記述され、後にタイプレベルの言及や代名詞によって参照される。
この設定は自然なストーリーテリングを反映するが、後続のプロンプトは重要なアイデンティティ関連セマンティクスを省略し、文字の一貫性を維持するのがより困難になる。
我々は,初期記述からエンティティレベルの情報を保存し,不足したセマンティクスを後続のプロンプト埋め込みに注入する,プラグインとプレイのセマンティクス拡張モジュールである‘textbf{Sidecar} を提案する。
Sidecarは追加のトレーニングを必要とせず、ベース拡散モデルのアーキテクチャを変更しない。
FreeStoryBenchの実験では、Sidecarは複数のSDXLとFLUXベースのベースラインにまたがって、計算オーバーヘッドを無視して、プロンプトイメージアライメントとキャラクタ一貫性を一貫して改善している。
関連論文リスト
- FreeStory: Training-Free Character Consistency for Free-Form Visual Storytelling [4.671002796177002]
FreeStoryは、自由形式のプロンプトの下で文字の一貫性を実体的な機能再利用として再構築する、トレーニング不要のフレームワークである。
提案手法は,参照参照と対応する文字記述を関連付け,動的文字マスク,対応性を考慮した特徴マッチング,キー値注入,クエリブレンディングを組み合わせる。
実験により、FreeStoryは構造化ベンチマーク上でのトレーニングフリーメソッドの最先端性能と、フリーフォームプロンプト下でのベースラインに対する全体的な一貫性の向上を実現している。
論文 参考訳(メタデータ) (2026-06-23T18:37:31Z) - Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification [60.02530716177415]
生涯人物再識別(LReID)は、逐次的に収集されたデータで一般化可能なモデルを訓練することを目的としている。
既存の非現代的なアプローチは、視覚のみの蒸留やパラメータ正規化に大きく依存している。
本稿では,意味的アライメントとドメイン間一般化のための非対称な視覚テキストフレームワークであるPrompt-Anchored Vision-text Distillation (PAD)を提案する。
論文 参考訳(メタデータ) (2026-05-06T15:23:13Z) - ReCap: Lightweight Referential Grounding for Coherent Story Visualization [11.022891519635834]
ReCapは、基本拡散バックボーンを変更することなく、文字安定性と視覚的忠実性を改善する軽量な一貫性フレームワークである。
ReCap's CORE (Conditional frame Reference) モジュールは、アナポーを視覚的アンカーとして扱う。
我々は、ストーリーの可視化を、リアル映画から派生した人間中心の物語に拡張し、スタイル化された漫画ドメインを超えてReCapの能力を実証する。
論文 参考訳(メタデータ) (2026-04-20T17:57:50Z) - DeCorStory: Gram-Schmidt Prompt Embedding Decorrelation for Consistent Storytelling [1.7683026013361776]
DeCorStoryは、フレーム間のセマンティック干渉を減らす、トレーニング不要な推論時間フレームワークである。
フレームレベルのセマンティクスに即時埋め込みデコリレーションを適用し、続いて特異値の再重み付けを行い、プロンシブ固有情報を強化する。
実験は、迅速なイメージアライメント、アイデンティティの整合性、視覚的多様性において一貫した改善を示す。
論文 参考訳(メタデータ) (2026-02-01T16:07:30Z) - ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation [6.4611000755192585]
ReDiStoryはトレーニング不要のフレームワークで、推論時プロンプトの組込みによる複数フレームのストーリー生成を改善する。
拡散パラメータを変更したり、追加の監視を必要とすることなく、クロスフレーム干渉を低減する。
ConsiStory+ベンチマークの実験では、複数のID整合性において、1Prompt1Storyよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-01T16:04:40Z) - StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization [36.14275850149665]
本稿では,様々なストーリー関連知識を包括的に表現した新しい知識グラフ,すなわちキャラクタグラフ(textbfCG)を提案する。
次に、リッチテキストセマンティクスと一貫したストーリー視覚化が可能な、キャラクタグラフ(textbfC-CG)によるカスタマイズを実現するイメージジェネレータであるStoryWeaverを紹介する。
論文 参考訳(メタデータ) (2024-12-10T10:16:50Z) - Evolving Storytelling: Benchmarks and Methods for New Character Customization with Diffusion Models [79.21968152209193]
ニューエピソード・ベンチマークを導入し、新しいキャラクターで新しいストーリーを生成する際の生成モデルの適応性を評価する。
EpicEvoは,新しいキャラクタをシームレスに統合した単一ストーリーで,拡散に基づくビジュアルストーリー生成モデルをカスタマイズする手法である。
論文 参考訳(メタデータ) (2024-05-20T07:54:03Z) - When StyleGAN Meets Stable Diffusion: a $\mathscr{W}_+$ Adapter for
Personalized Image Generation [60.305112612629465]
テキストと画像の拡散モデルは、多種多様で高品質でフォトリアリスティックな画像を生成するのに優れている。
本稿では,拡散モデルのための拡張されたアイデンティティ保存とアンタングル化を実現するために,StyleGAN 埋め込み空間 $mathcalW_+$ の新たな利用法を提案する。
提案手法は,即時記述に適合するだけでなく,一般的なスタイルGAN編集方向に対応可能なパーソナライズされたテキスト・ツー・イメージ出力を生成する。
論文 参考訳(メタデータ) (2023-11-29T09:05:14Z) - Text-Only Training for Visual Storytelling [107.19873669536523]
視覚条件付きストーリー生成問題として視覚的ストーリーテリングを定式化する。
本稿では,モダリティ間のアライメントとストーリー生成の学習を分離するテキストのみのトレーニング手法を提案する。
論文 参考訳(メタデータ) (2023-08-17T09:32:17Z) - Make-A-Story: Visual Memory Conditioned Consistent Story Generation [57.691064030235985]
本稿では,アクタと背景コンテキストを暗黙的にキャプチャするビジュアルメモリモジュールを備えた,自己回帰拡散に基づく新しいフレームワークを提案する。
本手法は,視覚的品質の高いフレーム生成において,先行技術よりも優れていた。
MUGEN, PororoSV, FlintstonesSVデータセット上でのストーリー生成実験により, この手法は, 視覚的品質の高いフレーム生成において, 先行技術よりも優れるだけでなく, キャラクタと背景との適切な対応をモデル化した。
論文 参考訳(メタデータ) (2022-11-23T21:38:51Z) - StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story
Continuation [76.44802273236081]
生成したビジュアルストーリーをソースイメージに条件付けしたストーリー継続のためのモデルであるStoryDALL-Eを開発した。
提案手法は, ストーリー継続のためのGANモデルよりも優れており, 画像からの視覚要素のコピーを容易にする。
全体として、本研究は、事前訓練されたテキスト-画像合成モデルがストーリー継続のような複雑で低リソースなタスクに適応できることを実証している。
論文 参考訳(メタデータ) (2022-09-13T17:47:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。