論文の概要: InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions
- arxiv url: http://arxiv.org/abs/2608.08460v1
- Date: Sun, 09 Aug 2026 04:01:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.83488
- Title: InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions
- Title(参考訳): InstructionCrafter: 一貫性と高忠実なビジュアルインストラクションの生成
- Authors: Shun Okamoto, Satoshi Iizuka, Kazuhiro Fukui,
- Abstract要約: 既存のテキスト画像生成アプローチは、ステップ忠実性、クロスイメージ一貫性、フレーム単位の視覚的品質を満たすことは滅多にない。
InstructionCrafterは、時間的および命令的アライメントの最適化を分離する鍵となるアイデアを持つ拡散ベースのフレームワークである。
私たちのコードとトレーニングされたモデルは公開されます。
- 参考スコア(独自算出の注目度): 6.198298884034955
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Given textual task instructions, generating step-by-step visual instructions as an image sequence requires the simultaneous satisfaction of multiple properties, specifically step faithfulness, cross-image consistency, and per-frame visual quality. Existing text-to-image generation approaches rarely meet all three properties, owing to independent sampling that breaks consistency, finetuning on low-quality video that degrades per-frame quality, and frozen backbones that lack multi-step understanding. In this work, we propose InstructionCrafter, a diffusion-based framework with the key idea of separating the optimization of temporal and instructional alignment from per-frame visual quality via (1) spatial-freeze training and (2) instruction-aware adapters. Built on a pretrained video diffusion backbone, InstructionCrafter freezes the spatial layers that control per-frame detail and updates only temporal and text-conditioning pathways to learn instruction semantics and inter-step relations, which preserves the generative prior for per-frame quality and reduces trainable parameters by about 50 percent compared with full finetuning. We also introduce two lightweight adapters that enhance the model's understanding of instructional context. The Consistent Adapter aggregates textual cues from the entire instruction sequence and from neighboring steps to keep object identity and attributes consistent across frames, and the Context-Aware Temporal Adapter converts cross-attention outputs into biases for temporal self-attention, explicitly propagating inter-frame relations. Extensive experiments on two benchmark datasets demonstrate state-of-the-art overall performance on step faithfulness, cross-image consistency, and per-frame visual quality while significantly reducing noise, blur, and spurious subtitles. Our code and trained models will be publicly available.
- Abstract(参考訳): テキストによるタスク命令が与えられた場合、画像シーケンスとしてステップバイステップの視覚命令を生成するには、複数のプロパティの同時満足度、特にステップ忠実性、クロスイメージ一貫性、フレームごとの視覚的品質が必要である。
既存のテキスト・ツー・イメージ生成アプローチは、一貫性を損なう独立したサンプリング、フレーム単位の品質を低下させる低品質ビデオの微調整、マルチステップ理解の欠如による、3つの特性をすべて満たさない。
本研究では,(1)空間凍結トレーニングと(2)命令認識アダプタを介し,時間的・命令的アライメントの最適化をフレーム単位の視覚的品質から分離する,拡散型フレームワークであるInstructionCrafterを提案する。
事前訓練されたビデオ拡散バックボーン上に構築されたInstructionCrafterは、フレーム単位のディテールを制御する空間層を凍結し、時間的およびテキスト条件の経路のみを更新して、命令セマンティクスとステップ間関係を学習する。
また、2つの軽量アダプタを導入し、モデルによる命令コンテキストの理解を強化する。
Consistent Adapterは命令シーケンス全体と隣接するステップからテキストキューを集約し、オブジェクトのアイデンティティと属性をフレーム間で一貫性を保つ。
2つのベンチマークデータセットに対する大規模な実験は、ステップ忠実性、クロスイメージ一貫性、フレームごとの視覚的品質に関する、最先端の全体的なパフォーマンスを示しながら、ノイズ、ぼかし、スプリアス字幕を著しく削減している。
私たちのコードとトレーニングされたモデルは公開されます。
関連論文リスト
- Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation [28.493796603648175]
Vorch-IRは、シングルモデルとデュアルパーソンのアイデンティティ置換をサポートする統一フレームワークで、オプションのバックグラウンド置換を単一のモデルでサポートする。
LTX2上に構築されたVorch-IRは、駆動ビデオ、インデックス付き参照画像、テキスト編集命令を共同で行う。
自動測定とペアワイズ人間評価を用いた実験は, 多様なシナリオにおける強いアイデンティティ保存, 動きの忠実度, 時間的コヒーレンスを示す。
論文 参考訳(メタデータ) (2026-08-06T06:46:35Z) - Compositional Video Generation via Inference-Time Guidance [69.53614395025632]
テキストからビデオへの拡散モデルは、しばしば構成的理解を必要とするプロンプトで失敗する。
凍結したテキスト・ビデオモデルにおける合成忠実度を改善するための推定時間誘導法であるtextbfCVG を提案する。
論文 参考訳(メタデータ) (2026-05-14T15:50:25Z) - DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning [3.47287766500271]
インストラクショナルビデオにおけるシーンレベルのキャプションは、視覚的手がかりと時間的構造の両方を理解することで学習を強化することができる。
手動シーンセグメンテーションを必要とせずに、コヒーレントなシーンレベルのキャプションを生成するパイプラインDynaStrideを導入する。
我々はDynaStrideが時間的コヒーレントで情報的なキャプションを生成することを示し、AIによる指導コンテンツ生成を改善するための有望な方向性を示唆している。
論文 参考訳(メタデータ) (2025-10-27T22:29:08Z) - VSC: Visual Search Compositional Text-to-Image Diffusion Model [15.682990658945682]
本稿では,一対のイメージ埋め込みを利用して属性オブジェクトの結合を改善する新しい合成生成手法を提案する。
提案手法は,複雑なプロンプトをサブプロンプトに分解し,対応する画像を生成し,テキスト埋め込みと融合して表現を強化する視覚プロトタイプを計算する。
提案手法は,T2I CompBenchベンチマークにおける既存の合成テキスト・画像拡散モデルより優れ,画像品質の向上,人間による評価,およびプロンプト内の結合対のスケーリングによる堅牢性の向上を実現している。
論文 参考訳(メタデータ) (2025-05-02T08:31:43Z) - FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance [3.6519202494141125]
我々は、既存のテキスト制御機構を改善する革新的なビデオジェネレータであるFancyVideoを紹介した。
CTGMは、TII(Temporal Information)とTAR(Temporal Affinity Refiner)をクロスアテンションの開始と終了に組み込んでいる。
提案手法は,EvalCrafterベンチマークを用いて,最先端のT2V生成結果を実現する。
論文 参考訳(メタデータ) (2024-08-15T14:47:44Z) - Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation [93.18163456287164]
本稿では,動画に画像モデルを適用するための新しいテキスト誘導型動画翻訳フレームワークを提案する。
我々のフレームワークは,グローバルなスタイルと局所的なテクスチャの時間的一貫性を低コストで実現している。
論文 参考訳(メタデータ) (2023-06-13T17:52:23Z) - Condensing a Sequence to One Informative Frame for Video Recognition [113.3056598548736]
本稿では,まず映像シーケンスを情報的「フレーム」に凝縮する2段階の代替手法について検討する。
有効な疑問は、どのように「有用な情報」を定義し、シーケンスから1つの合成フレームに蒸留するかである。
IFSは画像ベースの2Dネットワークとクリップベースの3Dネットワークを一貫して改善している。
論文 参考訳(メタデータ) (2022-01-11T16:13:43Z) - ASCNet: Self-supervised Video Representation Learning with
Appearance-Speed Consistency [62.38914747727636]
本研究では,1)明示的な監督のためのラベルの欠如,2)構造化されていない,ノイズの多い視覚情報による自己指導型映像表現学習について検討する。
既存の方法は、主にビデオクリップをインスタンスとしてコントラスト損失を使用し、互いにインスタンスを識別することで視覚的表現を学ぶ。
本稿では,ロバストな映像表現を学ぶ上で,正のサンプル間の一貫性が鍵となることを観察する。
論文 参考訳(メタデータ) (2021-06-04T08:44:50Z) - Improving Generation and Evaluation of Visual Stories via Semantic
Consistency [72.00815192668193]
一連の自然言語キャプションが与えられた場合、エージェントはキャプションに対応する一連の画像を生成する必要がある。
それまでの作業では、このタスクで合成テキスト・画像モデルより優れた繰り返し生成モデルを導入してきた。
従来のモデリング手法には、デュアルラーニングフレームワークの追加など、いくつかの改善点を提示する。
論文 参考訳(メタデータ) (2021-05-20T20:42:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。