論文の概要: EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation
- arxiv url: http://arxiv.org/abs/2608.06231v1
- Date: Thu, 06 Aug 2026 16:20:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.790016
- Title: EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation
- Title(参考訳): EmoWorld: コントロール可能な感情ビデオ生成のための分離された感情フィールド
- Abstract要約: EmoWorldはフリーズフローマッチングビデオ拡散変換器(Video DiT)内の因子を分離するフレームワーク
テキスト・ツー・ビデオと画像・ツー・ビデオの設定において27の感情カテゴリで評価され、複数のビデオ-DiTバックボーン間のポータビリティを示し、ジェネレータパラメータを更新せずにカメラ条件のコンポジションをサポートする。
- 参考スコア(独自算出の注目度): 5.91698805485263
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Emotion shapes how viewers interpret a scene, yet existing video generators entangle global atmosphere, affect-bearing semantic cues, and temporal progression within a single text condition. We present EmoWorld, a framework that decouples these factors within a frozen flow-matching video diffusion transformer (Video DiT). A one-time preparation stage extracts layer-specific affect directions and a reusable cue library from geometry-preserving neutral and emotion-edited panoramas. At inference, Visual Atmosphere Steering (VAS) injects atmosphere directions into hidden states, Semantic Affective Steering (SAS) isolates a separately scalable prompt residual for semantic cues, and Temporal Affective Steering (TAS) interpolates endpoint residual fields across denoising and video time. On Wan2.2, VAS improves target-emotion alignment by 19% while reducing a temporal-fluctuation proxy by 48%; SAS improves target-emotion alignment by 37% and increases detected affect-bearing cues by 36%; and TAS improves transition monotonicity by 15% over the strongest baseline. EmoWorld is evaluated across 27 emotion categories in text-to-video and image-to-video settings, demonstrates portability across multiple Video-DiT backbones, and supports camera-conditioned composition without updating generator parameters.
- Abstract(参考訳): 感情は、視聴者がシーンをどう解釈するかを形作るが、既存のビデオジェネレータは、グローバルな雰囲気を絡め、感情を抱くセマンティックキュー、そして1つのテキスト条件内での時間的進行を形作る。
EmoWorldは、これらの因子を凍結流マッチングビデオ拡散変換器(Video DiT)内に分離するフレームワークである。
ワンタイム準備段階は、幾何学保存性中立性及び感情編集性パノラマから、層特異的な影響方向と再利用可能なキューライブラリを抽出する。
推測すると、VAS(Visual Atmosphere Steering)は大気の方向を隠蔽状態に注入し、SAS(Semantic Affective Steering)はセマンティック・キューのために別々にスケーラブルなプロンプト残差を分離し、TAS(Temporal Affective Steering)はデノイングとビデオ時間にわたって終端残差フィールドを補間する。
Wan2.2では、VASは時間変動プロキシを48%減らしながら目標感情アライメントを19%改善し、SASは目標感情アライメントを37%改善し、検出された感情アライメントを36%改善し、TASは最強ベースラインよりも15%改善する。
EmoWorldはテキスト・ツー・ビデオと画像・ツー・ビデオの設定において27の感情カテゴリで評価されており、複数のVideo-DiTバックボーン間のポータビリティを示し、ジェネレータパラメータを更新せずにカメラ条件のコンポジションをサポートする。
関連論文リスト
- Balancing Emotional Alignment and Semantic Consistency in Image Generation via Reinforcement Learning with Valence-Arousal Anchoring [55.57242007016976]
テキスト・ツー・イメージ生成における継続的な感情制御は、プロンプトによって記述されたオブジェクトやレイアウト、シーンを変更することなく、感情的アライメントを改善するモデルを必要とする。
既存の教師付き感情注入法は、しばしば特徴空間プロキシを最適化し、したがって感情のセマンティックドリフトを示す。
本稿では,連続的原子価覚醒条件設定,グループ相対ポリシー最適化,中立的セマンティックアンカーを組み合わせたフローマッチング画像生成フレームワークを用いてこの問題に対処する。
論文 参考訳(メタデータ) (2026-09-11T13:24:35Z) - Dynamic-Robust Photometric-Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding [63.599342750566485]
SPARは、潜在空間アグリゲーションの前に過渡的ダイナミックノイズを明示的に分離する新しい意味幾何学的エンコーディングアーキテクチャである。
エンド・ツー・エンドのアプローチは例外的な新規なビュー合成品質を実現し、PSNRは22.15dB、23.33dBでそれぞれ3と4の入力ビューしか与えられなかった。
論文 参考訳(メタデータ) (2026-08-29T09:58:24Z) - EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis [27.6626018322393]
EmoTra-TTSは、単一の離散ラベルや発話毎の静的埋め込みを必要としない、感情的なテキスト音声合成(TTS)システムである。
EmoTra-TTSは、遅延オーバーヘッドのないパラメータ+0.43%しか追加せず、感情遷移の質が30%-87%向上し、対の選好テストでは64.4%-79.5%の総勝利率で相関している。
論文 参考訳(メタデータ) (2026-08-24T19:44:18Z) - CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation [57.47993858752813]
CineOrchestraは、被写体、イベント、カメラ、ショットトランジションを同時に制御する統合ビデオ拡散モデルである。
私たちの重要な洞察は、これらの異質な映画要素が基本的な構造を共有しているということです。
CineOrchestraは、高密度キャプションとショット・トランジションのタイミングで、アクセントあたりのスペシャリスト6人を上回っている。
論文 参考訳(メタデータ) (2026-06-11T17:59:10Z) - Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech [11.976178882036466]
我々は,大規模言語モデル (LLM) に基づく音声合成システムにおける意味的隠蔽状態の感情関連変動を分析した。
分析の結果、感情の変化は複数のスパースな潜在特徴に分散し、小さなサブセットに介入することで、解釈可能な感情制御が可能であることが判明した。
バックボーンパラメータを変更することなく、双方向の感情誘導と抑制のための特徴レベル介入フレームワークを導入する。
論文 参考訳(メタデータ) (2026-05-31T22:39:45Z) - SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion [17.122681000010807]
タスクを直感的な単一フレーム編集と意味的な動作記述に効率的に分離する訓練パラダイムフリーのSimInsertを提案する。
SimInsertは時間的に、厳密に背景コヒーレンスを保ちながら、挿入されたオブジェクトと動的環境の間の可塑性でテキスト駆動的な相互作用を可能にする。
論文 参考訳(メタデータ) (2026-05-22T05:28:56Z) - FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning [81.33341786837974]
Emotional Video Captioning (EVC) は、ビデオで表現される本質的な感情で事実を記述することを目的とした、新たなタスクである。
FActual and Emotion Augmentation (FACE-net) を用いた検索強化フレームワークを提案する。
FACE-netは、事実と感情のセマンティクスを協調的にマイニングし、生成のための適応的で正確なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-03-18T07:53:15Z) - Motion-Adaptive Temporal Attention for Lightweight Video Generation with Stable Diffusion [1.9349092719498848]
凍結安定拡散モデルに基づくパラメータ効率の高いビデオ生成のための動き適応型時間的注意機構を提案する。
カスケード戦略により、UNetトランスフォーマーブロックに軽量な時間的アテンションモジュールを注入する。
我々のアブレーション研究は、ノイズ相関と運動振幅との明確なトレードオフを明らかにし、多様な生成行動に対する実用的な推論時間制御を提供する。
論文 参考訳(メタデータ) (2026-03-18T06:20:57Z) - Spatio-Temporal Attention for Consistent Video Semantic Segmentation in Automated Driving [0.46664938579243564]
マルチフレームコンテキストを組み込むためにトランスフォーマーアテンションブロックを拡張したApatio S-Temporal Attention (STA) 機構を提案する。
提案手法は,計算効率を保ちながら,プロセス時間的特徴系列に標準的自己アテンションを付加する。
CityscapesとBDD100kデータセットに関する包括的な評価は、時間的一貫性のメトリクスにおいて、9.20ポイントの大幅な改善を示している。
論文 参考訳(メタデータ) (2026-02-10T18:18:37Z) - InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing [66.48064661467781]
我々は、アイデンティティ、象徴的なジェスチャー、カメラ軌跡を維持するために参照を戦略的に保存する新しいパラダイムであるスパースフレームビデオダビングを導入する。
無限長長列ダビング用に設計されたストリーミングオーディオ駆動型ジェネレータであるInfiniteTalkを提案する。
HDTF、CelebV-HQ、EMTDデータセットの総合評価は、最先端の性能を示している。
論文 参考訳(メタデータ) (2025-08-19T17:55:23Z) - eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos [15.533003031406551]
ショートフォームビデオ(SV)は、情報を取得し共有するためのオンラインルーチンの重要な部分になっています。
SVの感情データの可用性が制限されていることから,本研究では,27,996本のビデオからなる大規模データセットであるeMotionsを紹介する。
AV-CANetは,ビデオトランスフォーマを利用して意味的に関連する表現をキャプチャする,エンドツーエンドの音声-視覚融合ネットワークである。
論文 参考訳(メタデータ) (2025-08-09T09:27:45Z) - Speech2AffectiveGestures: Synthesizing Co-Speech Gestures with Generative Adversarial Affective Expression Learning [52.73083137245969]
そこで本稿では, 感情表現を適切に表現し, 3次元ポーズを合成する生成的対人ネットワークを提案する。
本ネットワークは,入力音声とシードポーズから符号化された特徴の組込み空間からジェスチャを合成するジェネレータと,合成されたポーズシーケンスと実3Dポーズシーケンスを識別する識別器とから構成される。
論文 参考訳(メタデータ) (2021-07-31T15:13:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。