論文の概要: ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program
- arxiv url: http://arxiv.org/abs/2607.19947v1
- Date: Wed, 22 Jul 2026 09:25:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.03807
- Title: ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program
- Title(参考訳): ETPDesigner:インタラクティブなマルチモーダル電子劇場プログラムのためのマルチエージェントオーケストレーション
- Abstract要約: ETPDesignerは、生のドラマティックスクリプトから直接高品質なETPを合成する、協調的なマルチエージェントフレームワークである。
Central to ETPDesignerは、コアポスターから視覚的な事前情報を抽出し、厳格な審美性を強制するグローバルスタイルのアンカーメカニズムである。
ポートレートアニメーション, カスタマイズ音声合成, パーソナグラウンド大言語モデル(LLM)を統合することにより, ユーザが生成した仮想文字とのリアルタイム音声対応会話を行えるようにした。
- 参考スコア(独自算出の注目度): 24.896035521560872
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Electronic Theater Programs (ETPs) serve as critical promotional media in the performing arts, comprising a multi-page collection of heterogeneous visual assets such as theatrical posters, performance details, and character portraits. However, existing text-to-image paradigms struggle with such complex design tasks due to their inability to comprehend long-context narratives and maintain visual consistency across multiple distinct pages. To address this, we introduce ETPDesigner, a collaborative Multi-Agent framework that directly synthesizes high-quality ETPs from raw dramatic scripts. Emulating a professional design pipeline, our framework orchestrates specialized agents for semantic script analysis, core poster synthesis, functional background generation, and the stratified composition of character assets. Central to ETPDesigner is a global style anchor mechanism that extracts visual priors from the core poster to enforce strict aesthetic uniformity across all generated components. Furthermore, we elevate the ETP from a static publication to an immersive interactive companion. By integrating portrait animation, customized speech synthesis, and persona-grounded Large Language Models (LLMs), our system enables users to engage in real-time, voice-enabled conversations with the generated virtual characters. To rigorously benchmark this task, we construct ETP-Pro, a domain-specific benchmark of professional theater posters and high-quality character portraits. Extensive evaluations demonstrate our method's superiority in producing semantically faithful, aesthetically consistent, and highly interactive program sets.
- Abstract(参考訳): エレクトロニック・シアター・プログラム(ETPs)は、演劇における重要なプロモーション・メディアとして機能し、劇場ポスター、パフォーマンス・ディテール、キャラクター・ポートレートなどの異質なビジュアル・アセットを多ページで収集している。
しかし、既存のテキスト・ツー・イメージのパラダイムは、長文の物語を理解したり、複数の異なるページをまたいだ視覚的一貫性を維持することができないため、このような複雑な設計課題に苦慮している。
そこで本研究では,劇的なスクリプトから高品質なETPを直接合成する,協調型マルチエージェントフレームワークであるETPDesignerを紹介する。
専門的な設計パイプラインをエミュレートし、セマンティックスクリプト分析、コアポスター合成、機能的背景生成、および文字資産の階層化のための特殊エージェントを編成する。
Central to ETPDesignerはグローバルスタイルのアンカー機構で、コアポスターから視覚的な事前情報を抽出して、生成されたすべてのコンポーネントに対して厳密な審美的統一を強制する。
さらに,静的な出版物から没入型インタラクティブコンパニオンへとETPを上昇させる。
ポートレートアニメーション, カスタマイズ音声合成, パーソナグラウンド大言語モデル(LLM)を統合することにより, ユーザが生成した仮想文字とのリアルタイム音声対応会話を行えるようにした。
このタスクを厳格にベンチマークするために,プロの劇場ポスターと高品質なキャラクター肖像画のドメイン固有のベンチマークであるETP-Proを構築した。
包括的評価は, セマンティックに忠実で, 審美的に整合性があり, 高度にインタラクティブなプログラムセットを作成する上で, 提案手法の優位性を示すものである。
関連論文リスト
- Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation [93.44732526074876]
複数のアイデンティティの正確なバインディングとシームレスな融合を目的としたエンドツーエンドフレームワークを提案する。
本アーキテクチャでは,セマンティックアンコール型マルチモーダルロ (SA-MRo) を用いて,視覚的および音声的参照トークンとTS埋め込みを対応する意味記述に固定する。
実験により、Omni-Contextはデュアルモーダルなカスタマイズ生成において最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-05-17T14:56:52Z) - Towards Customized Multimodal Role-Play [50.72454102691162]
マルチモーダル理解と生成モデルは、よりリッチなヒューマン-AIインタラクションを可能にする。
しかし、文字のペルソナ、対話スタイル、視覚的アイデンティティを共同でカスタマイズする一方で、モダリティ間の出力一貫性を維持することは、ほとんど探索されていない。
本研究では,20文字からなるRoleScape-20データセットを構築した。
UniCharacterは、Unified Supervised Finetuning(Unified-SFT)とCharacter-GRPO(Character-GRPO)を含む2段階のトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-05-01T03:22:04Z) - The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation [95.18045807704284]
対話・シネマティック・ビデオ生成のためのエンドツーエンドのエージェント・フレームワークを提案する。
ScripterAgentは粗い対話を微粒で実行可能なシネマティックスクリプトに変換するように訓練されている。
本フレームワークは,テスト対象のすべてのビデオモデルに対して,スクリプトの忠実度と時間的忠実度を大幅に向上させる。
論文 参考訳(メタデータ) (2026-01-25T08:10:28Z) - PosterGen: Aesthetic-Aware Paper-to-Poster Generation via Multi-Agent LLMs [16.62052847270255]
PosterGenはプロのポスターデザイナーのワークフローを反映したマルチエージェントフレームワークである。
意味的に根拠があり、視覚的に魅力的であるポスターを制作する。
実験の結果,PosterGenはコンテントの忠実度に一貫して一致し,ビジュアルデザインの既存手法よりも優れていた。
論文 参考訳(メタデータ) (2025-08-24T02:25:45Z) - Real-Time Intuitive AI Drawing System for Collaboration: Enhancing Human Creativity through Formal and Contextual Intent Integration [26.920087528015205]
本稿では,形式的意図と文脈的意図の両方を解釈・統合するリアルタイム生成システムを提案する。
このシステムは,共有キャンバス上でのマルチユーザコラボレーションをサポートしながら,低レイテンシで2段階の変換を実現する。
論文 参考訳(メタデータ) (2025-08-12T01:34:23Z) - Aether Weaver: Multimodal Affective Narrative Co-Generation with Dynamic Scene Graphs [0.8702432681310401]
Aether Weaverは、マルチモーダルテキスト-視覚パイプラインの制限を克服する、物語的コジェネレーションのための新しいフレームワークである。
本システムは,テキスト物語,動的シーングラフ表現,視覚シーン,情緒的サウンドスケープを同時に合成する。
論文 参考訳(メタデータ) (2025-07-29T15:01:31Z) - AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation [50.63646953706144]
AniMakerは、効率的なマルチ候補クリップ生成とストーリーテリング対応クリップ選択を可能にするフレームワークである。
AniMakerは、VBenchや提案したAniEvalフレームワークなど、一般的なメトリクスによって測定される、優れた品質を実現しています。
論文 参考訳(メタデータ) (2025-06-12T10:06:21Z) - GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts [53.568057283934714]
本稿では,コンテンツ対応のテキストロゴレイアウトを生成するVLM(Vision-Language Model)ベースのフレームワークを提案する。
本稿では,複数のグリフ画像を同時に処理するための計算コストを削減する2つのモデル手法を提案する。
本モデルでは,既存の公開データセットの5倍の広義のテキストロゴデータセットを2つ構築する。
論文 参考訳(メタデータ) (2024-11-18T10:04:10Z) - MetaDesigner: Advancing Artistic Typography Through AI-Driven, User-Centric, and Multilingual WordArt Synthesis [65.78359025027457]
MetaDesignerがLarge Language Models(LLM)を利用したアートタイポグラフィーのための変換フレームワークを導入
その基盤は、Pipeline、Glyph、Textureエージェントで構成されるマルチエージェントシステムであり、カスタマイズ可能なWordArtの作成をまとめてオーケストレーションしている。
論文 参考訳(メタデータ) (2024-06-28T11:58:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。