論文の概要: MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
- arxiv url: http://arxiv.org/abs/2605.28173v1
- Date: Wed, 27 May 2026 08:54:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.911982
- Title: MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
- Title(参考訳): MangaFlow: 操作可能なストーリーから漫画生成のためのエンドツーエンドのエージェントフレームワーク
- Authors: Muyao Wang, Zeke Xie, Yanhao Chen, Lixin Xiu, Hideki Nakayama,
- Abstract要約: MangaFlowは、コントロール可能なロングフォームマンガ生成のためのフレームワークである。
マンガ作成を計画、接地、レイアウト構成、参照条件付きレンダリング、構成、テキスト配置に分解する。
- 参考スコア(独自算出の注目度): 22.40264045909082
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: End-to-end manga generation is a structured visual storytelling task that requires story decomposition, recurring character and scene grounding, page layout design, panel rendering, page composition, and lettering. However, existing generative models often perform direct page synthesis, entangling these factors in a single visual output and limiting precise control over layout geometry, visual references, and cross-panel consistency. To address these limitations, we propose MangaFlow, an agentic framework for controllable long-form manga generation that decomposes manga creation into planning, grounding, layout construction, reference-conditioned rendering, composition, and text placement. By treating layout and visual references as explicit intermediate variables, MangaFlow enables both simple text-to-manga generation and more precise user-controlled manga creation. This design exposes layout, visual assets, and lettering as editable intermediate controls for refining panel geometry, references, and text placement. To support long-form consistency, MangaFlow introduces a story section memory that links section descriptions with corresponding character, scene, and object references for reuse across panels. We further present a meta-benchmark for evaluating layout controllability, visual consistency, and generation quality. Experiments show that MangaFlow improves layout adherence and cross-panel consistency over direct generation baselines while supporting flexible human control.
- Abstract(参考訳): エンド・ツー・エンドマンガ生成(End-to-end Manga generation)は、ストーリーの分解、キャラクターとシーンの接地、ページレイアウトデザイン、パネルレンダリング、ページ構成、レタリングを必要とする構造化されたビジュアルストーリーテリングタスクである。
しかし、既存の生成モデルは、しばしば直接ページ合成を行い、これらの因子を単一の視覚出力に絡み付け、レイアウトの幾何学、視覚参照、パネル間の整合性に対する正確な制御を制限する。
これらの制約に対処するために,マンガ生成を計画,接地,レイアウト構築,参照条件付きレンダリング,構成,テキスト配置に分解する,制御可能な長形マンガ生成のためのエージェントフレームワークであるMangaFlowを提案する。
レイアウトとビジュアル参照を明示的な中間変数として扱うことで、MangaFlowは単純なテキスト-マンガ生成とより正確なユーザ制御マンガ生成の両方を可能にします。
このデザインは、レイアウト、ビジュアルアセット、レタリングをパネル幾何学、参照、テキスト配置の編集可能な中間制御として公開している。
長い形式の一貫性をサポートするため、MangaFlowはストーリーセクションメモリを導入し、セクション記述と対応するキャラクタ、シーン、オブジェクト参照をパネル間で再利用する。
さらに,レイアウト制御性,視覚的整合性,生成品質を評価するメタベンチマークを提案する。
実験により、MangaFlowは、フレキシブルなヒューマンコントロールをサポートしながら、ダイレクトジェネレーションベースラインに対するレイアウトの整合性とクロスパネルの整合性を改善することが示されている。
関連論文リスト
- CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers [48.779823303618734]
グラフィックデザイン解析のためのハイブリッドな生成フレームワークを提案する。
デザインイメージを編集可能なテキスト、バックグラウンド、ステッカー層に分解する。
テキスト領域は、視覚言語モデルを用いてテキスト設計プロトコルに解析される。
背景ステッカー層はマルチブランチ拡散アーキテクチャを用いて生成される。
論文 参考訳(メタデータ) (2026-04-21T16:20:19Z) - FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow [52.01563659850181]
FlowSceneはグラフベースのシーン生成モデルで、シーンレイアウト、オブジェクト形状、オブジェクトテクスチャを協調的に生成する。
コアには、生成時にオブジェクト情報を交換する密結合整流モデルがあり、グラフ全体の協調推論を可能にする。
大規模な実験により、FlowSceneは、生成リアリズム、スタイルの整合性、人間の好みとの整合性という点で、言語条件とグラフ条件ベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2026-03-20T03:15:42Z) - CalliMaster: Mastering Page-level Chinese Calligraphy via Layout-guided Spatial Planning [37.872480365351485]
ページレベルの書記合成には、グリフの精度とレイアウト構成のバランスが必要である。
制御可能な生成および編集のための統合フレームワークである textbfCalliMaster を提案する。
論文 参考訳(メタデータ) (2026-03-12T22:01:19Z) - Manga Generation via Layout-controllable Diffusion [21.080054070512023]
本稿では,マンガ生成タスクを提示し,プレーンテキストからのみマンガ生成を研究するためのマンガ109Storyデータセットを構築する。
マンガ生成過程におけるパネル内およびパネル間情報相互作用を容易にするためのマンガ拡散法を提案する。
論文 参考訳(メタデータ) (2024-12-26T17:52:19Z) - DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation [32.24143157812589]
textbfDiffSenseiは動的マルチ文字制御でマンガを生成するために特別に設計されたフレームワークである。
DiffSenseiは、拡散ベースのイメージジェネレータと、テキスト互換のIDアダプタとして機能するマルチモーダル大言語モデル(MLLM)を統合している。
提案手法では,文字特徴をシームレスに組み込むためにマスク付きクロスアテンションを用いることで,直接ピクセル転送を行うことなく正確なレイアウト制御が可能となる。
論文 参考訳(メタデータ) (2024-12-10T15:24:12Z) - The Manga Whisperer: Automatically Generating Transcriptions for Comics [55.544015596503726]
我々は,パネル,テキストボックス,文字ボックスを検出可能な統一モデル Magi を提案する。
本稿では,検出したテキストボックスを読み順にソートし,対話文を生成する手法を提案する。
論文 参考訳(メタデータ) (2024-01-18T18:59:09Z) - Deep Geometrized Cartoon Line Inbetweening [98.35956631655357]
インベントワイニングは、2つの白黒線図の間の中間フレームを生成する。
画像全体のマッチングとワープに依存する既存のフレームメソッドは、ラインインテワイニングには適していない。
本稿では,AnimeInbetを提案する。これは幾何学的な線描画をエンドポイントにジオメトリし,グラフ融合問題としてインベントワイニングタスクを再構成する。
本手法は,線画の細部と細部を包含しながら,線画の細部と特異な構造を効果的に捉えることができる。
論文 参考訳(メタデータ) (2023-09-28T17:50:05Z) - MARVEL: Raster Manga Vectorization via Primitive-wise Deep Reinforcement
Learning [29.14983719525674]
漫画(まんが)は、白黒のストロークで構成され、デジタル機器のイメージとして一般的に見られる、流行の日本風の漫画形式である。
深部強化学習(DRL)によるマンガベクトル化のためのプリミティブワイドアプローチであるMARVELを提案する。
画像全体のベクトルパラメータを予測する従来の学習ベース手法とは異なり、MARVELはマンガ全体を基本的なプリミティブテキストダッシュストロークラインの集合と見なす新しい視点を導入する。
論文 参考訳(メタデータ) (2021-10-10T15:52:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。