論文の概要: TemplateCraft: Agentic Visual Template Generation
- arxiv url: http://arxiv.org/abs/2609.31451v1
- Date: Fri, 25 Sep 2026 16:08:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.481182
- Title: TemplateCraft: Agentic Visual Template Generation
- Title(参考訳): TemplateCraft: エージェント型ビジュアルテンプレート生成
- Abstract要約: 本稿では,自然言語命令を,計画,資料生成,エフェクト・ワークフロー生成,プロトコルコンパイルを通じて,クライアント実行可能なテンプレートに変換するマルチエージェントシステムを提案する。
同じQwen3-VLバックボーンで、TemplateCraftはイメージ/ビデオ生成の成功率を56.7%/30.0%から66.7%/50.0%に引き上げ、テンプレートの付着性とスタイルの整合性を改善する。
- 参考スコア(独自算出の注目度): 11.443017830960153
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The growing popularity of short videos has driven demand for one-click content creation. Visual templates turn uploaded images into personalized content with preset effects, but reusable template generation still requires substantial manual effort in asset preparation and tool orchestration. We propose TemplateCraft, a multi-agent system that converts natural-language instructions into client-executable templates through planning, material generation, effect-workflow generation, and protocol compilation. Its Planner-Evaluator loop uses execution feedback for targeted rollback, while stage-level and long-term memory support revision without parameter updates. We evaluate TemplateCraft on TemplateBench, derived from 60 real-world templates. With the same Qwen3-VL backbone, TemplateCraft raises image/video generation success rates from 56.7%/30.0% to 66.7%/50.0% over Planner-only (best-of-three) and improves template adherence and style consistency. With additional evaluation and revision, it matches or exceeds a GPT-4o Planner-only baseline on selected metrics. Persistent assets further improve cross-input style consistency.
- Abstract(参考訳): ショートビデオの人気が高まり、ワンクリックのコンテンツ制作への需要が高まった。
ビジュアルテンプレートはアップロードされた画像を、プリセットされたエフェクトでパーソナライズされたコンテンツに変換するが、再利用可能なテンプレート生成には、アセット準備とツールオーケストレーションにかなりの手作業が必要になる。
本稿では,自然言語命令をクライアント実行可能なテンプレートに変換するマルチエージェントシステムであるTemplateCraftを提案する。
Planner-Evaluatorループはターゲットのロールバックに実行フィードバックを使用し、ステージレベルと長期メモリのサポートはパラメータを更新せずに更新する。
60個の実世界のテンプレートから派生したTemplateBench上でTemplateCraftを評価する。
同じQwen3-VLバックボーンで、TemplateCraftはイメージ/ビデオ生成の成功率を56.7%/30.0%から66.7%/50.0%に引き上げ、テンプレートの付着性とスタイルの整合性を改善する。
さらなる評価とリビジョンにより、選択したメトリクスに対して、GPT-4o Plannerのみのベースラインをマッチまたは超過する。
永続資産は、クロスインプットスタイルの一貫性をさらに改善する。
関連論文リスト
- SeaSlides: Semantic Abstraction Layer for Agentic Slide Generation [23.344472571293917]
セマンティック・抽象化・レイヤを中心に構築されたエージェント・スライド生成フレームワークであるSeaSlidesを紹介した。
座標やインラインスタイル、SVGの生形状のオーサリングではなく、再利用可能なコンポーネントや機能モジュールを通じて構造化されたスライドコンテンツを記述する。
評価のために、18タスクのUltraPresent検証設定とSeaSlidesBench-Richを組み合わせる。
論文 参考訳(メタデータ) (2026-08-04T08:08:28Z) - ConRetroBert: EMA Stabilized Dual Encoders for Template-Based Single-Step Retrosynthesis [2.152036255395242]
単一段階の逆合成は、明示的な反応テンプレートを選択して適用することによって反応物を予測する。
ConRetroBertは、テンプレートベースのレトロシンセシスを高密度な製品テンプレート検索として再編成するデュアルエンコーダフレームワークである。
論文 参考訳(メタデータ) (2026-05-12T20:40:22Z) - AutoPresent: Designing Structured Visuals from Scratch [99.766901203884]
エンド・ツー・エンドの画像生成とプログラム生成を様々なモデルでベンチマークする。
スライド生成用のコードと7kペアの命令でトレーニングされた8B LlamaベースのモデルであるAutoPresentを開発した。
論文 参考訳(メタデータ) (2025-01-01T18:09:32Z) - Detection and Measurement of Syntactic Templates in Generated Text [58.111650675717414]
モデルにおける一般的な反復を特徴付けるための構文的特徴の解析を行う。
モデルでは、下流のタスクにおいて、人間の参照テキストよりも高いレートでテンプレートテキストを生成する傾向にある。
論文 参考訳(メタデータ) (2024-06-28T19:34:23Z) - Mind Your Format: Towards Consistent Evaluation of In-Context Learning Improvements [10.687101698324897]
大規模な言語モデルは、いくつかの例から新しいタスクを解くための驚くべき能力を示している。
プロンプトテンプレート、あるいはインプット例をフォーマットしてプロンプトを取得する方法は、コンテキスト内学習の重要な側面であるが、見過ごされがちである。
テンプレートの貧弱な選択は、最強モデルと推論手法の性能をランダムな推測レベルに低下させることができることを示す。
論文 参考訳(メタデータ) (2024-01-12T18:58:26Z) - A Template Is All You Meme [76.03172165923058]
5,200以上のmemeテンプレート、それらに関する情報、および54,000のテンプレートインスタンスの例で構成された知識ベースを作成します。
ミームテンプレートのセマンティック信号を調べるために,データセット中のミームと知識ベースに含まれるベーステンプレートを距離ベースで検索することでマッチングできることを示す。
メメテンプレートの検証により,検討対象のデータセット毎の最先端性能が得られ,テンプレート性に基づく解析方法が確立された。
論文 参考訳(メタデータ) (2023-11-11T19:38:14Z) - ZeroShotCeres: Zero-Shot Relation Extraction from Semi-Structured
Webpages [66.45377533562417]
本稿では,以前は見つからなかったテンプレートを用いたWebページからの「ゼロショット」オープンドメイン関係抽出手法を提案する。
我々のモデルは、グラフニューラルネットワークに基づくアプローチを使用して、Webページ上のテキストフィールドのリッチな表現を構築します。
論文 参考訳(メタデータ) (2020-05-14T16:15:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。