論文の概要: SkillPE: Creativity-Oriented Cinematic Skill Evolution for Text-to-Video Prompt Engineering
- arxiv url: http://arxiv.org/abs/2609.34335v1
- Date: Mon, 28 Sep 2026 05:11:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 21:45:08.8491
- Title: SkillPE: Creativity-Oriented Cinematic Skill Evolution for Text-to-Video Prompt Engineering
- Title(参考訳): SkillPE: テキストとビデオのプロンプトエンジニアリングのためのクリエイティビティ指向シネマティックスキル進化
- Abstract要約: 我々は、専門家が認可した種子から再利用可能な撮影スキルを進化させる、迅速なエンジニアリングフレームワークであるSkillPEを提案する。
SkillPEは、ショットロジック、構成、照明、サウンドデザイン、その他の映画製作のキューをきめ細かなフォーマットで表現している。
候補者のスキルは、生成したビデオを通じて評価され、即興の忠実さ、映画品質、物語の魅力、創造性によって最終的なスキルライブラリを構築する。
- 参考スコア(独自算出の注目度): 11.365099770373662
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Achieving high-quality, cinematic results in text-to-video generation remains challenging for non-experts, whose prompts often lack professional narrative and creative design. We propose SkillPE, a prompt engineering (PE) framework that evolves reusable cinematic skills from expert-authored seeds. SkillPE represents shot logic, composition, lighting, sound design, and other filmmaking cues in a fine-grained format, and retrieves movie references categorized as resonators (good matches), dissonants (weak matches), and divergents (creatively useful near-misses). The first two refine when and how a skill should be applied, while divergents inspire alternative cinematic realizations at different degrees of modification while preserving the user intent. Candidate skills are assessed through generated videos along prompt fidelity, cinematic quality, narrative appeal, and creativity to construct the final skill libraries. Experiments on StoryEval and VBench show improvements of up to 1.40 points over the strongest external baseline and 0.51 points over seed skills on 7-point four-dimensional evaluation, while remaining competitive on benchmark-native metrics. Overall, SkillPE offers a practical approach to balancing fidelity and creativity in cinematic text-to-video generation. Code is available at https://github.com/Ais0n/SkillPE .
- Abstract(参考訳): 高品質で映画的な結果を得ることは、プロの物語やクリエイティブなデザインを欠く非専門家にとって、依然として困難である。
我々は、専門家が認可した種子から再利用可能な撮影スキルを進化させる、プロンプトエンジニアリング(PE)フレームワークであるSkillPEを提案する。
SkillPEは、ショットロジック、構成、照明、サウンドデザイン、その他の映画製作の手がかりをきめ細かなフォーマットで表現し、共振器(良い試合)、不協和器(弱い試合)、発散器(創造的に有用な近接ミッション)に分類される映画参照を検索する。
最初の2つは、いつ、どのようにスキルが適用されるべきかを洗練し、分岐は、ユーザー意図を保ちながら、異なる修正の度合いで、代替の映画実現を刺激する。
候補者のスキルは、生成したビデオを通じて評価され、即興の忠実さ、映画品質、物語の魅力、創造性によって最終的なスキルライブラリを構築する。
StoryEvalとVBenchの実験では、7ポイントの4次元評価において、最強の外部ベースラインよりも最大1.40ポイント、シードスキルより0.51ポイント改善され、ベンチマークネイティブなメトリクスでは競争力を維持している。
全体として、SkillPEは映画テキスト・ビデオ生成における忠実さと創造性のバランスをとるための実践的なアプローチを提供する。
コードはhttps://github.com/Ais0n/SkillPEで入手できる。
関連論文リスト
- FilmBench: A Film-Grade Benchmark for Cinematic Video Generation [31.49880258407637]
フィルムベンチ (FilmBench) は、映画アカデミーの伝統のプロ向けシネマティック言語に基づくテキスト・トゥ・ビデオ (T2V) とレファレンス・トゥ・ビデオ (R2V) のベンチマークである。
プロンプトは20の映画ジャンルにまたがる受賞作品のクリップからリバースエンジニアリングされ、プロの監督が選ぶ。
評価は、3軸12成分35(T2V)+3(R2Vのみ)の3段階のシネマティック分類に従う。
論文 参考訳(メタデータ) (2026-07-27T10:20:31Z) - Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops [36.169206628733484]
CHIEFは人間とAIが共同で制作するビデオ生成フレームワークで、クリエイターを人間とループの反復的ビデオリファインメントの中心に配置する。
クリエーターは各イテレーションを駆動することで創造的な方向性を取り入れ、リビジョンは特別な精巧なエージェントによって取り入れられる。
提案手法の有効性を検証するため,映像制作経験のない高校生や大学生と共同でビデオ制作を行った。
論文 参考訳(メタデータ) (2026-06-17T01:39:30Z) - VISTA: A Test-Time Self-Improving Video Generation Agent [45.53495043750626]
VISTA (Video Iterative Self-IprovemenT Agent) は、反復ループでプロンプトを精製することで、ビデオ生成を自律的に改善する新しいシステムである。
ビデオの品質とユーザの意図との整合性を継続的に改善し、最先端のベースラインに対して最大60%の対等な勝利率を達成する。
人間の評価は一致し、VISTAの出力は66.4%である。
論文 参考訳(メタデータ) (2025-10-17T17:12:08Z) - Cut2Next: Generating Next Shot via In-Context Tuning [93.14744132897428]
マルチショット生成には、目的があり、映画のような遷移と厳密な撮影連続性が必要である。
現在の手法はしばしば基本的な視覚的一貫性を優先し、重要な編集パターンを無視している。
我々は、プロの編集パターンを批判的に合成する、その後の高品質なショットであるNext Shot Generation (NSG)を紹介する。
論文 参考訳(メタデータ) (2025-08-11T17:56:59Z) - AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation [50.63646953706144]
AniMakerは、効率的なマルチ候補クリップ生成とストーリーテリング対応クリップ選択を可能にするフレームワークである。
AniMakerは、VBenchや提案したAniEvalフレームワークなど、一般的なメトリクスによって測定される、優れた品質を実現しています。
論文 参考訳(メタデータ) (2025-06-12T10:06:21Z) - Stealing Creator's Workflow: A Creator-Inspired Agentic Framework with Iterative Feedback Loop for Improved Scientific Short-form Generation [20.571381061542766]
SciTalkは、テキスト、フィギュア、ビジュアルスタイル、アバターなど、さまざまなソースで動画をグラウンド化するための新しいフレームワークである。
コンテンツクリエーターのイテレーションにインスパイアされたSciTalkは、コンテンツ要約、ビジュアルシーン計画、テキストとレイアウトの編集に特別なエージェントを使用する。
我々のフレームワークは、フィードバック駆動のビデオ生成の課題とメリットに関する貴重な洞察を提供する。
論文 参考訳(メタデータ) (2025-04-26T05:22:35Z) - ExpertAF: Expert Actionable Feedback from Video [81.46431188306397]
本研究では,バスケットボールやサッカーなどの身体活動を行う人の映像から,アクション可能なフィードバックを生成する新しい手法を提案する。
提案手法は,映像のデモンストレーションとそれに伴う3Dボディーポーズを取り,その人が何をしているか,何が改善できるかを解説した専門家のコメントを生成する。
Ego-Exo4Dの[29]ビデオの熟練した活動と専門家の解説を、強力な言語モデルとともに活用して、このタスクのための弱い教師付きトレーニングデータセットを作成する方法を示す。
論文 参考訳(メタデータ) (2024-08-01T16:13:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。