論文の概要: SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution
- arxiv url: http://arxiv.org/abs/2608.17468v1
- Date: Tue, 18 Aug 2026 07:49:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.257532
- Title: SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution
- Title(参考訳): SAGE: 帰属型ルール進化による自己進化型ストーリーボードスキル
- Abstract要約: 我々は、専門家によるデモンストレーションから知識を学習、属性付け、進化、誘導するフレームワークであるSAGEを紹介する。
3つのジャンルにわたる18回のテストエピソードにおいて、SAGEは専門家によって検証されたルーリックで77.8点を獲得し、プロの監督は77.1点だった。
68エピソードにわたるプロのディレクターによるストーリーボードと、最初の公開データセットのペアリングスクリーンプレイであるPROSEをリリースする。
- 参考スコア(独自算出の注目度): 36.08747285600271
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Storyboards turn screenplays into visual shot plans for automated short drama production. Professional storyboarding relies on tacit directorial expertise and remains an industrial bottleneck. Large language models can automate this step, but methods for supplying directing knowledge face three challenges: (1) Knowledge acquisition: the craft remains implicit in exemplars or must be written manually. (2) Knowledge refinement: authored knowledge is not evaluated against execution outcomes, and opaque generation prevents feedback attribution to the knowledge behind each decision. (3) Knowledge injection: injecting all knowledge exceeds usable context, while manual selection for every narrative group does not scale. We present SAGE (Skill with Attribution-Guided Evolution), a deployed framework that learns, attributes, evolves, and routes directing knowledge from expert demonstrations. SAGE derives rules that are independent of episode content by contrasting each training screenplay with its expert storyboard. During generation, the model records each narrative group's adopted rules. Combining these records with localized feedback enables targeted updates to individual rules. Evolved rules form scenario packages with a routing index, so each group retrieves only a bounded set appropriate to its situation without expert intervention. On 18 test episodes across three genres, SAGE scored 77.8 on a rubric validated by experts, versus 77.1 for professional directors. Deployed for 14 days on Virtual Film Studio, SAGE produced 1,344 narrative group outputs; 87.2 percent were accepted without substantive edits, and the production team recorded over 83 percent less authoring time per episode. We release PROSE, the first public dataset pairing screenplays with storyboards by professional directors across 68 episodes: https://github.com/creDreams/PROSE.
- Abstract(参考訳): ストーリーボードは、脚本をショートドラマの自動制作のためのビジュアルショットプランに変える。
プロのストーリーボードは暗黙の監督の専門知識に依存しており、依然として工業的ボトルネックとなっている。
大規模な言語モデルは、このステップを自動化できますが、知識を指示する手段は、(1)知識獲得: 工芸品は模範として暗黙的に残るか、あるいは手作業で書かなければならない、という3つの課題に直面します。
2)知識の洗練:著者の知識は実行結果に対して評価されず,不透明な生成は各決定の背後にある知識に対するフィードバックの帰結を妨げている。
(3)知識注入:全ての知識を注入することは使用可能な文脈を超えるが、物語群ごとに手作業による選択はスケールしない。
SAGE(Skill with Attribution-Guided Evolution)は、専門家によるデモンストレーションから知識を学習、属性、進化、ルートするフレームワークである。
SAGEは、各トレーニング画面と専門家のストーリーボードを対比することにより、エピソード内容とは無関係なルールを導出する。
世代間、モデルは各物語グループの採用ルールを記録する。
これらのレコードとローカライズされたフィードバックを組み合わせることで、個々のルールをターゲットとする更新が可能になる。
進化したルールは、ルーティングインデックスでシナリオパッケージを形成するため、各グループは、専門家の介入なしに、その状況に適した境界セットのみを取得する。
3つのジャンルにわたる18回のテストエピソードにおいて、SAGEは専門家によって検証されたルーリックで77.8点を獲得し、プロの監督は77.1点だった。
SAGEは14日間バーチャル・フィルム・スタジオに展開し、1,344のストーリー・グループ・アウトプットを制作し、87.2%は実質的な編集なしに受け入れられ、プロダクション・チームは1話あたりのオーサリング・タイムを83%以上減らした。
PROSEは、68のエピソードでプロのディレクターがストーリーボードとペアリングする最初のパブリックデータセットである。
関連論文リスト
- REFRAMED: Towards Realistic Audio Description Generation for Movies [53.11641004249926]
オーディオ記述(Audio Description、AD)は、ビデオにおける重要な視覚的内容の言葉によるナレーションであり、視覚障害のある聴衆へのアクセスを可能にする。
既存のアプローチは、記述の内容とタイミングの両方を事前に指定した人工的な環境でAD生成を定式化する。
我々は、モデルが何を記述し、いつ実行するかを共同で決めなければならないAD生成の新しい定式化を導入する。
論文 参考訳(メタデータ) (2026-08-10T15:55:56Z) - Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity [0.042545248352921276]
鉄道や発電所などの重要なインフラの整備は、運用上の安全性と信頼性を確保するために不可欠である。
従来の研究では、手作業による作業のビデオと専門家労働者の動画を比較して、専門家の知識の候補を抽出しようと試みてきた。
本稿では,2つのタスクビデオ間の異常なフレームを検出し,専門家固有のアクションと文脈決定シーンを含む候補シーンを自動的に抽出する手法を提案する。
論文 参考訳(メタデータ) (2026-07-12T06:56:31Z) - Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning [4.964902130083661]
既存のマルチエージェントビデオ生成システムは、LLMエージェントを使用してニューラルビデオジェネレータをオーケストレーションする。
本稿では,このパラダイムを逆転させ,空間と時間におけるイベントの形式的なグラフを構築するエージェントシステムを提案する。
プログラム状態バックエンドは、検証済みのツールコールを通じてすべてのシミュレータの制約を強制し、生成されたすべての仕様が実行可能であることを保証します。
論文 参考訳(メタデータ) (2026-04-11T23:51:13Z) - Open-World Skill Discovery from Unsegmented Demonstrations [45.66528271008315]
オンラインデモビデオのセグメンテーションのための自己教師型学習ベースアプローチを開発した。
アノテーションのない時間的ビデオセグメンテーションアルゴリズムであるスキル境界検出(SBD)を導入する。
提案手法は,多様なYouTubeビデオを利用して,指示追従エージェントの訓練を行う。
論文 参考訳(メタデータ) (2025-03-11T18:51:40Z) - VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention [76.3175166538482]
VideoGen-of-Thought(VGoT)は、単一の文から複数ショットのビデオ合成を自動化するステップバイステップのフレームワークである。
VGoTは、ナラティブな断片化、視覚的不整合、トランジションアーティファクトの3つの課題に対処する。
トレーニング不要のパイプラインで組み合わせられたVGoTは、ショット内面の一貫性が20.4%、スタイルの一貫性が17.4%向上した。
論文 参考訳(メタデータ) (2024-12-03T08:33:50Z) - StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration [88.94832383850533]
CSVG(Customized Storytelling Video Generation)のためのマルチエージェントフレームワークを提案する。
StoryAgentはCSVGを特殊エージェントに割り当てられた個別のサブタスクに分解し、プロの制作プロセスを反映する。
具体的には、撮影時間内整合性を高めるために、カスタマイズされたイメージ・ツー・ビデオ(I2V)手法であるLoRA-BEを導入する。
コントリビューションには、ビデオ生成タスクのための汎用フレームワークであるStoryAgentの導入や、プロタゴニストの一貫性を維持するための新しい技術が含まれている。
論文 参考訳(メタデータ) (2024-11-07T18:00:33Z) - ScreenWriter: Automatic Screenplay Generation and Movie Summarisation [55.20132267309382]
ビデオコンテンツは、ユーザーがキープロットポイントをリコールしたり、見ずに概要を見ることができるようなテキスト記述や要約の需要を駆り立ててきた。
本稿では,映像のみを操作し,対話,話者名,シーンブレーク,視覚的記述を含む出力を生成するScreenWriterを提案する。
ScreenWriterは、映像を視覚ベクトルのシーケンスに基づいてシーンに分割する新しいアルゴリズムを導入し、アクターの顔のデータベースに基づく文字名決定の難しい問題に対する新しい方法を提案する。
論文 参考訳(メタデータ) (2024-10-17T07:59:54Z) - GOAL: A Challenging Knowledge-grounded Video Captioning Benchmark for
Real-time Soccer Commentary Generation [75.60413443783953]
我々は,KGVC(Knowledge-grounded Video Captioning)として新たなタスク設定を提案するための,8.9k以上のサッカービデオクリップ,22kの文,42kの知識トリプルのベンチマークであるGOALを提案する。
私たちのデータとコードはhttps://github.com/THU-KEG/goal.orgで公開されています。
論文 参考訳(メタデータ) (2023-03-26T08:43:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。