論文の概要: Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing
- arxiv url: http://arxiv.org/abs/2608.25622v1
- Date: Wed, 26 Aug 2026 10:43:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.769591
- Title: Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing
- Title(参考訳): 検証可能な動画編集のためのオープンウェイトプランナーの検証学習
- Abstract要約: RefineCutはビデオ編集のためのコンパクトなオープンウェイトプランナーだ。
クリップの選択、トリミング、順序付け、遷移、持続時間、音楽アライメントを含む構造化パッチを通じて、タイプ付きタイムラインを編集する。
編集には1つの地道的な修理がないので、直接教師を模倣することはない。
- 参考スコア(独自算出の注目度): 12.215422610950382
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Practical video editing is not only pixel generation: an editor must turn a brief, a clip pool, music metadata, and hard constraints into an executable timeline. We study this decision layer as \emph{executable video-editing planning} and introduce RefineCut, which, unlike workflow systems that wrap a prompted frontier model, trains a compact open-weight planner for it. The planner edits a typed timeline through structured patches covering clip selection, trimming, ordering, transitions, and duration and music alignment; a deterministic verifier applies each patch and checks it against an explicit constraint ledger. Because editing has no single ground-truth repair, we do not imitate teachers directly: RefineCut replays every multi-teacher branch through the verifier and keeps verifier-best repairs as supervision. A second stage, RefineCut-Evo, lets the student score its own repairs with the verifier and a task rubric and trains on high-margin preference pairs, so the final $8$B planner runs in a closed verifier loop with no teacher calls at inference. On RefineCut-Bench ($3{,}578$ tasks, $7{,}971$ captioned clips, $499$ music tracks, explicit ledgers), verifier-replayed distillation lifts the planner from $0.620$ to $0.858$ on the protocol-specific Video-Editing Score and RefineCut-Evo reaches $0.924$; the gain transfers to Llama-3.1-8B and GLM-4-9B, and in the same closed loop the $8$B planner matches or exceeds its frontier teachers. Code and RefineCut-Bench are publicly released; see the Data Availability statement.
- Abstract(参考訳): エディタはショート、クリッププール、音楽メタデータ、ハード制約を実行可能なタイムラインに変換する必要があります。
我々は、この決定層を「emph{executable video-editing planning」として研究し、プロンプトフロンティアモデルをラップするワークフローシステムとは異なり、コンパクトなオープンウェイトプランナーを訓練するRefineCutを紹介する。
プランナーは、クリップの選択、トリミング、順序付け、遷移、時間と音楽のアライメントを含む構造化されたパッチを通して、型付きタイムラインを編集する。
RefineCutは、検証者を通してすべてのマルチティーチンガーブランチを再生し、検証者最善の修復を監督する。
第2のステージであるRefineCut-Evoでは、生徒が検証者とタスクのルーリックを使って独自の修理を行い、高マージンの選好ペアで訓練する。
RefineCut-Bench$3{,}578$ task, $7{,}971$ Casted clips, 4,99$ music track, explicit ledgers)では、検証済み蒸留器がプランナーを0.620$から0.858$に引き上げ、RefineCut-Evoが0.924$に達した。
CodeとRefineCut-Benchは一般公開されている。
関連論文リスト
- StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding [16.629848186775718]
検証可能な報酬を伴う強化学習は、この体制に不適合であり、長い思考と答えの世代を奨励する。
オンライン蒸留は、学生の軌跡に密集したトークンレベルの教師の監督を提供するが、どちらのモデルも思考モードで訓練した場合のみ安定している。
オープンソースストリーミングビデオ研究のための透過的で再現可能なリファレンスを提供する。
論文 参考訳(メタデータ) (2026-08-17T09:25:36Z) - CoVEBench: Can Video Editing Models Handle Complex Instructions? [26.871333176496126]
CoVEBenchは、416のキュレートされたソースビデオ、626のマルチポイント編集命令、9,990のきめ細かいチェックリスト項目からなる合成ビデオ編集ベンチマークである。
MLLM-judged命令コンプライアンスとビデオ忠実度によるモデルの評価と、ビデオ品質の自動測定を行う。
論文 参考訳(メタデータ) (2026-06-07T02:29:41Z) - Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing [18.640980775340637]
Crayotterは、プロンプト駆動のビデオ編集のためのオープンソースのマルチモーダルマルチエージェントシステムである。
Crayotterは、カバレッジ対応の素材準備、アーティファクトベースの編集研究、ツールグラウンドのタイムライン実行という3つのフェーズで構成されている。
論文 参考訳(メタデータ) (2026-05-31T14:07:57Z) - R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking [73.0537447183962]
本稿では、Reasoning-guided Recalling and Re rankを中心に構築されたゼロショット合成ビデオ検索パイプラインを提案する。
モデルは、編集を適用した後、期待されるターゲットビデオを記述する推論トレースを生成する。
この課題に対処する上で,本手法の有効性を実証した。
論文 参考訳(メタデータ) (2026-05-31T09:20:53Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance [55.32799307123252]
本稿では,既存のビデオ編集ペアを高忠実度トレーニング四重項に変換するスケーラブルなデータ生成パイプラインを提案する。
本稿では,学習可能なクエリと参照セマンティックガイダンスのための潜在視覚特徴を相乗化する統合編集アーキテクチャKiwi-Editを提案する。
論文 参考訳(メタデータ) (2026-03-02T18:46:28Z) - EasyV2V: A High-quality Instruction-based Video Editing Framework [108.78294392167017]
キャプションemphEasyV2Vは、命令ベースのビデオ編集のためのフレームワークである。
EasyV2Vは、例えば video+text、 video+mask+reference+、最先端のビデオ編集結果などの柔軟な入力で動作する。
論文 参考訳(メタデータ) (2025-12-18T18:59:57Z) - In-Context Learning with Unpaired Clips for Instruction-based Video Editing [51.943707933717185]
我々は、命令ベースのビデオ編集のための低コストの事前学習戦略を導入する。
本フレームワークは,まず約100万本のビデオクリップを事前学習し,基本的な編集概念を学習する。
本手法は命令アライメントと視覚的忠実度の両方において既存の命令ベースビデオ編集手法を超越する。
論文 参考訳(メタデータ) (2025-10-16T13:02:11Z) - UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying [64.5307229755533]
画像編集機能を備えた統合VLMを実現するために,UniEdit-Iという新しいトレーニングフリーフレームワークを導入する。
我々は最新のBLIP3-oに基づいて提案手法を実装し,GEdit-BenchベンチマークでSOTA(State-of-the-art)性能を達成した。
論文 参考訳(メタデータ) (2025-08-05T06:42:09Z) - LOVECon: Text-driven Training-Free Long Video Editing with ControlNet [9.762680144118061]
本稿では,このギャップを埋めることを目的として,学習自由拡散モデルに基づく長大ビデオ編集のための,シンプルで効果的なベースラインを確立する。
ControlNet上にパイプラインを構築し、テキストプロンプトに基づいて様々な画像編集タスクを抽出する。
本手法は,ユーザの要求に応じて数百フレームの動画を編集する。
論文 参考訳(メタデータ) (2023-10-15T02:39:25Z) - InstructVid2Vid: Controllable Video Editing with Natural Language Instructions [97.17047888215284]
InstructVid2Vidは、人間の言語命令でガイドされたビデオ編集のためのエンドツーエンドの拡散ベースの方法論である。
我々のアプローチは、自然言語ディレクティブによって案内される映像操作を強化し、サンプルごとの微調整や逆変換の必要性を排除します。
論文 参考訳(メタデータ) (2023-05-21T03:28:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。