論文の概要: Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation
- arxiv url: http://arxiv.org/abs/2608.02694v1
- Date: Mon, 03 Aug 2026 10:41:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.900327
- Title: Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation
- Title(参考訳): Crayotter: Group-Relative Preference Backpropagationを通じて、長距離ビデオ編集エージェントを学習する
- Authors: Lecheng Yan, Jianze Lin, Yichong Zhang, Ben Pan, Wenxi Li, Chenyang Lyu, Liting Zhou, Cathal Gurrin,
- Abstract要約: Group-Relative Preference Backpropagationは、同じタスクのランクをゼロサムの利点に変換する。
本研究では,プロジェクト分離型,地平線階層化されたリアルな編集作業スイートを手作業で構築し,評価のトレーニングと制御を行う。
その結果、9B CrayotterモデルはAgenticVBench上のいくつかのプロプライエタリシステムを上回った。
- 参考スコア(独自算出の注目度): 14.003463557395621
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon video editing agents receive final-product feedback only after many interdependent decisions. Yet editing quality is subjective, admits multiple valid solutions, and is not meaningfully calibrated across heterogeneous requests, making a global scalar objective both ambiguous and temporally uninformative. Our key observation is that fixing the request, materials, and production constraints converts this subjective objective into an ordinal comparison among directly comparable alternatives. We introduce Group-Relative Preference Backpropagation (GRPB), which transforms same-task rankings into zero-sum advantages and redistributes them as bounded credit over semantic editing segments. A lagged allocator and guarded transmission prevent current judgments or unreliable estimates from directly shaping the same rollout group. We manually construct a project-disjoint, horizon-stratified suite of realistic editing tasks for training and controlled evaluation. Across matched baselines, credit interventions, external benchmarking, and blinded human evaluation, GRPB improves both editing behavior and rendered products. The resulting 9B Crayotter model surpasses several proprietary systems on AgenticVBench, supporting task-local preference reduction as a practical approach to learning from subjective, delayed outcomes. Code and all supporting materials are publicly available at https://github.com/idwts/Crayotter.
- Abstract(参考訳): ロングホライゾンビデオ編集エージェントは、多くの相互依存的な決定の後にのみ最終製品フィードバックを受け取る。
しかし、編集品質は主観的であり、複数の有効な解を認めており、不均一な要求に対して有意に校正されていない。
我々のキーとなる観察は、要求、材料、生産制約の修正は、この主観的目的を、直接的に比較可能な代替品間の順序的比較に変換することである。
グループ相対選好バックプロパゲーション (GRPB) を導入し, 同一タスクのランク付けをゼロサムのアドバンテージに変換し, セマンティックな編集セグメントよりも有界なクレジットとして再分類する。
タグ付きアロケータとガード送信は、現在の判断や信頼できない見積もりが同一のロールアウトグループを直接形成することを防ぐ。
本研究では,プロジェクト分離型,地平線階層化されたリアルな編集作業スイートを手作業で構築し,評価のトレーニングと制御を行う。
ベースラインの整合性、信用介入、外部ベンチマーク、人による評価など、GRPBは編集行動とレンダリングされた製品の両方を改善している。
結果として得られる9B Crayotterモデルは、AgenticVBench上のいくつかのプロプライエタリシステムを超え、主観的で遅延した結果から学ぶための実践的なアプローチとしてタスクローカルな嗜好削減をサポートする。
コードとすべてのサポート資料はhttps://github.com/idwts/Crayotter.comで公開されている。
関連論文リスト
- Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning [72.49938949082117]
MAR(Multi-agent reasoning)は、反復的な解交換と改良を通じて推論の信頼性を向上させる。
既存の適応MARメソッドは通常、クエリレベルのラベルやトラジェクトリレベルのリターンからルーティング決定を学習する。
効率的な適応MARのための共有操作型クレジット割り当てフレームワークであるTreeCreditを提案する。
論文 参考訳(メタデータ) (2026-08-03T14:22:23Z) - MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing [19.20156418373185]
本稿では,メッセージ駆動のビデオ編集を評価するためのデータセットとベンチマークを提案する。
異なるメッセージが同じソースからかなり異なる編集をもたらすことが分かりました。
最先端のMLLMと強化された微調整ベースラインを用いた実験では、全てのモデルがより厳格な基準で人間に遅れることが示されている。
論文 参考訳(メタデータ) (2026-07-28T05:24:10Z) - Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework [0.3867363075280543]
提案するクローズドループフレームワークでは,すべてのレビューコメントを永続的な行動規則として符号化する。
このフレームワークは、バージョン管理された命令ファイル、自己レビューチェックリスト、自動検証に設定された蓄積ルールを組み合わせる。
我々のフレームワークは、重み付けの更新なしに永続的なクロスセッション学習を実現し、既存のベンチマークが測定しない経験的な次元(時間とともに振る舞いの整合性)に対処する。
論文 参考訳(メタデータ) (2026-07-13T21:13:46Z) - Speculative Rollback Correction for Quality-Diverse Web Agent Imitation [43.603850569331975]
専門家の軌道から模倣学習を通じて対話型Webエージェントを訓練することは、非常に効果的なアプローチとして現れている。
リセット可能なエージェント環境のためのブランチレベルの模倣フレームワークであるSRC(Speculative Rollback Correction)を提案する。
論文 参考訳(メタデータ) (2026-06-10T08:56:27Z) - Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing [55.211537893248675]
本稿では,2つの補完コンポーネントを中心に構築された暗黙の推論ビデオ編集用DiTフレームワークであるRVEDiTを提案する。
RVEDiTは最先端のベースラインを一貫して上回り、特にローカライズされた編集や構成的な編集において大きな利益を得ている。
論文 参考訳(メタデータ) (2026-05-23T17:22:14Z) - Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents [6.89645931986174]
本稿では,ルーリック誘導型行動選択フレームワークCo-ReActを紹介する。
各決定ステップにおいて、Co-ReActはエージェントのコンテキストにルーブリックを注入し、次のReason-or-Act決定を導く。
我々は、GRPOで専用のルーリック発電機を訓練し、このガイダンスを信頼性の高いものにする。
論文 参考訳(メタデータ) (2026-05-22T12:59:16Z) - RAGR: Review-Augmented Generative Recommendation [61.29879991713178]
Review-Augmented Generative Recommendation (RAGR)は、レビューフィードバックを直接生成ユーザシーケンスに組み込む新しいGRフレームワークである。
RAGRは、すべてのメトリクスにわたる強力なGRバックボーンよりも一貫性があり、大きな利益をもたらす。
論文 参考訳(メタデータ) (2026-05-17T05:21:23Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing [76.349958946335]
本稿では,映像編集をセマンティックアンカーとモーションモデリングに分解するフレームワークであるSAMA(factorized Semantic Anchoring and Motion Alignment)を提案する。
まずセマンティックアンカリング(Semantic Anchoring)を導入し、スパースアンカフレームでのセマンティックトークンとビデオ潜在者を共同で予測することで、信頼性の高い視覚アンカを確立する。
第2に、モーションアライメントは同じバックボーンをモーション中心のビデオ復元のプリテキストタスクで事前トレーニングする。
論文 参考訳(メタデータ) (2026-03-19T17:59:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。