論文の概要: A Dual-Transformer for Multi-Camera View Recommendation
- arxiv url: http://arxiv.org/abs/2608.25601v1
- Date: Wed, 26 Aug 2026 10:22:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.728883
- Title: A Dual-Transformer for Multi-Camera View Recommendation
- Title(参考訳): マルチカメラビューレコメンデーションのためのデュアルトランス
- Abstract要約: 本稿では,従来のSOTAモデルよりも高い性能を示すクロスアテンションを持つ新しいデュアルトランスフォーマーアーキテクチャを提案する。
我々の手法は56.60%の精度@0.5を達成し、前回の37.16%よりも大幅に改善した。
- 参考スコア(独自算出の注目度): 10.437764544103276
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-camera systems are foundational to modern media production, and multi-camera editing is a critical task. This involves the proper selection of the appropriate camera view at each moment. In this paper, we propose a novel Dual-Transformer architecture with Cross-Attention that heavily outperformed the current SOTA models over the TVMCE dataset (TV Shows Multicamera Editing dataset). Our model decouples these tasks: (1) a dedicated temporal encoder first processes the sequence of past frames to build a rich memory of the recent history, and (2) the candidate camera views then act as queries to this memory via a cross-attention module, allowing each candidate to independently interrogate the historical context and find the most relevant information for its own evaluation. Our approach achieved 56.60% Precision@0.5, representing a substantial improvement over the prior best result of 37.16%. We further conducted an ablation study exploring the use of lightweight backbone architectures, where the SwinV2 backbone yielded the best performance, achieving 69.65% Precision@0.5. Using this best-performing configuration, we then investigated the feasibility of adapting the model to replicate the editing style of a specific human editor. To this end, we fine-tuned the model using varying proportions of the initial segment of a target video. Our results demonstrate that even with only 20% of the video used for fine-tuning, the model exhibited measurable improvements in Precision@0.5, indicating strong potential for data-efficient personalization of editing style adapted to each individual TV show or producer.
- Abstract(参考訳): マルチカメラシステムは現代メディア生産の基礎であり、マルチカメラ編集は重要な課題である。
これは、各瞬間に適切なカメラビューを適切に選択することを含む。
本稿では,現在のSOTAモデルをTVMCEデータセット(TV Shows Multicamera Editing dataset)で大きく上回った,クロスアテンションを持つ新しいデュアルトランスフォーマーアーキテクチャを提案する。
1) 専用のテンポラルエンコーダは,まず過去のフレームのシーケンスを処理して,最近の履歴の豊富なメモリを構築する。(2) 候補カメラビューは,クロスアテンションモジュールを介して,このメモリに対するクエリとして動作し,各候補が個別に履歴コンテキストを疑問視し,その評価に最も関連性の高い情報を見つけることができる。
我々の手法は56.60%の精度@0.5を達成し、前回の37.16%よりも大幅に改善した。
さらに,SwinV2バックボーンが最高の性能を示し,69.65%の精度@0.5を達成した軽量バックボーンアーキテクチャの使用について,アブレーション調査を行った。
この最適性能構成を用いて,特定の編集者の編集スタイルを再現するためにモデルを適応させる可能性を検討した。
そこで,本研究では,対象映像の初期セグメントの比率の異なるモデルを用いて微調整を行った。
その結果,微調整に使用したビデオの20%に過ぎなかったが,Precision@0.5の精度向上がみられ,各テレビ番組やプロデューサーに適応した編集スタイルのデータ効率のパーソナライズの可能性が示唆された。
関連論文リスト
- CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation [84.82778089348285]
カメラトランスフォーマー1(Camera Transformer 1)は、カメラ軌跡を正確に推定し、空間推論の知識を映像生成に伝達する特殊モデルである。
我々のフレームワークは空間的推論とビデオ合成のギャップを埋めることに成功し、忠実で高品質なカメラ制御可能なビデオを生み出した。
論文 参考訳(メタデータ) (2026-04-10T10:43:18Z) - Distill Video Datasets into Images [28.61426017935629]
単一フレームビデオセット蒸留(Single-Frame Videoset Distillation, SFVD)は、各クラスに対して高い情報フレームにビデオを蒸留するフレームワークである。
SFVDは従来の手法よりも大幅に優れており、MiniUCFでは最大5.3%の改善が達成されている。
論文 参考訳(メタデータ) (2025-12-16T17:33:41Z) - End-to-End Multi-Person Pose Estimation with Pose-Aware Video Transformer [7.19764062839405]
ビデオにおける多人数2Dポーズ推定のためのエンドツーエンドフレームワークを提案する。
鍵となる課題は、複雑な時間軌道と重なり合う時間軌道の下で、個人をフレーム全体で関連付けることである。
本稿では,フレーム内関係と時間デコーダのポーズをモデル化するための空間エンコーダを備えた新しいPose-Aware VideoErEr Network(PAVE-Net)を提案する。
論文 参考訳(メタデータ) (2025-11-17T10:19:35Z) - Subject-driven Video Generation via Disentangled Identity and Motion [52.54835936914813]
本稿では,ゼロショットにおける時間的ダイナミクスから被験者固有の学習を分離し,追加のチューニングを伴わずに,主題駆動のカスタマイズビデオ生成モデルを訓練することを提案する。
提案手法は、ゼロショット設定で既存のビデオカスタマイズモデルよりも優れた、強力な被写体整合性とスケーラビリティを実現する。
論文 参考訳(メタデータ) (2025-04-23T06:48:31Z) - Multi-subject Open-set Personalization in Video Generation [110.02124633005516]
我々は、マルチオブジェクトでオープンなパーソナライズ機能を備えたビデオモデルとして、Video Alchemist $-$を提示する。
本モデルは,各条件付き参照画像と対応する主観レベルテキストプロンプトを融合するDiffusion Transformerモジュール上に構築されている。
本手法は,定量評価と定性評価の両方において,既存のパーソナライズ手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-01-10T18:59:54Z) - SAM 2: Segment Anything in Images and Videos [63.44869623822368]
本稿では,画像やビデオにおける迅速な視覚的セグメンテーションの解決に向けた基礎モデルであるセグメンション・エキシング・モデル2(SAM2)を提案する。
ユーザインタラクションを通じてモデルとデータを改善するデータエンジンを構築し、これまでで最大のビデオセグメンテーションデータセットを収集します。
我々のモデルは、リアルタイムビデオ処理のためのストリーミングメモリを備えたシンプルなトランスフォーマーアーキテクチャである。
論文 参考訳(メタデータ) (2024-08-01T17:00:08Z) - TAPIR: Tracking Any Point with per-frame Initialization and temporal
Refinement [64.11385310305612]
本稿では,ビデオシーケンスを通して任意の物理面上の問合せ点を効果的に追跡する,TAP(Tracking Any Point)の新しいモデルを提案する。
提案手法では,(1)他のフレームの問合せ点に対する適切な候補点マッチングを独立に特定するマッチング段階と,(2)局所的相関に基づいてトラジェクトリと問合せの両方を更新する改良段階の2段階を用いる。
結果として得られたモデルは、DAVISにおける平均約20%の絶対平均ジャカード(AJ)改善によって示されるように、TAP-Vidベンチマークにおける大きなマージンで、すべてのベースライン手法を上回ります。
論文 参考訳(メタデータ) (2023-06-14T17:07:51Z) - Self-Supervised Camera Self-Calibration from Video [34.35533943247917]
汎用カメラモデルの効率的なファミリーを用いてシーケンスごとのキャリブレーションパラメータを回帰する学習アルゴリズムを提案する。
提案手法は,サブピクセル再投射誤差による自己校正を行い,他の学習手法よりも優れる。
論文 参考訳(メタデータ) (2021-12-06T19:42:05Z) - Understanding Road Layout from Videos as a Whole [82.30800791500869]
我々はこれをトップビューの道路属性予測問題として定式化し、その目的は各フレームの属性を正確かつ一貫して予測することである。
我々は、ビデオにおけるカメラモーションの活用と、長期ビデオ情報の導入という3つの新しい側面を生かした。
論文 参考訳(メタデータ) (2020-07-02T00:59:15Z) - Unified Image and Video Saliency Modeling [21.701431656717112]
イメージとビデオの相性モデリングは統一モデルによってアプローチできるだろうか?
本研究では,4つの新しい領域適応手法と学習されたガウス先行の定式化を提案する。
我々はこれらの技術を、シンプルで軽量なエンコーダ-RNNデコーダスタイルのネットワークUNISALに統合し、画像とビデオのサリエンシデータを併用してトレーニングする。
本手法は,DHF1K,ハリウッド-2,UCF-Sports,およびSALICON,MIT300の画像塩分濃度データセットについて検討した。
論文 参考訳(メタデータ) (2020-03-11T18:28:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。