論文の概要: TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
- arxiv url: http://arxiv.org/abs/2604.27975v1
- Date: Thu, 30 Apr 2026 15:05:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:54.157387
- Title: TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
- Title(参考訳): TransVLM:任意のショット遷移を検出するためのビジョンランゲージフレームワークとベンチマーク
- Authors: Ce Chen, Yi Ren, Yuanming Li, Viktor Goriachko, Zhenhui Ye, Zujin Guo, Zhibin Hong, Mingming Gong,
- Abstract要約: ショットトランジション検出(STD)は本質的に複雑なトランジションに苦しむ。
本稿では,STDのためのビジョン言語モデル(VLM)フレームワークであるTransVLMを提案する。
広範囲な実験により、TransVLMは全体的な性能が優れていることが示された。
- 参考スコア(独自算出の注目度): 52.61846373082384
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Traditional Shot Boundary Detection (SBD) inherently struggles with complex transitions by formulating the task around isolated cut points, frequently yielding corrupted video shots. We address this fundamental limitation by formalizing the Shot Transition Detection (STD) task. Rather than searching for ambiguous points, STD explicitly detects the continuous temporal segments of transitions. To tackle this, we propose TransVLM, a Vision-Language Model (VLM) framework for STD. Unlike regular VLMs that predominantly rely on spatial semantics and struggle with fine-grained inter-shot dynamics, our method explicitly injects optical flow as a critical motion prior at the input stage. Through a simple yet effective feature-fusion strategy, TransVLM directly processes concatenated color and motion representations, significantly enhancing its temporal awareness without incurring any additional visual token overhead on the language backbone. To overcome the severe class imbalance in public data, we design a scalable data engine to synthesize diverse transition videos for robust training, alongside a comprehensive benchmark for STD. Extensive experiments demonstrate that TransVLM achieves superior overall performance, outperforming traditional heuristic methods, specialized spatiotemporal networks, and top-tier VLMs. This work has been deployed to production. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/
- Abstract(参考訳): 従来のショット境界検出(SBD)は、分離されたカットポイントを中心にタスクを定式化し、しばしば破損したビデオショットを生成することで、本質的に複雑な遷移に苦しむ。
我々は、ショットトランジション検出(STD)タスクを形式化し、この基本的な制限に対処する。
曖昧な点を探すのではなく、STDは遷移の連続時間セグメントを明示的に検出する。
そこで本研究では,STDのためのビジョン言語モデル(VLM)フレームワークであるTransVLMを提案する。
空間的意味論や微粒なショット間ダイナミクスに主に依存する通常のVLMとは異なり、本手法は入力段階での臨界運動として光の流れを明示的に注入する。
シンプルだが効果的な機能融合戦略により、TransVLMは結合した色と動きの表現を直接処理し、言語バックボーンに追加の視覚的トークンオーバーヘッドを発生させることなく、時間的認識を著しく向上する。
公開データの厳密なクラス不均衡を克服するため,STDの包括的なベンチマークとともに,多種多様なトランジションビデオの合成を行うスケーラブルなデータエンジンを設計した。
広汎な実験により、TransVLMは、従来のヒューリスティックな手法、特殊な時空間ネットワーク、最上位のVLMよりも優れた性能を発揮することが示された。
この作業は本番環境に配備されている。
関連研究については、HeyGen Research (https://www.heygen.com/research)とHeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model)を参照してください。
プロジェクトページ: https://chence17.github.io/TransVLM/
関連論文リスト
- Can Vision-Language Models Solve the Shell Game? [15.221979890090077]
VETベンチ(VET-Bench)は、時間的連続性によるトラッキングを必要とする、視覚的に同一の物体を特徴とする、総合的な診断テストベッドである。
本手法は,VET-Bench上で90%を超える最先端の精度を達成し,ヴィジュアル・ランゲージ・モデルが外部ツールを使わずに,映像シェル・ゲーム・タスクをエンド・ツー・エンドで確実に解決できることを実証した。
論文 参考訳(メタデータ) (2026-03-09T14:33:25Z) - STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning [65.36458157092207]
視覚言語モデル(VLM)では、テキスト記述と視覚座標のミスアライメントはしばしば幻覚を引き起こす。
本稿では,座標の調整が難しい問題を回避するために,新しい視覚的プロンプトパラダイムを提案する。
本稿では,STVGの最初の強化学習フレームワークであるSTVG-R1を紹介する。
論文 参考訳(メタデータ) (2026-02-12T08:53:32Z) - 1 + 1 > 2: Detector-Empowered Video Large Language Model for Spatio-Temporal Grounding and Reasoning [53.28271278708241]
本稿では,DEViL の略である Detector-Empowered Video LLM を提案する。
DEViLはオープンボキャブラリ検出器(OVD)とビデオLLMを結合する
単に空間的なプロンプトやセグメンタスイッチとして機能するトークンとは異なり、RTTは制御信号とOVDのテキスト埋め込みの置き換えの両方として機能する。
論文 参考訳(メタデータ) (2025-12-07T06:11:15Z) - Segment Anything Across Shots: A Method and Benchmark [46.36499587944568]
本研究は,マルチショット半教師付きビデオオブジェクトセグメンテーション(MVOS)に焦点をあて,複数のショットでビデオ全体を通して初期マスクで示される対象オブジェクトをセグメンテーションすることを目的とする。
単発データを用いたクロスショット一般化を可能にするデータ拡張戦略(TMA)の移行を提案する。
MVOSにおける評価と今後の研究を支援するために,高密度マスクアノテーション,多種多様なオブジェクトカテゴリ,高周波トランジションを備えた新しいMVOSベンチマークであるCut-VOSを紹介する。
論文 参考訳(メタデータ) (2025-11-17T18:58:40Z) - Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs [88.68484904214142]
Patch-as-Decodable Token (PaDT)を導入し、テキストと多様な視覚出力を生成する。
PaDTの中心は、クエリイメージのビジュアルパッチ埋め込みから派生したVisual Reference Tokens (VRT)である。
MLLMモデルと比較しても,PaDTは最先端の性能を一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-10-02T12:23:57Z) - Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies [62.653984010274485]
VLA(Vision-Language-Action)モデルは、画像や命令をロボットアクションにマッピングするために、大きな視覚言語バックボーンを適応させる。
prevailingAsは、固定された左から右への順序で自動回帰的にアクションを生成するか、バックボーンの外側で分離または拡散ヘッドをアタッチする。
本稿では離散拡散を伴う離散化作用チャンクをモデル化する統一変換器ポリシである離散拡散VLAを提案する。
論文 参考訳(メタデータ) (2025-08-27T17:39:11Z) - Video-Level Language-Driven Video-Based Visible-Infrared Person Re-Identification [47.40091830500585]
Visible-based Infrared Person Re-Identification (VVIReID) は、モダリティ内のシーケンスレベルの特徴を抽出することによって、歩行者のシーケンスをモダリティにわたってマッチングすることを目的としている。
ビデオレベル言語駆動型VVI-ReID(VLD)フレームワークは、イモダリティ言語(IMLP)と時空間アグリゲーションという2つのコアモジュールから構成される。
論文 参考訳(メタデータ) (2025-06-03T04:49:08Z) - Unsupervised Video Domain Adaptation for Action Recognition: A
Disentanglement Perspective [37.45565756522847]
我々は2つの潜在要因からドメイン間ビデオを生成することを検討する。
TranSVAEフレームワークはそのような世代をモデル化するために開発される。
UCF-HMDB、Jester、Epic-Kitchensデータセットの実験は、TranSVAEの有効性と優位性を検証する。
論文 参考訳(メタデータ) (2022-08-15T17:59:31Z) - Multimodal Transformer with Variable-length Memory for
Vision-and-Language Navigation [79.1669476932147]
VLN(Vision-and-Language Navigation)は、エージェントが目標位置に向かうために言語命令に従う必要があるタスクである。
近年のTransformer-based VLN法は,視覚的観察と言語指導の直接的な結びつきから大きな進歩を遂げている。
視覚的な自然言語ナビゲーションのための可変長メモリ(MTVM)を備えたマルチモーダルトランス (Multimodal Transformer) を提案する。
論文 参考訳(メタデータ) (2021-11-10T16:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。