論文の概要: Natural Language Camera Movement Understanding
- arxiv url: http://arxiv.org/abs/2607.03043v1
- Date: Fri, 03 Jul 2026 07:33:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.502957
- Title: Natural Language Camera Movement Understanding
- Title(参考訳): 自然言語カメラの動きを理解する
- Authors: Yuwen Tan, Joey Huang, Jin Huang, Haoxiang Li, Boqing Gong,
- Abstract要約: 独立研究課題として自然言語カメラの動作理解を確立した。
本稿では,2段階の撮影分類と,実写ビデオと合成ビデオの両方を特徴とする広範囲な原子性ベンチマークを紹介する。
我々の微調整されたVLM-8Bは、ベンチマークのリアルビデオと合成ビデオでそれぞれ10%、ジェミニ3.1 Proを11%上回っている。
- 参考スコア(独自算出の注目度): 25.318138436729452
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding camera movement in natural language is critical for training and evaluating video generation models, among other applications. However, we demonstrate that existing vision-language models (VLMs) fail this task in surprising ways, frequently confusing translation with rotation, left with right, and object movement with camera movement. To address these limitations, we establish natural language camera movement understanding as a standalone research task. We introduce a two-level cinematographic taxonomy and an extensive, atomic benchmark featuring both real and synthetic videos. Furthermore, we curate a large-scale, multi-source training set enhanced by targeted camera movement augmentation. Our fine-tuned VLM-8B outperforms Gemini 3.1 Pro by 10% and 11% on our benchmark's real and synthetic videos, respectively. Despite these gains, a significant gap remains relative to human performance, underscoring the need to promote and facilitate future research on natural language camera movement understanding.
- Abstract(参考訳): 自然言語でカメラの動きを理解することは、ビデオ生成モデルの訓練と評価に不可欠である。
しかし,既存の視覚言語モデル(VLM)は,回転による翻訳や左右の移動,カメラの動きによる物体の動きなど,驚くべき方法でこのタスクを失敗することを示した。
これらの制約に対処するため、自然言語カメラの運動理解を独立した研究課題として確立する。
本稿では,2段階の撮影分類と,実写ビデオと合成ビデオの両方を特徴とする広範囲な原子性ベンチマークを紹介する。
さらに、ターゲットカメラの運動増強により強化された大規模マルチソーストレーニングセットをキュレートする。
我々の微調整されたVLM-8Bは、ベンチマークのリアルビデオと合成ビデオでそれぞれ10%、ジェミニ3.1 Proを11%上回っている。
これらの成果にもかかわらず、人間のパフォーマンスに対する大きなギャップは残っており、自然言語カメラのムーブメント理解の促進と促進の必要性を浮き彫りにしている。
関連論文リスト
- Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation [48.49793109378558]
生成ビデオにおける言語駆動型人中心カメラフレーミングの手法であるAuteurを提案する。
Auteurは、人中心のシーンの撮影フレーミングを可能にする。
論文 参考訳(メタデータ) (2026-06-01T08:41:01Z) - VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos [58.09854638265381]
VividCamは、拡散モデルによって合成ビデオから複雑なカメラの動きを学習する訓練パラダイムである。
我々は、驚くほど単純な合成データを用いて、精密に制御された複雑なカメラの動きを広範囲に合成できることを実証した。
論文 参考訳(メタデータ) (2025-10-28T19:12:22Z) - PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding? [9.059003409857775]
MLLM(Multi-modal large language model)は、画像とテキストのモダリティを用いてタスク間で印象的な一般化を示す。
我々は,動画MLLMが自然言語表現に基づいてオブジェクトをセグメント化できるのか,画素レベルの視覚的グラウンド化にモーションが用いられているのか,という疑問を提起する。
本研究では,映像MLLMが偽物から真の動きを識別する能力と,その動作順序を把握できる能力について,動画MLLMの4つの動き中心探索技術を紹介した。
論文 参考訳(メタデータ) (2025-09-02T20:21:11Z) - Towards Understanding Camera Motions in Any Video [89.97247162415158]
我々は、カメラモーション理解の評価と改善を目的とした大規模なデータセットとベンチマークであるCameraBenchを紹介する。
CameraBenchは、厳格な品質管理プロセスを通じて専門家によって注釈付けされた3,000の多様なインターネットビデオで構成されている。
私たちの貢献の1つは、撮影者との共同で設計されたカメラモーションプリミティブの分類である。
論文 参考訳(メタデータ) (2025-04-21T18:34:57Z) - ChatCam: Empowering Camera Control through Conversational AI [67.31920821192323]
ChatCamは、ユーザーとの会話を通じてカメラの動きをナビゲートするシステムである。
そこで本研究では,テキスト条件付きカメラ軌道生成のためのGPTに基づく自己回帰モデルであるCineGPTを提案する。
また、正確なカメラ軌道配置を保証するアンカー決定器も開発した。
論文 参考訳(メタデータ) (2024-09-25T20:13:41Z) - Image Conductor: Precision Control for Interactive Video Synthesis [90.2353794019393]
映画製作とアニメーション制作は、しばしばカメラの遷移と物体の動きを調整するための洗練された技術を必要とする。
イメージコンダクタ(Image Conductor)は、カメラトランジションとオブジェクトの動きを正確に制御し、単一の画像からビデオアセットを生成する方法である。
論文 参考訳(メタデータ) (2024-06-21T17:55:05Z) - MotionLLM: Understanding Human Behaviors from Human Motions and Videos [40.132643319573205]
この研究は、人間の行動理解の多様性(ビデオと運動のモダリティ)の領域を掘り下げる。
我々は、人間の動作理解、キャプション、推論のためのフレームワークであるMotionLLMを紹介する。
論文 参考訳(メタデータ) (2024-05-30T17:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。