論文の概要: MotionAtlas: Detailed Region Captioning for Motion-Centric Videos
- arxiv url: http://arxiv.org/abs/2606.29531v1
- Date: Sun, 28 Jun 2026 17:54:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.951223
- Title: MotionAtlas: Detailed Region Captioning for Motion-Centric Videos
- Title(参考訳): MotionAtlas:モーション中心ビデオの詳細な領域キャプション
- Authors: Weisong Liu, Haochen Wang, Kuan Gao, Yuhao Wang, Yikang Zhou, Zhongwei Ren, Jacky Mai, Anna Wang, Yanwei Li, Jason Li, Zhaoxiang Zhang,
- Abstract要約: MotionAtlasは、モーション中心のビデオのキャプションシステムである。
ターゲット領域内の運動の正確な記述を生成する。
MotionAtlas-4BはQwen3-VL-4Bを平均5.2ポイント上回る。
- 参考スコア(独自算出の注目度): 32.07943965658894
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose MotionAtlas, a system for detailed captioning of motion-centric videos, comprising (1) a dedicated human-annotated benchmark, (2) a scalable, high-quality pipeline to construct training samples, and (3) a family of powerful Video-MLLMs. Unlike conventional global motion captioning datasets, we focus on region-aware motion captioning: given a video and a spatiotemporal mask, the model generates precise descriptions of motion within the target region, thereby alleviating visual clutter and motion entanglement and enabling reliable, quantifiable evaluation. Concretely, we first build MotionAtlas-Bench, a comprehensive benchmark comprising 2,073 multiple-choice questions, meticulously annotated for a curated set of high-quality, motion-centric videos, to evaluate fine-grained motion understanding of the objects in question. Second, we design a rigorous and scalable data pipeline that leverages self-bootstrap refinement to suppress fine-grained hallucinations, yielding 159k high-quality motion captioning data. Third, we design a tailored training data composition strategy, which achieves consistent and substantial performance gains across diverse baseline Video-MLLMs, including Molmo2 and Qwen3-VL. For instance, MotionAtlas-4B surpasses Qwen3-VL-4B by an average of 5.2 percentage points across general motion benchmarks. The benchmark, dataset, and code have been released.
- Abstract(参考訳): 動き中心動画の詳細なキャプションシステムであるMotionAtlasを提案し,(1)専用ベンチマーク,(2)トレーニングサンプルを構築するためのスケーラブルで高品質なパイプライン,(3)強力なビデオMLLMのファミリーを備える。
従来のグローバルな動きキャプションデータセットとは異なり、ビデオと時空間マスクが与えられた場合、対象領域内の動きの正確な記述を生成し、視覚的クラッタや動きの絡み合いを緩和し、信頼性の高い定量的評価を可能にする。
具体的には、まず2,073の複数選択質問からなる総合的なベンチマークであるMotionAtlas-Benchを構築し、高品質で動き中心の動画を厳密に注釈付けして、対象物の微粒な動き理解を評価する。
第2に,より厳密でスケーラブルなデータパイプラインを設計し,より微細な幻覚を抑え,高品質なモーションキャプションデータを生成する。
第3に,M Molmo2 や Qwen3-VL など,多種多様なベースラインビデオMLLM に対して一貫した,実質的なパフォーマンス向上を実現するためのトレーニングデータ合成戦略を設計する。
例えば、MotionAtlas-4BはQwen3-VL-4Bを平均5.2ポイント上回る。
ベンチマーク、データセット、コードがリリースされた。
関連論文リスト
- Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding [9.774606705982874]
本稿では,感情モダリティデータを用いたMLLM(Large Language Models)を大幅に強化する。
運動MLLMは、身体的運動軌跡の視覚的内容のグラウンド化によって、シーン全体にわたる絶対的なスケールと空間的関係を推論することができる。
ビデオフレームと明示的な3Dデータに基づく最新技術(SOTA)手法と比較して、Motion-MLLMはオーバーヘッドをはるかに少なく、類似またはそれ以上の精度を示す。
論文 参考訳(メタデータ) (2026-03-18T17:42:49Z) - MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation [126.77662882743168]
テキストと音声の両方に33,072人の注釈付き動作表現を含むデータセットであるMeViSを紹介する。
MeViSがサポートする4つのタスクにまたがる15の既存メソッドをベンチマークする。
本稿では,RVOS/AVOS/RMOTに対するLMPM++のアプローチを提案する。
論文 参考訳(メタデータ) (2025-12-11T18:59:44Z) - FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos [109.99404241220039]
大規模なモーションデータセットを構築する完全自動データキュレーションパイプラインであるFoundationMotionを紹介した。
提案手法は,まずビデオ中のオブジェクトを検出してトラジェクトリを抽出し,次にこれらのトラジェクトリとビデオフレームを大規模言語モデルで活用する。
我々はNVILA-Video-15BやQwen2.5-7Bなどのオープンソースモデルを微調整し、性能を損なうことなく動作理解を大幅に改善した。
論文 参考訳(メタデータ) (2025-12-11T18:53:15Z) - Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance [107.25252623824296]
Wan-Moveは、ビデオ生成モデルにモーションコントロールを提供するフレームワークである。
私たちの中核となる考え方は、動画を誘導するためのモーションアウェアを元の状態にすることです。
Wan-Moveは5秒、480pの動画を制作し、Kling 1.5の商用モーションブラシに対抗している。
論文 参考訳(メタデータ) (2025-12-09T16:13:55Z) - DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis [17.750053029702222]
既存のテキスト・トゥ・ビデオ(T2V)評価ベンチマークであるVBenchやEvalCrafterには2つの制限がある。
ダイナミックカメラの動きを強調するプロンプトを体系的にキュレートしたベンチマークであるDynamicEvalを紹介する。
背景環境の整合性を示すために,Vbench運動の滑らか度測定値に基づく解釈可能な誤差マップを得る。
提案手法は,映像レベルとモデルレベルの両方において,人間の嗜好と強い相関関係を示す。
論文 参考訳(メタデータ) (2025-10-08T18:41:04Z) - VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models [110.32291962407078]
VimoRAG(ヴィモラグ)は、動画に基づく大規模言語モデルのためのモーション生成フレームワークである。
動作中心の効果的なビデオ検索モデルを開発し、最適下検索結果による誤り伝播の問題を緩和する。
実験結果から,VimoRAGはテキストのみの入力に制約された動きLLMの性能を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-16T15:31:14Z) - MOVE: Motion-Guided Few-Shot Video Object Segmentation [25.624419551994354]
本研究はFSVOS(Motion-guided few-shot Video Object segmentation)に対処する。
同じモーションパターンの注釈付きサンプルに基づいて、ダイナミックオブジェクトをビデオにセグメントすることを目的としている。
動作誘導型FSVOS用に設計された大規模データセットMOVEを紹介する。
論文 参考訳(メタデータ) (2025-07-29T17:59:35Z) - VideoMolmo: Spatio-Temporal Grounding Meets Pointing [66.19964563104385]
VideoMolmoは、ビデオシーケンスのきめ細かいポインティングに適したモデルだ。
新しい仮面融合はSAM2を双方向の点伝播に用いている。
The generalization of VideoMolmo, we introduced VPoMolS-temporal, a challenge out-of-distribution benchmark across two real-world scenarios。
論文 参考訳(メタデータ) (2025-06-05T17:59:29Z) - Learning to Segment Rigid Motions from Two Frames [72.14906744113125]
本研究では, 運動場から独立物体の動きを復元する幾何学的解析により, モジュラーネットワークを提案する。
2つの連続フレームを入力とし、背景のセグメンテーションマスクと複数の剛体移動オブジェクトを予測し、3次元の剛体変換によってパラメータ化する。
本手法はkittiおよびsintelにおける剛体運動セグメンテーションの最先端性能を実現する。
論文 参考訳(メタデータ) (2021-01-11T04:20:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。