論文の概要: COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2608.21030v1
- Date: Fri, 21 Aug 2026 12:28:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.524778
- Title: COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models
- Title(参考訳): COMET:ビデオマルチモーダル大言語モデルのためのコントラスト運動強調時間推論
- Authors: Chenghua Zhu, Zhaolu Kang, Qifan Shi, Siyan Wu, Kehan Jiang, Lei Wei, Lianyu Hu, Guangyuan Dong, Mingbo Yang, Rui Lu, Guibo Luo,
- Abstract要約: ビデオ多モーダル大言語モデルは大幅に進歩しているが、微粒な動き・時間的理解は脆弱である。
本稿では,ビデオMLLMを明示的な時間的表現によって体系的に強化する,時間的基盤のフレームワークであるCOMETを提案する。
最適化のために、COMETは時間的事前蒸留と時間的順序を直接学習信号に変換する前方逆TC-GRPOステージを組み合わせる。
- 参考スコア(独自算出の注目度): 15.39037309359101
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video multimodal large language models have advanced significantly, yet fine-grained motion-temporal understanding remains fragile. The core bottleneck is not only sparse frame sampling, but also the lack of a complete temporal modeling pipeline for explicitly representing frame-to-frame change, enabling appearance-motion interaction, and optimizing temporal direction sensitivity. We propose COMET, a temporally grounded framework that systematically strengthens video MLLMs through explicit temporal representation, appearance-motion fusion, and direction-aware optimization. Architecturally, COMET introduces a temporal motion branch built on Taylor frame differences and injects its motion evidence into the appearance stream via temporal attention bias-enhanced cross-attention. For optimization, COMET combines temporal prior distillation with a forward-reverse TC-GRPO stage that turns temporal order into a direct learning signal and strengthens the model's use of directional motion patterns encoded by the temporal motion branch. The method achieves consistent overall improvements with a pronounced motion-temporal bias: on Qwen3-VL-8B, action-centric tasks (STAR, SSv2) improve by 4.9% on average, temporal reasoning tasks (NExT-QA, CLEVRER, LLaVA-178K) by 2.1% over BL-GRPO, while static perception tasks (PerceptionTest) remain on par. The same gain pattern also transfers to InternVL2.5-8B, indicating that COMET generalizes across model families.
- Abstract(参考訳): ビデオ多モーダル大言語モデルは大幅に進歩しているが、微粒な動き・時間的理解は脆弱である。
コアボトルネックはスパースフレームサンプリングだけでなく、フレーム間の変化を明確に表現し、外観と動きの相互作用を可能にし、時間方向の感度を最適化するための完全な時間的モデリングパイプラインも欠如している。
本稿では,映像MLLMの明示的な時間的表現,外見と運動の融合,方向を意識した最適化によって体系的に強化する,時間的基盤のフレームワークであるCOMETを提案する。
建築的には、COMETはテイラーフレームの相違に基づく時間的動きの分岐を導入し、その動きの証拠を時間的注意バイアスによる交差注意を通して外見の流れに注入する。
最適化のためにCOMETは、時間的事前蒸留と、時間的順序を直接学習信号に変換する前向きのTC-GRPOステージを組み合わせて、時間的動き分岐によって符号化された方向運動パターンの使用を強化する。
Qwen3-VL-8Bでは、アクション中心タスク(STAR, SSv2)は平均で4.9%改善され、時間的推論タスク(NExT-QA, CLEVRER, LLaVA-178K)はBL-GRPOで2.1%改善され、静的知覚タスク(PerceptionTest)はそのままである。
同じゲインパターンはInternVL2.5-8Bにも転送され、COMETがモデルファミリー全体にわたって一般化されることを示している。
関連論文リスト
- Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation [25.677744104220853]
ビデオフレームは、特定の動作セマンティクスに固執しながら、所定のエンドポイント間で現実的な中間フレームを合成することを目的としている。
本稿では,前向きと後向きの軌跡の対称性を強制する新しい双方向フレームワークを提案する。
本手法は,37フレームと73フレームの両方のタスクにおいて,画像品質,運動の滑らかさ,動的制御における最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-02T06:58:46Z) - Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z) - Generalizable Implicit Motion Modeling for Video Frame Interpolation [51.966062283735596]
フローベースビデオフレーム補間(VFI)における動きの重要性
本稿では,動きモデリングVFIの新規かつ効果的なアプローチである一般インプリシット・モーション・モデリング(IMM)を紹介する。
我々のGIMMは、正確にモデル化された動きを供給することによって、既存のフローベースVFIワークと容易に統合できる。
論文 参考訳(メタデータ) (2024-07-11T17:13:15Z) - TSI: Temporal Saliency Integration for Video Action Recognition [32.18535820790586]
本稿では,SME(Salient Motion Excitation)モジュールとCTI(Cross-scale Temporal Integration)モジュールを主成分とするTSI(Temporal Saliency Integration)ブロックを提案する。
SMEは、局所的な動きモデリングを通して、動きに敏感な領域を強調することを目的としている。
CTIは、それぞれ別々の1D畳み込みの群を通じて、マルチスケールの時間的モデリングを実行するように設計されている。
論文 参考訳(メタデータ) (2021-06-02T11:43:49Z) - Learning Self-Similarity in Space and Time as Generalized Motion for
Action Recognition [42.175450800733785]
ビデオ自己相似性(STSS)に基づくリッチな動き表現を提案する。
stssのボリューム全体を活用し、モデルに効果的なモーション表現を抽出させるようにしています。
SELFYと呼ばれる提案された神経ブロックは、追加の監督なしに簡単に神経アーキテクチャに挿入し、エンドツーエンドで訓練することができます。
論文 参考訳(メタデータ) (2021-02-14T07:32:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。