論文の概要: Exploring High-Order Self-Similarity for Video Understanding
- arxiv url: http://arxiv.org/abs/2604.20760v1
- Date: Wed, 22 Apr 2026 16:48:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:11.237866
- Title: Exploring High-Order Self-Similarity for Video Understanding
- Title(参考訳): 映像理解のための高次自己相似性探索
- Abstract要約: MOSS(Multi-Order Self-Similarity)は、マルチオーダーSTSS機能の学習と統合を目的とした軽量ニューラルネットワークモジュールである。
多様なビデオタスクに適用することで、限界計算コストとメモリ使用量のみを消費しながら、モーションモデリング能力を向上させることができる。
- 参考スコア(独自算出の注目度): 55.52840327834189
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Space-time self-similarity (STSS), which captures visual correspondences across frames, provides an effective way to represent temporal dynamics for video understanding. In this work, we explore higher-order STSS and demonstrate how STSSs at different orders reveal distinct aspects of these dynamics. We then introduce the Multi-Order Self-Similarity (MOSS) module, a lightweight neural module designed to learn and integrate multi-order STSS features. It can be applied to diverse video tasks to enhance motion modeling capabilities while consuming only marginal computational cost and memory usage. Extensive experiments on video action recognition, motion-centric video VQA, and real-world robotic tasks consistently demonstrate substantial improvements, validating the broad applicability of MOSS as a general temporal modeling module. The source code and checkpoints will be publicly available.
- Abstract(参考訳): 空間時間自己相似性(STSS)は、フレーム間の視覚的対応を捉え、ビデオ理解のための時間的ダイナミクスを表現する効果的な方法を提供する。
本研究では、高次STSSを探索し、異なる順序でのSTSSがどのようにこれらのダイナミクスの異なる側面を明らかにするかを実証する。
次に,Multi-Order Self-Similarity (MOSS)モジュールを紹介した。
多様なビデオタスクに適用することで、限界計算コストとメモリ使用量のみを消費しながら、モーションモデリング能力を向上させることができる。
ビデオアクション認識、モーション中心ビデオVQA、実世界のロボットタスクに関する広範囲にわたる実験は、一般的な時間モデリングモジュールとしてのMOSSの適用性を検証し、一貫して顕著な改善を証明している。
ソースコードとチェックポイントが公開されている。
関連論文リスト
- MVR: Multi-view Video Reward Shaping for Reinforcement Learning [17.20077949643041]
MVR(Multi-View Video Reward Shaping)は、複数の視点から撮影したビデオを用いて、対象タスクに関する状態の関連性をモデル化するフレームワークである。
MVRは、画像ベースの手法に固有の特定の静的ポーズに対するバイアスを軽減する状態関連関数を学習する。
タスク固有の報酬とVLMに基づくガイダンスを統合した状態依存報酬形成形式を導入する。
論文 参考訳(メタデータ) (2026-03-02T10:24:04Z) - Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders [9.162827706080337]
本稿では,視覚エンコーダ内に直接重畳された時間的注意モジュールを導入したビデオLLMアーキテクチャを提案する。
この設計では、視覚エンコーダの時間的注意が組み込まれており、モデルがアクションの進行とフレーム間の関係をよりよく捉えることができる。
その結果,本手法は時間的推論を著しく改善し,ビデオ質問応答タスクにおける既存モデルよりも優れることがわかった。
論文 参考訳(メタデータ) (2025-10-29T23:50:57Z) - Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models [78.32948112203228]
ビデオ理解はコンピュータビジョンにおける最も困難なフロンティアである。
近年,映像理解タスクにおいて,映像多時間モデルが顕著に出現している。
Surveyは、ビデオ-LMM能力を向上するための統一的なフレームワークを研究者や実践者に提供することを目的としている。
論文 参考訳(メタデータ) (2025-10-06T17:10:44Z) - TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning [54.033346088090674]
TWIST と SCOUT は,事前学習したMLLM に視覚的接地能力を持たせるフレームワークである。
モデルを効果的に微調整するために,SCOUTと呼ばれる高品質な合成データセットを生成する。
このデータセットは、ステップバイステップのマルチモーダル推論プロセスを記述する、豊富な監視信号を提供する。
論文 参考訳(メタデータ) (2024-10-14T13:35:47Z) - CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion [58.15403987979496]
CREMAは、ビデオ推論のための一般化可能、高効率、モジュラリティ融合フレームワークである。
本稿では,軽量核融合モジュールとモーダリティ・シークエンシャル・トレーニング・ストラテジーによって支援された,新しいプログレッシブ・マルチモーダル・フュージョン設計を提案する。
ビデオQA や Video-Audio/3D/Touch/Thermal QA を含む7つのビデオ言語推論タスクについて検証を行った。
論文 参考訳(メタデータ) (2024-02-08T18:27:22Z) - MVBench: A Comprehensive Multi-modal Video Understanding Benchmark [63.14000659130736]
本稿では、MVBenchという総合的なマルチモーダルビデオ理解ベンチマークを紹介する。
まず、これらの時間的タスクを定義するための新しい静的-動的手法を提案する。
そして,タスク定義に従って,公開ビデオアノテーションを複数選択QAに自動的に変換し,各タスクを評価する。
論文 参考訳(メタデータ) (2023-11-28T17:59:04Z) - Revisiting Temporal Modeling for CLIP-based Image-to-Video Knowledge
Transferring [82.84513669453744]
画像テキスト事前訓練モデル(例えばCLIP)は、大規模な画像テキストデータペアから学んだ、印象的な汎用マルチモーダル知識を示している。
画像間知識伝達の文脈における時間的モデリングを再考する。
本稿では,CLIPモデルを多様なビデオタスクに拡張する簡易かつ効果的な時間的モデリング機構を提案する。
論文 参考訳(メタデータ) (2023-01-26T14:12:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。