論文の概要: MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning
- arxiv url: http://arxiv.org/abs/2607.24064v1
- Date: Mon, 27 Jul 2026 07:06:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.340075
- Title: MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning
- Title(参考訳): MarineEVT:ビジュアルツール推論によるイベント中心の海洋ビデオ理解の促進
- Abstract要約: 我々は、ドメインの専門知識と大規模な注釈付きビデオデータを必要とする海洋ビデオ理解に焦点を当てる。
これらの課題に対処するため、MarineEVTと呼ばれる最初のイベント中心の海洋ビデオ理解データセットを慎重にキュレートする。
マリンEVTに基づき、イベント中心のビジュアルツール統合推論プロセスEVT-R1として、海洋ビデオ理解を分解する。
- 参考スコア(独自算出の注目度): 21.267648894621683
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent Vision-Language Models (VLMs) have achieved remarkable success in visual understanding, driven by the growing availability of high-quality image-text pairs. However, the performance of VLMs often degrades in the video domain due to the essential need for temporal understanding and the scarcity of large-scale annotated video data. In this work, we focus on marine video understanding, which brings further challenges: first, it requires substantial domain expertise; and video VLMs usually struggle with localizing and interpreting critical information from marine videos, as the informative events are typically sparse, unpredictable, and unevenly distributed. To address these challenges, we carefully curate the first event-centric marine video understanding dataset called MarineEVT, which features 20K multi-task, video-level visual question-answering pairs spanning multiple dimensions of marine understanding and analysis. Meanwhile, based on MarineEVT, we decompose marine video understanding as an Event-centric Visual Tool-integrated Reasoning process EVT-R1 for short, where we leverage powerful visual tools to drive the model to localize and interpret critical information aligned with visual questions and human intent. To demonstrate its effectiveness, we compare EVT-R1 against 11 SOTA VLMs in different settings. EVT-R1 outperforms the top open-source and top commercial models by 5.22 and 11.09, respectively. MarineEVT and EVT-R1 lay the foundation for ecological discovery and marine education, fostering the development of VLMs capable of interpreting marine dynamics, reasoning about ecological interactions, and supporting sustainable ocean video understanding and analysis.
- Abstract(参考訳): 近年の視覚言語モデル (VLM) は、高品質な画像テキストペアが利用可能になるにつれて、視覚的理解において顕著な成功を収めている。
しかしながら、VLMの性能は、時間的理解と大規模な注釈付きビデオデータの不足により、ビデオ領域で劣化することが多い。
本研究は,海洋ビデオの理解に重点を置いており,まずドメインの専門知識を必要とする。そしてビデオVLMは,通常,海洋ビデオからの重要情報のローカライズと解釈に苦慮する。
これらの課題に対処するため、我々はMineEVTと呼ばれる最初のイベント中心の海洋ビデオ理解データセットを慎重にキュレートした。
一方、MarineEVTに基づいて、海洋ビデオ理解をイベント中心のビジュアルツール統合推論プロセスEVT-R1と略して分解し、強力なビジュアルツールを活用して、視覚的な質問や人間の意図に沿った重要な情報をローカライズし解釈する。
EVT-R1と11個のSOTA VLMを異なる設定で比較した。
EVT-R1は、それぞれ5.22と11.09で、オープンソースとトップの商用モデルを上回っている。
海洋EVTとEVT-R1は、生態学の発見と海洋教育の基礎を築き、海洋力学を解釈し、生態的な相互作用を推論し、持続可能な海洋ビデオ理解と分析をサポートするVLMの開発を促進する。
関連論文リスト
- TRANSPORTER: Transferring Visual Semantics from VLM Manifolds [56.749972238005604]
本稿では,ビデオ生成のためのモデルに依存しないアプローチであるTransportERとともに,ロジット・トゥ・ビデオ(L2V)タスクを提案する。
TransporterはVLMの高セマンティック埋め込み空間への最適輸送結合を学習する。
代わりに、ロジットスコアは条件付きビデオ生成のための埋め込み方向を定義する。
論文 参考訳(メタデータ) (2025-11-23T09:12:48Z) - MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs [61.70050081221131]
MVU-EvalはMLLMのマルチビデオ理解を評価するための最初の包括的なベンチマークである。
私たちのMVU-Evalは、主に8つのコア能力を評価し、4,959本のビデオにまたがる1,824本の厳密にキュレートされた質問応答ペアを評価します。
これらの機能は、自律システムにおけるマルチセンサー合成や、クロスアングルスポーツ分析のような現実世界のアプリケーションと厳格に一致している。
論文 参考訳(メタデータ) (2025-11-10T16:02:33Z) - Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models [78.32948112203228]
ビデオ理解はコンピュータビジョンにおける最も困難なフロンティアである。
近年,映像理解タスクにおいて,映像多時間モデルが顕著に出現している。
Surveyは、ビデオ-LMM能力を向上するための統一的なフレームワークを研究者や実践者に提供することを目的としている。
論文 参考訳(メタデータ) (2025-10-06T17:10:44Z) - VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs [13.486495756813078]
VLM(Vision-Language Models)は、高レベルのシーン理解において優れるが、精密なローカライゼーションを必要とする微粒な知覚タスクに重点を置いている。
VLM-FO1は、オブジェクト中心の知覚を堅牢な特徴検索タスクに再フレーミングすることで、この制限を克服する新しいフレームワークである。
本手法は,プリトレーニング済みのVLMと統合したプラグイン・アンド・プレイモジュールとして動作する。
論文 参考訳(メタデータ) (2025-09-30T08:10:56Z) - MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning [16.858769096087297]
海洋ビデオは、ビデオ理解にとって重要な課題である。
既存のビデオキャプションデータセットは、しばしば海洋環境の複雑さを一般化するのに失敗する。
本稿では,2段階の海洋オブジェクト指向ビデオキャプションパイプラインを提案する。
論文 参考訳(メタデータ) (2025-08-06T15:34:24Z) - Response Wide Shut? Surprising Observations in Basic Vision Language Model Capabilities [54.94982467313341]
視覚言語モデル(VLM)は、様々な複雑なコンピュータビジョン問題に対処するための汎用ツールとして登場した。
我々は、設計のどのコンポーネントが欠落しているかを調査する一連のテストを構築することで、基本的な視覚的タスクにおけるSoTA VLMの限界を理解することにしました。
論文 参考訳(メタデータ) (2025-07-10T15:26:41Z) - UVLM: Benchmarking Video Language Model for Underwater World Understanding [11.475921633970977]
水中ビデオ観測のためのベンチマークであるUVLMを紹介する。
データセットには419種類の海洋動物と 様々な静的植物と地形が含まれています
2つの代表的なVidLMの実験により、UVLM上の微調整のVidLMは水中での世界の理解を著しく改善することが示された。
論文 参考訳(メタデータ) (2025-07-03T07:08:38Z) - Kwai Keye-VL Technical Report [80.53170317017147]
ショートビデオ理解のためのマルチモーダル基盤モデルである textbfKwai Keye-VL を紹介する。
Keye-VLの開発は,ビデオに重点を置いた大規模で高品質なデータセットと,革新的なトレーニングレシピという,2つのコア柱に留まっている。
提案手法の有効性を検証するため,我々は,Kee-VLが公開ビデオベンチマークにおける最先端の成果を達成し,一般的な画像ベースタスクにおいて高い競争力を保っていることを示す,広範囲な評価を行う。
論文 参考訳(メタデータ) (2025-07-02T17:57:28Z) - SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models [93.73583158211115]
ビデオにおけるきめ細かい時間的理解の獲得は、現在のビデオ大マルチモデル(ビデオLMM)にとって大きな課題である。
私たちは、データセット、モデル、ベンチマークの3つの中核的な側面に貢献しています。
まず,ビデオ理解,グラウンドニング,マルチターンビデオチャットの共用学習を実現するため、15Kビデオからなる大規模データセットであるSAMA-239Kを紹介する。
第2に,広義の時間的コンテキストアグリゲータとセグメンションモデルを組み合わせたSAMAモデルを提案する。
論文 参考訳(メタデータ) (2025-05-24T18:13:16Z) - AUTV: Creating Underwater Video Datasets with Pixel-wise Annotations [27.609227883183713]
AUTVは,海洋ビデオデータをピクセル単位のアノテーションで合成するフレームワークである。
2つのビデオデータセットを構築することで、このフレームワークの有効性を実証する。
論文 参考訳(メタデータ) (2025-03-17T05:18:20Z) - MarineVRS: Marine Video Retrieval System with Explainability via
Semantic Understanding [11.878077736295863]
MarineVRSは、海洋ドメイン用に明示的に設計された、新しく柔軟なビデオ検索システムである。
MarineVRSは、視覚的および言語的オブジェクト表現のための最先端の手法を統合し、大量の水中ビデオデータの効率的かつ正確な検索と分析を可能にする。
MarineVRSは、海洋研究者や科学者が大量のデータを効率的に正確に処理し、海洋生物の行動や動きについて深い洞察を得るための強力なツールである。
論文 参考訳(メタデータ) (2023-06-07T16:46:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。