論文の概要: SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing
- arxiv url: http://arxiv.org/abs/2607.17386v1
- Date: Sun, 19 Jul 2026 19:07:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.455522
- Title: SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing
- Title(参考訳): リモートセンシングにおけるUAV映像理解のためのマルチモーダル大言語モデルSkyVLaM
- Authors: Kaiwen Jing, Ruixu Jia, Bingyao Li, Ruizhe Ou, Ming Wu, Chuang Zhang,
- Abstract要約: UAVビデオ理解のための多モード大言語モデルSkyVLaMを提案する。
SkyVLaMは、時間ベースの知覚器を通じてパッチレベルのビデオ表現から直接スパーストークンを構築する。
さらに,SkyVid-VGCGとSkyVid-RVOSを組み合わせたSkyVidを構築した。
- 参考スコア(独自算出の注目度): 10.503838482038736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in Multimodal Large Language Models (MLLMs) have significantly improved remote sensing (RS) multimodal understanding. Language-conditioned segmentation is crucial for fine-grained target understanding in Unmanned Aerial Vehicle (UAV) videos. However, this task remains challenging due to the prevalence of small, visually ambiguous targets and dynamic aerial perspectives. In this paper, we propose SkyVLaM, a multimodal large language model for UAV video understanding. SkyVLaM constructs sparse tokens directly from patch-level video representations through a temporal basis perceiver, regularizes the sparse basis to encourage complementary temporal cues, and adaptively selects a temporally coherent dense segment for high-resolution inspection. The resulting sparse and dense tokens are jointly processed by a large language model for query-conditioned segmentation. We further build SkyVid, consisting of SkyVid-VGCG and SkyVid-RVOS for video grounded conversation generation and referring video object segmentation, respectively. SkyVid contains 101 videos, 33.6K frames, and 1.53M pixel-level object instances. Experiments show that SkyVLaM provides a more effective allocation of the visual token budget and improves language-conditioned video segmentation in UAV scenarios.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)の最近の進歩は、リモートセンシング(RS)のマルチモーダル理解を大幅に改善している。
無人航空機(UAV)ビデオにおいて、言語条件のセグメンテーションは、きめ細かな目標理解に不可欠である。
しかし、この課題は、小さな、視覚的に曖昧な目標と動的空中視点の出現のため、依然として困難なままである。
本稿では,UAVビデオ理解のためのマルチモーダル大規模言語モデルSkyVLaMを提案する。
SkyVLaMは、パッチレベルのビデオ表現から時間的ベース知覚を通して直接スパーストークンを構築し、相補的な時間的手がかりを促進するためにスパースベースを規則化し、高分解能検査のために時間的に一貫性のある高密度セグメントを適応的に選択する。
結果として得られるスパーストークンと高密度トークンは、クエリ条件セグメンテーションのための大きな言語モデルによって共同で処理される。
さらに,SkyVid-VGCG と SkyVid-RVOS を併用して,ビデオ対話生成のためのSkyVid-VGCG とビデオオブジェクトセグメンテーションのためのSkyVid-RVOS を構築した。
SkyVidには101本のビデオ、33.6Kフレーム、1.53Mピクセルレベルのオブジェクトインスタンスが含まれている。
実験により、SkyVLaMは視覚トークン予算をより効果的に割り当て、UAVシナリオにおける言語条件付きビデオセグメンテーションを改善することが示された。
関連論文リスト
- SVAC: Scaling Is All You Need For Referring Video Object Segmentation [6.940369414261821]
Video Video Object (RVOS) は、自然言語による記述に基づいて、対象物をビデオシーケンスに分割することを目的としている。
マルチモーダル大言語モデル(LMML)の最近の進歩は,テキスト・ビデオ理解の強化を通じてRVOSの性能を改善している。
入力フレームとセグメンテーショントークンをスケーリングすることでRVOSを改善する統一モデルSVACを提案する。
論文 参考訳(メタデータ) (2025-09-28T23:02:09Z) - Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos [126.02606196101259]
Sa2VAは、画像とビデオの両方の密集した理解のための、包括的で統一されたモデルである。
セグメンテーションや会話など、幅広い画像やビデオのタスクをサポートする。
Sa2VAはQwen-VLやIntern-VLなど、様々なVLMに容易に拡張できる。
論文 参考訳(メタデータ) (2025-01-07T18:58:54Z) - ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation [14.534308478766476]
何千もの挑戦的なビデオを含む新しいデータセットであるViCaSを紹介します。
本ベンチマークでは,全体的/高レベルの理解と言語誘導,画素精度のセグメンテーションに関するモデルを評価する。
論文 参考訳(メタデータ) (2024-12-12T23:10:54Z) - VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos [58.765796160750504]
VideoGLaMMは、ユーザが提供するテキスト入力に基づいて、ビデオの細かいピクセルレベルのグラウンド化を行うための新しいモデルである。
このアーキテクチャは、ビデオコンテンツの空間的要素と時間的要素の両方をテキスト命令と同期させるよう訓練されている。
実験の結果、我々のモデルは3つのタスクすべてで既存のアプローチより一貫して優れています。
論文 参考訳(メタデータ) (2024-11-07T17:59:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。