論文の概要: RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?
- arxiv url: http://arxiv.org/abs/2608.02039v2
- Date: Tue, 04 Aug 2026 02:55:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.433281
- Title: RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?
- Title(参考訳): RSVideo:あなたのビジョンランゲージモデルはリモートセンシングビデオの準備ができているか?
- Abstract要約: 本研究では,連続的リモートセンシング映像理解に基づく視覚言語モデル評価のための統一的評価設定を開発する。
フレーム間の質問時間領域を選択する小対象焦点のための強化学習フレームワークであるRSVideoを紹介する。
RSVideoはInternVL3.5-14Bで最大9.01%の改善を達成し、Qwen3.6-27Bで最高40.63%に達した。
- 参考スコア(独自算出の注目度): 24.603802871747092
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Remote-sensing videos enable real-time observation of changes in target attributes, short-term activities, and scene evolution. They record motion, actions, interactions, and scene changes that cannot be captured by isolated images. Existing models primarily target single images or discrete temporal observations spanning a long time range. However, a unified evaluation setting for assessing vision-language models on continuous remote-sensing video understanding remains lacking. We introduce RSVideo-10K, a remote-sensing video dataset comprising 10,773 instances, 1.47 million frames, and 17.02 hours of footage, containing both unmanned aerial vehicles and satellite platforms. Its fixed evaluation benchmark, RSVideo-Bench, contains 2,731 test instances and evaluates two complementary aspects of remote-sensing video understanding: L1 Perception and L2 Reasoning, spanning seven capability groups and 17 tasks. Evaluations show that current vision-language models still struggle to recover small local evidence, track short-lived states, and use scene-constrained spatial relations. Based on this analysis, we further propose RSVideo, a reinforcement learning framework for small-target spatiotemporal focusing that selects question-relevant regions across frames and suppresses redundant background tokens. RSVideo achieves a maximum absolute improvement of 9.01% with InternVL3.5-14B and attains the highest accuracy of 40.63% with Qwen3.6-27B across 26 open-source vision-language backbones. Codes will be available at https://github.com/HongjieZhou0329/RSVideo.
- Abstract(参考訳): リモートセンシングビデオは、ターゲット属性の変化、短期活動、シーンの進化をリアルタイムで観察することを可能にする。
彼らは、孤立した画像では捉えられない動き、行動、相互作用、シーンの変化を記録します。
既存のモデルは、主に単一の画像または長い時間範囲にまたがる離散的な時間観測をターゲットにしている。
しかし、連続的リモートセンシングビデオ理解において、視覚言語モデルを評価するための統一的な評価設定は、いまだに欠落している。
我々は,無人航空機と衛星プラットフォームの両方を含む,10,773のインスタンス,1.47万フレーム,17.02時間の映像からなるリモートセンシングビデオデータセットであるRSVideo-10Kを紹介した。
その固定評価ベンチマークであるRSVideo-Benchは、2,731のテストインスタンスを含み、リモートセンシングビデオ理解の相補的な2つの側面(L1知覚とL2推論、7つの機能グループと17のタスク)を評価する。
評価の結果、現在の視覚言語モデルでは、小さな局所的な証拠の復元、短命状態の追跡、シーン制約された空間的関係の利用が依然として困難であることが示されている。
この分析に基づいて,フレーム間の質問関連領域を選択し,冗長な背景トークンを抑圧する,小ターゲット時空間集中のための強化学習フレームワークRSVideoを提案する。
RSVideoはInternVL3.5-14Bで9.01%の絶対改善を達成し、Qwen3.6-27Bで最高精度は40.63%に達した。
コードはhttps://github.com/HongjieZhou0329/RSVideoで入手できる。
関連論文リスト
- VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models [6.534399108411788]
物理AIのクラス: インフラストラクチャAIは、オープンループロギングの洞察のために固定カメラに依存している。
私たちは、この"インフラAIギャップ"を測定するベンチマークであるVANTAGE-Benchを紹介します。
我々は、ゼロショットを17モデル評価し、一般ではなく、消費者中心のベンチマークに対する欠点が集中していることを見出した。
論文 参考訳(メタデータ) (2026-09-08T19:50:25Z) - Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events [52.031070006859544]
ビデオマルチモーダル大言語モデル(MLLM)は、一般的なビデオ理解と長大なビデオ理解を急速に進歩させてきたが、短い回答クリティカルな視覚的証拠を保存できる能力はいまだに未発見のままである。
本稿では,映像MLLMの時間的忠実度を時間的視覚的事象理解によって診断するためのベンチマークであるMoment-Videoを紹介する。
論文 参考訳(メタデータ) (2026-06-01T17:32:20Z) - ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos [25.988212332357545]
ReVisionLLMは、1時間ビデオ中のイベントを見つけるために設計された視覚言語モデルである。
人間の検索戦略にインスパイアされた私たちのモデルは、当初は幅広い関心領域をターゲットとしていました。
私たちのモデルは、数分から数時間の間、非常に異なる長さの動画をシームレスに処理することができます。
論文 参考訳(メタデータ) (2024-11-22T12:46:50Z) - Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs [20.168429351519055]
ビデオ理解はマルチモーダル大言語モデル(LMLM)にとって重要な次のステップである
合成ビデオ生成によるベンチマーク構築フレームワークであるVideoNIAH(Video Needle In A Haystack)を提案する。
我々は、プロプライエタリモデルとオープンソースモデルの両方を包括的に評価し、ビデオ理解能力の重大な違いを明らかにする。
論文 参考訳(メタデータ) (2024-06-13T17:50:05Z) - Vript: A Video Is Worth Thousands of Words [54.815686588378156]
Vriptは12Kの高解像度ビデオの注釈付きコーパスで、420Kのクリップで詳細な、密度の高い、スクリプトのようなキャプションを提供する。
各クリップには145ワードのキャプションがあり、ほとんどのビデオテキストデータセットの10倍以上の長さである。
Vriptは、長いビデオのための高密度で詳細なキャプションをエンドツーエンドに生成できる強力なモデルである。
論文 参考訳(メタデータ) (2024-06-10T06:17:55Z) - DeVAn: Dense Video Annotation for Video-Language Models [68.70692422636313]
実世界のビデオクリップに記述を生成する視覚言語モデルの有効性を評価するために,人間の注釈付きデータセットを提案する。
データセットには、20秒から60秒間の8.5KのYouTubeビデオクリップが含まれており、幅広いトピックや関心事をカバーしている。
論文 参考訳(メタデータ) (2023-10-08T08:02:43Z) - Let's Think Frame by Frame with VIP: A Video Infilling and Prediction
Dataset for Evaluating Video Chain-of-Thought [62.619076257298204]
我々は、少数のビデオ推論のシーケンシャルな理解として、フレーミングビデオ推論を動機付けている。
VIPは、ビデオチェーンオブ思考を通してモデルの推論能力を調べるために設計された、推論時の課題データセットである。
我々は、VIP上でGPT-4、GPT-3、VICUNAをベンチマークし、複雑なビデオ推論タスクのパフォーマンスギャップを実証し、今後の作業を促進する。
論文 参考訳(メタデータ) (2023-05-23T10:26:42Z) - HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training [49.52679453475878]
本稿では,モーメントとテキスト間の相互アライメントをモデル化するための時間対応ビデオ言語事前学習フレームワークHiTeAを提案する。
15の精確なビデオ言語理解と生成タスクに関する最先端の成果を得た。
論文 参考訳(メタデータ) (2022-12-30T04:27:01Z) - QVHighlights: Detecting Moments and Highlights in Videos via Natural
Language Queries [89.24431389933703]
Query-based Video Highlights (QVHighlights) データセットを提示する。
これは1万本以上のYouTubeビデオで構成され、幅広いトピックをカバーしている。
データセット内の各ビデオには、(1)人書き自由形式のNLクエリ、(2)クエリに関するビデオw.r.t.の関連モーメント、(3)クエリに関連するすべてのクリップに対する5ポイントスケールのサリエンシスコアが注釈付けされている。
論文 参考訳(メタデータ) (2021-07-20T16:42:58Z) - TCLR: Temporal Contrastive Learning for Video Representation [49.6637562402604]
2つの新しい損失からなる新しい時間的コントラスト学習フレームワークを開発し、既存のコントラスト自己監督ビデオ表現学習方法を改善する。
一般的な3D-ResNet-18アーキテクチャでは、UCF101で82.4%(+5.1%)、HMDB51で52.9%(+5.4%)の精度を達成した。
論文 参考訳(メタデータ) (2021-01-20T05:38:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。