論文の概要: VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
- arxiv url: http://arxiv.org/abs/2605.02834v1
- Date: Mon, 04 May 2026 17:11:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:50.425682
- Title: VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
- Title(参考訳): VideoNet: ドメイン特有なアクション認識のための大規模データセット
- Abstract要約: 我々は37ドメインから1,000の異なるアクションをカバーするドメイン固有のアクション認識ベンチマークであるVideoNetを紹介する。
視覚言語モデル(VLM)は、コンテキスト内サンプルを十分に活用するのに苦労している。
ドメイン固有のアクションのための、最初の大規模なトレーニングデータセットを収集し、合計で500万近いビデオ質問応答ペアを収集する。
- 参考スコア(独自算出の注目度): 107.13283099863123
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Videos are unique in their ability to capture actions which transcend multiple frames. Accordingly, for many years action recognition was the quintessential task for video understanding. Unfortunately, due to a lack of sufficiently diverse and challenging data, modern vision-language models (VLMs) are no longer evaluated on their action recognition capabilities. To revitalize action recognition in the era of VLMs, we advocate for a returned focus on domain-specific actions. To this end, we introduce VideoNet, a domain-specific action recognition benchmark covering 1,000 distinct actions from 37 domains. We begin with a multiple-choice evaluation setting, where the difference between closed and open models is stark: Gemini 3.1 Pro attains 69.9% accuracy while Qwen3-VL-8B gets a mere 45.0%. To understand why VLMs struggle on VideoNet, we relax the questions into a binary setting, where random chance is 50%. Still, Qwen achieves only 59.2% accuracy. Further relaxing the evaluation setup, we provide $k\in\{1,2,3\}$ in-context examples of the action. Some models excel in the few-shot setting, while others falter; Qwen improves $+7.0\%$, while Gemini declines $-4.8\%$. Notably, these gains fall short of the $+13.6\%$ improvement in non-expert humans when given few-shot examples. Finding that VLMs struggle to fully exploit in-context examples, we shift from test-time improvements to the training side. We collect the first large-scale training dataset for domain-specific actions, totaling nearly 500k video question-answer pairs. Fine-tuning a Molmo2-4B model on our data, we surpass all open-weight 8B models on the VideoNet benchmark.
- Abstract(参考訳): ビデオは、複数のフレームを横切るアクションをキャプチャできるという点でユニークなものだ。
したがって、長年にわたってアクション認識はビデオ理解にとって重要な課題であった。
残念ながら、十分に多様で困難なデータがないため、現代の視覚言語モデル(VLM)はもはやその行動認識能力について評価されていない。
VLMの時代にアクション認識を再活性化するために、ドメイン固有のアクションに再びフォーカスすることを提唱する。
この目的のために、37ドメインから1,000の異なるアクションをカバーするドメイン固有のアクション認識ベンチマークであるVideoNetを紹介する。
Gemini 3.1 Proは69.9%、Qwen3-VL-8Bは45.0%である。
VLMがVideoNetで苦労している理由を理解するため、ランダムな確率が50%となるバイナリ設定に質問を緩和する。
それでもQwenは59.2%の精度しか達成していない。
評価設定をさらに緩和し、$k\in\{1,2,3\}$ in-context example of the actionを提供する。
Qwenは$+7.0\%$を、Geminiは$4.8\%$を下げる。
注目すべきは、これらの利得は、少数の例を挙げると、非専門家の人間では+13.6\%$の改善に届かなかったことである。
VLMがコンテキスト内サンプルを完全に活用するのに苦労していることに気付き、テスト時間の改善からトレーニング側にシフトします。
ドメイン固有のアクションのための、最初の大規模なトレーニングデータセットを収集し、合計で500万近いビデオ質問応答ペアを収集する。
データ上でMomo2-4Bモデルを微調整し、VideoNetベンチマークのすべてのオープンウェイト8Bモデルを上回っます。
関連論文リスト
- RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos? [24.603802871747092]
本研究では,連続的リモートセンシング映像理解に基づく視覚言語モデル評価のための統一的評価設定を開発する。
フレーム間の質問時間領域を選択する小対象焦点のための強化学習フレームワークであるRSVideoを紹介する。
RSVideoはInternVL3.5-14Bで最大9.01%の改善を達成し、Qwen3.6-27Bで最高40.63%に達した。
論文 参考訳(メタデータ) (2026-08-03T10:34:42Z) - FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding [30.42523020030251]
VLM(Vision-Language Models)は、一般的なビデオ理解において顕著な能力を示す。
彼らはしばしば、現実世界のアプリケーションに不可欠なきめ細かい理解に苦しむ。
我々は、きめ細かい理解を評価するために特別に設計されたベンチマークであるFineBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-19T13:40:26Z) - Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding [73.52241177491655]
Molmo2はビデオ言語モデル(VLM)の新たなファミリーであり、オープンソースモデルの中でも最先端の製品である。
単一画像、マルチイメージ、ビデオタスクにおけるポイント駆動グラウンドリングにおいて、例外的な新機能を示す。
私たちの最高の8Bモデルは、ショートビデオ、カウント、キャプションでオープンウェイトとデータモデルのクラスで他よりも優れており、ロングビデオでは競争力があります。
論文 参考訳(メタデータ) (2026-01-15T17:27:44Z) - VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos [62.29924199978745]
VideoAgentTrekは、Webスケールで公開されているスクリーン録画ビデオからトレーニングデータを自動的にマイニングするスケーラブルなパイプラインである。
生のビデオには暗黙のデモが含まれているが、明示的なアクションラベルがない。
39,000のYouTubeチュートリアルビデオに適用されたパイプラインは、自動的に1250万のインタラクションステップを生成します。
論文 参考訳(メタデータ) (2025-10-22T11:25:48Z) - LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models [59.0256377330646]
Lensは3.4Kの現代画像と8つのタスクと12の日次シナリオをカバーする60K以上の人間による質問のベンチマークである。
このデータセットは本質的に、基本的な知覚から構成的推論に至るまで、画像不変のプロンプトを処理するためのMLLMの評価をサポートする。
我々は,Qwen2.5-VL-72B,InternVL3-78B,GPT-4oおよび2つの推論モデルQVQ-72B-previewとKim-VLなどの15以上のフロンティアMLLMを評価する。
論文 参考訳(メタデータ) (2025-05-21T15:06:59Z) - Fine-Tuning Video-Text Contrastive Model for Primate Behavior Retrieval from Unlabeled Raw Videos [0.2796197251957245]
非ヒト霊長類の自然生息地におけるビデオ記録は、野生での行動を研究するための共通の情報源である。
我々は,カプチン猿の特定の領域に対して,事前学習したビデオテキスト基盤モデルを微調整する。
論文 参考訳(メタデータ) (2025-05-08T22:48:52Z) - ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition [111.32822459456793]
ActionAtlasは、様々なスポーツのショートビデオを含むビデオ質問応答ベンチマークである。
このデータセットには、56のスポーツで580のユニークなアクションを示す934の動画が含まれており、合計1896のアクションが選択できる。
我々は、このベンチマークでオープンでプロプライエタリな基礎モデルを評価し、最高のモデルであるGPT-4oが45.52%の精度を達成することを発見した。
論文 参考訳(メタデータ) (2024-10-08T07:55:09Z) - How can objects help action recognition? [74.29564964727813]
より優れたビデオモデルを設計するために、オブジェクトの知識をどのように利用できるかを検討する。
まず,入力トークンの少数の保持が可能なオブジェクト誘導型トークンサンプリング戦略を提案する。
第二に、オブジェクト情報で特徴表現を豊かにするオブジェクト認識アテンションモジュールを提案する。
論文 参考訳(メタデータ) (2023-06-20T17:56:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。