論文の概要: RobotEQ-Video: A Video-Centric Benchmark for Social Proactive Intelligence with World-State Taxonomy
- arxiv url: http://arxiv.org/abs/2609.21371v1
- Date: Fri, 18 Sep 2026 06:35:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.881176
- Title: RobotEQ-Video: A Video-Centric Benchmark for Social Proactive Intelligence with World-State Taxonomy
- Title(参考訳): RobotEQ-Video: 社会活動知能と世界国家の分類のためのビデオ中心ベンチマーク
- Abstract要約: 我々は、画像中心からビデオ中心の分析へと焦点をシフトするRobotEQ-Videoを紹介した。
動作適性を評価するため,100K以上の人的アノテーションと16K以上のラベルで2K以上の動画をベンチマークした。
この研究は、静的画像からダイナミックビデオへのSPI研究を前進させ、ベンチマーク中により包括的なシナリオカバレッジを保証する。
- 参考スコア(独自算出の注目度): 27.434407039549402
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Social Proactive Intelligence (SPI) extends proactive assistance beyond task completeness to consider social appropriateness in diverse embodied scenarios. However, prior SPI research faces two key limitations. First, existing work focuses on static images, whereas dynamic videos provide crucial cues for inferring human states and needs, offering richer information than isolated images. Second, prior work often relies on free-form data collection pipelines, which fail to guarantee comprehensive coverage of diverse scenarios. To address these gaps, we introduce RobotEQ-Video, shifting the focus from image-centric to video-centric analysis. To ensure comprehensive video coverage, we construct a hierarchical world-state taxonomy organized into a four-level coarse-to-fine structure, comprising 6 domains, 20 dimensions, 142 level-1 attributes, and 816 level-2 attributes. The resulting benchmark comprises 2K+ videos with 100K+ human annotations and 16K+ labels for assessing behavior properness. Benchmark evaluation reveals that current systems remain unreliable and fall short of human performance. We further explore how world models can help tackle this task. This work advances SPI research from static images to dynamic videos and ensures more comprehensive scenario coverage during benchmarking.
- Abstract(参考訳): ソーシャル・プロアクティブ・インテリジェンス (Social Proactive Intelligence, SPI) は、様々な実施シナリオにおける社会的適切性を検討するために、タスク完全性を超えて積極的な支援を拡張する。
しかし、以前のSPI研究は2つの重要な制限に直面していた。
まず、既存の研究は静的画像に焦点を当て、動的ビデオは人間の状態やニーズを推測するための重要な手がかりを提供し、孤立した画像よりも豊かな情報を提供する。
第2に、事前の作業は、さまざまなシナリオの包括的なカバレッジを保証するのに失敗する、フリー形式のデータ収集パイプラインに依存することが多い。
これらのギャップに対処するため、ロボットEQ-Videoを導入し、画像中心からビデオ中心の分析へと焦点を移した。
包括的ビデオカバレッジを確保するため,6つの領域,20次元,142のレベル-1属性,816のレベル2属性からなる4段階の粗粒構造に組織された階層的世界国家分類を構築した。
結果として得られたベンチマークは、100K以上の人間のアノテーションを備えた2K以上のビデオと16K以上のラベルから成っている。
ベンチマーク評価によると、現在のシステムは信頼性が低く、人間のパフォーマンスに欠けている。
我々は、世界モデルがこの課題にどう取り組むかをさらに探求する。
この研究は、静的画像からダイナミックビデオへのSPI研究を前進させ、ベンチマーク中により包括的なシナリオカバレッジを保証する。
関連論文リスト
- AHA - Predicting What Matters Next: Online Highlight Detection Without Looking Ahead [4.55107996328448]
Ahaは、自然言語で記述されたタスクに対する各ビデオフレームの関連性を予測する自動回帰ハイライト検出フレームワークである。
Ahaはハイライト検出ベンチマークで最先端(SOTA)のパフォーマンスを達成する。
我々は、タスク指向の自然言語入力と連続ロボット中心のビデオが与えられた現実世界のロボティクスアプリケーションに対するAhaの可能性を探求する。
論文 参考訳(メタデータ) (2025-09-19T21:03:00Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated
by AI [1.1035305628305816]
本稿では,様々なビデオ生成タスクを評価するために設計された,先駆的な総合ベンチマークであるAIGCBenchを紹介する。
等価条件下で異なる最先端アルゴリズムを評価する、多様なオープンドメインの画像テキストデータセット。
我々は、リッチテキストプロンプトを作成するために、新しいテキストコンバインダーとGPT-4を使用し、高度なテキスト・ツー・イメージモデルを用いて画像を生成する。
論文 参考訳(メタデータ) (2024-01-03T10:08:40Z) - DeVAn: Dense Video Annotation for Video-Language Models [68.70692422636313]
実世界のビデオクリップに記述を生成する視覚言語モデルの有効性を評価するために,人間の注釈付きデータセットを提案する。
データセットには、20秒から60秒間の8.5KのYouTubeビデオクリップが含まれており、幅広いトピックや関心事をカバーしている。
論文 参考訳(メタデータ) (2023-10-08T08:02:43Z) - ASOD60K: Audio-Induced Salient Object Detection in Panoramic Videos [79.05486554647918]
本研究では,パノラマビデオから有能な物体を分離する新しいタスクであるPV-SODを提案する。
既存の固定レベルやオブジェクトレベルの塩分濃度検出タスクとは対照的に,多モードの塩分濃度検出(SOD)に焦点を当てる。
AsOD60Kという,6レベル階層の4K解像度ビデオフレームを含む,最初の大規模データセットを収集する。
論文 参考訳(メタデータ) (2021-07-24T15:14:20Z) - Temporal Context Aggregation for Video Retrieval with Contrastive
Learning [81.12514007044456]
フレームレベルの特徴間の時間的長距離情報を組み込んだビデオ表現学習フレームワークTCAを提案する。
提案手法は,映像レベルの特徴を持つ最先端の手法に対して,FIVR-200Kでは17% mAPの大幅な性能上の優位性を示す。
論文 参考訳(メタデータ) (2020-08-04T05:24:20Z) - Dense-Caption Matching and Frame-Selection Gating for Temporal
Localization in VideoQA [96.10612095576333]
本稿では,マルチモーダルな入力源を効果的に統合し,時間的関連情報から質問に答えるビデオ質問応答モデルを提案する。
また,2レベルアテンション(単語・オブジェクト・フレームレベル),異なるソース(ビデオ・高密度キャプション)に対するマルチヘッド自己統合,ゲートへのより関連性の高い情報伝達などで構成されている。
当社のモデルは,各モデルコンポーネントが大きな利益をもたらす,難易度の高いTVQAデータセット上で評価され,全体的なモデルでは,最先端のモデルよりも大きなマージンで優れています。
論文 参考訳(メタデータ) (2020-05-13T16:35:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。