論文の概要: VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.09396v1
- Date: Tue, 08 Sep 2026 19:50:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.80153
- Title: VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models
- Title(参考訳): VANTAGE-Bench:ビジョンランゲージモデルにおけるインフラストラクチャAIギャップの評価
- Abstract要約: 物理AIのクラス: インフラストラクチャAIは、オープンループロギングの洞察のために固定カメラに依存している。
私たちは、この"インフラAIギャップ"を測定するベンチマークであるVANTAGE-Benchを紹介します。
我々は、ゼロショットを17モデル評価し、一般ではなく、消費者中心のベンチマークに対する欠点が集中していることを見出した。
- 参考スコア(独自算出の注目度): 6.534399108411788
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Vision-Language Models (VLMs) advance toward physical deployment, the focus has remained on action-oriented Embodied AI evaluated on subject-centric consumer video. This overlooks a pervasive class of Physical AI: Infrastructure AI, which relies on fixed cameras for open-loop insights like safety monitoring and operational logging. We introduce VANTAGE-Bench, a benchmark measuring this "Infrastructure AI Gap." It spans three operational domains (Logistics, Transportation, and Smart Spaces), unifies image and video evaluation across semantic, spatial, temporal, and spatio-temporal capabilities, and moves beyond multiple-choice to eight task formulations including dense captioning and spatio-temporal grounding. It adds a single-pass trajectory protocol for Single Object Tracking and, to our knowledge, the first such evaluation on fixed-camera infrastructure video, scored against specialist trackers. Annotation spans three regimes over 3,346 media assets: 3,342 video-task annotations, 4,281 image-grounding annotations, and 27,404 detection boxes. Evaluating 17 models zero-shot, we find the shortfall relative to consumer-centric benchmarks is concentrated, not general. Event verification, referring expressions, and temporal localization fall roughly 9 to 24 points at every model scale, while video question answering stays within 5.3 points of VideoMME and 2D spatial pointing shows no shortfall against BLINK. The temporal pillar is weakest in absolute terms: no system exceeds 55.7 mIoU on temporal localization or 37.3 SODA_c on dense video captioning. On tracking, frontier models come within roughly 5 points of specialist trackers over short horizons but separate as the horizon extends. Open-weight models lead 2D object localization outright, so neither scale nor proprietary access explains the pattern. Data, evaluation harness, and leaderboard: https://vantage-bench.org/
- Abstract(参考訳): VLM(Vision-Language Models)が物理的な展開に向けて前進するにつれ、アクション指向のEmbodied AIは、主観中心のコンシューマビデオで評価され続けている。
インフラストラクチャAIは、安全監視や運用ログといったオープンループの洞察のために固定カメラに依存している。
本稿では、この「インフラAIギャップ」を測定するベンチマークであるVANTAGE-Benchを紹介する。
3つの操作領域(ロジスティックス、トランスポーテーション、スマートスペース)にまたがり、意味、空間的、時間的、時空間的、時空間的な機能にまたがって画像とビデオの評価を統一し、密接なキャプションや時空間的接地を含む8つのタスクの定式化を超越する。
シングルオブジェクト追跡のためのシングルパストラジェクトリプロトコルを追加し、我々の知る限り、プロのトラッカーに対して測定された固定カメラインフラストラクチャビデオにおいて、このような評価を初めて行った。
アノテーションは3,346以上のメディア資産(ビデオタスクアノテーション3,342、画像グラウンドアノテーション4,281、検出ボックス27,404)にまたがる。
ゼロショットで17モデルを評価すると、一般のベンチマークよりも消費者中心のベンチマークに対する欠点が集中していることがわかる。
イベント検証、参照式、時間的局所化は、各モデルスケールで約9~24ポイント減少し、ビデオ質問応答はビデオMMEの5.3ポイント以内に留まり、2次元空間的ポインティングは、BLINKに対する欠点を示さない。
時間的柱は絶対的に最も弱く、時間的局所化で55.7 mIoUを超える系や、高密度ビデオキャプションで37.3 SODA_cを超える系はない。
追跡では、フロンティアモデルは約5ポイントの専門トラッカーが短い地平線上に存在するが、地平線が広がるにつれて分離される。
オープンウェイトモデルは2Dオブジェクトのローカライゼーションを直接リードするので、スケールもプロプライエタリアクセスもパターンを説明しません。
データ、評価ハーネス、リーダーボード:https://vantage-bench.org/
関連論文リスト
- TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models [7.348671989582267]
ビジュアルグラウンドティングは言語参照をターゲットにマッピングし、視覚言語モデルによるオープンボキャブラリ認識の中心となる。
我々は、フレーム間のオブジェクト対応を検出し、オブジェクトの存在状態を明示的にモデル化するVLMネイティブフレームワークであるTempoGroundを紹介する。
さらに、検証可能なグラウンド、アイデンティティ、一貫性の報酬でTempoGroundを最適化するStreaming Grounding Reinforcement (SGR)を紹介します。
論文 参考訳(メタデータ) (2026-09-02T09:30:08Z) - TAPVid-MV: A Benchmark for Tracking Any Point in 3D Across Multiple Views [50.26507994908593]
この設定の最初のベンチマークであるTAPVid-MV(Tracking Any Point in Video across Multiple Views)を紹介します。
キュレートされた284のシーケンス、1,142のキャリブレーションされたカメラストリーム、109,769のトラックが、屋内と屋外のドメインにまたがる7つのサブセットにまたがっている。
本研究では,センサ深度,LiDAR,SLAM,SfM点,ヒューマンメッシュ,ポーズされたオブジェクトメッシュ,シミュレーションといった,データセット固有の補助的モダリティを用いてこれらのトラジェクトリを解析し,各シーケンスとトラジェクトリを人間のアノテーションによって視覚的に検証する。
論文 参考訳(メタデータ) (2026-09-01T21:58:51Z) - RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos? [24.603802871747092]
本研究では,連続的リモートセンシング映像理解に基づく視覚言語モデル評価のための統一的評価設定を開発する。
フレーム間の質問時間領域を選択する小対象焦点のための強化学習フレームワークであるRSVideoを紹介する。
RSVideoはInternVL3.5-14Bで最大9.01%の改善を達成し、Qwen3.6-27Bで最高40.63%に達した。
論文 参考訳(メタデータ) (2026-08-03T10:34:42Z) - LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence [107.63317552620231]
LLaVA-OneVision-2(LLaVA-OV-2)について述べる。
幅広いマルチモーダルベンチマークで優れたパフォーマンスを実現している。
際立った能力は、ビデオ理解、時間的接地、空間的接地、操作言語推論にまたがる統一的な認識である。
論文 参考訳(メタデータ) (2026-05-25T15:54:04Z) - ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search [49.61286310968402]
我々は,対話型推論問題として,マルチカメラの人物探索を再構成する最初のベンチマークとフレームワークであるARGOSを紹介する。
ARGOSエージェントはあいまいな目撃声明を受け取り、何を尋ねるか、いつ空間的または時間的ツールを呼び出すか、不明瞭な応答をどう解釈するかを判断しなければならない。
このベンチマークは、意味的知覚(Who)、空間的推論(Where)、時間的推論(When)の3つのプログレッシブトラックにおいて、14の現実世界シナリオにまたがる2,691のタスクからなる。
論文 参考訳(メタデータ) (2026-04-14T14:06:19Z) - MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence [61.065486539729875]
MMSI-Video-Bench(MMSI-Video-Bench)は、MLLMにおけるビデオベースの空間知能の完全な人為的なベンチマークである。
4段階のフレームワークである知覚、計画、予測、クロスビデオ推論を運用しており、1,278のクリップで1,106の質問を下敷きにしている。
オープンソースとプロプライエタリなMLLMを25種類評価し,AIギャップが顕著であることを明らかにした。
論文 参考訳(メタデータ) (2025-12-11T17:57:24Z) - Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence [70.2803680525165]
我々は、明示的な証拠をビデオ推論に統合する非エージェントフレームワークであるOpen-o3 Videoを紹介した。
このモデルは、キーオブジェクトとバウンディングボックスをその答えとともに強調し、推論を具体的な視覚的な観察で基礎付けることができる。
V-STARベンチマークでは、Open-o3 Videoは最先端のパフォーマンスを達成し、mAMを14.4%、mLタイムスタンプを24.2%向上させた。
論文 参考訳(メタデータ) (2025-10-23T14:05:56Z) - Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames [17.975173937253494]
エゴセントリックなビデオを操作するAIアシスタントは、時間をかけて空間的な手がかりを統合する必要がある。
Disjoint-3DQAは、VLMのこの能力を評価するためのQAベンチマークである。
論文 参考訳(メタデータ) (2025-05-30T06:32:26Z) - ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models [63.12671761097701]
視覚言語モデル(Ms)は、移動距離や移動物体の速度などの要素を分析するのに苦労する。
我々はSTKitとST-Benchと呼ばれるベンチマークデータセットを構築した。
本稿では,ST-VLMが多様な領域やタスクにまたがって頑健に一般化されていることを示す。
論文 参考訳(メタデータ) (2025-03-25T05:08:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。