論文の概要: GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models
- arxiv url: http://arxiv.org/abs/2604.10385v1
- Date: Sun, 12 Apr 2026 00:01:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.985948
- Title: GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models
- Title(参考訳): GTASA:ビデオモデルの時空間解析・評価・訓練のための接地真実アノテーション
- Authors: Nicolae Cudlenco, Mihai Masala, Marius Leordeanu,
- Abstract要約: 本稿では、フレームごとの空間グラフとイベントレベルの時間マッピングを備えたマルチアクタービデオのコーパスであるGTASAを紹介する。
宇宙時間におけるイベントのグラフ (EST: GEST-Engine) に基づいて生成する。
11の時間的推論タスクで4つの凍結ビデオエンコーダを探索することで、GTASAの正確な3D基底真理が実現された。
- 参考スコア(独自算出の注目度): 4.964902130083661
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generating complex multi-actor scenario videos remains difficult even for state-of-the-art neural generators, while evaluating them is hard due to the lack of ground truth for physical plausibility and semantic faithfulness. We introduce GTASA, a corpus of multi-actor videos with per-frame spatial relation graphs and event-level temporal mappings, and the system that produced it based on Graphs of Events in Space and Time (GEST): GEST-Engine. We compare our method with both open and closed source neural generators and prove both qualitatively (human evaluation of physical validity and semantic alignment) and quantitatively (via training video captioning models) the clear advantages of our method. Probing four frozen video encoders across 11 spatiotemporal reasoning tasks enabled by GTASA's exact 3D ground truth reveals that self-supervised encoders encode spatial structure significantly better than VLM visual encoders.
- Abstract(参考訳): 複雑なマルチアクターシナリオのビデオの生成は、最先端のニューラルジェネレータでも難しいが、物理的妥当性とセマンティック忠実性に対する基礎的真理が欠如しているため、評価は難しい。
GTASAは、フレームごとの空間関係グラフとイベントレベルの時間マッピングを備えたマルチアクタービデオのコーパスであり、GEST-Engine(空間と時間における事象グラフ)をベースとしたシステムである。
提案手法をオープン・クローズド・ソースのニューラルジェネレータと比較し,定性的に(物理的妥当性とセマンティックアライメントの人間による評価),定量的に(ビデオキャプションモデルのトレーニングを通じて)本手法の明確な利点を証明した。
GTASAの正確な3次元基底真理によって実現された11の時空間推論タスクで4つの凍結ビデオエンコーダを探索すると、自己監督エンコーダがVLMビジュアルエンコーダよりもかなり良い空間構造をエンコーダが符号化されていることが分かる。
関連論文リスト
- Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding [50.098085774845195]
本稿では,大規模生成モデルにおいて暗黙の空間的先行性を活用することで,パラダイムシフトを提案する。
GeneEGA-3D (Video Extracted Generative Awareness) は,事前学習した映像拡散モデルを潜在世界シミュレータとして再利用するプラグイン・アンド・プレイ・フレームワークである。
論文 参考訳(メタデータ) (2026-03-19T17:59:58Z) - Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning [18.15310805625469]
マルチモーダルビデオ言語モデル(Video-LMs)を評価するための新しいベンチマークであるKnow-Showを提案する。
Know-Showは、空間的(人、物、人、物)と時間的次元の5つのシナリオからなる単一の評価枠組み内での推論と局所化を統一する。
Charades、Action Genome、Ego4Dから2.5万の人間の言語質問で作られたこのベンチマークは、現在のビデオ-LMと人間の推論の間に大きなギャップを露呈している。
このギャップを埋めるために、我々は、きめ細かい接地でビデオ-LMを増強するトレーニング不要なプラグインであるGRAMを提案する。
論文 参考訳(メタデータ) (2025-12-05T08:15:49Z) - SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding [64.86119288520419]
マルチモーダル言語モデルは時間と空間の空間的推論に苦しむ。
SIMS-Vは3次元シミュレータの特権情報を利用するシステムデータ生成フレームワークである。
提案手法は,実世界の空間的タスクの具体的改善を図りながら,一般的な映像理解の性能を維持しながら,堅牢な一般化を実証する。
論文 参考訳(メタデータ) (2025-11-06T18:53:31Z) - Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence [70.2803680525165]
我々は、明示的な証拠をビデオ推論に統合する非エージェントフレームワークであるOpen-o3 Videoを紹介した。
このモデルは、キーオブジェクトとバウンディングボックスをその答えとともに強調し、推論を具体的な視覚的な観察で基礎付けることができる。
V-STARベンチマークでは、Open-o3 Videoは最先端のパフォーマンスを達成し、mAMを14.4%、mLタイムスタンプを24.2%向上させた。
論文 参考訳(メタデータ) (2025-10-23T14:05:56Z) - ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models [63.12671761097701]
視覚言語モデル(Ms)は、移動距離や移動物体の速度などの要素を分析するのに苦労する。
我々はSTKitとST-Benchと呼ばれるベンチマークデータセットを構築した。
本稿では,ST-VLMが多様な領域やタスクにまたがって頑健に一般化されていることを示す。
論文 参考訳(メタデータ) (2025-03-25T05:08:06Z) - LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision [58.6039004982056]
本稿では,ビデオキャプションのみを用いて,ジェネレータの訓練を可能にするニューロシンボリックフレームワークを提案する。
アライメントアルゴリズムは、微分可能なシンボリック推論を利用することにより、弱い監督の課題を克服する。
提案手法を,OpenPVSG,20BN,MUGENの3つのビデオデータセット上で評価した。
論文 参考訳(メタデータ) (2023-04-15T22:24:05Z) - Autoencoding Video Latents for Adversarial Video Generation [0.0]
AVLAEは2ストリームの遅延オートエンコーダであり、ビデオ配信は敵の訓練によって学習される。
提案手法は, 発生器の明示的な構造構成を伴わずとも, 動きや外見の符号を乱すことを学習できることを実証する。
論文 参考訳(メタデータ) (2022-01-18T11:42:14Z) - Self-supervised Video Representation Learning by Uncovering
Spatio-temporal Statistics [74.6968179473212]
本稿では,自己指導型学習問題に対処する新しい前提課題を提案する。
最大運動の空間的位置や支配的な方向など,分割的・時間的統計的な要約を連続して計算する。
ビデオフレームを入力として与えられた統計的要約を得るために、ニューラルネットワークを構築して訓練する。
論文 参考訳(メタデータ) (2020-08-31T08:31:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。