論文の概要: Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos
- arxiv url: http://arxiv.org/abs/2607.20903v1
- Date: Thu, 23 Jul 2026 03:54:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.273476
- Title: Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos
- Title(参考訳): サイドウォークのモーメント:よりリッチな表現は、常に人間に近いのか?
- Abstract要約: よりリッチな視覚表現が都市エンゲージメントの人間対応度を高めるかどうかを検討する。
われわれは、YouTubeから61人の1対1の都市ウォークビデオを使用し、ビデオ機能、時間平均画像(TAI)、オーディオ埋め込み、テキストベースのセマンティック記述の4つのモードでそれらを表現している。
- 参考スコア(独自算出の注目度): 4.7125066717595825
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We examine whether richer visual representations yield more human-aligned measures of urban engagement, using 61 first-person city-walk videos from YouTube segmented into over 50,000 ten-second clips and represented across four modalities: spatiotemporal video features, temporally averaged images (TAIs), audio embeddings, and text-based semantic descriptions. Spearman correlation analysis reveals the expected ordering along the temporal-richness continuum, with video features showing the strongest continuous alignment. However, this ordering breaks down under binary classification of high- versus low-engagement moments (the paradigm most commonly used to train perceptual scoring models), where TAIs consistently match or outperform video across most classifiers and quantile thresholds. An independent two-alternative forced-choice study on Amazon Mechanical Turk confirms that this parity reflects human judgment: participants identified engaging moments with comparable accuracy from TAIs and full video clips, while text performed substantially worse and audio remained near chance. Gap analysis reveals a functional dissociation: video features are advantaged in activity-driven scenes with dynamic content, whereas TAIs better align with human judgments in composition-driven scenes dominated by stable spatial structure. These findings challenge the assumption that richer representations are inherently more human-aligned, and suggest that perceptually grounded temporal compression can be a principled alternative to full video encoding.
- Abstract(参考訳): よりリッチな視覚表現が都市部エンゲージメントの人為的な指標となるかどうかを, 時空間映像の特徴, 時間平均画像(TAI), 音声埋め込み, テキストベースセマンティック記述の4つのモダリティに区分した, YouTubeの61人の都市ウォークビデオを用いて検討した。
スピアマン相関解析では、時間的豊かさの連続体に沿った予測順序が示され、ビデオの特徴は最も強い連続的アライメントを示す。
しかし、この順序付けは高エンゲージメントモーメントと低エンゲージメントモーメントのバイナリ分類(最も一般的に知覚的スコアリングモデルの訓練に使用されるパラダイム)によって破られる。
参加者は、TAIとフルビデオクリップから同等の精度でエンゲージメントモーメントを識別し、テキストは著しく悪化し、音声は近い確率で再生された。
映像特徴は動的内容を持つ活動駆動シーンにおいて有利であるが、TAIは安定な空間構造に支配される構成駆動シーンにおいて人間の判断とよく一致している。
これらの知見は、よりリッチな表現が本質的により人間的に整合しているという仮定に挑戦し、知覚的に基底付けられた時間圧縮がフルビデオ符号化の原則的な代替となることを示唆している。
関連論文リスト
- PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation [118.49150310327475]
PersonaShotは、マルチショットビデオ生成における物語の連続性に関する最初の人中心のベンチマークである。
約1,000のマルチショットセグメントと16のメトリクスがあり、物理的連続性、感情力学、映画文法にまたがっている。
論文 参考訳(メタデータ) (2026-08-17T15:34:54Z) - Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models [56.851611990473174]
動的ビジュアルコンテンツに対する推論は、大きな言語モデルにとって依然として中心的な課題である。
本稿では,時間的精度と推論一貫性を両立させる強化学習手法を提案する。
結果のモデルであるVideo R2は、複数のベンチマークでTAC、VAS、精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-11-28T18:59:58Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding [6.980340270823506]
SceneRAGは,映像を物語に一貫性のあるシーンに分割するフレームワークである。
各シーンについて、このフレームワークは視覚とテキストの両方のモダリティから情報を融合し、エンティティ関係を抽出する。
LongerVideosベンチマークの実験では、134時間以上の多様なコンテンツがあり、SceneRAGが以前のベースラインを大幅に上回っていることを確認した。
論文 参考訳(メタデータ) (2025-06-09T10:00:54Z) - TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos [26.97196583891564]
本稿では,高密度ダイナミックビデオの微粒化理解のための時間指向ベンチマークTUNAを紹介する。
我々のTUNAは様々なビデオシナリオとダイナミックスを備えており、解釈可能で堅牢な評価基準によって支援されている。
この評価は、アクション記述の制限、多目的理解の不十分、カメラモーションに対する感度の低下など、ビデオの時間的理解における重要な課題を明らかにする。
論文 参考訳(メタデータ) (2025-05-26T15:24:06Z) - TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models [75.42002690128486]
TemporalBenchは、ビデオの微細な時間的理解を評価するための新しいベンチマークだ。
ビデオクリップの時間的ダイナミクスを詳述した2Kの高品質な人間のアノテーションから派生した10KのビデオQ&Aペアで構成されている。
GPT-4oのような最先端のモデルは、TemporalBench上で38.5%の質問応答精度しか達成していない。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model [9.762722976833581]
現在のモデルは、ビデオと言語間のインスタンスレベルのアライメントに大きく依存している。
我々は、人間の知覚からインスピレーションを得て、エゴビデオ表現のための構成的アプローチを探求する。
論文 参考訳(メタデータ) (2024-06-01T05:41:12Z) - Audio-Visual Contrastive Learning with Temporal Self-Supervision [84.11385346896412]
人間の監督なしにRGBフレームと付随するオーディオの両方の表現を学習するビデオのための自己教師付き学習手法を提案する。
ビデオに固有の時間的・聴覚的次元を活用するために,本手法は時間的自己監督を音声視覚設定に拡張する。
論文 参考訳(メタデータ) (2023-02-15T15:00:55Z) - Time Is MattEr: Temporal Self-supervision for Video Transformers [72.42240984211283]
我々は、時間的ダイナミクスをよりよく学習するために、ビデオモデルのための単純で効果的な自己教師型タスクを設計する。
ビデオフレームの時間順序を余分な自己監督として学習し、ランダムにシャッフルされたフレームを低信頼出力に強制する。
様々なビデオ行動認識タスクにおいて,本手法の有効性と最先端のビデオ変換器との互換性を実証する。
論文 参考訳(メタデータ) (2022-07-19T04:44:08Z) - Controllable Augmentations for Video Representation Learning [34.79719112810065]
本稿では,ローカルクリップとグローバルビデオを併用して,詳細な地域レベルの対応から学習し,時間的関係を最小化する枠組みを提案する。
我々のフレームワークは、アクション認識とビデオ検索の3つのビデオベンチマークよりも優れており、より正確な時間的ダイナミクスを捉えることができる。
論文 参考訳(メタデータ) (2022-03-30T19:34:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。