論文の概要: Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video
- arxiv url: http://arxiv.org/abs/2607.11078v1
- Date: Mon, 13 Jul 2026 04:37:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.329528
- Title: Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video
- Title(参考訳): ビデオLLMは本当に見るのか? 長いビデオで文字追跡の失敗を診断する
- Authors: Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki,
- Abstract要約: ビデオ大言語モデル(Video-LLM)のベンチマーク
しかし、そのスコアは名前のついた文字を追跡することや、もっと簡単なものから来ているのだろうか?
アーキテクチャ的に異なる3つのオープンソースビデオLLMに適用した9条件診断プロトコルでこれを検証する。
- 参考スコア(独自算出の注目度): 0.2624902795082451
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Can a Video Large Language Model (Video-LLM) follow one person through a long video, keeping track of who they are well enough to report, in order, how their outfit changes across a full TV episode? Benchmarks increasingly score this kind of task, and the strongest open-source 7--8B models now reach 37--38% on InfiniBench's global appearance task, which asks exactly that. But does that score come from tracking the named character, or from something easier? We test this with a nine-condition diagnostic protocol applied to three architecturally distinct open-source Video-LLMs, with Gemini~2.5~Flash as a frontier reference, and find the accuracy does not come from character tracking. When we change the character named in the question to a different cast member, leaving the video and answer options untouched, the models change their answer only 4--31% of the time, so they are largely ignoring who the question asks about. Breaking that test down by the gender of the swapped name shows why: the models react more when the name is changed to a different-gender character than to a same-gender one (a 13--28 point gap), picking up coarse gender cues but unable to tell same-gender individuals apart. This shallow processing surfaces again when we drop the multiple-choice options and ask the same questions open-endedly: open-source accuracy drops 18--25 points, with none of 151 answers fully correct, versus a 12-point drop for Gemini. Further checks rule out the obvious innocent explanations, adding subtitles, using the most informative frames, or doubling the number of frames all leave character tracking unimproved, so the bottleneck is not how much video the model sees but how it ties that video to the person the question names. We release a diagnostic toolkit for auditing what such benchmark scores actually measure.
- Abstract(参考訳): ビデオ大言語モデル(Video-LLM)は、長いビデオを通して1人の人物をフォローし、その人物の報告に十分な人数を記録している。
ベンチマークはますますこの種のタスクをスコア付けし、最も強力なオープンソース7--8Bモデルは、InfiniBenchのグローバルな外観タスクで37-38%に達している。
しかし、そのスコアは名前のついた文字を追跡することや、もっと簡単なものから来ているのだろうか?
そこで我々は,Gemini~2.5~Flashをフロンティア参照として,アーキテクチャ的に異なる3つのオープンソースビデオLLMに適用した9条件診断プロトコルを用いてこれを検証した。
質問で名前をつけたキャラクターを別のキャストメンバーに変更し、ビデオと回答オプションを未修正のままにしておくと、モデルは回答の4~31%だけを変更します。
スワップされた名前の性別によるテストのブレークダウンは、以下の理由を示している: モデルは、名前が同じ性別の人物(13-28ポイントのギャップ)に変更されたときよりも、異なる性別のキャラクターに変更されたときに、より多く反応し、粗い性別の手がかりを拾うが、同じ性別の個人を区別することができない。
オープンソースの精度は18~25ポイント低下し、151の答えが完全に正しかったのに対して、Geminiは12ポイント減った。
さらには、字幕の追加、最も情報に富んだフレームの使用、フレーム数の倍増など、明らかな無意味な説明を除外する。
このようなベンチマークスコアが実際に何を計測しているかを監査するための診断ツールキットをリリースする。
関連論文リスト
- When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection [21.933691657055075]
EVID-Benchは、ビデオ誤情報検出のためのベンチマークである。
AI生成、シングルソース編集、マルチソース編集の3つのカテゴリにまたがる9つの操作タイプにまたがる222のビデオで構成されている。
最良のシステムは61.43%のポイントレベルの精度と43.24%のビデオレベルの精度しか達成していないが、AI生成による操作は特に困難である。
論文 参考訳(メタデータ) (2026-06-02T18:03:35Z) - What-If World: A Causal Benchmark for General World Models in Embodied Scenarios [23.527918480081013]
ビデオ生成モデルは、運転やロボット操作といったタスクのための世界シミュレータとして、ますます使われている。
これらの設定で重要なのは、単一のビデオが正しく見えるかどうかではなく、入力が変わったときにモデルの出力が変わるかどうかです。
我々は、同じシーンを1つの物理的詳細で記述した2つのプロンプトをモデルに与え、この2つのビデオが物理の予測方法が異なるかどうかを確認することによって、これを検証した。
論文 参考訳(メタデータ) (2026-05-26T19:02:26Z) - VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition [107.13283099863123]
我々は37ドメインから1,000の異なるアクションをカバーするドメイン固有のアクション認識ベンチマークであるVideoNetを紹介する。
視覚言語モデル(VLM)は、コンテキスト内サンプルを十分に活用するのに苦労している。
ドメイン固有のアクションのための、最初の大規模なトレーニングデータセットを収集し、合計で500万近いビデオ質問応答ペアを収集する。
論文 参考訳(メタデータ) (2026-05-04T17:11:16Z) - HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering [13.370338205427911]
HERBenchはビデオQAのベンチマークで、時間をかけてマルチエビデンス統合を評価する。
HERBenchは、12の合成タスクで構成された26Kの5方向の多重選択質問で構成されている。
我々は、HERBenchが以前のデータセットよりもかなり高い需要を課していることを示す。
論文 参考訳(メタデータ) (2025-12-16T19:34:47Z) - MINERVA: Evaluating Complex Video Reasoning [72.12644008002566]
我々は、最新のマルチモーダルモデルのためのMINERVAと呼ばれる新しいビデオ推論データセットを提供する。
我々のデータセットはマルチモーダルであり、ビデオ領域と長さの点で多様であり、複雑なマルチステップの質問で構成されている。
我々は,様々なモデルにまたがる共通障害モードを特定するために,きめ細かいエラー解析を行い,推論エラーの分類を作成する。
論文 参考訳(メタデータ) (2025-05-01T17:41:49Z) - Lost in Time: A New Temporal Benchmark for VideoLLMs [48.71203934876828]
現在最も使われているビデオ言語ベンチマークは、時間的推論を必要とせずに解決可能であることを示す。
提案するTVBenchは,オープンソースのマルチ選択質問応答ベンチマークである。
論文 参考訳(メタデータ) (2024-10-10T09:28:36Z) - Perception Test: A Diagnostic Benchmark for Multimodal Video Models [78.64546291816117]
本稿では,事前学習したマルチモーダルモデルの知覚と推論能力を評価するために,新しいマルチモーダルビデオベンチマークを提案する。
知覚テストは、スキル(記憶、抽象化、物理学、セマンティックス)と、ビデオ、オーディオ、テキストモダリティ間の推論(記述的、説明的、予測的、反ファクト的)のタイプに焦点を当てている。
このベンチマークは、ゼロショット/少数ショットまたは限定的な微調整方式で、転送機能の事前訓練されたモデルを探索する。
論文 参考訳(メタデータ) (2023-05-23T07:54:37Z) - Learning Person Re-identification Models from Videos with Weak
Supervision [53.53606308822736]
本稿では、監督の弱いビデオから人物再識別モデルを学ぶ問題について紹介する。
このようなビデオレベルラベルを用いた人物再識別のための多段階注意学習フレームワークを提案する。
注意重みは、ビデオ中の人物追跡レットではなく、すべての人物画像に基づいて得られるため、学習したモデルはノイズの多いアノテーションの影響を受けにくくなる。
論文 参考訳(メタデータ) (2020-07-21T07:23:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。