論文の概要: MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs
- arxiv url: http://arxiv.org/abs/2609.09528v1
- Date: Tue, 08 Sep 2026 23:15:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.843354
- Title: MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs
- Title(参考訳): MotionBlind:ビデオLLMにおける動作理解のイライラを探る
- Abstract要約: ビデオ大言語モデル (Video-LLMs) は、世界モデルの知覚的フロントエンドとしてますます使われている。
我々は、物理的に接地されたモーションのための自己記録ビデオのコントラストベンチマークであるMotionBlindを紹介する。
Video-LLMは、同じ部屋で同じ人の2つのクリップを見ることができる。
- 参考スコア(独自算出の注目度): 4.006324106431453
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Video large language models (Video-LLMs) are increasingly used as the perceptual front end of world models, a role that assumes they can read motion: how fast something moves, which way it travels, how hard it is pushed. We show they cannot. A Video-LLM can watch two clips of the same person in the same room, name every object in both, and still fail to say which clip moves faster. We introduce MotionBlind, a contrastive benchmark of self-recorded video for physically grounded motion(speed, magnitude, and direction), the variables a world model must predict. Each instance is a pair of near-identical clips that differ only in motion. Each clip carries two complementary yes/no questions, giving four items per instance, and a model earns credit only if all four are correct. We report Instance Accuracy(IAcc), which has a 6.25% chance floor. Single-frame, appearance, and language-only shortcuts all collapse to it. MotionBlind complements the recent TimeBlind benchmark. We run a controlled study of six open and two frontier Video-LLMs, varying whether the video is present, whether frames are shown in the correct temporal order, and how frames are sampled (1 to 24 frames, four selection strategies). Open models sit near the 6.25% floor, and scale does not help. Removing the video drops every model to zero IAcc, and shuffling frames collapses IAcc to chance, so the task genuinely needs video in order. Neither more frames nor smarter frame selection closes the gap, because these change which frames are seen, not whether motion is read. Only Gemini3.1 Pro clears the benchmark overall, and even it fails on speed. A frontend that cannot tell two speeds of the same action apart is not yet a trustworthy source of supervision, reward, or evaluation for a world model.
- Abstract(参考訳): ビデオ大言語モデル(Video-LLMs)は、世界モデルの知覚的なフロントエンドとして、動きの速さ、移動の仕方、押すのがいかに難しいかを仮定する役割として、ますます使われている。
できないと示します。
Video-LLMは、同じ部屋で同じ人の2つのクリップを見ることができる。
我々は、世界モデルが予測しなければならない動き(速度、大きさ、方向)を物理的にグラウンド化するための自己記録ビデオのコントラストベンチマークであるMotionBlindを紹介する。
それぞれのインスタンスは、動きだけが異なる、ほぼ同一のクリップのペアです。
各クリップには2つの補足的なイエス/ノー質問があり、インスタンス毎に4つのアイテムが与えられている。
我々は6.25%の確率フロアを持つインスタンス精度(IAcc)を報告する。
単一フレーム、外観、言語のみのショートカットがすべて崩壊する。
MotionBlindは最近のTimeBlindベンチマークを補完する。
我々は,映像の有無,フレームが正しい時間順に表示されているか,フレームがどのようにサンプリングされているか(1~24フレーム,4選択戦略),6つのオープンおよび2つのフロンティアビデオ-LLMを制御した研究を行う。
オープンモデルは6.25%階の近くにあり、スケールは役に立たない。
動画の削除はすべてのモデルをIAccゼロに落とし、シャッフルフレームはIAccを偶然に崩壊させます。
フレームやよりスマートなフレーム選択がギャップを埋めることはない。
Gemini3.1 Proだけがベンチマークを全体としてクリアし、高速で失敗する。
同じ行動の2つの速度を区別できないフロントエンドは、世界モデルの監督、報酬、評価の信頼できる情報源ではありません。
関連論文リスト
- TEMPO: Learning Temporal Context for Dynamic Robot Manipulation [12.057683796484232]
本稿では、事前訓練されたVLAを2つの時間入力で拡張し、動きのあいまいさと状態のエイリアスを解消するTEMPOを提案する。
ボトルハンドオーバの成功を44%から74%に改善し、状態エイリアスを解決する唯一の方法である。
さらに、動作認識ロボットの知覚を評価するために、50k以上の注釈付きフレームのベンチマークであるTEMPO-Benchをリリースする。
論文 参考訳(メタデータ) (2026-09-15T08:56:52Z) - ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow [24.623235518370695]
我々は、インタラクティブなビデオワールドモデルの任意のアクション、フレームレベル制御に対する新しいアプローチであるShadowDancerを提示する。
既存のインターフェイスはアクションを緩やかにエンコードし、モデルが即興的に展開する方法を残したり、構造化された信号を通じて正確にエンコードしたりする。
ShadowDancer氏はこれを,2つの重要なイノベーション – シャドウペア,独立して再サンプリングされた外観の下で同じダイナミクスを再生するビデオペア,シャドウ間の予測 – で対処する。
論文 参考訳(メタデータ) (2026-07-30T15:28:43Z) - Frames2LoRA: Parametric Video Internalization for Vision-Language Models [52.46510577817688]
Frames2LoRAはパラメトリックビデオ内部化の手法である。
知覚者ハイパーネットワークは、層ごとに生成された中間表現を読み出し、凍結されたVLMがビデオをエンコードする。
ローランド適応 (LoRA) アダプタを1つのフォワードパスで生成する。
論文 参考訳(メタデータ) (2026-06-03T02:07:35Z) - What-If World: A Causal Benchmark for General World Models in Embodied Scenarios [23.527918480081013]
ビデオ生成モデルは、運転やロボット操作といったタスクのための世界シミュレータとして、ますます使われている。
これらの設定で重要なのは、単一のビデオが正しく見えるかどうかではなく、入力が変わったときにモデルの出力が変わるかどうかです。
我々は、同じシーンを1つの物理的詳細で記述した2つのプロンプトをモデルに与え、この2つのビデオが物理の予測方法が異なるかどうかを確認することによって、これを検証した。
論文 参考訳(メタデータ) (2026-05-26T19:02:26Z) - DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction [73.7305982336243]
DuoMoは、ノイズや不完全な観察で制約のないビデオから世界空間の座標で人間の動きを復元する生成方法である。
本手法は,運動学習を2つの拡散モデルに分解することでこの問題に対処する。
この2つのモデルは、ノイズや不完全な観察からでも、様々なシーンや軌道をまたいで動きを再構築することができる。
論文 参考訳(メタデータ) (2026-03-03T18:54:17Z) - In-2-4D: Inbetweening from Two Single-View Images to 4D Generation [63.68181731564576]
Inbetween-2-4Dという,2枚のシングルビュー画像を補間する4次元(つまり3D + モーション)の生成問題を提案する。
テキストや1つの画像のみからの映像/4D生成とは対照的に、補間タスクはより正確なモーション制御を利用して生成をよりよく制約することができる。
論文 参考訳(メタデータ) (2025-04-11T09:01:09Z) - Follow-Your-Click: Open-domain Regional Image Animation via Short
Prompts [67.5094490054134]
簡単なユーザクリックで画像アニメーションを実現するために,Follow-Your-Clickという実用的なフレームワークを提案する。
我々のフレームワークは、従来の方法よりもシンプルで正確なユーザ制御と、より優れた生成性能を備えています。
論文 参考訳(メタデータ) (2024-03-13T05:44:37Z) - Masked Motion Encoding for Self-Supervised Video Representation Learning [84.24773072241945]
Masked Motion MMEは、外観情報と動作情報の両方を再構成し、時間的手がかりを探索する新しい事前学習パラダイムである。
物体の位置変化や形状変化を追跡することで、人間が行動を認識することができるという事実を動機として、マスク領域におけるこれらの2種類の変化を表す運動軌跡を再構築することを提案する。
我々のMMEパラダイムで事前訓練されたモデルでは、長期的かつきめ細かな動きの詳細を予測できる。
論文 参考訳(メタデータ) (2022-10-12T11:19:55Z) - Revealing Single Frame Bias for Video-and-Language Learning [115.01000652123882]
単一フレームのトレーニングモデルでは,トレーニングに複数のフレームを使用する既存手法よりも優れたパフォーマンスが得られることを示す。
この結果は、人気のあるビデオおよび言語データセットに強い「静的な外観バイアス」が存在することを明らかにする。
本稿では、時間的モデリングを促進するために、既存のきめ細かい行動認識データセットに基づく2つの新しい検索タスクを提案する。
論文 参考訳(メタデータ) (2022-06-07T16:28:30Z) - No frame left behind: Full Video Action Recognition [26.37329995193377]
我々は全映像の動作認識を提案し,全映像のフレームを考察する。
まず、時間次元に沿って全てのフレームアクティベーションをクラスタ化する。
次に、時間的にクラスタ内のフレームをより少ない数の表現に集約する。
論文 参考訳(メタデータ) (2021-03-29T07:44:28Z) - Layered Neural Rendering for Retiming People in Video [108.85428504808318]
そこで本研究では,通常の自然ビデオで人々をリタイピングする手法を提案する。
異なる動きを時間的に調整したり、特定の動作の速度を変更したり、選択した人々をビデオから完全に「排除」したりできます。
このモデルの主な特徴は、入力ビデオ中の各人物の直接の動きを分離するだけでなく、各人物が生成するシーンの変化と自動的に関連付けることである。
論文 参考訳(メタデータ) (2020-09-16T17:48:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。