論文の概要: Video Models Reason Early: Exploiting Plan Commitment for Maze Solving
- arxiv url: http://arxiv.org/abs/2603.30043v1
- Date: Tue, 31 Mar 2026 17:58:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:03.970436
- Title: Video Models Reason Early: Exploiting Plan Commitment for Maze Solving
- Title(参考訳): 動画で見る「迷路解決の計画」
- Authors: Kaleb Newman, Tyler Zhu, Olga Russakovsky,
- Abstract要約: 本研究では,2次元迷路解をテストベッドとして用いた映像モデルの内部計画力学について検討する。
最初の発見は、ビデオ拡散モデルが最初の数ステップでハイレベルなモーションプランにコミットすることです。
第2の発見は、障害物密度ではなく経路長が迷路の難易度の主要な予測因子であり、12ステップの急激な故障閾値を持つことである。
- 参考スコア(独自算出の注目度): 23.115647054109306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video diffusion models exhibit emergent reasoning capabilities like solving mazes and puzzles, yet little is understood about how they reason during generation. We take a first step towards understanding this and study the internal planning dynamics of video models using 2D maze solving as a controlled testbed. Our investigations reveal two findings. Our first finding is early plan commitment: video diffusion models commit to a high-level motion plan within the first few denoising steps, after which further denoising alters visual details but not the underlying trajectory. Our second finding is that path length, not obstacle density, is the dominant predictor of maze difficulty, with a sharp failure threshold at 12 steps. This means video models can only reason over long mazes by chaining together multiple sequential generations. To demonstrate the practical benefits of our findings, we introduce Chaining with Early Planning, or ChEaP, which only spends compute on seeds with promising early plans and chains them together to tackle complex mazes. This improves accuracy from 7% to 67% on long-horizon mazes and by 2.5x overall on hard tasks in Frozen Lake and VR-Bench across Wan2.2-14B and HunyuanVideo-1.5. Our analysis reveals that current video models possess deeper reasoning capabilities than previously recognized, which can be elicited more reliably with better inference-time scaling.
- Abstract(参考訳): ビデオ拡散モデルは迷路やパズルを解くなど、突発的な推論能力を示すが、世代間の理由についてはほとんど理解されていない。
我々はこの理解に向けて第一歩を踏み出し、制御されたテストベッドとして2次元迷路解法を用いてビデオモデルの内部計画力学を研究する。
私たちの調査では2つの結果が判明した。
ビデオ拡散モデルは、最初の数ステップでハイレベルなモーションプランにコミットし、その後さらに視覚的細部を変化させるが、下層の軌道は変えない。
第2の発見は、障害物密度ではなく経路長が迷路の難易度の主要な予測因子であり、12ステップの急激な故障閾値を持つことである。
つまり、ビデオモデルは、連続した世代をチェーンすることで、長い迷路を乗り越えることしかできない。
この結果の実用的メリットを実証するために、我々は、早期計画(Chaining with Early Planning)またはChEaP(Chaining with Early Planning)を導入しました。
これにより、長距離迷路の精度は7%から67%に向上し、Wan2.2-14BとHunyuanVideo-1.5をまたいだ凍結湖とVR-Benchでのハードタスク全体の2.5倍向上する。
分析の結果,現在のビデオモデルは従来よりも深い推論能力を有しており,推論時間のスケーリングが向上した上で,より確実な推論が可能であることが判明した。
関連論文リスト
- Demystifing Video Reasoning [71.53763299316041]
ビデオモデルにおける推論は、主に拡散認知のステップに沿って現れることを示す。
モデル性能に重要ないくつかの創発的推論行動を特定する。
これらの知見に触発され、私たちは概念実証としてトレーニングフリー戦略を提示した。
論文 参考訳(メタデータ) (2026-03-17T17:59:55Z) - Streaming Autoregressive Video Generation via Diagonal Distillation [50.13573884115673]
自己回帰モデルは、シーケンシャルフレーム合成のための自然なフレームワークを提供するが、高い忠実性を達成するためには重い計算を必要とする。
ビデオチャンクとデノイングステップの時間的情報を活用するために,ダイアゴナル蒸留を提案する。
本手法は,2.61秒(最大31FPS)で5秒ビデオを生成し,未蒸留モデル上で277.3倍のスピードアップを実現する。
論文 参考訳(メタデータ) (2026-03-10T10:45:24Z) - SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning [53.67654657011112]
SAGEは、1ターンでより単純な問題を処理しながら、長いビデオのマルチターン推論を行うエージェントシステムである。
さらに,SAGE-MMにおける任意の水平推論能力を注入するための効果的なRLポストトレーニングレシピを提案する。
提案手法の有効性を実証的に検証し,オープンエンドビデオ推論タスクにおいて最大6.1%の顕著な改善が見られた。
論文 参考訳(メタデータ) (2025-12-15T20:14:19Z) - RoboEnvision: A Long-Horizon Video Generation Model for Multi-Task Robot Manipulation [30.252593687028767]
ロボット操作作業のための長距離ビデオ生成の問題に対処する。
本稿では,自己回帰生成の必要性を回避できる新しいパイプラインを提案する。
提案手法は,ビデオ品質と一貫性の2つのベンチマークにおいて,最先端の結果を達成している。
論文 参考訳(メタデータ) (2025-06-27T08:21:55Z) - Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning? [56.06537213958482]
本稿では,MLLMの複雑なビデオ推論能力を評価するためのベンチマークであるVideo-Holmesを紹介する。
Video-Holmesは270本の手動注釈付きサスペンス短編映画から1,837の質問で構成されている。
最新のMLLMを包括的に評価した結果,これらのモデルは視覚的知覚に優れるが,情報の統合にはかなりの困難が伴うことが明らかとなった。
論文 参考訳(メタデータ) (2025-05-27T16:05:01Z) - Training-Free Efficient Video Generation via Dynamic Token Carving [54.52061549312799]
Jengaは、ダイナミックアテンション彫刻とプログレッシブレゾリューション生成を組み合わせた推論パイプラインである。
プラグアンドプレイのソリューションとして、Jengaは現代のハードウェアで実用的な高品質のビデオ生成を可能にする。
論文 参考訳(メタデータ) (2025-05-22T16:21:32Z) - VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models [29.706347050700867]
ビデオベース長周期因果推論(VCRBench)という新しいベンチマークを導入する。
VCRBenchは、LVLM(Large Video Language Model)が特定の目標を達成するために必要なイベントを特定し、推論し、正しくシーケンスできるかどうかをテストする。
本稿では,ビデオに基づく因果推論を,ビデオ認識と因果推論の2つのサブタスクに分割するモジュラーアプローチである認識推論分解(RRD)を提案する。
論文 参考訳(メタデータ) (2025-05-13T11:35:58Z) - Human Motion Diffusion as a Generative Prior [20.004837564647367]
拡散先行に基づく3種類の合成法を提案する。
長いシーケンス生成の課題に取り組みます。
並列合成を用いて、2人の世代に向けた有望なステップを示す。
論文 参考訳(メタデータ) (2023-03-02T17:09:27Z) - Localizing Moments in Long Video Via Multimodal Guidance [51.72829274071017]
本研究では,非記述可能なウィンドウを識別し,抽出することにより,長いビデオにおける自然言語グラウンドリングの性能を向上させる手法を提案する。
実験の結果,提案手法はMADが4.1%,Ego4Dが4.52%,最先端モデルが4.1%向上することがわかった。
論文 参考訳(メタデータ) (2023-02-26T18:19:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。