論文の概要: ProAR: Learning Prospective Reasoning with Autoregressive Video Models
- arxiv url: http://arxiv.org/abs/2610.03664v1
- Date: Fri, 02 Oct 2026 17:37:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.532554
- Title: ProAR: Learning Prospective Reasoning with Autoregressive Video Models
- Title(参考訳): ProAR: 自己回帰ビデオモデルによる前向き推論の学習
- Abstract要約: 自己回帰ビデオモデル(ProAR)を用いた学習前向き推論を提案する。
ProARは自動回帰ビデオ生成をゴール指向の推論プロセスに変換する。
ProARの相補的なコンポーネントは、様々な視覚的推論ベンチマークにおけるパフォーマンスを一貫して改善することを示す。
- 参考スコア(独自算出の注目度): 24.64211642693866
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive (AR) video models excel at causal generation, but their reliance on next-chunk prediction confines them to a short-sighted, reactive paradigm. This limitation is particularly consequential for reasoning-oriented generation, where achieving a target outcome through valid intermediate states matters more than local visual plausibility. To address this challenge, we propose Learning Prospective Reasoning with Autoregressive Video Models (ProAR), a novel framework that transforms autoregressive video generation into a goal-oriented reasoning process. ProAR introduces two key components: (1) To anchor generation to the long-range outcome, we integrate goal-frame prediction into the autoregressive loop via an asymmetric attention mask, enabling the predicted goal frame to guide the generation of intermediate states without being disrupted by them. (2) To guide short-range transitions, we introduce future representation self-alignment to encourage current hidden states to anticipate upcoming temporal dynamics. By leveraging teacher-forcing in AR training, we extract clean future representations in a single forward pass and align current representations with them using a lightweight, training-only predictor. Together, these two mechanisms seamlessly combine explicit, sparse target supervision with implicit, dense step-wise guidance, promoting coherent, goal-directed reasoning progress with modest computational cost. Experiments show that ProAR's complementary components consistently improve performance across diverse visual reasoning benchmarks. The framework proves highly training-efficient, surpassing fully trained standard AR baselines using only 25% of the training steps. This paradigm also demonstrates promising applicability to embodied reasoning tasks.
- Abstract(参考訳): 自己回帰(AR)ビデオモデルは因果生成において優れているが、次のチャンク予測に依存しているため、短目でリアクティブなパラダイムに制限される。
この制限は推論指向の生成において特に重要であり、有効な中間状態を通じて目標となる結果を達成することは、局所的な視覚的可視性よりも重要である。
この課題に対処するために,自動回帰ビデオ生成を目標指向の推論プロセスに変換する新しいフレームワークである自動回帰ビデオモデル(ProAR)を用いた学習前向き推論を提案する。
ProAR は,(1) 長距離結果に生成を固定するために,非対称の注意マスクを用いて自己回帰ループに目標フレーム予測を統合することにより,予測された目標フレームが中間状態の生成を妨害されることなく誘導できるようにする。
2)短距離遷移を導くために,現在隠れている状態が今後の時間的ダイナミクスを予測できるように,未来表現の自己アライメントを導入する。
ARトレーニングにおける教師強制の活用により、単一前方パスにおけるクリーンな未来表現を抽出し、軽量なトレーニング専用予測器を用いて、現在の表現をそれらと整合させる。
これら2つのメカニズムは、暗黙的かつ疎密な目標監視と暗黙的かつ厳密なステップワイドガイダンスをシームレスに組み合わせ、厳密で目標指向の推論の進行を、控えめな計算コストで促進する。
実験の結果、ProARの補完的なコンポーネントは、様々な視覚的推論ベンチマークのパフォーマンスを一貫して改善している。
このフレームワークはトレーニング効率が高く、トレーニングステップの25%しか使用せず、完全にトレーニングされた標準ARベースラインを超えている。
このパラダイムはまた、推論タスクを具現化する有望な適用性を示している。
関連論文リスト
- FLaRA: Predicting Future Latent Representations for Accident Anticipation [15.994549120609358]
ダッシュカムビデオからの交通事故を予想することは、インテリジェント交通システムにおいて重要な課題である。
事故予知のための潜在表現を予測することで、このパラダイムをシフトさせる新しい予測アーキテクチャであるFLaRAを提案する。
提案手法は,現実的な早期警告機能を維持しつつ,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-06-12T12:16:45Z) - FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment [45.21358158991569]
VLAモデルは、世界モデリングとして知られる環境力学を予測することができる。
現在のアプローチでは,1) セマンティックラーニングと一般化を制約する画素レベルの再構成を過度に強調する訓練対象モデル,2) 推論中に予測される将来の観測への信頼が,しばしばエラーの蓄積につながる,という2つの問題に直面している。
これらの課題に対処するために、並列プログレッシブ拡張(FRAPPE)を介して、Future Representation Alignmentを導入する。
論文 参考訳(メタデータ) (2026-02-19T11:00:46Z) - Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations [53.91818843831925]
NExT-Vidは,新しい自己回帰型視覚生成事前学習フレームワークである。
本研究では,文脈分離型自己回帰予測器を導入し,セマンティック表現をターゲットデコーディングから切り離す。
文脈分離型フローマッチング事前学習により,本手法は強い表現を実現する。
論文 参考訳(メタデータ) (2025-12-24T07:07:08Z) - Next Interest Flow: A Generative Pre-training Paradigm for Recommender Systems by Modeling All-domain Movelines [8.895768051554162]
本稿では,eコマースレコメンデータシステムのための新しい生成事前学習パラダイムを提案する。
我々のモデルは,ユーザの将来の意図を表す密度の高いベクトル列であるNext Interest Flowを予測することを学ぶ。
パイプライン全体を実装した統合フレームワークである All-domain Moveline Evolution Network (AMEN) を提示する。
論文 参考訳(メタデータ) (2025-10-13T12:13:17Z) - Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation [110.03631978640298]
本稿では,視覚領域に次世代の予測パラダイムを適用するメカニズムについて,初めて体系的に検討する。
高レベルの視覚的意味論の学習を妨げる3つの重要な特性を同定する。
これらの課題は、訓練中に自己指導的目的を導入することで効果的に対処できることが示される。
論文 参考訳(メタデータ) (2025-09-18T17:47:40Z) - Ego-centric Predictive Model Conditioned on Hand Trajectories [52.531681772560724]
自我中心のシナリオでは、次の行動とその視覚的結果の両方を予測することは、人間と物体の相互作用を理解するために不可欠である。
我々は,エゴセントリックなシナリオにおける行動と視覚的未来を共同でモデル化する,統合された2段階予測フレームワークを提案する。
我々のアプローチは、エゴセントリックな人間の活動理解とロボット操作の両方を扱うために設計された最初の統一モデルである。
論文 参考訳(メタデータ) (2025-08-27T13:09:55Z) - Foresight in Motion: Reinforcing Trajectory Prediction with Reward Heuristics [34.570579623171476]
The First Reasoning, Then Forecasting”は、行動意図を軌道予測のための空間的ガイダンスとして明示的に組み込む戦略である。
本稿では,新しいクエリ中心の逆強化学習方式を基礎とした,解釈可能な報酬駆動型意図推論手法を提案する。
提案手法は軌道予測の信頼性を著しく向上させ,最先端手法と比較して高い競争性能を実現する。
論文 参考訳(メタデータ) (2025-07-16T09:46:17Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z) - Self-Regulated Learning for Egocentric Video Activity Anticipation [147.9783215348252]
自己制御学習(SRL)は、中間表現を連続的に制御し、現在のタイムスタンプのフレームにおける新しい情報を強調する表現を作り出すことを目的としている。
SRLは2つのエゴセントリックなビデオデータセットと2つの第三者のビデオデータセットにおいて、既存の最先端技術よりも大幅に優れています。
論文 参考訳(メタデータ) (2021-11-23T03:29:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。