論文の概要: Learning via Self-Consistency for Diffusion-based Video Reasoning
- arxiv url: http://arxiv.org/abs/2609.36826v1
- Date: Tue, 29 Sep 2026 06:37:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.241504
- Title: Learning via Self-Consistency for Diffusion-based Video Reasoning
- Title(参考訳): 拡散型ビデオ推論のための自己整合性による学習
- Abstract要約: ビデオ生成モデルは、視覚的推論、知覚、その他の視覚タスクのためのゼロショット能力の出現を実証している。
自己整合性も同様に拡散型ビデオ推論を改善することができるかを検討する。
自己整合性推論とコンセンサス蒸留の両方が、映像に基づく知覚と推論を劇的に改善することを示す。
- 参考スコア(独自算出の注目度): 4.647364885140317
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video generation models have demonstrated emerging zero-shot capabilities for visual reasoning, perception, and other vision tasks. However, diffusion-based video generation is inherently stochastic, while many downstream vision tasks are deterministic. Motivated by the effectiveness of self-consistency in chain-of-thought reasoning for large language models, we investigate whether self-consistency can similarly improve diffusion-based video reasoning. We first introduce a training-free test-time scaling method that samples multiple video generations and aggregates their predictions through self-consistency. Specifically, we aggregate extracted paths, locations, or masks from multiple rollouts into a consensus prediction. To reduce the inference overhead of multi-rollout generation, we read out predictions early in the denoising trajectory, which preserves consensus quality while reducing denoising steps by more than half. We further propose Rejection Fine-Tuning (RFT) to distill consensus predictions into the video generation model. The resulting model internalizes the benefit of multi-sample consensus and requires only a single generation at inference time, while substantially outperforming the original model. Experiments on three tasks, including maze solving, visual search, and referring segmentation, show that both our self-consistency inference and consensus distillation dramatically improve video-based perception and reasoning, without requiring ground-truth videos or task-specific verification. For visual search, self-consistency raises task accuracy from 48.4% for a single generation to 99.0%. The distilled model retains much of the consensus benefit with a single rollout. For 4-by-4 maze solving, consensus-based training improves the single-generation strict success rate from 72.0% to 84.0% with the same inference latency.
- Abstract(参考訳): ビデオ生成モデルは、視覚的推論、知覚、その他の視覚タスクのためのゼロショット能力の出現を実証している。
しかし、拡散に基づくビデオ生成は本質的に確率的であり、下流の視覚タスクの多くは決定論的である。
大規模言語モデルにおける連鎖推論における自己整合性の有効性から,自己整合性も同様に拡散に基づくビデオ推論を改善することができるかを検討する。
まず、複数のビデオ世代をサンプリングし、自己整合性を通じて予測を集約する、トレーニング不要なテスト時間スケーリング手法を提案する。
具体的には,複数のロールアウトから抽出した経路,場所,マスクを,コンセンサス予測に集約する。
マルチロールアウト生成の予測オーバーヘッドを低減するため,デノナイジング軌道の早期に予測を読み出し,コンセンサスの品質を維持しつつ,デノナイジングステップを半分以上削減する。
さらに、コンセンサス予測をビデオ生成モデルに再現するために、Rejection Fine-Tuning (RFT)を提案する。
結果として得られたモデルは、マルチサンプルコンセンサスの利点を内部化し、推論時に1世代しか必要とせず、元のモデルよりも大幅に優れている。
迷路解決、視覚探索、参照セグメンテーションを含む3つのタスクの実験により、我々の自己整合性推論とコンセンサス蒸留の両方が、地味なビデオやタスク固有の検証を必要とせず、映像に基づく知覚と推論を劇的に改善することを示した。
視覚検索では、タスクの正確性は1世代で48.4%から99.0%に向上する。
蒸留モデルでは、単一ロールアウトによるコンセンサス利益の大部分を維持できる。
4対4の迷路解法では、コンセンサスに基づくトレーニングは、同一の推論レイテンシで、単一世代の厳密な成功率を72.0%から84.0%に改善する。
関連論文リスト
- Generative Uncertainty as a Self-supervised Signal for Semantic Similarity Learning [29.62631500768148]
人間のアノテーションなしで意味的類似性を学ぶために、テキスト・トゥ・ビデオ(T2V)モデルから生成する不確実性。
提案手法は,T2Vモデルが慣れ親しんだ概念に対して一貫した出力を生成するが,特殊概念によって誘導される場合,高いばらつきや不確実性を示すことに基づく。
本稿では,ビデオMAE や V-JEPA などの既存の事前訓練された表現において,安定した意味的特徴を識別するために,この振る舞いを利用する。
論文 参考訳(メタデータ) (2026-09-28T14:58:40Z) - Test-time Reinforcement Learning for Anomalous Video Understanding [12.200293794553005]
異常ビデオ理解は、ビデオ中の異常事象を特定し、その意味を単純な異常検出を越えて解釈することを目的としている。
最近のビデオ大言語モデル(ビデオ-LLM)は、このタスクに期待できるゼロショット機能を実証している。
本稿では,異常映像理解のための新しいテスト時間強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-18T13:49:45Z) - Demystifing Video Reasoning [71.53763299316041]
ビデオモデルにおける推論は、主に拡散認知のステップに沿って現れることを示す。
モデル性能に重要ないくつかの創発的推論行動を特定する。
これらの知見に触発され、私たちは概念実証としてトレーニングフリー戦略を提示した。
論文 参考訳(メタデータ) (2026-03-17T17:59:55Z) - LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion [87.42285185305813]
本稿では,Reward-Guided Resampling and Pruningを実行する新しい推論時間探索機構を提案する。
LatSearchは、ベースラインのWan2.1モデルと比較して、複数の評価次元にわたるビデオ生成を一貫して改善する。
論文 参考訳(メタデータ) (2026-03-15T18:07:29Z) - Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion [67.94300151774085]
本稿では,自己回帰ビデオ拡散モデルのための新しい訓練パラダイムであるSelf Forcingを紹介する。
露光バイアスの長年の問題に対処し、地道的な文脈で訓練されたモデルは、自身の不完全な出力で条件付けられたシーケンスを生成する必要がある。
論文 参考訳(メタデータ) (2025-06-09T17:59:55Z) - Learning from Streaming Video with Orthogonal Gradients [62.51504086522027]
本稿では,映像の連続的ストリームからの表現学習を自己指導的に行うという課題に対処する。
これは、トレーニング中にビデオが切り刻まれ、シャッフルされ、非冗長なバッチを生成する、ビデオ学習の標準的なアプローチとは異なる。
3つのタスクでシャッフルからシーケンシャルな学習に移行する際のパフォーマンスの低下を実演する。
論文 参考訳(メタデータ) (2025-04-02T17:59:57Z) - Efficient Action Recognition Using Confidence Distillation [9.028144245738247]
本研究では,教師の不確実性の表現を学生に教える信頼性蒸留フレームワークを提案する。
我々は3つの行動認識データセットに関する広範な実験を行い、我々のフレームワークが、行動認識精度(最大20%)と計算効率(40%以上)の大幅な改善を実現していることを示す。
論文 参考訳(メタデータ) (2021-09-05T18:25:49Z) - ASCNet: Self-supervised Video Representation Learning with
Appearance-Speed Consistency [62.38914747727636]
本研究では,1)明示的な監督のためのラベルの欠如,2)構造化されていない,ノイズの多い視覚情報による自己指導型映像表現学習について検討する。
既存の方法は、主にビデオクリップをインスタンスとしてコントラスト損失を使用し、互いにインスタンスを識別することで視覚的表現を学ぶ。
本稿では,ロバストな映像表現を学ぶ上で,正のサンプル間の一貫性が鍵となることを観察する。
論文 参考訳(メタデータ) (2021-06-04T08:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。