論文の概要: Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
- arxiv url: http://arxiv.org/abs/2608.04124v1
- Date: Tue, 04 Aug 2026 18:23:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.579378
- Title: Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
- Title(参考訳): 推論前の知覚:ビデオ理解と質問応答のための動的潜時推論
- Abstract要約: ビデオの質問応答には、言語クエリを視覚的証拠として、必要に応じて、時間をかけてその証拠を推論するモデルが必要である。
本稿では,まず,短時間の知覚遅延ブロックに疑問を投げかける動的遅延推論(DyLaR)を提案する。
DyLaRは、知覚潜伏剤を検証された視覚的証拠に接地し、検証された有理を推論された潜伏剤に蒸留することによって、この振る舞いを学習する。
- 参考スコア(独自算出の注目度): 21.009232014467266
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Video question answering requires models to ground language queries in visual evidence and, when necessary, reason over that evidence across time. Existing methods typically rely on long textual chain-of-thought rationales, even though many questions can be answered as soon as the relevant object, action, or frame is localized. We propose Dynamic Latent Reasoning (DyLaR), which first grounds a question in a short block of perception latents (continuous hidden states that encode query-relevant visual evidence), and then adaptively decides whether to append reasoning latents (continuous thoughts that reason over this evidence in latent space) before answering. DyLaR learns this behavior by grounding perception latents in verified visual evidence and distilling verified rationales into reasoning latents, followed by reinforcement learning that further refines when to reason. Across nine video benchmarks and four multimodal language model backbones, DyLaR improves average accuracy over same-backbone baselines while generating fewer than 20 tokens per query. On Qwen3-VL-4B, for example, DyLaR improves average accuracy over Qwen3-VL-4B-Thinking from 54.0 to 58.2 while reducing response length from 1,220.7 to 18.5 tokens per query. Ablations further show that grounded perception latents, rationale-supervised reasoning latents, and adaptive routing each improve accuracy.
- Abstract(参考訳): ビデオの質問応答には、言語クエリを視覚的証拠として、必要に応じて、時間をかけてその証拠を推論するモデルが必要である。
既存の方法は通常、関連するオブジェクト、アクション、フレームがローカライズされるとすぐに多くの疑問が答えられるが、長いテキストの連鎖論理に依存している。
本稿では,まず,質問文の短いブロック(クエリ関連視覚的証拠をエンコードする連続的隠蔽状態)に質問文を根拠として動的潜時推論(DyLaR)を提案し,回答の前に推論的潜時(この証拠を潜時空間で理由づける連続的思考)を付加するかを適応的に決定する。
DyLaRは、知覚潜伏者を検証された視覚的証拠に接地させ、検証された有理を推論潜伏者へ蒸留し、さらに推論のタイミングをさらに洗練させる強化学習によって、この振る舞いを学習する。
9つのビデオベンチマークと4つのマルチモーダル言語モデルバックボーンに対して、DyLaRは、クエリ毎に20トークン未満を生成しながら、同じバックボーンベースラインの平均精度を改善している。
例えばQwen3-VL-4Bでは、DyLaRはQwen3-VL-4B-Thinkingの平均精度を54.0から58.2に改善し、応答長を1,220.7から18.5トークンに短縮する。
さらにアブレーションは、接地された知覚潜伏者、合理的教師付き推論潜伏者、適応的ルーティングがそれぞれ精度を向上させることを示している。
関連論文リスト
- ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models [5.030873315667928]
思考の連鎖(CoT)推論は、自然言語の中間的推論ステップを言語化することによって、大きな視覚言語モデル(LVLM)の推論能力を大幅に向上させた。
最近の研究は、推論を連続的な潜在空間に移すことによって、この制限に対処している。
ReGuLaRは、視覚的証拠に潜伏状態を明確に根拠付ける潜在状態推論フレームワークである。
論文 参考訳(メタデータ) (2026-05-28T21:34:40Z) - Leveraging Latent Visual Reasoning in Silence [46.71750408786006]
遅延トークンをランダムノイズに置き換えたり、取り除いたりすると、空間推論ベンチマーク間で性能劣化がほとんどないことが示される。
本稿では、RL中に生成された潜在トークンが後続のテキストトークンと対話することを奨励するアテンションベースの報酬を提案する。
論文 参考訳(メタデータ) (2026-05-18T16:46:02Z) - Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs [54.16324124242172]
連続潜在空間推論は、マルチモーダルモデルに対するテキストチェーンのコンパクトな代替を提供する。
既存の視覚的推論手法では,これまで見過ごされてきた最適化病理を同定する。
パラメータ更新を伴わない推論時間潜時最適化は、視覚潜時における抑止的推論能力を効果的に解き放つことを示す。
論文 参考訳(メタデータ) (2026-05-04T15:36:12Z) - Pause or Fabricate? Training Language Models for Grounded Reasoning [50.104657152302956]
不完全情報に基づくグラウンドド推論のために,対話型強化学習(GRIL)によるグラウンドド推論を提案する。
GRILは推論プロセスを2つの段階に分解する: 明確化と一時停止、利用可能な情報が十分かどうかを識別する。
GSM8K-InsufficientおよびMetaMATH-Insufficientの実験では、GRILは前提検出を大幅に改善し(最大45%)、平均応答長を20%以上削減しながらタスク成功率が30%向上した。
論文 参考訳(メタデータ) (2026-04-21T16:45:29Z) - Early Stopping for Large Reasoning Models via Confidence Dynamics [55.67938134245981]
大きな推論モデルは複雑な問題を解決するために長い連鎖生成に依存している。
重要な課題は、いつモデルが推論を止めて最終回答を生み出すべきかを決定することです。
中間回答の信頼性のダイナミクスを利用して推論をいつ終了するかを判断する早期停止手法であるCoDE-Stopを提案する。
論文 参考訳(メタデータ) (2026-04-06T17:59:45Z) - VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice [88.93674345138054]
CoT推論(Chain-of-thinkt)は、ビデオ理解タスクにおけるマルチモーダルな大規模言語モデルのための強力なツールとして登場した。
本稿では,ビデオ理解フレームワークであるVideoAuto-R1を提案する。
論文 参考訳(メタデータ) (2026-01-08T18:00:59Z) - Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models [56.851611990473174]
動的ビジュアルコンテンツに対する推論は、大きな言語モデルにとって依然として中心的な課題である。
本稿では,時間的精度と推論一貫性を両立させる強化学習手法を提案する。
結果のモデルであるVideo R2は、複数のベンチマークでTAC、VAS、精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-11-28T18:59:58Z) - Learning When to Stop: Adaptive Latent Reasoning via Reinforcement Learning [7.669927190506031]
本研究では適応長潜時推論モデルを開発し,SFT後補強学習手法を提案する。
Llama 3.2 1BモデルとGSM8K-Augデータセットの実験では、合計推理長さが52%$ダウンし、精度にペナルティはない。
論文 参考訳(メタデータ) (2025-11-26T16:54:06Z) - A Survey on Latent Reasoning [100.54120559169735]
大きな言語モデル(LLM)は印象的な推論機能を示している。
中間ステップを言語化するCoT推論は、モデルの表現帯域幅を制限する。
潜在的推論は、モデルの連続的な隠れ状態に完全にマルチステップの推論を実行することで、このボトルネックに対処する。
論文 参考訳(メタデータ) (2025-07-08T17:29:07Z) - Answer-Centric or Reasoning-Driven? Uncovering the Latent Memory Anchor in LLMs [28.556628696390767]
大きな言語モデル(LLM)は印象的な推論機能を示している。
彼らの成功の多くは、真の推論よりも、暗記された回答推論パターンに起因している、とエビデンスは示唆している。
本稿では, 応答キューを体系的に操作し, 間接的, 行動解析によるモデル行動の探索を行う5段階の応答可視プロンプトフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-21T08:15:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。