論文の概要: Latent Visual Cache for Video Reasoning
- arxiv url: http://arxiv.org/abs/2607.02607v1
- Date: Wed, 01 Jul 2026 13:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.347342
- Title: Latent Visual Cache for Video Reasoning
- Title(参考訳): ビデオ推論のための潜時ビジュアルキャッシュ
- Authors: Yongheng Zhang, Zhipeng Xu, Hao Wu, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu,
- Abstract要約: 我々は,遅延ビデオキャッシュ(Latent-VC)を導入し,遅延ビデオキャッシュをデコーダに挿入し,推論を通してコンパクトな視覚記憶を維持する。
Latent-VCは、6つのビデオベンチマークでCoTとSFT+ GRPOのベースラインを一貫して上回っている。
また、かなり短い応答で高い精度を達成する。
- 参考スコア(独自算出の注目度): 64.44259870076141
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Video reasoning requires Large Multimodal Models (LMMs) to remain grounded in dense evidence, yet existing systems largely adopt "read-once, generate-many" paradigm, in which visual grounding weakens during generation. This phenomenon has been widely observed and is known as Visual Anchoring Decay. To fill this gap, we introduce Latent Video Cache (Latent-VC), a recurrent latent visual cache inserted into the decoder to preserve compact visual memories throughout reasoning. The cache is trained with supervised contrastive cache alignment and vision-grounded GRPO with a latent grounding reward, while maintaining strict train-inference alignment through native decoder hidden states. Built on Qwen3.5-9B, Latent-VC consistently outperforms strong CoT and SFT+GRPO baselines across six video benchmarks, with especially clear gains on grounding-intensive and long-video tasks. In addition, it also achieves higher accuracy with substantially shorter responses, suggesting that latent visual caching improves video reasoning by preserving visual evidence rather than relying on longer textual chains.
- Abstract(参考訳): ビデオ推論では、LMM(Large Multimodal Models)は、密集した証拠に根ざしていなければならないが、既存のシステムは、生成時に視覚的な接地が弱まる"read-once, generate-many"パラダイムをほとんど採用している。
この現象は広く観測され、Visual Anchoring Decayとして知られている。
このギャップを埋めるために、我々は遅延ビデオキャッシュ(Latent-VC)を導入しました。
キャッシュは、教師付きコントラストキャッシュアライメントと、隠れたネイティブデコーダを通じて厳格な列車干渉アライメントを維持しながら、遅延グラウンドの報酬で、ビジョングラウンドされたGRPOでトレーニングされる。
Qwen3.5-9B上に構築されたLatent-VCは、6つのビデオベンチマークでCoTとSFT+GRPOのベースラインを一貫して上回っている。
さらに、より短い応答で高い精度を実現し、より長いテキスト連鎖に頼るのではなく、視覚的エビデンスを保存することにより、潜時的な視覚的キャッシングがビデオの推論を改善することを示唆している。
関連論文リスト
- Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning [51.563653495547335]
マルチモーダル推論は、マルチステップ生成中に視覚的証拠を再考することによって、視覚的接地を改善する。
再生不要な視覚的再考のためのキャッシュレベルフレームワークであるPlace Rebinding Cache Reuse (PRCR)を提案する。
PRCRはリプレイレベルまたはパフォーマンスの向上を実現し、平均精度を5%向上し、視覚的再考を最大数万倍削減する。
論文 参考訳(メタデータ) (2026-06-25T05:47:52Z) - TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment [51.33418612284208]
ドリフト耐性長ビデオ生成のためのトレーニングフリーでプラグアンドプレイのキャッシュ管理戦略であるTetherCacheを提案する。
Gated Recall with Attention-Diversity Balancingは、ゲートスコアを使用して長距離メモリフレームを選択する。
TAMEは、信頼されたコンテキスト分布に統計を合わせることで、新しくリコールされたメモリトークンを軽量に編集する。
論文 参考訳(メタデータ) (2026-06-11T08:16:08Z) - SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation [31.105007908298003]
ストリーミング長ビデオ生成は、連続的なセマンティックスイッチングにおいて中心的な課題に直面している。
現在のアプローチは、プロンプトバウンダリや固定メモリ予算でのキャッシュ再構築に依存している。
マルチプロンプト長ビデオ生成のためのトレーニングフリーフレームワークであるSWIFTを提案する。
論文 参考訳(メタデータ) (2026-05-10T09:37:56Z) - Decouple and Cache: KV Cache Construction for Streaming Video Understanding [53.55135022958052]
ストリーミングビデオ理解には、限られたメモリと計算量で無制限のビデオストリームを処理する必要がある。
トレーニング不要なキャッシュ構築機構であるDecoupled Streaming Cache(DSCache)を提案する。
Streaming Video QAベンチマークの実験では、DSCacheの最先端のパフォーマンスが実証され、従来の手法よりも平均2.5%精度が向上した。
論文 参考訳(メタデータ) (2026-05-03T13:02:44Z) - Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention [37.91838955436801]
自動回帰ビデオ拡散モデルは、ストリーミング生成、ロングフォーム合成への扉を開くこと、ビデオワールドモデル、インタラクティブなニューラルゲームエンジンを可能にする。
生成が進むにつれて、KVキャッシュが増加し、レイテンシの増加とGPUメモリのエスカレーションが生じる。
我々は、自己回帰拡散のための統合されたトレーニングなしアテンションフレームワークを提案する: TempCacheは、時間的対応によるKVキャッシュをバウンドキャッシュ成長に圧縮し、AnnCAは、高速近傍マッチングを用いてフレーム関連プロンプトを選択することで、クロスアテンションを加速し、AnnSAは各クエリを制限して自己アテンションを拡大する。
論文 参考訳(メタデータ) (2026-02-02T08:31:21Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management [17.645183933549458]
VideoMemは、適応メモリ管理によるシーケンシャルな生成タスクとして、長いビデオ理解をモデル化する新しいフレームワークである。
我々は,VMemが,超長期ビデオ理解タスクの様々なベンチマークにおいて,既存のオープンソースモデルを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2025-12-04T07:42:13Z) - Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence [70.2803680525165]
我々は、明示的な証拠をビデオ推論に統合する非エージェントフレームワークであるOpen-o3 Videoを紹介した。
このモデルは、キーオブジェクトとバウンディングボックスをその答えとともに強調し、推論を具体的な視覚的な観察で基礎付けることができる。
V-STARベンチマークでは、Open-o3 Videoは最先端のパフォーマンスを達成し、mAMを14.4%、mLタイムスタンプを24.2%向上させた。
論文 参考訳(メタデータ) (2025-10-23T14:05:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。