論文の概要: AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
- arxiv url: http://arxiv.org/abs/2605.12954v1
- Date: Wed, 13 May 2026 03:40:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.791648
- Title: AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
- Title(参考訳): AdaFocus: 効率的な長時間ビデオ理解のためのゼロキャッシュルックバックによる適応的妥当性・多様性サンプリング
- Authors: Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin,
- Abstract要約: 長いビデオ理解は、厳格なワンショットパラダイムによって非常にボトルネックになっている。
AdaFocusは,ワンパス符号化ではなく,プログレッシブエビデンス獲得として長いビデオ理解を再考する,効率的なフレームワークである。
- 参考スコア(独自算出の注目度): 4.238932162084854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long video understanding is heavily bottlenecked by a rigid one-shot paradigm: existing methods either densely encode videos at prohibitive memory and latency costs, or aggressively compress them into sparse frame sets that irreversibly discard fine-grained evidence needed for downstream reasoning. Consequently, current models struggle to simultaneously balance temporal coverage, visual details, and computational efficiency. We propose AdaFocus, an efficient framework that rethinks long-video understanding as progressive evidence acquisition rather than one-pass encoding. AdaFocus relies on two tightly coupled components. First, a Query-Aware Adaptive Relevance-Diversity sampler (AdaRD) produces a compact yet informative video preview, adaptively switching to global clustering when the query lacks reliable local grounding. Second, instead of caching exhaustive frame sequences in memory, AdaFocus introduces an uncertainty-triggered refinement mechanism. It performs targeted look-back only when the model is not confident, retrieving high-resolution evidence directly from disk via a zero-cache I/O design. This turns discarded visual details from an irreversible loss into on-demand recoverable evidence without paying the cost of exhaustive preloading. Experiments on seven standard long-video benchmarks show that AdaFocus delivers a substantially better efficiency-accuracy trade-off than strong baselines. Compared with conventional dense encoding, AdaFocus achieves improved task performance (e.g., +2.59 accuracy on VideoMME, +8.39 mIoU on Charades-STA over single-pass inference) while reducing visual token consumption by ~33x and eliminating the need for in-memory frame pre-caching through its zero-cache disk retrieval design. These findings suggest that progressive preview combined with zero-cache evidence refinement is a highly effective paradigm for scalable multimedia reasoning.
- Abstract(参考訳): 既存の方法では、ビデオの高密度エンコードを禁止メモリとレイテンシのコストで行うか、あるいはそれらを粗いフレームに積極的に圧縮することで、下流の推論に必要なきめ細かい証拠を不可逆的に取り除くかのどちらかだ。
その結果、現在のモデルは時間的カバレッジ、視覚的詳細、計算効率の両立に苦慮している。
AdaFocusは、ワンパス符号化ではなくプログレッシブエビデンス獲得として、長ビデオ理解を再考する効率的なフレームワークである。
AdaFocusは2つの密結合コンポーネントに依存している。
まず、AdaRD(Query-Aware Adaptive Relevance-Diversity sampler)は、クエリが信頼性のあるローカルグラウンドを欠いた場合に、グローバルクラスタ化に適応的に切り替える、コンパクトで情報に富んだビデオプレビューを生成する。
第二に、AdaFocusはメモリに徹底的なフレームシーケンスをキャッシュする代わりに、不確実性トリガー付き精細化機構を導入している。
モデルが自信がない場合にのみターゲットの振り返りを実行し、ゼロキャッシュのI/O設計を通じてディスクから直接高解像度の証拠を取得する。
これにより、不可逆的な損失から破棄された視覚的詳細を、徹底的なプリロードのコストを払わずに、オンデマンドで回復可能な証拠に変える。
7つの標準長ビデオベンチマークの実験は、AdaFocusが強力なベースラインよりもはるかに優れた効率と精度のトレードオフを提供することを示している。
従来の高密度符号化と比較して、AdaFocus はタスク性能の改善(例えば VideoMME では +2.59 、シングルパス推論では +8.39 mIoU )を達成し、視覚トークンの消費を ~33倍削減し、ゼロキャッシュディスクの検索設計によるインメモリフレームのプリキャッシュの必要性を排除した。
これらの結果から,ゼロキャッシュエビデンスの改良とプログレッシブプレビューが組み合わさって,スケーラブルなマルチメディア推論に極めて効果的なパラダイムであることが示唆された。
関連論文リスト
- Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions [75.23170605943457]
textbfmodelは、メモリ統合から推論制御を分離するフレームワークである。
emphActive Thinking Decision Maker (ATDM)は、決定プロセスの外部化を行う透明な推論コントローラである。
emphHierarchical Progressive Semantic Integration (HPSI)モジュールは効率的なメモリシステムとして機能する。
論文 参考訳(メタデータ) (2026-04-20T16:15:33Z) - SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching [75.02865981328509]
キャッシュは、以前計算されたモデル出力をタイムステップで再利用することで計算を減らす。
本稿では,動的キャッシュポリシーであるSensitivity-Aware Caching(SenCache)を提案する。
SenCacheは、同様の計算予算の下で、既存のキャッシュメソッドよりも視覚的品質が向上する。
論文 参考訳(メタデータ) (2026-02-27T17:36:09Z) - WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs [37.61875409530676]
WeaveTimeは、シンプルで効率的でモデルに依存しないフレームワークで、まず注文を教え、次に注文を使用する。
推論では、パスCurrent Dynamic Focus Cacheは不確実性トリガ、粗い粒度検索を実行し、必要なときにだけ履歴を拡大する。
これらの結果はWeaveTimeを、厳格なオンライン時間因果制約の下でビデオ-LLMをストリームする時間意識への実践的なパスとして確立する。
論文 参考訳(メタデータ) (2026-02-25T17:45:45Z) - Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory [50.30283773196725]
既存のアプローチは、時間とともにフレームレベルの詳細を蓄積するためにキーバリューキャッシングに依存していますが、フレーム毎に限られた数のトークンを使用します。
より詳細な時間的理解と推論を可能にするためにトークン予算のスケーリングを提案する。
論文 参考訳(メタデータ) (2026-02-20T18:59:50Z) - ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion [30.897215456167753]
拡散モデルは、本質的に反復的推論プロセスのため、かなりの計算オーバーヘッドに悩まされる。
我々は、両方のエラータイプを共同で修正する原則的なキャッシュフレームワークであるERTACacheを提案する。
ERTACacheは最大2倍の推論スピードアップを実現します。
論文 参考訳(メタデータ) (2025-08-27T10:37:24Z) - PromptTea: Let Prompts Tell TeaCache the Optimal Threshold [1.0665410339553834]
一般的な加速戦略は、一定の間隔でキャッシング機構を介してモデル出力を再利用することである。
本稿では,入力プロンプトから直接推定されるシーンの複雑さに基づいて,再利用しきい値を自動的に調整する手法であるPrompt-Complexity-Aware(PCA)キャッシングを提案する。
論文 参考訳(メタデータ) (2025-07-09T10:53:05Z) - Less is Enough: Training-Free Video Diffusion Acceleration via Runtime-Adaptive Caching [57.7533917467934]
EasyCacheは、ビデオ拡散モデルのためのトレーニング不要のアクセラレーションフレームワークである。
我々は,OpenSora,Wan2.1,HunyuanVideoなどの大規模ビデオ生成モデルについて包括的な研究を行っている。
提案手法は,従来のベースラインと比較して推定時間を最大2.1-3.3$times$に短縮する。
論文 参考訳(メタデータ) (2025-07-03T17:59:54Z) - FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality [58.80996741843102]
FasterCacheは、高品質な生成を伴うビデオ拡散モデルの推論を高速化するために設計された、トレーニング不要の戦略である。
我々は、FasterCacheがビデオの質をベースラインと同等に保ちながら、ビデオ生成を著しく加速できることを示した。
論文 参考訳(メタデータ) (2024-10-25T07:24:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。