論文の概要: RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory
- arxiv url: http://arxiv.org/abs/2609.23286v1
- Date: Sun, 20 Sep 2026 01:42:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.744439
- Title: RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory
- Title(参考訳): RegVGGT: 調整メモリによるストリーミングのための持続可能なビジュアルジオメトリグラウンド
- Abstract要約: フィードフォワード再構成モデル(FFRM)のジレンマを考慮した長大なビデオストリーム入力からの3次元再構成
近年の研究では、推論コンテキストの整合性とGPUメモリ使用量のトレードオフによってこの問題を解決しようとしている。
本稿では,入力フレームのトークンを積極的に規制する,トレーニング不要なトークン規制手法であるRegVGGTを提案する。
- 参考スコア(独自算出の注目度): 69.4680941912247
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D reconstruction from a lengthy video stream input poses a dilemma for feed-forward reconstruction models (FFRMs), that a whole-stream inference context cannot be retained under limited GPU memory.Recent studies seek to resolve this problem via a trade-off between the integrity of inference context and GPU memory usage, which either suffer from a rapid memory inflation or degraded context integrity due to artificially capping memory usage.Driven by our key observation that the initial saliency of a token reliably dictates its long-term importance across the stream, we propose RegVGGT, a training-free token regulation method which aggressively regulates the tokens of incoming frames.By admitting at most 1% of tokens per frame to update the context memory, our method dramatically suppresses memory inflation as the stream progresses.Equipped with a FlashAttention-compatible token saliency estimation scheme, RegVGGT is capable of processing thousands of frames on a consumer-grade GPU with negligible compromise to reconstruction quality.Extensive experiments demonstrate that RegVGGT achieves state-of-the-art performance on long-horizon benchmarks across diverse FFRM prediction tasks, surpassing prior FFRM-based stream reconstruction baselines by a large margin.
- Abstract(参考訳): 長大なビデオストリーム入力からの3D再構成は、フィードフォワード再構成モデル(FFRM)のジレンマであり、ストリーム全体の推論コンテキストを限られたGPUメモリ下で保持することはできない。近年の研究は、推論コンテキストの整合性とGPUメモリ使用量の整合性のトレードオフを通じてこの問題を解決しようとしている。これは、高速なメモリインフレーションや、メモリ使用量による劣化したコンテキストの整合性に悩まされているものである。我々のキー観察では、トークンの初期サリエンシが、ストリーム全体の長期的重要性を確実に判断する、ということが示されている。我々は、入力フレームのトークンを積極的に規制するトレーニングフリートークン規制であるRegVGGTを提案する。
関連論文リスト
- StreamFlow: Dynamic Memory Flows for Streaming Video Understanding [65.10324190760602]
StreamFlowは、歴史的視覚情報への動的なオンデマンドアクセスを可能にする効率的なビジュアルメモリフレームワークである。
最先端のストリーミングビデオ理解性能を達成し、StreamingBenchの全体的な精度は67.73%に達した。
バニラ設定とは対照的に、視覚的注意スコア(VAS)を59.1%改善し、それぞれエンドツーエンドのレイテンシとピークメモリを50.4%、21.1%削減した。
論文 参考訳(メタデータ) (2026-08-11T14:19:03Z) - Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval [86.05617542701644]
Visual Geometry Grounded Transformer (VGGT)はスケーラブルなTransformerアーキテクチャを通じて3D再構成を行う。
StreamVGGTは因果的にストリーミングを可能にするが、KVキャッシュはフレームとともに線形に成長し、メモリオーバーフローと品質劣化を引き起こす。
本稿では、VGGTのコンテキスト構築を検索問題として定式化する、トレーニング不要なフレームワークRetrieveVGGTを提案する。
論文 参考訳(メタデータ) (2026-05-10T16:41:54Z) - Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding [55.7992006853979]
SAVEMemは、セマンティックな認識をメモリ生成にもたらすフレームワークで、クエリ毎に検索スコープを適応させる。
SAVEMemは、メモリ生成にセマンティックな認識をもたらし、クエリ毎に検索範囲を適応させる、トレーニングフリーのデュアルステージフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:40:40Z) - SoLAR: Error-Resilient Streamable Long-Horizon Free-Viewpoint Video Reconstruction with Anchor Activation and Latent Recalibration [57.159190580279585]
ビット割り当て理論により、速度歪み最適化フレームワーク内で動的アンカーベースのボリュームビデオ表現を解析する。
我々は,長いシーケンスの復元品質を安定的に維持する,エラー回復性の最初のFVVフレームワークである textbfSoLAR を提案する。
論文 参考訳(メタデータ) (2026-05-08T06:48:59Z) - CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management [9.03430145112447]
トレーニング不要で曲率を考慮した階層型ビジュアルメモリ管理フレームワークであるCurveStreamを提案する。
我々のアプローチは、連続的な特徴軌跡に沿った高曲率領域が重要なグローバルセマンティックトランジションと密接に一致していることの鍵となる観察によって動機付けられている。
この幾何学的洞察に基づいて、CurveStreamはCurvature Scoreを介してリアルタイムセマンティックインテンシティを評価し、オンラインK-Sigmaダイナミックしきい値を統合し、フレームをクリアでファジィなメモリ状態に適応的にルーティングする。
論文 参考訳(メタデータ) (2026-03-20T02:28:57Z) - OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer [14.628152488797356]
OVGGTはトレーニング不要のフレームワークで、メモリと計算を、シーケンスの長さに関わらず固定予算にバウンドする。
我々は,OVGGTが一定のVRAMエンベロープ内で任意の長さのビデオを処理し,最先端の3D幾何精度を実現していることを示す。
論文 参考訳(メタデータ) (2026-03-06T06:44:17Z) - LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory [97.14005794889134]
提案するLoGeRは,高密度な3次元再構成を,後最適化なしで極めて長いシーケンスに拡張する新しいアーキテクチャである。
LoGeRはビデオストリームをチャンクで処理し、高忠実度なチャンク内推論に強力な双方向の事前処理を活用する。
このメモリアーキテクチャにより、LoGeRは128フレームのシーケンスでトレーニングでき、推論中に数千フレームまで一般化できる。
論文 参考訳(メタデータ) (2026-03-03T18:55:37Z) - Evict3R: Training-Free Token Eviction for Memory-Bounded Streaming Visual Geometry Transformers [1.9268905951820923]
StreamVGGTのようなストリーミングビジュアルトランスフォーマーは、強力な3D認識を実現するが、キーバリュー(KV)メモリの増大に悩まされる。
本稿では、冗長なトークンを破棄し、最も情報性の高いトークンを保持しながらメモリをバウンドする、トレーニング不要な推論時トークン消去ポリシーを提案する。
論文 参考訳(メタデータ) (2025-09-22T11:54:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。