論文の概要: LongStream: Long-Sequence Streaming Autoregressive Visual Geometry
- arxiv url: http://arxiv.org/abs/2602.13172v1
- Date: Fri, 13 Feb 2026 18:30:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-16 23:37:54.078163
- Title: LongStream: Long-Sequence Streaming Autoregressive Visual Geometry
- Title(参考訳): LongStream: 時系列のストリーミング自動回帰ビジュアルジオメトリ
- Abstract要約: LongStreamは、計量スケールのシーン再構成のための新しいゲージ分離型ストリーミングビジュアルジオメトリモデルである。
長距離外挿を定距離局所的なタスクに再構成する。
安定して18FPSで、キロメートルスケールのシークエンスで安定してメートルスケールの再構築を行う。
- 参考スコア(独自算出の注目度): 18.46781332515933
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-sequence streaming 3D reconstruction remains a significant open challenge. Existing autoregressive models often fail when processing long sequences. They typically anchor poses to the first frame, which leads to attention decay, scale drift, and extrapolation errors. We introduce LongStream, a novel gauge-decoupled streaming visual geometry model for metric-scale scene reconstruction across thousands of frames. Our approach is threefold. First, we discard the first-frame anchor and predict keyframe-relative poses. This reformulates long-range extrapolation into a constant-difficulty local task. Second, we introduce orthogonal scale learning. This method fully disentangles geometry from scale estimation to suppress drift. Finally, we solve Transformer cache issues such as attention-sink reliance and long-term KV-cache contamination. We propose cache-consistent training combined with periodic cache refresh. This approach suppresses attention degradation over ultra-long sequences and reduces the gap between training and inference. Experiments show LongStream achieves state-of-the-art performance. It delivers stable, metric-scale reconstruction over kilometer-scale sequences at 18 FPS. Project Page: https://3dagentworld.github.io/longstream/
- Abstract(参考訳): 長時間のストリーミング3D再構成は依然として大きな課題である。
既存の自己回帰モデルは、長いシーケンスを処理するときに失敗することが多い。
通常は第1フレームにアンカーポーズし、注意崩壊、スケールドリフト、外挿エラーを引き起こす。
数千フレームにわたる距離スケールのシーン再構成のための,新しいゲージ分離型ストリーミングビジュアルジオメトリモデルであるLongStreamを紹介した。
私たちのアプローチは3倍です。
まず、最初のフレームアンカーを捨てて、キーフレーム相対的なポーズを予測する。
これにより、長距離外挿を定距離局所的なタスクに再構成する。
第2に、直交的スケール学習を導入する。
この方法は、スケール推定から幾何を完全に切り離し、ドリフトを抑制する。
最後に、注意リンク依存や長期KVキャッシュ汚染といったトランスフォーマーキャッシュの問題を解決する。
本稿では,定期的なキャッシュリフレッシュとキャッシュ一貫性トレーニングを提案する。
このアプローチは、超長いシーケンスに対する注意の低下を抑制し、トレーニングと推論のギャップを小さくする。
実験では、LongStreamが最先端のパフォーマンスを達成した。
安定して18FPSで、キロメートルスケールのシークエンスで安定してメートルスケールの再構築を行う。
Project Page: https://3dagentworld.github.io/longstream/
関連論文リスト
- Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction [10.383154504465232]
ABot-Reconは、前の11フレームからKV機能をキャッシュするシンプルなストリーミングモデルである。
現在のカメラ座標系における点マップと、隣接するフレームの相対的なポーズを予測する。
蓄積ドリフトを低減するために、最近の視覚と運動のコンテキストを用いて、軽量の時間リファインダは相対回転を改善する。
論文 参考訳(メタデータ) (2026-08-27T15:07:38Z) - StreamSplat: Streaming Feed-Forward 3D Gaussian Splatting [13.605490241534797]
StreamSplatはフィードフォワード3DGSフレームワークで、永続的な幾何学的なシーンステートを漸進的に維持する。
実験の結果,StreamSplat はスパース因果入力下での最先端のフィードフォワード 3DGS 法と競合し続けていることがわかった。
StreamSplatは256, 512, 1024ビューで長い入力ストリームにスケールする。
論文 参考訳(メタデータ) (2026-08-03T03:48:20Z) - Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - Anchor3R: Streaming 3D Reconstruction with Transient Anchors for Long-Horizon Visual Mapping [28.6268034980389]
ロングホライゾンのオンライン視覚マッピングは、ロボット知覚のコア機能である。
最近のフィードフォワード3D再構成モデルは、第1フレームまたは永続的なシーンメモリに結び付けられた固定座標系におけるポーズを予測する。
フィードフォワード再構成を電流中心の局所測定予測として扱うストリーミング3D再構成フレームワークであるemphAnchor3Rを提案する。
論文 参考訳(メタデータ) (2026-06-03T16:00:13Z) - HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction [18.749241400724493]
既存の方法は、しばしば長いシーケンスでドリフト、ジッター、崩壊に悩まされる。
我々は,このカーネルを明示的に分解する長い水平変換器であるHorizonStreamを提案する。
実験により,HorizonStreamは定数メモリと線形時間で1万フレームを超えるシーケンスに安定に一般化できることが示された。
論文 参考訳(メタデータ) (2026-05-22T17:50:48Z) - DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation [51.58559206569209]
我々は,コンパクトなメモリバンクを保守し,動的フレームシンクとして視覚的に関連する歴史的フレームを選択する検索ベースのフレームワークであるDySinkを提案する。
分長ビデオの実験では、DySinkは強いベースラインよりもダイナミックな度合いを一貫して改善し、同時に時間的品質も向上している。
論文 参考訳(メタデータ) (2026-05-20T11:01:01Z) - Geometric Context Transformer for Streaming 3D Reconstruction [51.19524805829903]
LingBot-Mapは、ストリーミングデータからシーンを再構築するためのフィードフォワード3Dファウンデーションモデルである。
LingBot-Mapの定義的な側面は、アンカーコンテキスト、ポーズ参照ウィンドウ、トラジェクトリメモリを統合した、慎重に設計されたアテンションメカニズムにある。
この設計は、リッチな幾何学的コンテキストを維持しながら、ストリーミング状態をコンパクトに保ち、518 x 378の解像度入力に対して、20FPS程度の安定した効率的な推論を可能にする。
論文 参考訳(メタデータ) (2026-04-15T17:58:13Z) - Fast-SAM3D: 3Dfy Anything in Images but Faster [65.17322167628367]
SAM3Dは複雑なシーンからスケーラブルでオープンな3D再構築を可能にする。
textbfFast-SAM3Dは、計算を瞬時生成の複雑さと整合させる、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-02-05T04:27:59Z) - LoL: Longer than Longer, Scaling Video Generation to Hour [50.945885467651216]
この研究は、品質劣化の少ないリアルタイム、ストリーミング、無限長のビデオ生成の最初のデモンストレーションを実現する。
実例として、最大12時間までの連続ビデオを生成し、私たちの知る限り、ストリーミングビデオ生成において最も長く実証された結果の1つである。
論文 参考訳(メタデータ) (2026-01-23T17:21:35Z) - InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams [22.277387867568834]
InfiniteVGGT (InfiniteVGT) は、ローリングメモリの概念を、有界で適応的で永続的に表現可能なKVキャッシュを通じて操作する因果的視覚幾何学変換器である。
本稿では,約1万フレームの連続3次元幾何推定を厳密に評価できるLong3Dベンチマークを提案する。
論文 参考訳(メタデータ) (2026-01-05T17:11:00Z) - TTT3R: 3D Reconstruction as Test-Time Training [69.51086319339662]
テストタイムトレーニングの観点から3次元再構築基盤モデルを再考する。
メモリ状態と受信した観測値のアライメントの信頼性を利用して、クローズドフォーム学習率を導出する。
この訓練のない介入はTTT3Rと呼ばれ、長さの一般化を大幅に改善する。
論文 参考訳(メタデータ) (2025-09-30T17:59:51Z) - Mixture of Contexts for Long Video Generation [72.96361488755986]
我々は長文ビデオ生成を内部情報検索タスクとして再放送する。
本稿では,学習可能なスパークアテンション・ルーティング・モジュールであるMixture of Contexts (MoC) を提案する。
データをスケールしてルーティングを徐々に分散させていくと、そのモデルは計算を適切な履歴に割り当て、アイデンティティ、アクション、シーンを数分のコンテンツで保存する。
論文 参考訳(メタデータ) (2025-08-28T17:57:55Z) - STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer [72.88105562624838]
本稿では,ポイントマップ予測をデコーダのみの変換器問題として再構成する新しい3次元再構成手法STream3Rを提案する。
大規模な3Dデータセットから幾何学的先行性を学ぶことで、STream3Rは多様で困難なシナリオにうまく一般化する。
この結果から,オンライン3次元知覚のための因果変換モデルの可能性を浮き彫りにし,ストリーミング環境におけるリアルタイム3次元理解の道を開いた。
論文 参考訳(メタデータ) (2025-08-14T17:58:05Z) - LONG3R: Long Sequence Streaming 3D Reconstruction [29.79885827038617]
Long3Rは、より長いシーケンス上でのマルチビュー3Dシーン再構成をストリーミングするために設計された新しいモデルである。
本モデルでは,新たな観測値の更新と更新を繰り返すことで,リアルタイム処理を実現している。
実験により、LONG3Rは、特に長いシーケンスにおいて、最先端のストリーミング手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-07-24T09:55:20Z) - SplatVoxel: History-Aware Novel View Streaming without Temporal Training [29.759664150610362]
スパースビュー映像からの新たなビューストリーミングの問題について検討する。
既存のビュー合成手法は、時間的コヒーレンスと視覚的忠実さに苦慮している。
本稿では,ハイブリッド型スプラ・ボクセルフィードフォワードシーン再構築手法を提案する。
論文 参考訳(メタデータ) (2025-03-18T20:00:47Z) - Temporally Consistent Transformers for Video Generation [80.45230642225913]
正確なビデオを生成するには、アルゴリズムは世界の空間的および時間的依存関係を理解する必要がある。
時間依存性のあるビデオ生成を厳格に評価するために、複雑なデータに関する確立されたベンチマークは存在しない。
本稿では,長期間の一貫性を著しく向上し,サンプリング時間を短縮するTemporally Consistent Transformer(TECO)を提案する。
論文 参考訳(メタデータ) (2022-10-05T17:15:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。