論文の概要: SLAMFormer-$\infty$: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing
- arxiv url: http://arxiv.org/abs/2608.03429v1
- Date: Tue, 04 Aug 2026 10:19:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.126005
- Title: SLAMFormer-$\infty$: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing
- Title(参考訳): SLAMFormer-$\infty$:無制限フロントエンドおよびバックエンド処理のための無限SLAM変換器
- Authors: Zhijian Fang, Weicheng Zheng, Yijun Yuan, Weibang Wang, Zhuoguang Chen, Chang Sun, Junhao Huang, Kenan Li, Minghui Qin, Hang Zhao,
- Abstract要約: Infinite SLAM Transformer (SLAMFormer-$infty$)を導入する。
SLAMFormer-$infty$は,大規模データセット間の軌道推定とシーン再構成の両方において,優れた,あるいは高い競争力を発揮することを示す。
特に、SLAMFormer-$infty$は、非常に長い軌道に一般化し、17mathrmkm$を超えるシーケンスでうまく動作する。
- 参考スコア(独自算出の注目度): 26.897856714460257
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce the Infinite SLAM Transformer (SLAMFormer-$\infty$), the first geometric transformer capable of supporting both long-range frontend and backend processing without an explicit distance bound. Instead of relying on a first-frame-anchored formulation, SLAMFormer-$\infty$ employs memory conditions to define flexible coordinate systems and scales for input frames, enabling more expressive structural conditioning. Built upon this formulation, the frontend preserves efficient local computation, while the backend jointly optimizes long-range trajectories and scene geometry in a globally consistent manner. Experimental results demonstrate that SLAMFormer-$\infty$ achieves superior or highly competitive performance in both trajectory estimation and scene reconstruction across large-scale datasets. Notably, SLAMFormer-$\infty$ generalizes to extremely long trajectories, successfully operating on sequences exceeding $17\mathrm{km}$.
- Abstract(参考訳): Infinite SLAM Transformer (SLAMFormer-$\infty$)を導入する。
SLAMFormer-$\infty$は、第一フレームアンコレートの定式化に頼る代わりに、フレキシブルな座標系と入力フレームのスケールを定義するためにメモリ条件を使用する。
この定式化に基づいて、フロントエンドは効率的な局所計算を保存し、バックエンドは長距離軌道とシーン幾何学を一様に一貫した方法で共同で最適化する。
実験の結果,SLAMFormer-$\infty$は,大規模データセット間の軌道推定とシーン再構成の両方において,優れた,あるいは高い競争力を発揮することが示された。
特に、SLAMFormer-$\infty$は極端に長い軌跡に一般化し、17\mathrm{km}$を超える列をうまく操作する。
関連論文リスト
- Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs [3.50654760771471]
cMoLLMは、完全に微分可能な動的畳み込みを通じて、エンドツーエンドのストリームをルーティングする、畳み込みでゲートされたLLMの混合である。
FineWebでトレーニングされたGPT-2スタイルのモデルでは、cMoLLMは言語モデリングの難易度と下流GLUEとSQuADの精度を改善している。
論文 参考訳(メタデータ) (2026-06-06T13:51:15Z) - Flash-Mono: Feed-Forward Accelerated Gaussian Splatting Monocular SLAM [30.770651925808846]
本稿では,3つのコアモジュールからなるシステムであるFlash-Monoを紹介する。
マルチフレームコンテキストを活用するフィードフォワードパラダイムは、これらの課題に対処するために不可欠である。
ガウス属性を直接予測することにより、最適化に基づくGS-SLAMに必要なフレーム毎の負担を回避できる。
論文 参考訳(メタデータ) (2026-04-03T15:17:23Z) - FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM [50.9765003472032]
FoundationSLAMは、正確でロバストな追跡とマッピングのための学習ベースの単分子高密度SLAMシステムである。
我々の中核となる考え方は、基礎深度モデルからのガイダンスを活用することによって、推論によるフロー推定をブリッジすることである。
論文 参考訳(メタデータ) (2025-12-31T17:57:45Z) - Rethinking Dense Linear Transformations: Stagewise Pairwise Mixing (SPM) for Near-Linear Training in Neural Networks [0.0]
本稿では,高密度行列をスパースなペアワイズ混合段階の合成に置き換える構造的線形作用素であるStagewise Pairwise Mixers (SPM)を紹介する。
実世界のベンチマークでは競合性能を維持しつつ,ウォールクロックコストを大幅に削減し,構造化学習問題に対する精度を向上した。
論文 参考訳(メタデータ) (2025-12-30T00:03:22Z) - Scaling Bidirectional Spans and Span Violations in Attention Mechanism [5.755498052202004]
canonical $O(N2)$ Transformerは、シーケンスモデリングにおける経験的なパフォーマンスフロンティアのままである。
本研究では,非対称なプロジェクションを利用して後方方向の勾配を並列スパンに分解する最適化フレームワークを提案する。
我々はこれらのコンポーネントを選択的にスケーリングし、主に0分の1の双方向並列スパンにフォーカスすることで、最も効果的な学習信号が得られることを示した。
論文 参考訳(メタデータ) (2025-12-15T07:03:24Z) - PT$^2$-LLM: Post-Training Ternarization for Large Language Models [52.4629647715623]
大きな言語モデル(LLM)は、様々なタスクにまたがる印象的な機能を示しているが、その大きなメモリと計算能力は、デプロイメントを妨げている。
PT$2$-LLMを提案する。
その中核は2段精製パイプラインを備えた非対称3次量子化器である。
論文 参考訳(メタデータ) (2025-09-27T03:01:48Z) - SLAM-Former: Putting SLAM into One Transformer [28.173503112119374]
SLAM-Formerは、完全なSLAMを単一の変換器に統合する新しいニューラルアプローチである。
SLAM-Formerは,最先端の高密度SLAM法と比較して,優れた,あるいは高い競争力を発揮することを示す。
論文 参考訳(メタデータ) (2025-09-21T04:04:47Z) - Pushing the Envelope of Rotation Averaging for Visual SLAM [69.7375052440794]
視覚SLAMシステムのための新しい最適化バックボーンを提案する。
従来の単分子SLAMシステムの精度, 効率, 堅牢性を向上させるために, 平均化を活用している。
我々のアプローチは、公開ベンチマークの最先端技術に対して、同等の精度で最大10倍高速に表示することができる。
論文 参考訳(メタデータ) (2020-11-02T18:02:26Z) - $P^2$ Net: Augmented Parallel-Pyramid Net for Attention Guided Pose
Estimation [69.25492391672064]
拡張ボトルネックとアテンションモジュールによる特徴改善を施したパラレルピラミドネットを提案する。
並列ピラミド構造は、ネットワークによって導入された情報損失を補うために続く。
提案手法は, MSCOCO と MPII のデータセットにおいて, 最適な性能を実現する。
論文 参考訳(メタデータ) (2020-10-26T02:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。