論文の概要: DL-VINS-Factory: A Modular Framework for Learned Visual Front-Ends in Visual-Inertial SLAM
- arxiv url: http://arxiv.org/abs/2607.01757v1
- Date: Thu, 02 Jul 2026 06:17:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.695714
- Title: DL-VINS-Factory: A Modular Framework for Learned Visual Front-Ends in Visual-Inertial SLAM
- Title(参考訳): DL-VINS-Factory:Visual-Inertial SLAMで学習した視覚フロントエンドのためのモジュールフレームワーク
- Abstract要約: 本稿では,学習した特徴抽出器を光フロー追跡や光Glue(LG)記述器マッチングと統合する統合フレームワークを提案する。
室内、非構造屋外、アグレッシブモーション、視覚的に劣化した4つのデータセットにまたがってシステムをベンチマークした。
その結果、学習したフロントエンドはリアルタイムの組み込みVI-SLAMで実現可能であるが、古典的追跡よりも普遍的に優れているわけではないことがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Deep-learning features excel in visual matching, yet their practical value in tightly coupled visual-inertial SLAM (VI-SLAM) remains insufficiently characterized. We present DL-VINS-Factory, a unified framework that integrates learned feature extractors (ALIKED, RaCo, SuperPoint, XFeat) with either Lucas--Kanade (LK) optical-flow tracking or LightGlue (LG) descriptor matching. All front-ends share a sliding-window Ceres back-end, with optional AnyLoc DINOv2-VLAD loop closure, and 4-DoF pose-graph optimization. We benchmark the system across the four datasets covering indoor, unstructured outdoor, aggressive-motion, and visually degraded conditions. Results show that learned front-ends are viable for real-time embedded VI-SLAM, but are not universally superior to classical tracking. Relative to the corresponding GFTT+LK baseline, ALIKED+LG reduces EuRoC ATE by $5\%$ in monocular odometry and by $7\%$ in stereo with loop-closure. On NTU-VIRAL, where aggressive aerial motion increases inter-frame viewpoint change, ALIKED+LG stereo reduces loop-closed ATE by $12\%$. In Botanic Garden dataset, optical-flow tracking remains preferable, but learned keypoints still improve over the baseline GFTT, in which SuperPoint+LK reduces grayscale camera ATE by $29\%$, while RaCo+LK reduces RGB camera ATE by $38\%$. On SubT-MRS, learned front-ends display varying degree of improvement based on individual cases. With TensorRT acceleration on a Jetson AGX Orin, all valid configurations run in real time between $29$--$47$ FPS in monocular mode and $18$--$33$ FPS in stereo mode for the EuRoC and NTU-VIRAL datasets. AnyLoc further confirms roughly $2$--$7\times$ more valid loops than BRIEF+DBoW2. The implementation is open-sourced at https://github.com/limshoonkit/DL-VINS-Factory-ROS2/.
- Abstract(参考訳): 深層学習機能は視覚マッチングに優れるが、密結合型視覚慣性SLAM(VI-SLAM)の実用的価値は依然として不十分である。
本稿では,学習した特徴抽出器(ALIKED,RaCo,SuperPoint,XFeat)とLucas-Kanade(LK)光フロー追跡,あるいはLightGlue(LG)記述器マッチングを統合する統合フレームワークであるDL-VINS-Factoryを提案する。
すべてのフロントエンドは、AnyLoc DINOv2-VLADループクロージャと4-DoFポーズグラフ最適化を備えたスライディングウィンドウのCeresバックエンドを共有している。
システムは、屋内、非構造屋外、アグレッシブモーション、視覚的に劣化した4つのデータセットにまたがってベンチマークを行う。
その結果、学習したフロントエンドはリアルタイムの組み込みVI-SLAMで実現可能であるが、古典的追跡よりも普遍的に優れているわけではないことがわかった。
対応するGFTT+LKベースラインとは対照的に、ALIKED+LGはEuRoC ATEをモノクロオドメトリーで5\%、ステレオで7\%削減する。
NTU-VIRALでは、アグレッシブな空中運動がフレーム間視点の変化を増大させるため、ALIKED+LGステレオはループクローズされたATEを12\%の値で還元する。
ボタニックガーデンのデータセットでは、光フロー追跡が好まれるが、学習キーポイントはGFTTよりも改善され、SuperPoint+LKはグレースケールカメラATEを29 %、RaCo+LKはRGBカメラATEを38 %で下げる。
SubT-MRSでは、学習したフロントエンドは個々のケースに基づいて様々な改善の度合いを示す。
Jetson AGX Orin上のTensorRTアクセラレーションでは、すべての有効な構成がモノクロモードで29$--47$FPS、EuRoCおよびNTU-VIRALデータセットで18$--33$FPSのステレオモードでリアルタイムに実行される。
AnyLocはさらに、BRIEF+DBoW2よりも有効なループを約$2-$7\times$で確認している。
実装はhttps://github.com/limshoonkit/DL-VINS-Factory-ROS2/でオープンソース化されている。
関連論文リスト
- TDDN: Text-aligned Diffused DINO Network for Puzzle Understanding [4.3420614278019976]
現在の視覚言語モデル(VLM)は、きめ細かい視覚的知覚を欠いている。
画像テキスト検索においてCLIPと一致するテキスト整合モデルTDDNを開発した。
これはCLIPの高密度予測精度を3倍にしている。
論文 参考訳(メタデータ) (2026-09-07T19:52:26Z) - Stable Curves, Unstable Items: Item-Level Scaling Heterogeneity in Video LLMs [16.31176289941024]
ビデオLLMは、視覚的予算が大きくなるにつれて、スムーズに改善されるか、飽和していることを示す。
制御された視覚的予算の下で,各凍結モデルペアを応答軌道で表現する。
我々は、構成の相補性、有害な遷移、およびテキスト上書きの一致したグリッド測度を導出する。
論文 参考訳(メタデータ) (2026-08-07T09:25:20Z) - SLAM in Low-Light Environments: Project Report [13.846177322392725]
ロボット工学の基本的な問題の一つに、同時局所化とマッピング(SLAM)がある。
機能ベース、ダイレクト、フィルタベース、学習ベースのパラダイムにまたがる6つのシステムをベンチマークします。
その結果、RGBのみのSLAMは、慣性融合と大域最適化の両方が存在する場合にのみ安定した低照度追跡を維持できることがわかった。
論文 参考訳(メタデータ) (2026-07-20T08:47:43Z) - Total Generalized Variation regularization closes the gap between neural-eld and classical methods in seismic travel-time tomography [0.0]
トモグラフィーはメッシュ分解能と安定性のトレードオフを強制し、レギュレータの選択が回復可能なものを支配します。
本稿では,Fourier-Feature Neural Networkとして,2次元速度場を表す差別化可能なフレームワークMIMIRを紹介する。
論文 参考訳(メタデータ) (2026-05-11T04:13:52Z) - Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization [4.365822392824561]
本稿では,SIMP最適化のためのオンラインコントローラとして,大規模言語モデルが機能するフレームワークを提案する。
ハードグレーネスゲートは未熟なバイナライゼーションを防止し、メタ最適化ループは第2パスを使用してエージェントの呼び出し周波数を調整する。
エージェントはすべてのベンチマークの最終的なコンプライアンスを達成する:$5.7%$から$-1%、すべてのソリューションが完全にバイナリである。
論文 参考訳(メタデータ) (2026-03-26T07:14:31Z) - $D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation [72.9912717963138]
リモートセンシング画像からのリアルタイムで高忠実な単眼深度推定は、多くのアプリケーションにとって不可欠である。
視覚変換器(ViT)のバックボーンを高密度な予測に使用するのは速いが、知覚品質は低いことが多い。
リモートセンシング単眼深度推定のための深度詳細拡散法(D3$-RSMDE)を提案する。
D3$-RSMDEは、Learninged Perceptual Image Patch similarity (LPIPS)の知覚距離を11.85%削減する。
論文 参考訳(メタデータ) (2026-03-17T10:50:36Z) - Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity [86.71343842875878]
NVIDIAの2:4 Sparse Coresは2倍のスループットを提供するが、厳しい50%のプルーニングを要求する。
Milder $(2N-2):2N$パターンは正確さを維持しながらハードウェアサポートを受けない。
Sparse Coreアクセラレーションをアンロックする最初のシステムであるSlideSparseを紹介する。
論文 参考訳(メタデータ) (2026-03-05T14:49:16Z) - PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective [59.24570811503256]
本稿では,視覚モデル(VLM)における冗長な視覚トークンを減らし,推論を高速化するPIO-FVLMを提案する。
提案されているPIO-FVLMは、トレーニングフリーで、FlashAttentionと互換性があり、実用的なアプリケーションやデプロイメントに親しみやすい。
LLaVA-Next-7Bでは、PIO-FVLMは視覚トークンの11.1%しか保持していないが、オリジナルのパフォーマンスの97.2%を維持している。
論文 参考訳(メタデータ) (2026-02-04T15:33:10Z) - LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs [52.24096832965001]
提案するプログレッシブ・ビジュアル・圧縮(PVC)法を中心としたMLLMであるLLaVA-UHD v3を提案する。
PVC法は、視覚変換器(ViT)にシームレスに統合して、効率的なネイティブ解像度符号化を可能にする。
ViT-UHDをベースとしたLLaVA-UHD v3はQwen2-VLとの競合性能も達成し、TTFTを1.9倍削減した。
論文 参考訳(メタデータ) (2025-11-26T08:11:10Z) - AdaTP: Attention-Debiased Token Pruning for Video Large Language Models [73.70241811066907]
ビデオ大言語モデル (Video Large Language Models, ビデオLLM) は, 映像理解タスクにおいて顕著な成果を上げている。
それらは、複数のビデオフレームから生成される大量の視覚トークンのために、計算上のオーバーヘッドに悩まされることが多い。
AdaTPは2つの専用デバイアスモジュールをパイプラインに統合し、グローバルなアテンションバイアスとローカルなアテンションバイアスをターゲットとする。
論文 参考訳(メタデータ) (2025-05-26T15:08:37Z) - $R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding [41.69321731689751]
ビデオの時間的グラウンドは、自然言語のクェリが与えられたビデオに関連性のあるクリップを埋めることを目的としている。
既存のVTGモデルは、フレームワイドのファイナルレイヤCLIP機能に基づいて構築されており、追加の時間バックボーンによって支援されている。
ビデオ時間的グラウンド化のためのパラメータとメモリ効率の変換学習フレームワークであるReversed Recurrent Tuning(R2$-Tuning)を提案する。
論文 参考訳(メタデータ) (2024-03-31T21:17:48Z) - Anti-Oversmoothing in Deep Vision Transformers via the Fourier Domain
Analysis: From Theory to Practice [111.47461527901318]
Vision Transformer (ViT) は先日,コンピュータビジョン問題における有望性を実証した。
ViTは観察された注意崩壊やパッチの均一性のために、深さが増加するにつれて急速に飽和する。
所望の低域制限を緩和する2つの手法を提案する。
論文 参考訳(メタデータ) (2022-03-09T23:55:24Z) - Rethinking Dilated Convolution for Real-time Semantic Segmentation [0.0]
背骨全体に大きな拡張率を持つ拡張畳み込みを用いて異なるアプローチをとる。
我々のモデルであるRegSegは、リアルタイムのCityscapesとCamVidデータセットの競合的な結果を達成する。
論文 参考訳(メタデータ) (2021-11-18T22:08:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。