論文の概要: Learning to Navigate Efficiently with Only 0.58M Trainable Parameters
- arxiv url: http://arxiv.org/abs/2607.11029v1
- Date: Mon, 13 Jul 2026 02:49:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.308832
- Title: Learning to Navigate Efficiently with Only 0.58M Trainable Parameters
- Title(参考訳): 0.58万の学習可能なパラメータで効率的にナビゲートする学習
- Abstract要約: 既知の閉形式構造を持つ操作を解析的に計算し、3つの小さな学習モジュール間のインタフェースとして機能するナビゲーションモデルを提案する。
このシステムは、合計22.7Mパラメータのうちわずか0.58Mを1時間未満で44kフレームでトレーニングするが、ナビゲーションタスクの最先端モデルの性能にアプローチする。
- 参考スコア(独自算出の注目度): 12.68304107799412
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent progress in visual navigation has largely been driven by scale: end-to-end policies with hundreds of millions of parameters trained on billions of frames or large-scale simulated data. We ask how much of this scale a single task family actually requires, and what structure can substitute for it. We propose a decomposed navigation model in which operations with known closed-form structure, such as projective geometry, occupancy, and coordinate transforms, are computed analytically and serve as interfaces between three small learned modules: an egress predictor that grounds the episode goal as a local subgoal in the current view, a navigation predictor that estimates a goal-conditioned posterior over where trajectories travel, and an endpoint-pinned residual diffusion generator that samples trajectory shapes from this posterior. The system trains only 0.58M out of a total of 22.7M parameters, on 44k frames in under one GPU-hour, yet approaches the performance of state-of-the-art models on navigation tasks across 6060 point-goal episodes and 60 environments, while having 233x fewer trainable parameters, the lowest collision rate among all evaluated methods, and 50 Hz inference speed. The decomposition further transfers to no-goal exploration by retraining only the 123k-parameter egress head, and its failure modes under sensor corruption are transparent and analytically correctable.
- Abstract(参考訳): 数十億のフレームでトレーニングされた数十億のパラメータや大規模なシミュレーションデータによるエンドツーエンドのポリシー。
単一のタスクファミリが実際に必要とする規模と、それに代わる構造について尋ねます。
本稿では,現在視界にある局所的なサブゴールとしてエピソード目標を基礎とするエクスレス予測器と,軌跡の移動先を目標条件で推定するナビゲーション予測器と,この後部から軌跡形状をサンプリングするエンドポイントピン付残留拡散発生器とを,解析的に計算し,そのインターフェースとして機能する。
このシステムは、合計22.7Mのパラメータのうちわずか0.58Mを1つのGPU時間以下で44kフレームでトレーニングするが、6060個のポイントゴールエピソードと60環境にわたるナビゲーションタスクの最先端モデルの性能にアプローチし、訓練可能なパラメータは233倍少なく、全ての評価方法の中で衝突速度は最低で、推論速度は50Hzである。
分解は123kパラレックスヘッドのみをリトレーニングすることで、さらに非ゴール探索に移行し、センサ破損時の故障モードは透明で解析的に修正可能である。
関連論文リスト
- FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation [18.092834753587454]
FlowPilotは、UAVナビゲーションを深度からリアルタイムに行うための、コンパクトなワールドアクションモデルである。
デュアルストリーム・オブ・トランスフォーマーは、ビデオとアクションの専門家を共通の注意で結合し、将来的な予測と軌跡生成を相互に通知する。
論文 参考訳(メタデータ) (2026-08-01T12:43:31Z) - DepthART: Scaling Foundation Monocular Depth to Tiny Models [51.10174763031444]
DepthARTは、様々なシーンにまたがるデバイス上のデプロイメントのためのコンパクトなMDEモデルである。
ゼロショット一般化とメートル法精度の両方において、DepthARTが従来の小さなベースラインを一貫して上回っていることを示す。
また、GTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで2242/4482ドル、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達したスケーラブルなモデルファミリも提供しています。
論文 参考訳(メタデータ) (2026-07-19T06:54:52Z) - DRIFT: Drift and Aggregation for Motion Planning [20.309189828710362]
DRIFTは1ステップのドリフトをコンパクトな軌跡空間内でのドリフトとシーン認識型提案アグリゲーションを組み合わせた固定深度軌道プランナーである。
軽量アグリゲーションヘッドはこれらの特徴をシーン、ナビゲーション、エゴステート情報と統合し、最終軌道を直接予測する。
その出力は、専門家軌道の模倣と、乾燥可能なポリゴンの外側のウェイポイントをペナライズする地図由来境界正規化器で訓練されている。
論文 参考訳(メタデータ) (2026-07-16T02:43:13Z) - ShipNet: A Geometric Deep Learning Surrogate for Real-Time Ship Hydrodynamics [0.0]
ShipNetは、船体表面圧力分布と遠距離自由表面波パターンの両方を、船体形状と速度から直接予測する幾何学的深層学習サロゲートである。
推論には1ケースあたり約0.15秒が必要で、従来のハードウェアの電位フローソルバと比較して550倍のスピードアップが得られる。
論文 参考訳(メタデータ) (2026-06-13T15:38:24Z) - Towards Real-Time Autonomous Navigation: Transformer-Based Catheter Tip Tracking in Fluoroscopy [35.565354067805835]
本研究の目的は, 実時間カテーテル先端追跡パイプラインの開発と評価である。
U-Net、U-Net+Transformer、SegFormerなどのディープラーニングセグメンテーションモデルをトレーニングし、ベンチマークした。
2級のSegFormerは平均絶対誤差4.44mm、U-Net(4.60mm)、U-Net+Transformer(6.20mm)、および3級モデル(5.19-7.74mm)を上回った。
論文 参考訳(メタデータ) (2026-05-14T01:42:56Z) - Trajectory-Aware Adaptive Inference in Object Detection Models [0.19845233274307664]
我々は,GPSトラジェクトリデータを推論プロセスに組み込むことにより,既存のオブジェクト検出フレームワークを構築した。
我々は、動きキューを組み込んだYOLOv8ベースの検出器に早期退避機構を導入する。
その結果、この戦略は予測時間と計算コストを大幅に削減しつつ、良好な検出性能を維持していることが示された。
論文 参考訳(メタデータ) (2026-05-12T16:04:07Z) - WUTDet: A 100K-Scale Ship Detection Dataset and Benchmarks with Dense Small Objects [68.44670476527155]
WUTDetは100,576イメージと381,378のアノテートされた船舶インスタンスを備えた大規模な船舶検出データセットである。
CNN, Transformer, Mambaの3つの主流検出アーキテクチャから20のベースラインモデルを体系的に評価した。
Ship-GENの結果は、WUTDetでトレーニングされたモデルは、異なるデータ分布下でより強力な一般化を示すことを示している。
論文 参考訳(メタデータ) (2026-04-09T03:28:05Z) - HCLSM: Hierarchical Causal Latent State Machines for Object-Centric World Modeling [0.0]
HCLSMは、オブジェクト中心分解、空間放送復号化、階層的時間力学の3つの原理で機能する。
システムは51モジュールにまたがる8,478行のPythonにまたがっており、171のユニットテストがある。
論文 参考訳(メタデータ) (2026-03-31T00:11:29Z) - End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction [74.31251139839047]
THOは、ビデオと3Dテンプレートから、人間の動きと調整された物体の動きを前方に予測する、エンドツーエンドの空間-時間変換器である。
実験により、THOは1つの4090 GPU上で31.5 FPSの推論速度で動作し、以前の最適化ベースの手法よりも600倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-03-15T15:21:36Z) - MetricNet: Recovering Metric Scale in Generative Navigation Policies [51.90872764552077]
MetricNetは、ウェイポイント間の距離を予測するジェネレーティブナビゲーションのための効果的なアドオンである。
MetricNetスケールのウェイポイントの実行はナビゲーションと探索の両方のパフォーマンスを大幅に改善することを示す。
また、MetricNetをナビゲーションポリシーに統合し、目標に向かって移動しながら障害物からロボットを誘導するMetricNavを提案する。
論文 参考訳(メタデータ) (2025-09-17T13:37:13Z) - CabiNet: Scaling Neural Collision Detection for Object Rearrangement
with Procedural Scene Generation [54.68738348071891]
私たちはまず、さまざまな日常環境において、650万以上の散らばったシーン(前よりも桁違いに多い)を生成します。
このデータから合成部分点雲をレンダリングし、それをCabiNetモデルアーキテクチャのトレーニングに使用します。
CabiNetは、オブジェクトとシーンポイントの雲を受け入れる衝突モデルである。
論文 参考訳(メタデータ) (2023-04-18T21:09:55Z) - Ultra-low Power Deep Learning-based Monocular Relative Localization
Onboard Nano-quadrotors [64.68349896377629]
この研究は、2つのピアナノドロンのディープニューラルネットワーク(DNN)を介して、単分子の相対的な局所化に対処する、新しい自律的なエンドツーエンドシステムを示す。
超制約ナノドローンプラットフォームに対処するため,データセットの増大,量子化,システム最適化などを含む垂直統合フレームワークを提案する。
実験の結果,DNNは低分解能モノクローム画像のみを用いて最大2mの距離で10cmのターゲットナノドローンを正確に局在させることができることがわかった。
論文 参考訳(メタデータ) (2023-03-03T14:14:08Z) - Learning Spatio-Temporal Transformer for Visual Tracking [108.11680070733598]
本稿では,エンコーダ・デコーダ変換器をキーコンポーネントとする新しいトラッキングアーキテクチャを提案する。
メソッド全体がエンドツーエンドであり、コサインウィンドウやバウンディングボックススムーシングのような後処理ステップは不要である。
提案されたトラッカーは、Siam R-CNNよりも6倍速いリアルタイム速度を実行しながら、5つのチャレンジングな短期および長期ベンチマークで最先端のパフォーマンスを実現します。
論文 参考訳(メタデータ) (2021-03-31T15:19:19Z) - Object Tracking by Detection with Visual and Motion Cues [1.7818230914983044]
自動運転車は、カメラ画像中の物体を検出し、追跡する必要がある。
本稿では,カルマンフィルタを用いた定速度運動モデルに基づく簡易オンライン追跡アルゴリズムを提案する。
課題のあるBDD100データセットに対するアプローチを評価します。
論文 参考訳(メタデータ) (2021-01-19T10:29:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。