論文の概要: LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation
- arxiv url: http://arxiv.org/abs/2606.27871v1
- Date: Fri, 26 Jun 2026 09:11:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.439585
- Title: LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation
- Title(参考訳): LocalNav: オンデバイスオブジェクト目標ナビゲーションのためのフロンティアVLMとエンボダイドRLの蒸留
- Authors: Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno,
- Abstract要約: 視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
- 参考スコア(独自算出の注目度): 53.88286427894783
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Language Models (VLMs) have emerged in the robotic domain as a powerful tool that enables environmental perception with language context, serving as a catalyst for open-vocabulary tasks like ObjectNav. Yet, their computational footprint typically confines them to cloud execution, hindering low-latency inference with local deployment on resource-constrained robots. To address this challenge, we present a distillation strategy that transfers complex spatial-semantic reasoning from large frontier models into a lightweight, 4B-parameter local VLM for edge execution on embedded GPU devices (e.g., Jetson Orin). We first establish a State of the Art (SotA), Scene Graph (SG)-based pipeline using Claude Sonnet 4.6, achieving a 39.7% Success Rate (SR) on the HM3D OVON benchmark. We then demonstrate that fine-tuning Qwen3.5-4B on just 500 frontier reasoning traces effectively enables navigation capabilities, yielding a SR of 34.5%, narrowing the gap to the performance of large cloud models. Finally, we introduce E-RLVR with Token Generation (TG) regularization to compress output sequence lengths for physical deployment while grounding the agent in its task. This downstream optimization reduces TG overhead by 72.1% and latency by 71.8%. Combined with quantization, this joint strategy yields a cumulative 82.8% reduction in overall inference latency without significantly sacrificing performance, presenting a viable paradigm for local, low-latency VLM execution on mobile robots.
- Abstract(参考訳): 視覚言語モデル(VLM)は、ObjectNavのようなオープン語彙タスクの触媒として機能する、言語コンテキストによる環境認識を可能にする強力なツールとして、ロボット領域に登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
この課題に対処するため,我々は,大規模なフロンティアモデルから,組込みGPUデバイス(例えばJetson Orin)上でエッジ実行を行うために,複雑な空間意味推論を軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
The State of the Art (SotA), Scene Graph (SG)-based pipeline using Claude Sonnet 4.6, a 39.7% Success Rate (SR) on the HM3D OVON benchmark。
次に、500のフロンティア推論トレースを微調整したQwen3.5-4Bが、ナビゲーション機能を効果的に実現し、34.5%のSRが得られることを示し、大きなクラウドモデルの性能とのギャップを狭める。
最後に,Token Generation (TG) の正規化による E-RLVR を導入し,タスク中のエージェントを接地しながら,物理配置のための出力シーケンス長を圧縮する。
このダウンストリーム最適化はTGオーバーヘッドを72.1%削減し、レイテンシを71.8%削減する。
量子化と組み合わせて、このジョイント戦略は、性能を著しく犠牲にすることなく、全体の推論遅延を82.8%削減し、モバイルロボット上でのローカルで低レイテンシなVLM実行に実行可能なパラダイムを提供する。
関連論文リスト
- Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - LightAVSeg: Lightweight Audio-Visual Segmentation [67.18006751024687]
LightAVSegは、セマンティックフィルタリングと空間接地のための分離された設計に置き換わっている。
実験では、軽量メソッド間で新しい最先端を実現することを実証している。
MS3ベンチマークで50.4 mIoUに達し、モバイルプロセッサでの効率的な推論を可能にする。
論文 参考訳(メタデータ) (2026-05-09T08:47:54Z) - TinyML Enhances CubeSat Mission Capabilities [8.462623779881566]
本稿では,画像分類のための畳み込みニューラルネットワーク(ConvNets)モデル最適化と配置パイプラインを提案する。
我々のパイプラインは、構造化された反復プルーニング、後のINT8量子化、および圧縮モデルへのハードウェア対応オペレータマッピングを統合している。
最適化されたモデルでは、RAM使用率89.55%、フラッシュメモリ709%の平均的な削減が示されている。
論文 参考訳(メタデータ) (2026-03-20T17:51:07Z) - GLANCE: Gaze-Led Attention Network for Compressed Edge-inference [10.229095428511654]
AR/VRシステムにおけるリアルタイムオブジェクト検出は、厳格な電力予算内で10ms未満のレイテンシを必要とする、計算上の重要な制約に直面している。
生体の葉の視覚にインスパイアされた2段階のパイプラインを提案する。このパイプラインは、異なる重みのないニューラルネットワークを組み合わせ、超効率的な視線推定と、注意誘導された関心の領域検出を行う。
論文 参考訳(メタデータ) (2026-03-16T15:52:52Z) - EdgeNav-QE: QLoRA Quantization and Dynamic Early Exit for LAM-based Navigation on Edge Devices [5.926544683744667]
大規模行動モデル(LAM)は、低レベル制御による高レベル推論をブリッジすることで、自律的なナビゲーションにおいて大きな可能性を示している。
エッジデバイスにこれらのマルチビリオンパラメータモデルをデプロイすることは、メモリ制約とレイテンシ要求のため、依然として大きな課題である。
我々は、リアルタイムエッジナビゲーションのためにLAMを最適化する動的早期出力機構と、量子化低ランク適応(QLoRA)を統合する新しいフレームワークであるEdgeNav-QEを提案する。
論文 参考訳(メタデータ) (2026-01-12T09:20:53Z) - Open-Vocabulary Spatio-Temporal Scene Graph for Robot Perception and Teleoperation Planning [55.90805559207812]
動的リモートシーンでは、双方向通信における伝送遅延は、リモート認識状態とオペレータ意図の間のギャップを生じさせる。
本稿では,時間的ダイナミクスと軽量遅延アノテーションを用いて,オープン語彙認識を充実させる表現を提案する。
提案手法はReplicaベンチマークで74%のノード精度を実現し,Concept.Graphよりも優れていた。
論文 参考訳(メタデータ) (2025-09-27T04:31:24Z) - A Novel Compression Framework for YOLOv8: Achieving Real-Time Aerial Object Detection on Edge Devices via Structured Pruning and Channel-Wise Distillation [0.0]
YOLOv8オブジェクト検出モデルのための新しい3段階圧縮パイプラインを提案する。
スパシティ対応トレーニング、構造化チャネルプルーニング、CWD(Channel-Wise Knowledge Distillation)が使用されている。
VisDroneデータセットの実験では、複数のYOLOv8変種にまたがるアプローチの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-16T10:11:59Z) - Robustifying the Deployment of tinyML Models for Autonomous
mini-vehicles [61.27933385742613]
本稿では,ループ内環境を含む自動運転ミニ車両を対象とした閉ループ学習フローを提案する。
我々は、小型CNNのファミリーを利用してミニ車両を制御し、コンピュータビジョンアルゴリズム、すなわち専門家を模倣してターゲット環境で学習する。
CNNのファミリを実行する場合、我々のソリューションはSTM32L4とk64f(Cortex-M4)の他の実装よりも優れており、レイテンシを13倍以上削減し、エネルギー消費を92%削減する。
論文 参考訳(メタデータ) (2020-07-01T07:54:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。