論文の概要: HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across Scenes
- arxiv url: http://arxiv.org/abs/2607.16267v1
- Date: Sat, 04 Jul 2026 01:21:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.909967
- Title: HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across Scenes
- Title(参考訳): HyperDCM: ハイパーボリック空間における動的クラスタメモリリプレイ
- Authors: Zhengfei Lu, Jian Yang, Muyu Wang, Shaowen Chen, Jinpeng Mi, Ke Li, Xiong You, Qi Wu, Xuan Tang, Xian Wei,
- Abstract要約: 視覚ナビゲーションにおける継続的な学習は、破滅的な忘れ物のため、依然として困難である。
本稿では,ハイパーボリック・ダイナミック・クラスタ・メモリ(HyperDCM)を提案する。
多言語および屋内の屋外データセットの実験は、HyperDCMが過去のナビゲーション能力の優れた保持を実現することを示す。
- 参考スコア(独自算出の注目度): 32.325022961379155
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continual learning in visual navigation remains challenging due to catastrophic forgetting and the difficulties associated with adapting to diverse and evolving environments. To address these issues, we propose Hyperbolic Dynamic Cluster Memory (HyperDCM), a structure-aware memory mechanism that enhances diffusion policy-based navigation through scene graph modeling and principled memory replay. HyperDCM extracts semantic scene triples from RGB observations using large vision-language models, encodes them into scene graph embeddings via a Relational Graph Convolutional Network (R-GCN), and projects the embeddings into hyperbolic space to enhance structural separability and retention in continual navigation. A dynamic clustering and structure-sensitive update strategy selects representative samples for memory replay, thereby preserving knowledge diversity and mitigating catastrophic forgetting. Experiments on multi-scene indoor and outdoor datasets demonstrate that HyperDCM achieves superior retention of past navigation capabilities and improved generalization compared to representative continual learning baselines adapted to diffusion policy navigation.
- Abstract(参考訳): 視覚ナビゲーションにおける継続的な学習は、破滅的な忘れ物と、多様で進化する環境への適応に伴う困難のために、依然として困難である。
これらの問題に対処するために,シーングラフモデリングと原則記憶再生による拡散ポリシーに基づくナビゲーションを強化する構造対応メモリ機構であるHyperDCMを提案する。
HyperDCMは、大きな視覚言語モデルを用いてRGB観測からセマンティックシーントリプルを抽出し、リレーショナルグラフ畳み込みネットワーク(R-GCN)を介してシーングラフ埋め込みにエンコードし、その埋め込みを双曲空間に投影し、連続的なナビゲーションにおける構造分離性と保持性を高める。
動的クラスタリングと構造に敏感な更新戦略は、メモリ再生のための代表サンプルを選択し、知識の多様性を保ち、破滅的な忘れを緩和する。
屋内および屋外の多場面データセットを用いた実験により,HyperDCMは,拡散政策ナビゲーションに適応した代表的な連続学習ベースラインと比較して,過去のナビゲーション能力の維持と一般化の向上を実現していることが示された。
関連論文リスト
- EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation [81.54723508469617]
EvoMemNavは、ゼロショットエンボディナビゲーションのための効率的で自己進化的できめ細かいメモリフレームワークである。
VSMGraphは、セマンティックキューとトポロジ的関係を持つビューをルームビューオブジェクト階層に整理する。
GOAT-BenchとHM3Dのオブジェクト、テキスト記述、画像ゴールのモダリティによる実験は、SR/SPLにおいて一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-02T11:27:44Z) - SoLAR: Error-Resilient Streamable Long-Horizon Free-Viewpoint Video Reconstruction with Anchor Activation and Latent Recalibration [57.159190580279585]
ビット割り当て理論により、速度歪み最適化フレームワーク内で動的アンカーベースのボリュームビデオ表現を解析する。
我々は,長いシーケンスの復元品質を安定的に維持する,エラー回復性の最初のFVVフレームワークである textbfSoLAR を提案する。
論文 参考訳(メタデータ) (2026-05-08T06:48:59Z) - Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models [56.44348799741838]
静的な背景の正確なアーキビストと動的対象の警戒トラッカーを同時に行うためにモデルを必要とする新しいパラダイムであるHybrid Memoryを導入する。
HM-Worldは、ハイブリッドメモリに特化した最初の大規模ビデオデータセットである。
また,メモリをトークンに圧縮し,時間的関連性に基づく検索機構を利用する専用メモリアーキテクチャHyDRAを提案する。
論文 参考訳(メタデータ) (2026-03-26T17:56:01Z) - Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos [87.15961946494629]
本稿では,Web ベースのルームツアービデオから派生した大規模ビデオ教育フレームワークを提案する。
既存のデータセットとは異なり、我々のフレームワークは3Dで再構成されたオープンエンドな記述リッチな軌跡とアクションリッチな軌跡を統合している。
この研究の鍵となる拡張は暗黙の幾何学的表現の取り込みであり、それは、脆弱な3D再構成を必要とせず、RGBフレームから直接空間的手がかりを抽出するものである。
論文 参考訳(メタデータ) (2026-03-10T06:47:38Z) - Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation [22.876516699004814]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、高レベルの言語命令を正確で安全で長期の空間行動に基礎付けるという、中核的な課題を提示している。
露骨なトポロジカルマップは、そのようなタスクにおいて堅牢な空間記憶を提供するための重要な解決策であることが証明されている。
既存のトポロジカルプランニング手法は、"Granularity Rigidity"問題に悩まされている。
本研究では,動的トポロジカルナビゲーションのためのフレームワークであるDGNavを提案する。
論文 参考訳(メタデータ) (2026-01-29T14:06:23Z) - CausalNav: A Long-term Embodied Navigation System for Autonomous Mobile Robots in Dynamic Outdoor Scenarios [20.83088545971651]
CausalNavは、動的な屋外環境に適したグラフベースのセマンティックナビゲーションフレームワークである。
LLMを用いたマルチレベルセマンティック・シーングラフを構築し、粗粒度マップデータと細粒度オブジェクトエンティティを階層的に統合する。
オフラインマップデータとリアルタイム認識を融合することにより、Embodied Graphはさまざまな空間的粒度にわたる堅牢なナビゲーションをサポートする。
論文 参考訳(メタデータ) (2026-01-05T08:00:34Z) - ReCon-GS: Continuum-Preserved Gaussian Streaming for Fast and Compact Reconstruction of Dynamic Scenes [41.108974064267436]
ReCon-GSは、高忠実なオンライン動的シーン再構築とリアルタイムレンダリングを可能にするストレージ対応フレームワークである。
本稿では,ReCon-GSがトレーニング効率を約15%向上し,FVV合成品質が向上することを示す。
同等のレンダリング品質では、ReCon-GSは最先端の方法と比較して、メモリ要求を50%以上削減する。
論文 参考訳(メタデータ) (2025-09-29T06:23:47Z) - From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning [59.88543114325153]
本稿では,航法基礎モデルの強化学習能力を高めるためのSeeing-to-Experiencingフレームワークを提案する。
S2Eは、ビデオの事前トレーニングとRLによるポストトレーニングの長所を組み合わせたものだ。
実世界のシーンを3DGSで再現した3D画像に基づく総合的なエンドツーエンド評価ベンチマークであるNavBench-GSを構築した。
論文 参考訳(メタデータ) (2025-07-29T17:26:10Z) - Dynamic Memory-enhanced Transformer for Hyperspectral Image Classification [3.5093938502961763]
ハイパースペクトル画像(HSI)分類は、複雑な空間スペクトル相関のため、依然として困難な課題である。
既存のトランスモデルは、長距離依存を捉えるのに優れているが、情報冗長性と注意力の非効率さに悩まされることが多い。
MemFormerは、動的メモリモジュールを反復的に洗練するメモリ強化型マルチヘッドアテンションメカニズムを導入している。
動的メモリ富化戦略は、複雑な空間的およびスペクトル的依存関係を段階的にキャプチャし、より表現力のある特徴表現をもたらす。
論文 参考訳(メタデータ) (2025-04-17T17:43:34Z) - Structured Scene Memory for Vision-Language Navigation [155.63025602722712]
視覚言語ナビゲーション(VLN)のための重要なアーキテクチャを提案する。
ナビゲーション中に知覚を正確に記憶できるほど区画化されている。
また、環境内の視覚的および幾何学的な手がかりを捉え、取り除く、構造化されたシーン表現としても機能する。
論文 参考訳(メタデータ) (2021-03-05T03:41:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。