論文の概要: HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments
- arxiv url: http://arxiv.org/abs/2609.00950v1
- Date: Tue, 01 Sep 2026 09:09:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.491668
- Title: HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments
- Title(参考訳): HitMem: 動的環境のためのマルチモーダルコンテキスト対応検索による階層型テンポラル3Dメモリ
- Authors: Ruijie Tang, Chenye Zou, Guoquan Wu, Jun Wei, Wei Chen, Jiaxin Zhu,
- Abstract要約: HitMemは階層的な時間的3Dメモリフレームワークで、マルチモーダルなコンテキスト認識検索機構を備えている。
HitMemはオブジェクトの移動精度を大幅に向上し、探索コストを低減し、動的環境におけるタスク実行性能を向上させる。
- 参考スコア(独自算出の注目度): 5.55387168911911
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Executing long-term tasks in dynamic environments requires embodied agents to maintain robust and adaptive 3D scene representations. However, most existing 3D memory frameworks rely on static world assumptions. When objects are displaced by human activities or unobserved events, agents encounter memory-observation conflicts and often require costly geometric recomputations or inefficient global re-exploration. To address this, we propose HitMem, a hierarchical temporal 3D memory framework with a multi-modal context-aware retrieval mechanism. Through continuous perception, HitMem unifies semantic and spatial information into a lightweight topological graph that captures support relationships, while a temporal decay mechanism dynamically regulates memory activeness to mitigate the impact of stale representations. In addition, the multi-modal context-aware retrieval mechanism defaults to filtering candidates using integrated semantic, spatial, and temporal memory features, and activates a specialized two-stage retrieval process when object displacement is detected. This process combines spatial constraints inferred from external agent trajectories with semantic common sense grounded in class affinities, efficiently identifying high-probability candidate regions. Extensive evaluations on our constructed Dyna-THOR benchmark demonstrate that HitMem significantly improves object relocation accuracy, reduces exploration costs, and enhances task execution performance in dynamic environments.
- Abstract(参考訳): 動的環境下での長期タスクの実行には、堅牢で適応的な3Dシーン表現を維持するためのエンボディエージェントが必要である。
しかし、既存の3Dメモリフレームワークのほとんどは静的世界の仮定に依存している。
物体が人間の活動や観測されていない出来事によって移動された場合、エージェントは記憶と観測の衝突に遭遇し、しばしばコストのかかる幾何学的再計算や非効率なグローバル再探索を必要とする。
そこで我々はHitMemを提案する。HitMemは階層型時間的3Dメモリフレームワークで,マルチモーダルなコンテキスト認識検索機構を備えている。
連続的な知覚を通じて、HitMemは意味情報と空間情報を、サポート関係を捉える軽量なトポロジカルグラフに統合し、時間的減衰機構は、静的な表現の影響を軽減するために、動的にメモリ活性を調節する。
さらに、マルチモーダルコンテキスト認識検索機構は、統合意味、空間、時間記憶特徴を用いて候補をフィルタリングすることをデフォルトとし、オブジェクトの変位を検出する際に、特殊な2段階検索プロセスを活性化する。
このプロセスは、外部エージェント軌跡から推定される空間的制約とクラス親和性に基づく意味的共通感覚を組み合わせ、高確率候補領域を効率的に同定する。
構築したDyna-THORベンチマークにおいて、HitMemはオブジェクトの移動精度を大幅に向上し、探索コストを低減し、動的環境におけるタスク実行性能を向上することを示した。
関連論文リスト
- Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering [93.80043825360514]
EQA(Embodied Question answering)は、伝統的にエピソードの定式化の下で評価され、エージェントは各タスクを独立して解決し、エピソード間の内部状態をリセットする。
EQAエージェントを逐次評価する際に異なるメモリアーキテクチャがどのように振る舞うかを検討する。
既存のメモリを単純に保存することは、しばしば不十分である。
連続したシーン表現の視覚的意味的証拠を3次元幾何学にマッピングするアーキテクチャについて, 構造的, 空間的基盤的記憶の必要性を強調した。
論文 参考訳(メタデータ) (2026-07-23T17:50:45Z) - AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts [78.33143446024485]
我々は、横方向思考パズルに基づく環境ロールアウトによるエージェントの評価を行うtextbfAgentLongBenchを紹介した。
このフレームワークは、知識集約的で知識のないシナリオにまたがる厳密な相互作用の軌跡を生成する。
論文 参考訳(メタデータ) (2026-01-28T16:05:44Z) - Online Segment Any 3D Thing as Instance Tracking [60.20416622842975]
オンライン3Dセグメンテーションをインスタンス追跡問題として再認識する(AutoSeg3D)。
視覚基礎モデルに固有の断片化問題を緩和するために,空間整合性学習を導入する。
ScanNet200上でESAMを2.8 AP上回る新しい最先端技術を確立する。
論文 参考訳(メタデータ) (2025-12-08T14:48:51Z) - Mem4D: Decoupling Static and Dynamic Memory for Dynamic Scene Reconstruction [17.587320705104343]
静的幾何学と動的運動のモデリングを分離する新しいフレームワークを提案する。
Mem4Dは、グローバルな整合性を持つ静的幾何学を同時に維持し、高忠実度で動的要素を再構成する。
論文 参考訳(メタデータ) (2025-08-11T12:23:31Z) - FindingDory: A Benchmark to Evaluate Memory in Embodied Agents [49.18498389833308]
本研究では,Habitatシミュレータに長距離エンボディタスクのための新しいベンチマークを導入する。
このベンチマークは、持続的なエンゲージメントとコンテキスト認識を必要とする60タスクにわたるメモリベースの機能を評価する。
論文 参考訳(メタデータ) (2025-06-18T17:06:28Z) - 3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model [83.70640091897947]
人間は、時間的・空間的な体験にまたがって長期記憶を活用することで、複雑なタスクを実行するのに優れる。
現在のLarge Language Models (LLM) は、動的でマルチルームな3D環境において、効果的に計画し、振る舞うのに苦労している。
本稿では,空間的時間的推論と動作を具現化した新しい動的メモリ管理と融合モデルである3DLLM-Memを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:59:13Z) - SemanticFlow: A Self-Supervised Framework for Joint Scene Flow Prediction and Instance Segmentation in Dynamic Environments [10.303368447554591]
本稿では,全時間点雲のシーンフローとインスタンスセグメンテーションを同時に予測するマルチタスクフレームワークを提案する。
1)静的な背景と動的オブジェクトの最初の粗いセグメンテーションを用いて、共有特徴処理モジュールを介して動きと意味情報を精製するためのコンテキスト情報を提供するマルチタスクスキームの開発,2)シーンフロー推定とインスタンスセグメンテーションの性能を高めるための損失関数セットの開発,そして,交通シーン内の静的および動的オブジェクトの空間的および時間的一貫性を確保することを支援すること,3)粗い学習スキームの開発。
論文 参考訳(メタデータ) (2025-03-19T02:43:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。