論文の概要: Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics
- arxiv url: http://arxiv.org/abs/2607.13245v1
- Date: Tue, 14 Jul 2026 20:14:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.580523
- Title: Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics
- Title(参考訳): Just-In-Time Scene Graph Growth:Long-Horizon Roboticsにおける知覚飽和の議論
- Abstract要約: JITOMAは,タスク推論,知覚,記憶をジャスト・イン・タイムな成長プロセスに統合するクローズドループフレームワークである。
JITOMAは,長期タスク切替時の処理時間を安定的に保ちながら,アクティブグラフサイズとキャプション遅延を大幅に低減することを示す。
- 参考スコア(独自算出の注目度): 25.314200952645567
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While 3D Scene Graphs (3DSGs) provide crucial structured representations for embodied agents, conventional Ahead-of-Time, build-everything-then-filter pipelines conflict with the real-time, low-latency demands of edge platforms, inducing a perceptual saturation effect via severe observation redundancy. To resolve this, we present JITOMA (Just-In-Time On-demand Memory Activation), a closed-loop framework that unifies task reasoning, perception, and memory into a just-in-time growth process. Instead of exhaustively mapping the entire environment, JITOMA leverages a top-down task heatmap at the frontend to filter continuous observations, routing minimal streams to maintain a global foundation of low-cost, dormant anchors. Upon a cognitive query, the backend Large Language Model (LLM) parses the robotic intent to dynamically awaken task-relevant anchors, triggering resource-intensive operations -- such as dense node captioning and functional inference -- exclusively within the activated local subgraph. To evaluate these dynamic capabilities and study perceptual saturation trade-offs, we introduce JITOMA-Bench, a comprehensive suite for long-horizon multi-tasking and complex multi-step reasoning. Extensive experiments demonstrate that JITOMA substantially reduces active graph size and captioning latency, while maintaining stable processing time under long-horizon task switching.
- Abstract(参考訳): 3D Scene Graphs (3DSG)はエンボディエージェントに対して重要な構造化された表現を提供するが、従来のAhead-of-Time, build-everything-then-filterパイプラインはエッジプラットフォームのリアルタイム、低レイテンシ要求と競合し、厳しい観察冗長性を通じて知覚飽和効果を誘導する。
JITOMA(Just-In-Time On-Time Memory Activation)は、タスク推論、認識、メモリをジャストインタイム成長プロセスに統合するクローズドループフレームワークである。
JITOMAは、環境全体を徹底的にマッピングする代わりに、フロントエンドのトップダウンタスクのヒートマップを活用して、継続的な観察をフィルタリングし、最小限のストリームをルーティングして、低コストで休息的なアンカーのグローバルな基盤を維持する。
認知クエリの際、バックエンドのLarge Language Model(LLM)は、アクティブなローカルサブグラフ内でのみ、タスク関連アンカーを動的に起動するロボット意図を解析し、高密度ノードキャプションや機能推論などのリソース集約的な操作をトリガーする。
これらの動的機能の評価と知覚飽和トレードオフの研究のために, JITOMA-Benchを導入し, 長期マルチタスクと複雑なマルチステップ推論のための総合的なスイートを提案する。
JITOMAは、長期タスク切替時の処理時間を維持しながら、アクティブなグラフサイズとキャプション遅延を大幅に低減することを示した。
関連論文リスト
- HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments [5.55387168911911]
HitMemは階層的な時間的3Dメモリフレームワークで、マルチモーダルなコンテキスト認識検索機構を備えている。
HitMemはオブジェクトの移動精度を大幅に向上し、探索コストを低減し、動的環境におけるタスク実行性能を向上させる。
論文 参考訳(メタデータ) (2026-09-01T09:09:21Z) - A Task-State Representation for Long-Horizon Mobile GUI Agents [53.359524744953575]
Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
論文 参考訳(メタデータ) (2026-07-01T06:37:21Z) - WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning [6.545488752368577]
本稿では,Causal Event Graph を備えた低レベルコントローラを備えた長時間水平エージェントフレームワーク WISE を提案する。
WISEは、観察とタスク関連性をリンクする明確な因果構造でエピソード記憶を増強する。
実験により、WISEは長時間のスパースタスクにおけるタスクの成功と効率を大幅に改善することが示された。
論文 参考訳(メタデータ) (2026-06-11T03:35:02Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - When Users Change Their Mind: Evaluating Interruptible Agents in Long-Horizon Web Navigation [46.98726551486937]
本稿では,長期的,環境に配慮したWebナビゲーションタスクにおいて,割り込み可能なエージェントを初めて体系的に検討する。
我々は、追加、リビジョン、リトラクションを含む3つの現実的な中断タイプを形式化し、InterruptBenchを紹介します。
統合割り込みシミュレーションフレームワークを用いて,シングルターンおよびマルチターン割り込み設定における6つの強力なLDMバックボーンの評価を行った。
論文 参考訳(メタデータ) (2026-04-01T13:40:28Z) - Online Segment Any 3D Thing as Instance Tracking [60.20416622842975]
オンライン3Dセグメンテーションをインスタンス追跡問題として再認識する(AutoSeg3D)。
視覚基礎モデルに固有の断片化問題を緩和するために,空間整合性学習を導入する。
ScanNet200上でESAMを2.8 AP上回る新しい最先端技術を確立する。
論文 参考訳(メタデータ) (2025-12-08T14:48:51Z) - Rethinking Progression of Memory State in Robotic Manipulation: An Object-Centric Perspective [16.541717037293278]
物体レベルの部分観測性の下でのストレステストロボット操作のための非マルコフタスクスイートであるLIBERO-Memを紹介する。
短軸と長軸の物体追跡と時間的に順序付けられたサブゴールを組み合わせ、現在のフレームを超えて推論を必要とする。
Embodied-SlotSSMは時間的拡張性のために構築されたスロット中心のVLAフレームワークである。
論文 参考訳(メタデータ) (2025-11-14T16:56:01Z) - Open-Vocabulary Spatio-Temporal Scene Graph for Robot Perception and Teleoperation Planning [55.90805559207812]
動的リモートシーンでは、双方向通信における伝送遅延は、リモート認識状態とオペレータ意図の間のギャップを生じさせる。
本稿では,時間的ダイナミクスと軽量遅延アノテーションを用いて,オープン語彙認識を充実させる表現を提案する。
提案手法はReplicaベンチマークで74%のノード精度を実現し,Concept.Graphよりも優れていた。
論文 参考訳(メタデータ) (2025-09-27T04:31:24Z) - Spatial-Temporal Graph Enhanced DETR Towards Multi-Frame 3D Object Detection [54.041049052843604]
STEMDは,多フレーム3Dオブジェクト検出のためのDETRのようなパラダイムを改良した,新しいエンドツーエンドフレームワークである。
まず、オブジェクト間の空間的相互作用と複雑な時間的依存をモデル化するために、空間的時間的グラフアテンションネットワークを導入する。
最後に、ネットワークが正のクエリと、ベストマッチしない他の非常に類似したクエリを区別することが課題となる。
論文 参考訳(メタデータ) (2023-07-01T13:53:14Z) - Tracking Objects and Activities with Attention for Temporal Sentence
Grounding [51.416914256782505]
時間文 (TSG) は、意味的に自然言語のクエリと一致した時間セグメントを、トリミングされていないセグメントでローカライズすることを目的としている。
本稿では,(A)マルチモーダル・検索空間を生成するクロスモーダル・ターゲット・ジェネレータと(B)マルチモーダル・ターゲットの動作を追跡し,クエリ関連セグメントを予測するテンポラル・センセント・トラッカーとを含む,新しいテンポラル・センセント・トラッカー・ネットワーク(TSTNet)を提案する。
論文 参考訳(メタデータ) (2023-02-21T16:42:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。