論文の概要: P-POSEMEM: Projective Semantic Memory for Consistent Language Grounding under Pose-Graph Rewrites
- arxiv url: http://arxiv.org/abs/2609.15475v1
- Date: Mon, 14 Sep 2026 12:31:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.325508
- Title: P-POSEMEM: Projective Semantic Memory for Consistent Language Grounding under Pose-Graph Rewrites
- Title(参考訳): P-POSEMEM:Pose-Graphリライト下での一貫性言語接地のためのプロジェクティブセマンティックメモリ
- Abstract要約: P-POSEMEMは、それぞれの観測をその誕生時に不変事象として保存する。
Dprojは、推論等価な全グラフと辺付きグラフの言語ゴール分布間の全変分欠陥を測定する。
- 参考スコア(独自算出の注目度): 10.214485367791779
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A robot following language instructions needs its semantic memory to keep naming the same physical object while the SLAM pose graph underneath is optimized, loop-closed and compressed. Maps committing each detection to a world coordinate cannot: a closure moves the anchor it was measured from, or the solver marginalizes that anchor, and the query then selects a different object although both graphs represent the same posterior. P-POSEMEM stores each observation as an immutable event at its birth keyframe, retains the Bayes-tree elimination conditional of every marginalized keyframe, and integrates the semantic likelihood over the reconstructed joint posterior of poses, anchors and identities. Dproj, the total-variation defect between the language-goal distributions of inference-equivalent full and marginalized graphs, measures this directly. Over 40 HM3DSem scenes and 112,000 queries, P-POSEMEM reproduces the full-graph oracle (Dproj = 0) and reduces goal flips against every memory-reducing baseline. On an eight-run campaign whose 761 closures rewrote the map by up to 47 m, Dproj stays below 10^-13 with 0/288 goal flips when elimination follows the closures, where every ablation and a coordinate committed at insertion flip goals it does not; under a live bounded solver the same memory flips 23/288 against 53 for that frozen coordinate. A pre-registered negative control is detected by Dproj while leaving calibration error and navigation success unchanged, indicating that these measures capture distinct failure modes. Retrieval is held fixed by a shared frozen detector, isolating the gain to memory consistency. Code and data: https://anonymous.4open.science/r/posemem-2328/.
- Abstract(参考訳): 言語命令に従うロボットは、同じ物理オブジェクトを命名し続けるためにセマンティックメモリを必要とし、下のSLAMポーズグラフは最適化され、ループクローズされ、圧縮される。
それぞれの検出を世界座標にコミットするマップでは、クロージャが測定したアンカーを移動させるか、あるいはソルバがそのアンカーをマーカライズする。
P-POSEMEMは、各観測結果を、その誕生キーフレームにおける不変事象として保存し、すべての辺縁化キーフレームのベイズツリー除去条件を保持し、ポーズ、アンカー、アイデンティティの再構成された後部部分に対する意味的可能性を統合する。
Dproj は、推論等価な完全グラフと辺化グラフの言語ゴール分布の間の全変分欠陥であり、直接的にこれを測る。
40以上のHM3DSemシーンと112,000のクエリに対して、P-POSEMEMはフルグラフのオラクル(Dproj = 0)を再現し、メモリ削除ベースラインに対するゴールフリップを減らす。
761のクロージャが47mまでの地図を書き換える8回のキャンペーンでは、Dprojは10^-13未満に留まり、0/288のゴールフリップを除去する。
事前登録された負の制御はDprojによって検出され、キャリブレーションエラーとナビゲーション成功はそのままであり、これらの測定が異なる障害モードをキャプチャすることを示す。
Retrievalは共有冷凍検出器によって固定され、メモリ一貫性への利得を分離する。
コードとデータ:https://anonymous.4open.science/r/posemem-2328/
関連論文リスト
- RefGuard: Identity-Aware Language-Guided Robot Manipulation via Joint Target-Anchor-Frame Grounding [11.774477485982958]
RefGuardは、3変数すべてに対して共同で後続を維持することでコミットメントを遅らせるフレームワークである。
実際のUF850アームでは、RefGuardは曖昧性ストレストライアルではIDスイッチを記録せず、その90.0%で正しく実行される。
3200エピソードの手続きスイートでは、ターゲットの前にアンカーとフレームにコミットするアブレーションにおいて、解決可能な命令の正しい実行を56.6%から80.5%に引き上げている。
論文 参考訳(メタデータ) (2026-09-05T18:39:50Z) - SimFuse3D: Source-Guided Target Simulation and Confidence-Guided Multi-Stage Localization Reweighting for Cross-Platform 3D Object Detection [14.526062661334437]
センサ高さと視点の変化は、オブジェクトレベルの点分布を変化させ、クロスプラットフォームのLiDAR非教師なし領域適応を困難にする。
そこで,SimFuse3Dを導入し,ラベル付きソーススキャンから計測した幾何を用いて,対象の配置を保存し,関連する擬似オブジェクトを修復する。
論文 参考訳(メタデータ) (2026-09-04T08:41:56Z) - When Graph-JEPA Learns the Wrong Thing: Diagnosing and Repairing Category-Conditional Collapse [3.0255780640228984]
共同埋め込み予測アーキテクチャは線形探索と有効ランクによってほぼ普遍的に選択される。
本報告では,表現中に使用可能なインスタンス情報がゼロである場合に,両者が正常に読まれる事例を報告する。
Graph-JEPAは、サブグラフの残りの側面から1つのマスクされたアスペクトを予測し、線形プローブ精度0.871と有効ランク18-47を達成する。
再現性監査とターゲットゲートを備えたハーネスをリリースする。
論文 参考訳(メタデータ) (2026-08-20T19:22:49Z) - SR-JEPA: Learning Predictive Latent State in 3D Scenes [8.534434711262909]
SR-JEPAは、シーンスケールのポイントクラウドのためのポイントネイティブなJEPAである。
訓練は自己完結した3D EMAターゲットのみを使用する。
5,953個のARKitScenesオブジェクトでは、インプットされた潜伏語は43.13%のセマンティック・アイデンティティ・マクロ精度に達する。
論文 参考訳(メタデータ) (2026-08-06T09:09:16Z) - NoPA: Non-Parametric Online 3D Scene Graph Generation [57.15076373014265]
NoPAは各オブジェクトを別の非パラメトリック分布として表現する。
カーネル密度推定における平均誤差の最大化を利用して、オブジェクト候補のロバストなマージを可能にする。
NoPAは、リアルタイムの推論速度を犠牲にすることなく、現在の手法を大幅に上回る。
論文 参考訳(メタデータ) (2026-07-01T07:18:07Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations [1.2763567932588586]
ForgetEvalは1000ケースのテンプレート・スイートと385ケースの対向層(手作り+253 LLMのオラクル・バリデーション)
決定論的プリミティブは語彙的・時間的カテゴリーで十分だが、正準化に失敗する。
1000ケースのテンプレートスイートと385ケースの反対層であるForgetEvalを通じて、トレードオフを公開しています。
論文 参考訳(メタデータ) (2026-06-14T16:32:15Z) - Surflo: Consistent 3D Surface Flow Model with Global State [57.57234680235885]
Surfloは、方向付けられた3次元表面点を、ノイズからフローマッチングを通じて独立して表面へ輸送することでデコードする。
独立なポイント単位の復号化に固有の局所的不整合を抑制するために、光度勾配を注入することにより、推定時間誘導項が近傍の点と相関する。
Surfloは、サーフェスメトリクスのフィードフォワードベースラインにマッチし、数百のビューを必要とする最適化ベースのメソッドよりも桁違いに高速に動作し、グローバルなラテントと任意の解像度のデコーディングを組み合わせた唯一のフィードフォワードアプローチである。
論文 参考訳(メタデータ) (2026-06-11T17:48:38Z) - EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation [81.54723508469617]
EvoMemNavは、ゼロショットエンボディナビゲーションのための効率的で自己進化的できめ細かいメモリフレームワークである。
VSMGraphは、セマンティックキューとトポロジ的関係を持つビューをルームビューオブジェクト階層に整理する。
GOAT-BenchとHM3Dのオブジェクト、テキスト記述、画像ゴールのモダリティによる実験は、SR/SPLにおいて一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-02T11:27:44Z) - Robust Scene Coordinate Regression via Geometrically-Consistent Global Descriptors [52.57327385675752]
幾何学的構造と視覚的類似性の両方に整合したグローバルな記述子を学習するアグリゲータモジュールを提案する。
これにより、信頼できないオーバーラップスコアによる誤関連が修正される。
挑戦的なベンチマークの実験では、大規模環境ではかなりのローカライゼーションが得られた。
論文 参考訳(メタデータ) (2025-12-19T04:24:03Z) - Memorize What Matters: Emergent Scene Decomposition from Multitraverse [54.487589469432706]
3次元ガウス写像は3次元ガウス写像をベースとしたカメラのみのオフラインマッピングフレームワークである。
3DGMは、同じ領域から複数のRGBビデオをガウスベースの環境マップに変換し、同時に2D短命なオブジェクトセグメンテーションを実行する。
We build the Mapverse benchmark, sourced from the Ithaca365 and nuPlan datasets, to evaluate our method in unsupervised 2D segmentation, 3D reconstruction, and Neural rendering。
論文 参考訳(メタデータ) (2024-05-27T14:11:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。