論文の概要: REMIND: RE-Identification with Memory for INDoor Navigation
- arxiv url: http://arxiv.org/abs/2607.09267v1
- Date: Fri, 10 Jul 2026 10:30:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.830982
- Title: REMIND: RE-Identification with Memory for INDoor Navigation
- Title(参考訳): REMIND: InDoorナビゲーションのためのメモリによる再識別
- Authors: Pablo Diaz-Pereda, Alejandro Rodriguez-Ramos, David Perez-Saura, Pascual Campoy,
- Abstract要約: モノクロRGB画像からの屋内ジェネリックオブジェクトの長期的多目的再識別のためのオンライントラッカー。
視覚的認知の証拠によって、人間は明示的な自己ローカライゼーションではなく、蓄積した外観の親しみと空間的コンテキストに依存している。
ScanNet++では、すべてのシーンで1つのエンドツーエンド検出を除いて、すべての設定で最高のIDF1を達成している。
- 参考スコア(独自算出の注目度): 39.146761527401424
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mobile robots operating indoors must re-identify previously observed objects after long temporal gaps, significant viewpoint changes, and severe illumination variations. This remains a challenging problem: multi-object tracking methods are optimized for short-term association of pedestrians and vehicles at video rates, person and vehicle re-identification approaches lack persistent memory mechanisms, and state-of-the-art video object segmentation techniques rely on reactive distractor filtering rather than enforcing global identity consistency. To address these limitations, we present REMIND, an online tracker designed for long-term multi-object re-identification of generic indoor objects from monocular RGB imagery, requiring neither camera pose nor depth. Motivated by evidence from visual cognition that humans rely on accumulated appearance familiarity and spatial context rather than explicit self-localization, REMIND combines frozen DINOv3 features with a dual-bank multi-prototype appearance memory, part- and background-level descriptors, a neighbour-context reasoning module exploiting spatial co-occurrence, and joint Hungarian assignment with ambiguity-aware safeguards. On a purpose-built indoor dataset featuring controlled revisits and dense same-class clutter, REMIND reaches 90.35% IDF1, nearly 20 points above a state-of-the-art video object segmentation baseline and more than 36 above a strong tracking-by-detection baseline. On ScanNet++, it attains the highest IDF1 in every setting but one, end-to-end detection over all scenes, where the tracking-by-detection baseline is marginally ahead while REMIND still associates and recovers identities more accurately; it also completes every scene, whereas the video object segmentation baseline exhausts GPU memory on 66.9% under YOLO detections. The complete system, evaluation framework, and dataset are publicly released.
- Abstract(参考訳): 屋内で動作している移動ロボットは、長時間の時間的ギャップ、重要な視点の変化、および激しい照明の変化の後、観測された物体を再同定する必要がある。
多目的追跡手法は、ビデオレートでの歩行者と車両の短期的な連携に最適化され、個人と車両の再識別アプローチは、永続的なメモリメカニズムが欠如しており、最先端のビデオオブジェクトセグメンテーション技術は、グローバルなアイデンティティの一貫性を強制するのではなく、リアクティブなイントラクタフィルタリングに依存している。
これらの制約に対処するために、モノクロRGB画像からジェネリック屋内オブジェクトの長期的多目的再識別のために設計されたオンライントラッカーREMINDを、カメラのポーズも奥行きも必要としない。
視覚的認識から、人間が明らかに自己ローカライゼーションではなく、蓄積した外観の親しみと空間的コンテキストに依存しているという証拠に動機づけられたREMINDは、凍結したDINOv3特徴とデュアルバンクのマルチプロトタイプの外観記憶、部分的および背景的記述子、空間的共起を生かした隣のコンテキスト推論モジュール、そしてあいまいさを意識したハンガリー人の共同割り当てを組み合わせている。
制御されたリビジットと密集した同類クラッタを備えた屋内データセットにおいて、REMINDは90.35% IDF1に達し、最先端のビデオオブジェクトセグメンテーションベースラインの20ポイント近く、強力なトラッキング・バイ・検出ベースラインの36以上に達した。
ScanNet++では、すべてのシーンで最高に高いIDF1を達成しているが、1つのエンドツーエンド検出では、トラッキング・バイ・検出のベースラインがわずかに前方にあるのに対して、REMINDはいまだにアイデンティティを関連付け、より正確に回復している。
完全なシステム、評価フレームワーク、データセットが公開されている。
関連論文リスト
- Think as Needed: Geometry-Driven Adaptive Perception for Autonomous Driving [4.320171553006484]
現在の3D検出モデルは、すべてのフレームに固定された計算予算を適用し、単純なシーンでリソースを浪費すると同時に、複雑なシーンのキャパシティを欠いている。
本稿では,各LiDARフレームの幾何学的複雑さを測定する適応型知覚アーキテクチャである拡張HOPEを提案する。
nuScenesとCARLAのベンチマークでは、強化HOPEは、正確さを損なわずに単純なシーンでのレイテンシを38%削減し、稀なロングテールシナリオでは平均平均精度を2.7ポイント改善している。
論文 参考訳(メタデータ) (2026-05-11T07:34:13Z) - Learning Spatial-Semantic Features for Robust Video Object Segmentation [108.045326229865]
本稿では,空間意味的特徴と識別的オブジェクトクエリを学習する,ロバストなビデオオブジェクトセグメンテーションフレームワークを提案する。
DAVIS 2017 test (textbf87.8%)、YoutubeVOS 2019 (textbf88.1%)、MOSE val (textbf74.0%)、LVOS test (textbf73.0%)を含むベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-07-10T15:36:00Z) - Detecting Every Object from Events [24.58024539462497]
本稿では,イベントベースの視覚において,クラスに依存しない高速なオープンワールドオブジェクト検出を実現するためのアプローチとして,イベント中のすべてのオブジェクトの検出(DEOE)を提案する。
私たちのコードはhttps://github.com/Hatins/DEOEで公開されています。
論文 参考訳(メタデータ) (2024-04-08T08:20:53Z) - Transformer Network for Multi-Person Tracking and Re-Identification in
Unconstrained Environment [0.6798775532273751]
マルチオブジェクトトラッキング(MOT)は、監視、スポーツ分析、自動運転、協調ロボットなど、さまざまな分野に深く応用されている。
我々は、オブジェクト検出とアイデンティティリンクを単一のエンドツーエンドのトレーニング可能なフレームワーク内にマージする統合MOT手法を提唱した。
本システムでは,記憶時記憶モジュールの高機能化を図り,アグリゲータを用いて効果的に記憶時記憶モジュールを符号化する。
論文 参考訳(メタデータ) (2023-12-19T08:15:22Z) - Object-Centric Multiple Object Tracking [124.30650395969126]
本稿では,多目的追跡パイプラインのためのビデオオブジェクト中心モデルを提案する。
オブジェクト中心のスロットを検出出力に適応するインデックスマージモジュールと、オブジェクトメモリモジュールで構成される。
オブジェクト中心学習に特化して、オブジェクトのローカライゼーションと機能バインディングのためのスパース検出ラベルしか必要としない。
論文 参考訳(メタデータ) (2023-09-01T03:34:12Z) - Target-Aware Object Discovery and Association for Unsupervised Video
Multi-Object Segmentation [79.6596425920849]
本稿では,教師なしビデオマルチオブジェクトセグメンテーションの課題について述べる。
より正確で効率的な時間区分のための新しいアプローチを紹介します。
DAVIS$_17$とYouTube-VISに対する提案手法を評価した結果,セグメント化精度と推論速度の両方において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2021-04-10T14:39:44Z) - Learning to Track with Object Permanence [61.36492084090744]
共同物体の検出と追跡のためのエンドツーエンドのトレーニング可能なアプローチを紹介します。
私たちのモデルは、合成データと実データで共同トレーニングされ、KITTIおよびMOT17データセットの最先端を上回ります。
論文 参考訳(メタデータ) (2021-03-26T04:43:04Z) - Relation3DMOT: Exploiting Deep Affinity for 3D Multi-Object Tracking
from View Aggregation [8.854112907350624]
3Dマルチオブジェクトトラッキングは、自律ナビゲーションにおいて重要な役割を果たす。
多くのアプローチでは、トラッキングのための2次元RGBシーケンス内のオブジェクトを検出するが、これは3次元空間内のオブジェクトをローカライズする際の信頼性の欠如である。
本稿では,隣接フレーム内の各オブジェクト間の相関をよりよく活用するために,RelationConvという新しい畳み込み演算を提案する。
論文 参考訳(メタデータ) (2020-11-25T16:14:40Z) - IA-MOT: Instance-Aware Multi-Object Tracking with Motion Consistency [40.354708148590696]
IA-MOT(Instance-Aware MOT)は、静止カメラまたは移動カメラで複数の物体を追跡できる。
提案手法は,CVPR 2020ワークショップにおけるBMTTチャレンジのトラック3で優勝した。
論文 参考訳(メタデータ) (2020-06-24T03:53:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。