論文の概要: iSEE: Object Permanence Through Self-Supervision
- arxiv url: http://arxiv.org/abs/2610.01201v1
- Date: Thu, 01 Oct 2026 07:12:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.959373
- Title: iSEE: Object Permanence Through Self-Supervision
- Title(参考訳): iSEE: セルフスーパービジョンによるオブジェクト永続性
- Abstract要約: iSEEはラベルなしでオブジェクトを永続化するためのフレームワークです。
オブジェクトが閉じこもったときを検出し、オブジェクトが再び現れたときに再識別し、オブジェクトの隠れた位置を連続的に保持する。
LA-CATERの静的な場合、iSEEは86%のオクルージョンの後に再出現するオブジェクトを自身のスロットに返却し、SlotContrastは32%でローカライズし、ラベルでトレーニングされたSoTA RAMの4.1 mAP内に隠されたままローカライズする。
- 参考スコア(独自算出の注目度): 59.28457331222791
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Object permanence, keeping track of an object's identity and position while it is occluded, is central to video representations that track, predict and plan. Trackers that achieve it learn from boxes, track identities and visibility labels. On the other hand, self-supervised object-centric methods discover objects without labels: through slot attention, it represents a video as slots that bind to objects and follow them across frames. However, these slots are lost under occlusion, making the desired permanence impossible. Reasoning permanence is a hard problem because it requires to detect when an object becomes occluded, re-identify when object reappears, and keep the object's hidden position continuous, using reapperance as the only learning cue. To address this, we propose iSEE, a novel framework that offers all three aforementioned requirements, without any labels whatsoever. We built iSEE using the following three proposed components: (i) Object evidence modelling: a slot's attention, compared with its own past, reveals when its object is hidden. (ii) Appearance-position separation: two slot streams let the appearance be held for re-identification while the position keeps changing. (iii) Permanence from reappearance: a walker follows the hidden object's position, trained only on where the object reappears. On LA-CATER static, iSEE returns a reappearing object to its own slot after 86% of occlusions, against 32% for SlotContrast, and localises it while hidden within 4.1 mAP of the label-trained SoTA RAM. The two streams also allow downstream planning, with the position stream as the action of a world model. Project page: https://insait-institute.github.io/iSEE/
- Abstract(参考訳): オブジェクトの永続性(オブジェクトのアイデンティティと位置の追跡)は、オブジェクトが隠されている間、追跡し、予測し、計画するビデオ表現の中心となる。
ボックスから学習し、アイデンティティや可視性ラベルを追跡するトラッカー。
一方、自己監督されたオブジェクト中心のメソッドは、ラベルのないオブジェクトを発見する。スロットの注意を通して、ビデオはオブジェクトにバインドし、フレームをまたいでそれらを追跡するスロットとして表現される。
しかし、これらのスロットは排他的に失われ、望まれる永続性は不可能となる。
パーシステンスの推論は、物体が閉塞されたときに検出し、物体が再び現れたときに再識別し、物体の隠れた位置を連続的に維持する必要があるため、難しい問題である。
この問題に対処するため、我々は上記の3つの要件すべてを提供する新しいフレームワークiSEEを提案する。
私たちは以下の3つの提案されたコンポーネントを使ってiSEEを構築しました。
(i)オブジェクトエビデンスモデリング: スロットの注意は、自身の過去と比較して、そのオブジェクトがいつ隠されているかを明らかにする。
(ii)出現位置分離:2つのスロットストリームは、位置が変化し続ける間、再識別のために外観を保持させる。
3) 再出現からの永続性: 歩行者は、隠された物体の位置に従い、物体が再出現した場所のみを訓練する。
LA-CATERの静的な場合、iSEEは86%のオクルージョンの後に再出現するオブジェクトを自身のスロットに返却し、SlotContrastは32%でローカライズし、ラベルでトレーニングされたSoTA RAMの4.1 mAP内に隠されたままローカライズする。
2つのストリームは下流の計画も可能で、位置ストリームが世界モデルのアクションとなる。
プロジェクトページ: https://insait-institute.github.io/iSEE/
関連論文リスト
- REMIND: RE-Identification with Memory for INDoor Navigation [39.146761527401424]
モノクロRGB画像からの屋内ジェネリックオブジェクトの長期的多目的再識別のためのオンライントラッカー。
視覚的認知の証拠によって、人間は明示的な自己ローカライゼーションではなく、蓄積した外観の親しみと空間的コンテキストに依存している。
ScanNet++では、すべてのシーンで1つのエンドツーエンド検出を除いて、すべての設定で最高のIDF1を達成している。
論文 参考訳(メタデータ) (2026-07-10T10:30:50Z) - Finding Distributed Object-Centric Properties in Self-Supervised Transformers [59.00547715011873]
自己監督型視覚変換器(ViT)は、最終層のトークンアテンションマップでよく見られる、オブジェクトを発見できる創発的な能力を示す。
これは、[]トークンがイメージレベルの目的に基づいてトレーニングされ、オブジェクトにフォーカスするのではなく、全体像を要約しているためです。
我々は、この分散オブジェクト中心情報を抽出するトレーニング不要なObject-DINOを提案する。
論文 参考訳(メタデータ) (2026-03-27T07:22:04Z) - On Extending Semantic Abstraction for Efficient Search of Hidden Objects [0.0]
このフレームワークは、隠されたオブジェクトの排他的ドメインに対する3Dローカライゼーションと完了の学習に使用します。
本モデルでは,最初の試みにおいて,隠れた物体の完全な3次元位置を,無作為なランダム探索よりもはるかに高速に同定することができる。
論文 参考訳(メタデータ) (2025-12-22T20:25:19Z) - Offline Tracking with Object Permanence [0.8901073744693314]
本稿では,隠蔽された物体追跡に焦点をあてたオフライン追跡モデルを提案する。
これはオブジェクト永続性の概念を活用し、オブジェクトがもはや観測されていない場合でも、オブジェクトは存在し続けることを意味する。
従来のオンライン追跡結果を大幅に改善することにより、3次元多目的追跡における最先端性能を実現する。
論文 参考訳(メタデータ) (2023-10-02T15:41:35Z) - Object-Centric Multiple Object Tracking [124.30650395969126]
本稿では,多目的追跡パイプラインのためのビデオオブジェクト中心モデルを提案する。
オブジェクト中心のスロットを検出出力に適応するインデックスマージモジュールと、オブジェクトメモリモジュールで構成される。
オブジェクト中心学習に特化して、オブジェクトのローカライゼーションと機能バインディングのためのスパース検出ラベルしか必要としない。
論文 参考訳(メタデータ) (2023-09-01T03:34:12Z) - AirObject: A Temporally Evolving Graph Embedding for Object
Identification [7.266006567606757]
本研究では,オブジェクトのグローバルなキーポイントグラフに基づく埋め込みを実現するために,AirObjectと呼ばれる新しい時間的3次元オブジェクト符号化手法を提案する。
本研究では,AirObjectが映像オブジェクト識別の最先端性能を実現することを実証する。
論文 参考訳(メタデータ) (2021-11-30T06:17:03Z) - Learning to Track with Object Permanence [61.36492084090744]
共同物体の検出と追跡のためのエンドツーエンドのトレーニング可能なアプローチを紹介します。
私たちのモデルは、合成データと実データで共同トレーニングされ、KITTIおよびMOT17データセットの最先端を上回ります。
論文 参考訳(メタデータ) (2021-03-26T04:43:04Z) - Detecting Invisible People [58.49425715635312]
我々は,追跡ベンチマークを再利用し,目立たない物体を検出するための新しい指標を提案する。
私たちは、現在の検出および追跡システムがこのタスクで劇的に悪化することを実証します。
第2に,最先端の単眼深度推定ネットワークによる観測結果を用いて,3次元で明示的に推論する動的モデルを構築した。
論文 参考訳(メタデータ) (2020-12-15T16:54:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。