論文の概要: Object-centric LeJEPA
- arxiv url: http://arxiv.org/abs/2607.02404v1
- Date: Thu, 02 Jul 2026 16:38:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.922125
- Title: Object-centric LeJEPA
- Title(参考訳): オブジェクト指向LeJEPA
- Abstract要約: 画像全体ではなく、オブジェクト中心の表現をアライメントするために、LeJEPAを拡張します。
2つのモデルスケールとCOCOの10-100%のオブジェクトレベルLeJEPAは、トラッキング(DAVIS)、分類(ImageNet-1k)、セグメンテーション(ADE20k)、再識別(NAVI)において、画像レベルLeJEPAより優れています。
- 参考スコア(独自算出の注目度): 16.408669047976023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Image encoders trained with LeJEPA can deliver strong features for downstream tasks, but, like other image-level self-supervised methods, typically require large training datasets. Aligning representations at the level of objects rather than whole scenes promises greater data efficiency, but doing this in a completely self-supervised way, effectively jointly partitioning a scene and representing its objects, is unstable: the two are locked in a cyclic dependency, partitioning requires meaningful representations, while meaningful representations require consistent partitioning. We sidestep this instability by taking object masks as given during training, using cheap, off-the-shelf SAM proposals. We extend LeJEPA - whose distributional anti-collapse objective ports naturally from whole images to variable-sized sets of objects - to align object-centric representations rather than whole images. An additional instance-separating loss, which treats other objects in the same scene as negatives, further boosts downstream performance. Across two model scales and 10-100% of COCO, object-level LeJEPA outperforms image-level LeJEPA on tracking (DAVIS), classification (ImageNet-1k), segmentation (ADE20k), and re-identification (NAVI).
- Abstract(参考訳): LeJEPAでトレーニングされたイメージエンコーダは、下流タスクに強力な機能を提供するが、他のイメージレベルの自己管理メソッドと同様に、通常は大規模なトレーニングデータセットを必要とする。
全体ではなくオブジェクトのレベルで表現を調整することで、データ効率は向上するが、これを完全に自己管理的な方法で実行し、シーンを効果的に分割し、オブジェクトを表現することは不安定である。
我々は、この不安定さを、トレーニング中に与えられたオブジェクトマスクを、安価で既定のSAM提案を使って横取りする。
画像全体から可変サイズのオブジェクトセットに自然に分散的な反崩壊客観的ポートを持つLeJEPAを拡張して、画像全体ではなく、オブジェクト中心の表現を調整します。
新たなインスタンス分離損失は、同じシーンで他のオブジェクトを負として扱うことで、下流のパフォーマンスをさらに向上させる。
2つのモデルスケールとCOCOの10-100%のオブジェクトレベルLeJEPAは、トラッキング(DAVIS)、分類(ImageNet-1k)、セグメンテーション(ADE20k)、再識別(NAVI)において画像レベルLeJEPAを上回っている。
関連論文リスト
- Causal-JEPA: Learning World Models through Object-Level Latent Interventions [46.562961546550895]
C-JEPAは単純で柔軟なオブジェクト中心の世界モデルであり、イメージパッチからオブジェクト中心の表現まで、マスク付きジョイント埋め込み予測を拡張する。
物体の状態が他の物体から推測される必要があるオブジェクトレベルのマスキングを適用することで、C-JEPAは反事実的効果を伴う潜伏介入を誘導する。
論文 参考訳(メタデータ) (2026-02-11T21:47:26Z) - CObL: Toward Zero-Shot Ordinal Layering without User Prompting [0.0]
コンカレント・オブジェクト・レイヤ(CObL)という拡散型アーキテクチャを導入する。
CObL はオブジェクト層を並列に生成し、Stable Diffusion を自然オブジェクトの先駆体として使用する。
ゼロショットは、様々な種類の新しい物体を持つ現実世界のタブレットの写真に一般化される。
論文 参考訳(メタデータ) (2025-08-11T22:08:57Z) - SparseJEPA: Sparse Representation Learning of Joint Embedding Predictive Architectures [0.46040036610482665]
JEPA(Joint Embedding Predictive Architectures)は、汎用的な表現を学ぶための強力なフレームワークとして登場した。
本稿では,スパース表現学習をJEPAフレームワークに統合し,学習表現の質を高める拡張であるSparseJEPAを提案する。
論文 参考訳(メタデータ) (2025-04-22T02:43:00Z) - Are We Done with Object-Centric Learning? [65.67948794110212]
オブジェクト中心学習(OCL)は、シーン内の他のオブジェクトやバックグラウンドキューから分離されたオブジェクトのみをエンコードする表現を学習しようとする。
最近のサンプル効率のセグメンテーションモデルでは、ピクセル空間内のオブジェクトを分離し、それらを独立に符号化することができる。
我々は,OCLのレンズを通した背景刺激によるOOD一般化の課題に対処する。
論文 参考訳(メタデータ) (2025-04-09T17:59:05Z) - From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation [24.51617545483278]
画像分割タスクのための階層型トランスフォーマーモデルを提案する。
我々のアプローチの核心は、個々のピクセルからスーパーピクセルへと体系的に進化するマルチレベル表現戦略である。
このアーキテクチャは、ローカルアグリゲーションとグローバルアグリゲーションという2つの重要なアグリゲーション戦略によって支えられている。
論文 参考訳(メタデータ) (2024-09-02T16:13:26Z) - SOOD++: Leveraging Unlabeled Data to Boost Oriented Object Detection [68.18620488664187]
本稿では,SOOD++ と呼ばれる簡易かつ効果的な半教師付きオブジェクト指向検出手法を提案する。
具体的には、空中画像からの物体は、通常任意の向き、小さなスケール、密度分布を持つ。
各種ラベル付き環境下での多目的対象物に対する大規模な実験により,本手法の有効性が示された。
論文 参考訳(メタデータ) (2024-07-01T07:03:51Z) - Object-Centric Multiple Object Tracking [124.30650395969126]
本稿では,多目的追跡パイプラインのためのビデオオブジェクト中心モデルを提案する。
オブジェクト中心のスロットを検出出力に適応するインデックスマージモジュールと、オブジェクトメモリモジュールで構成される。
オブジェクト中心学習に特化して、オブジェクトのローカライゼーションと機能バインディングのためのスパース検出ラベルしか必要としない。
論文 参考訳(メタデータ) (2023-09-01T03:34:12Z) - Self-Supervised Learning from Images with a Joint-Embedding Predictive
Architecture [43.83887661156133]
本稿では,手作業によるデータ拡張に頼らずに,高度に意味のある画像表現を学習するためのアプローチを示す。
本稿では,画像からの自己教師型学習のための非生成的アプローチであるイメージベースジョイントエンベッドディング予測アーキテクチャ(I-JEPA)を紹介する。
論文 参考訳(メタデータ) (2023-01-19T18:59:01Z) - Salient Objects in Clutter [130.63976772770368]
本稿では,既存の正当性オブジェクト検出(SOD)データセットの重大な設計バイアスを特定し,対処する。
この設計バイアスは、既存のデータセットで評価した場合、最先端のSODモデルのパフォーマンスの飽和につながった。
我々は,新しい高品質データセットを提案し,前回のsaliencyベンチマークを更新する。
論文 参考訳(メタデータ) (2021-05-07T03:49:26Z) - Image-Level or Object-Level? A Tale of Two Resampling Strategies for
Long-Tailed Detection [114.00301664929911]
複数のクラスが1つの画像に存在する可能性があるため,ロングテール検出は分類と異なる。
動的でエピソードなメモリバンクに基づくオブジェクト中心のメモリリプレイ戦略を導入する。
本手法は、LVIS v0.5における最先端の長尾検出およびセグメンテーション法を様々なバックボーンにまたがる。
論文 参考訳(メタデータ) (2021-04-12T17:58:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。