論文の概要: The JEPA Predictor: A Transferable Operator for Occluded Feature Completion
- arxiv url: http://arxiv.org/abs/2607.16274v2
- Date: Tue, 21 Jul 2026 17:41:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.067823
- Title: The JEPA Predictor: A Transferable Operator for Occluded Feature Completion
- Title(参考訳): JEPA Predictor:Occluded Feature Completion用の転送可能なオペレータ
- Authors: William Nguyen, Christopher Nguyen,
- Abstract要約: JEPA(Joint-Embedding Predictive Architectures)は、予測器をエンコーダと共同でトレーニングするが、下流デプロイメントは予測器を捨て、エンコーダから機能を読み取る。
この演算子はエンコーダファミリ間で可搬可能であることを示す。
- 参考スコア(独自算出の注目度): 1.2664079403656765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Joint-Embedding Predictive Architectures (JEPAs) train a predictor jointly with their encoder, but downstream deployment discards the predictor and reads features from the encoder alone. The predictor is, by construction, a learned operator from visible-context features to features at masked positions, the structure a partial-view classifier needs. We show that this operator is portable across encoder families. We first establish that, at heavy mask, retaining the frozen predictor on a JEPA encoder substantially closes the accuracy gap against the strongest non-JEPA discriminative baselines. We then bolt the frozen predictors of I-JEPA and V-JEPA 2 onto four non-JEPA hosts (CLIP, DINOv3, DINOv2, MAE) through a single linear projection between feature spaces, fit in closed form on 500 ImageNet-1k images. Across both ImageNet-9 and Stanford Dogs and across three mask fractions, the lift over each host's masked-encoder baseline grows monotonically with the mask fraction K in every host-donor pair. CLIP paired with the I-JEPA predictor recovers most of the accuracy that masking removed on ImageNet-9 at heavy occlusion, and lifts fine-grained Stanford Dogs from 15.9% to 52.1% (+36 pp). The mechanism is identifiable: the projection pays a fixed cost on visible patches and the predictor provides a growing benefit on masked patches; the benefit dominates the heavy-occlusion regime. At low K on fine-grained classification the projection cost exceeds the benefit, defining the boundary where the linear bridge breaks down. The frozen JEPA predictor functions as a portable operator for occluded feature completion across encoder families, requiring no retraining of either model while fitting matched linear probes per mask fraction.
- Abstract(参考訳): JEPA(Joint-Embedding Predictive Architectures)は、予測器をエンコーダと共同でトレーニングするが、下流デプロイメントは予測器を捨て、エンコーダから機能を読み取る。
予測器は、構成上、可視的コンテキストの特徴から、マスキングされた位置における特徴、部分的なビュー分類器を必要とする構造まで、学習された演算子である。
この演算子はエンコーダファミリ間で可搬可能であることを示す。
我々はまず,JEPAエンコーダの凍結予測器をヘビーマスクで保持することで,JEPA非差別的ベースラインに対する精度のギャップを大幅に縮めることを確認した。
次に,I-JEPA と V-JEPA 2 の凍結予測器を,500 ImageNet-1k 画像上の閉形式に収まる特徴空間間の単一の線形投影により,4つの非 JEPA ホスト (CLIP, DINOv3, DINOv2, MAE) にボルトする。
ImageNet-9とStanford Dogsの両方、および3つのマスク分数で、各ホストのマスクエンコーダベースライン上のリフトは、ホスト-ドナーペア毎のマスク分数Kとともに単調に成長する。
CLIPとI-JEPA予測器が組み合わされたCLIPは、ImageNet-9で除去されたマスキングの精度を回復し、微細なスタンフォードドッグを15.9%から52.1%(+36 pp)まで引き上げる。
プロジェクションは可視パッチに固定コストを払い、予測器はマスクパッチに増大する利益を提供する。
細粒度分類における低Kでは、投射コストは利益を超え、線形橋が崩壊する境界を定義する。
凍結されたJEPA予測器は、エンコーダファミリにまたがる機能補完のポータブル演算子として機能し、マスク分ごとに一致した線形プローブを適合させながら、どちらのモデルの再トレーニングも必要としない。
関連論文リスト
- CF-JEPA: Mask-free forward prediction with asymmetric encoder utilization for time-series representation learning [3.526682160724688]
クロップベースのForward JEPAは、マスクをマルチ水平前方予測に置き換える革新的なマスクフリーフレームワークとして提案されている。
オンラインエンコーダと指数移動平均(EMA)目標エンコーダとの間には強い非対称性が同定され、どちらも単一のトレーニングランから生成される。
CF-JEPA は自己監督ベースラインの中で UCR と UEA の最高平均精度とランクを達成している。
論文 参考訳(メタデータ) (2026-06-05T08:21:20Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - From Measurement to Mitigation: Quantifying and Reducing Identity Leakage in Image Representation Encoders with Linear Subspace Removal [9.492715910999749]
擬似認識率の低い開集合検証を報告する視覚埋め込みのベンチマークと、推定されたアイデンティティ部分空間を除去する1ショット線形プロジェクタを提案する。
CelebA-20 と VGGFace2 全体では、これらのエンコーダは開集合線形プローブの下で堅牢であることを示す。
この結果から,非FRエンコーダの顔認証監査を初めて実施した。
論文 参考訳(メタデータ) (2026-04-07T01:03:51Z) - LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels [49.35636088613484]
JEPA(Joint Embedding Predictive Architectures)は、コンパクトな潜在空間で世界モデルを学習するための魅力的なフレームワークを提供する。
最初のJEPAであるLeModelWorldを紹介します。
数時間で1つのGPU上で15万のパラメータをトレーニングできるため、LeWMはファンデーションモデルベースの世界モデルよりも48倍高速に計画している。
論文 参考訳(メタデータ) (2026-03-13T19:48:14Z) - LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics [53.247652209132376]
JEPA(Joint-Embedding Predictive Architectures)は、有望な青写真を提供するが、実践的なガイダンスや理論の欠如がアドホックな研究開発につながっている。
我々はJEPAの包括的な理論を示し、それをbf LeJEPAでインスタンス化する。
論文 参考訳(メタデータ) (2025-11-11T18:21:55Z) - Split-Fuse-Transport: Annotation-Free Saliency via Dual Clustering and Optimal Transport Alignment [10.013879292840707]
Salient Object Detection (SOD) は、視覚的に目立つ領域を画像に分割することを目的としており、様々なコンピュータビジョンアプリケーションの基礎となるタスクとして機能している。
我々は、SODが1ピクセルレベルのラベルなしでほぼ監督された精度に達することができると仮定するが、信頼できる擬似マスクが利用可能である場合に限られる。
我々は,POTの単一k-平均ステップをエントロピー誘導デュアルクラスタリングヘッドで置き換える,プロトタイプ最適輸送の適応であるPOTNetを紹介する。
このスプリット・フューズ・トランスポートの設計は、手作りの先行を使わずに、よりシャープで部分認識の擬似マスクを単一の前方通過で得る。
論文 参考訳(メタデータ) (2025-10-20T12:27:55Z) - Label-Efficient Grasp Joint Prediction with Point-JEPA [0.0]
Point-JEPAによる3次元自己教師付き事前トレーニングにより,ラベル効率のよいグリップ・アングル予測が可能となる。
JEPAスタイルの事前学習は、データ効率のよい学習のための実践的なレバーである。
論文 参考訳(メタデータ) (2025-09-13T21:00:03Z) - How JEPA Avoids Noisy Features: The Implicit Bias of Deep Linear Self Distillation Networks [14.338754598043968]
データ表現の自己教師型学習には2つの競合パラダイムが存在する。
JEPA(Joint Embedding Predictive Architecture)は、意味的に類似した入力が互いに予測可能な表現に符号化されるアーキテクチャのクラスである。
論文 参考訳(メタデータ) (2024-07-03T19:43:12Z) - Consistency Regularization for Deep Face Anti-Spoofing [69.70647782777051]
顔認証システムでは、顔認証(FAS)が重要な役割を担っている。
このエキサイティングな観察によって、異なる視点の特徴整合性を促進することが、FASモデルを促進するための有望な方法かもしれないと推測する。
FASにおけるEPCR(Embeddding-level and Prediction-level Consistency Regularization)とEPCR(Embeddding-level Consistency Regularization)を併用した。
論文 参考訳(メタデータ) (2021-11-24T08:03:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。