論文の概要: Three Necessary Principles for Self-Supervised Visual Representation Learning
- arxiv url: http://arxiv.org/abs/2608.08309v1
- Date: Sat, 08 Aug 2026 19:37:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.764995
- Title: Three Necessary Principles for Self-Supervised Visual Representation Learning
- Title(参考訳): 自己監督型視覚表現学習のための3つの必要原理
- Authors: Nikos Giakoumoglou, Paschalis Giakoumoglou, Tania Stathaki,
- Abstract要約: ラベルなしで視覚表現を学習するには、3つの重複しない目的に対して協調的に完成する訓練信号が必要であると我々は主張する。
我々はこれらを観測,予測,正規化の原則として定式化し,(i) 正規化なしで観測と予測を組み合わせることで,定数エンコーダを大域最小化器として認めることを証明した。
我々は全ての理論的主張を制御実験と組み合わせ、予測の空間的結果に対するパッチ-検索評価を含む。
- 参考スコア(独自算出の注目度): 6.086784305572313
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We argue that learning visual representations without labels requires a training signal jointly complete across three non-overlapping objectives: semantic invariance across augmented views, patch-level spatial prediction, and representational non-degeneracy. We formalize these as the observation, prediction, and regularization principles and prove (i) that combining observation and prediction without regularization admits the constant encoder as a global minimizer under negative-free alignment; (ii) that the two objectives are gradient-complementary and structurally non-conflicting at the encoder output; and (iii) that the momentum encoder converges to the same fixed point as the online encoder and provides no collapse guarantee at convergence. Contrastive alignment provides only self-limiting collapse resistance, formalized via an explicit gradient-decay argument. Dropping prediction withholds the spatial training signal by construction; dropping observation forfeits cross-view semantic invariance by construction; at the scale we study, no pair substitutes for the third. Every major self-supervised method is a special case of a single unified energy decomposition. We pair every theoretical claim with a controlled experiment, including a patch-retrieval evaluation for the spatial consequence of prediction.
- Abstract(参考訳): ラベルのない視覚的表現の学習には,3つの重複しない目的 – 拡張ビュー間の意味的不変性,パッチレベルの空間予測,表現的非退化 – を共同で完全化する訓練信号が必要である,と我々は主張する。
我々はこれらを観察・予測・正規化原則として定式化し、証明する。
一 一定のエンコーダを非負のアライメントの下で大域的最小化器として認めること。
二 エンコーダ出力において、2つの目的が勾配補完的かつ構造的に非競合であること。
三 モーメントエンコーダがオンラインエンコーダと同じ固定点に収束し、収束時の崩壊保証を提供しないこと。
対照的なアライメントは、明示的な勾配遅延引数によって形式化された自己制限的な崩壊抵抗のみを提供する。
落下予測は, 建設による空間訓練信号の保持, 建設による横断的な意味的不変性の低下, 研究規模では, 3人目のペア代用は存在しない。
すべての主要な自己監督法は、単一の統一エネルギー分解の特別な場合である。
我々は全ての理論的主張を制御実験と組み合わせ、予測の空間的結果に対するパッチ-検索評価を含む。
関連論文リスト
- The Loss Is Not Enough: Sampling Conditions and Inductive Bias in Contrastive Representation Learning [2.575874871258672]
多様性条件を定式化する測度理論の枠組みを開発する。
標準のフルサポートvon Mises-Fisher設定が多様性条件の満足度を示すことを示す。
本研究は, 比較表現学習において, サンプリング機構と帰納バイアスがどのように相互作用するかを明らかにするものである。
論文 参考訳(メタデータ) (2026-06-02T23:08:30Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis [57.78407973423517]
我々は、モデルが人間の不一致を反映した不確実性を表現しながら予測する不確実性を考慮した主観性分析を提唱する。
この視点を運用するために,二相認識と不確実性アライメントの枠組みを提案する。
3つの主観的分析課題の実験は、DPUAが人間の不一致とモデルの不確実性をよりよく整合させながら、タスク性能を保っていることを示している。
論文 参考訳(メタデータ) (2026-05-11T11:52:58Z) - DOC-GS: Dual-Domain Observation and Calibration for Reliable Sparse-View Gaussian Splatting [80.43237927269575]
本稿では,新しい視点からスパースビュー3DGSの再構築について再考する。
我々は、ガウスの原始的信頼性の観測不能性として、コアチャレンジを識別する。
この観測を動機として、レンダリング画像フレームワークにおける統合されたデュアルドメイン観測と幾何学的手法を提案する。
論文 参考訳(メタデータ) (2026-04-08T07:01:24Z) - UniSTOK: Uniform Inductive Spatio-Temporal Kriging [18.058350565240637]
本稿では,観察不足下でのインダクティブ・クリグ・バックボーンを向上するプラグイン・アンド・プレイ・フレームワークを提案する。
我々のフレームワークは、元の観測結果と、欠落したエントリのみにプロキシシグナルを合成するジグソー a-augmented とからなるデュアルブランチ入力を形成する。
さまざまなパターンが欠如している複数の実世界のデータセットの実験は、大幅な改善を示している。
論文 参考訳(メタデータ) (2026-03-05T15:42:03Z) - Binary Flow Matching: Prediction-Loss Space Alignment for Robust Learning [23.616336786063552]
フローマッチングは、生成モデリングの強力なフレームワークとして登場した。
速度に基づく目的と結合した場合に発生する潜在構造ミスマッチを同定する。
信号空間に対する目的の再調整が特異重み付けを排除していることを示す。
論文 参考訳(メタデータ) (2026-02-11T02:02:30Z) - Rebenchmarking Unsupervised Monocular 3D Occupancy Prediction [18.187675837847667]
単一の画像から、特に隠された領域から3D構造を推定することは、視覚中心の自律運転において、根本的な課題でありながら未解決の課題である。
既存の教師なしアプローチは、通常、神経放射場を訓練し、評価中にネットワーク出力を占有確率として扱う。
本稿では,教師なし単分子3次元占有予測のための改良されたベンチマークを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:30:26Z) - The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems [0.0]
外部からのフィードバックのない再帰的な自己評価は、進歩よりもむしろ改革をもたらすことが多い。
3つのモデル(OpenAI GPT-4o-mini, Anthropic Claude 3 Haiku, Google Gemini 2.0 Flash)と4つのタスクファミリー(パラメータ、コード、説明、リフレクション)にまたがる144の推論シーケンスについて検討する。
我々はこれを、生成的推論における自己補正の構造的限界の証拠として解釈する。
論文 参考訳(メタデータ) (2025-10-23T07:53:26Z) - Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts [80.32933059529135]
TTA(Test-Time Adaptation)メソッドが出現し、推論中にターゲット分布に適応する。
我々は、堅牢なM3ODの両不確実性を共同で最小化するために設計された、最初のTTAフレームワークであるDual Uncertainity Optimization (DUO)を提案する。
並列に,明瞭な意味的手がかりを持つ領域における幾何学的コヒーレンスを保存する意味認識型正規場制約を設計する。
論文 参考訳(メタデータ) (2025-08-28T07:09:21Z) - Causal Unsupervised Semantic Segmentation [60.178274138753174]
教師なしセマンティックセグメンテーションは、人間のラベル付きアノテーションなしで高品質なセマンティックセマンティックセグメンテーションを実現することを目的としている。
本稿では、因果推論からの洞察を活用する新しいフレームワークCAUSE(CAusal Unsupervised Semantic sEgmentation)を提案する。
論文 参考訳(メタデータ) (2023-10-11T10:54:44Z) - Neuro-Symbolic Entropy Regularization [78.16196949641079]
構造化予測では、目的は構造化されたオブジェクトをエンコードする多くの出力変数を共同で予測することである。
エントロピー正則化(Entropy regularization)という1つのアプローチは、決定境界が低確率領域にあるべきであることを示唆している。
我々は、モデルが有効対象を確実に予測することを奨励する損失、ニューロシンボリックエントロピー正規化を提案する。
論文 参考訳(メタデータ) (2022-01-25T06:23:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。