論文の概要: Conditional Predictive Sufficient Statistics for Visual Representation Learning
- arxiv url: http://arxiv.org/abs/2609.30647v2
- Date: Mon, 28 Sep 2026 10:24:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-29 21:31:51.814617
- Title: Conditional Predictive Sufficient Statistics for Visual Representation Learning
- Title(参考訳): 視覚表現学習のための条件付き予測的統計量
- Abstract要約: 有用な視覚表現は、観測された過去の統計であり、将来と共有される潜在因子を保持し、パッチプライベートノイズを破棄する。
我々はこの要件を条件付き予測十分統計(CPSS)として定式化する。
MNISTとCIFAR-10の小さな因果トランスフォーマーは、リーダーボードとしてではなく診断として使用される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A useful visual representation is a statistic of the observed past that retains the latent factors shared with the future and discards patch-private noise. We formalize this requirement as a conditional predictive sufficient statistic (CPSS). Under a shared-factor model of image patches, the mutual information between the past and the next patch equals the information the past carries about the shared factor, up to a remainder that the next patch itself fails to reveal. Predicting the next patch embedding with a cosine loss is maximum likelihood for a von Mises-Fisher model of that embedding's direction, and is therefore a tractable surrogate for the predictive information. The same population loss is also minimized by a constant embedding, so stop-gradient does not by itself select the sufficient statistic; it only blocks the symmetric gradient that implements the constant solution in one step. The regression target is a shallow embedding, which forces the network output back into that shallow range and leaves the sufficient statistic in intermediate blocks. Small causal Transformers on MNIST and CIFAR-10 are used as diagnostics, not as a leaderboard. On MNIST the future shift and the stop-gradient move probe accuracy by tens of points, and the CPSS readout peaks before the output. On CIFAR-10, with the same short budget and no augmentation, every objective lands near a linear classifier on pixels. What still matches the derivation is the geometry: the CPSS output is a worse readout than its best intermediate block, next-pixel regression does not pay that penalty, and removing the stop-gradient collapses the effective rank of the embedding even when the pretext loss looks perfect.
- Abstract(参考訳): 有用な視覚表現は、観測された過去の統計であり、将来と共有される潜在因子を保持し、パッチプライベートノイズを破棄する。
我々はこの要件を条件付き予測十分統計(CPSS)として定式化する。
イメージパッチの共有要素モデルの下では、過去と次のパッチの間の相互情報は、その共有要因に関する情報と等しい。
副次的な損失を伴う次のパッチの予測は、その埋め込み方向のvon Mises-Fisherモデルにとって最大の可能性であり、したがって予測情報の抽出可能なサロゲートである。
同じ集団損失は、定数埋め込みによって最小化されるので、停止勾配はそれ自体が十分な統計量を選ぶのではなく、1ステップで定数解を実装する対称勾配をブロックするだけである。
レグレッションターゲットは浅い埋め込みであり、ネットワーク出力をその浅い範囲に戻し、中間ブロックに十分な統計を残します。
MNISTとCIFAR-10の小さな因果トランスフォーマーは、リーダーボードとしてではなく診断として使用される。
MNISTでは、将来のシフトと停止段階の移動プローブの精度が数十ポイント向上し、CPSS読み出しは出力の前にピークとなる。
CIFAR-10では、同じ予算で拡張することなく、全ての目的がピクセル上の線形分類器の近くに着地する。
CPSS出力は最良の中間ブロックよりも悪い読み出しであり、次のピクセル回帰はそのペナルティを支払わない。
関連論文リスト
- Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training [51.18425726646089]
我々は、画像とビデオの拡散モデルのための統合潜在空間フレームワークであるtextscSUREを提案する。
報酬分布を学習し、信頼性を直接利用して、密集したポストトレーニングをガイドする。
textscSURE-REFLは評価手法の中で最も高いVBench品質、セマンティック、総得点を達成する。
論文 参考訳(メタデータ) (2026-08-06T14:55:42Z) - SMOPD: Selective Token-Entropy Masking for Dirty-History Multi-Turn On-Policy Self-Distillation [0.0]
SMOPD(Selective Masking for On-Policy Distillation)は多ターンOPSDにおける損失のみの安定化手法である。
生成した中ターン応答ごとに、SMOPDは学生エントロピーによってトークンの位置をランク付けし、クリッピングされたジェンセン・シャノン蒸留損失から最低エントロピー20%を除去する。
この設計は、粗い軌道結果よりもトークンレベルの不確実性を目標とし、パラメータを追加せず、推論時のオーバーヘッドもゼロである。
論文 参考訳(メタデータ) (2026-07-30T08:40:30Z) - Anticipating the Optimism Gap: Predicting Distribution-Shift Degradation of RF-Impairment Detectors from In-Distribution Statistics [0.0]
電波障害の検知器は、通常、調整された分布で測定された単一のAUCで報告される。
アウト・オブ・ディストリビューション・データを見る前に、この楽観主義が予測できるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-20T14:10:59Z) - ScoreStop: Gradient-based early stopping using functional score tests [0.0]
本稿では,現在予測器が人口リスク最小化器であるというヌル仮説のテストとして,各イテレーションで停止決定を行う勾配に基づく早期停止則を提案する。
我々のテストでは損失値よりも勾配を用いるため、LambdaRankのような暗黙的な検証損失や、影響関数によるCox回帰のようなデータ依存的な損失にも、同じ構成が適用されます。
論文 参考訳(メタデータ) (2026-06-01T18:05:22Z) - MaxSup: Overcoming Representation Collapse in Label Smoothing [52.66247931969715]
ラベル平滑化(LS)は、ニューラルネットワーク予測における過信を減らすために広く採用されている。
LSコンパクトは、過剰に厳密なクラスタに表現を特徴付け、クラス内の多様性を希薄にする。
正しい予測と誤予測の両方に一様正則化を適用するMax Suppression(MaxSup)を提案する。
論文 参考訳(メタデータ) (2025-02-18T20:10:34Z) - Verifiably Robust Conformal Prediction [1.391198481393699]
本稿では、ニューラルネットワーク検証手法を利用して、敵攻撃時のカバレッジ保証を回復する新しいフレームワークであるVRCP(Verifiably Robust Conformal Prediction)を紹介する。
私たちのメソッドは、回帰タスクだけでなく、$ell1$, $ell2$, $ellinfty$といった任意のノルムで束縛された摂動をサポートする最初の方法です。
いずれの場合も、VRCPは名目上の範囲を達成し、SotAよりもはるかに効率的で情報的な予測領域が得られる。
論文 参考訳(メタデータ) (2024-05-29T09:50:43Z) - Reducing Predictive Feature Suppression in Resource-Constrained
Contrastive Image-Caption Retrieval [65.33981533521207]
我々は、リソース制約のあるICR手法における予測的特徴抑圧を減らすアプローチを提案する:潜在目標デコーディング(LTD)
LTDは、汎用文エンコーダの潜時空間で入力キャプションを再構成し、画像及びキャプションエンコーダが予測的特徴を抑制するのを防止する。
実験の結果,入力空間における入力キャプションの再構成とは異なり,LTDはリコール@k,r精度,nDCGスコアを高くすることで,予測的特徴抑制を低減できることがわかった。
論文 参考訳(メタデータ) (2022-04-28T09:55:28Z) - SLOE: A Faster Method for Statistical Inference in High-Dimensional
Logistic Regression [68.66245730450915]
実用データセットに対する予測の偏見を回避し、頻繁な不確実性を推定する改善された手法を開発している。
私たちの主な貢献は、推定と推論の計算時間をマグニチュードの順序で短縮する収束保証付き信号強度の推定器SLOEです。
論文 参考訳(メタデータ) (2021-03-23T17:48:56Z) - Minimax-Optimal Off-Policy Evaluation with Linear Function Approximation [49.502277468627035]
本稿では,関数近似を用いたバッチデータ強化学習の統計的理論について検討する。
記録履歴から新たな対象政策の累積値を推定するオフ・ポリティクス評価問題を考察する。
論文 参考訳(メタデータ) (2020-02-21T19:20:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。