論文の概要: An Accuracy--Information Tradeoff for Loss-Difference Conditional Mutual Information
- arxiv url: http://arxiv.org/abs/2610.09206v1
- Date: Tue, 06 Oct 2026 23:07:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.642331
- Title: An Accuracy--Information Tradeoff for Loss-Difference Conditional Mutual Information
- Title(参考訳): ロスディファレンス条件付き相互情報の正確性-情報トレードオフ
- Abstract要約: 損失差条件付き相互情報(ld-CMI)は、一般化境界のスーパーサンプル階層における標準観測の最小値を使用する。
損失差の3つの瞬間をバウンドすることで、精度がld-CMIを強制することを示す。
- 参考スコア(独自算出の注目度): 0.16921396880325776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Loss-difference conditional mutual information (ld-CMI) uses the smallest of the standard observations in the supersample hierarchy of generalization bounds: it measures what a learner's loss differences reveal about which candidate of each pair it was trained on. Accuracy is known to force information into the model; data processing does not carry such lower bounds to losses. We show, by bounding three moments of the loss differences, that accuracy also forces ld-CMI. For linear predictors with a smooth convex loss of nonzero slope at zero, such as the logistic loss, plus a regularizer whose curvature and growth are both of power $r\ge2$, on product distributions over a scaled sign cube in dimension at least linear in $n$, every proper learner with expected excess risk at most $\varepsilon$ on these distributions at the optimal sample size $n\asymp\varepsilon^{-2+2/r}$ has worst-case ld-CMI of order $n$ bits, and $Θ(n/(1+(τ/\varepsilon)^2))$ bits under Gaussian noise of standard deviation $τ$ on the loss differences. The same holds without a regularizer, at $n\asymp\varepsilon^{-2}$. Consequently, range-scaled ld-CMI bounds cannot vanish on these distributions, although every proper learner's generalization gap is $O(n^{-1/2})$. We also show that model-level information does not determine noisy loss-difference information, and that the growth, slope and dimension conditions are needed, the last up to a logarithm.
- Abstract(参考訳): 損失差条件付き相互情報(ld-CMI)は、一般化境界のスーパーサンプル階層における標準観測の最小値を使用する。
データ処理はそのような低い境界を損失に持たない。
損失差の3つの瞬間をバウンドすることで、精度がld-CMIを強制することを示す。
ロジスティック損失などゼロの非ゼロ斜面の滑らかな凸損失を持つ線形予測器と、曲率と成長がともにパワー$r\ge2$である正規化器の場合、スケールされた符号立方体上の積の分布を少なくとも線型に$n$で、最大で$\varepsilon$で予想される余剰リスクを持つすべての固有学習器$n\asymp\varepsilon^{-2+2/r} の分布について$n$ビットの最低ケースld-CMIと$n$ビットの$(n/(1+(τ/\varepsilon)^2) のビットは、標準偏差のガウスノイズの下で$τ$である。
同じことは正規化子なしで、$n\asymp\varepsilon^{-2}$で成り立つ。
したがって、レンジスケールのld-CMI境界は、すべての固有学習者の一般化ギャップが$O(n^{-1/2})$であるにもかかわらず、これらの分布では消滅しない。
また, モデルレベルの情報によってノイズ損失差情報が決定されず, 成長条件, 傾斜条件, 寸法条件が必要であり, 最終値が対数となることを示す。
関連論文リスト
- Optimal Lower Bounds for Networked Information Aggregation [3.130458422860269]
最悪のケースでは、ガウスのインスタンス上のネットワーク情報アグリゲーションが$ell$-errorを$(1/sqrtD)でバウンドする。
論文 参考訳(メタデータ) (2026-08-16T01:36:33Z) - Adaptive Confidence Intervals in Efron's Gaussian Two-Groups Model [28.636700996382558]
敵のノイズに満ちた性質により、Efronのガウス的二群分数モデルにおいて、ヌル位置パラメータ$$に対する信頼区間を研究する。
信頼区間の最小最適長を、未知の割合の汚染と全てのノイズに満ちた敵に対して、所定のカバレッジレベルで特徴付ける。
論文 参考訳(メタデータ) (2026-04-28T22:40:54Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Tight Bounds for Logistic Regression with Large Stepsize Gradient Descent in Low Dimension [36.3266119975955]
分離可能なデータを用いた二項分類のための線形モデルを訓練するために、降下によるロジスティック勾配を最小化する最適化問題を考察する。
十分な学習率を持つGDが$mathcalO (1/(T))$よりも小さく、$T geq (n/+ 1/2)$の場合、$n$はデータセットサイズであることを示す。
論文 参考訳(メタデータ) (2026-02-12T22:58:18Z) - General Gaussian Noise Mechanisms and Their Optimality for Unbiased Mean
Estimation [58.03500081540042]
プライベート平均推定に対する古典的なアプローチは、真の平均を計算し、バイアスのないがおそらく相関のあるガウスノイズを加えることである。
すべての入力データセットに対して、集中的な差分プライバシーを満たす非バイアス平均推定器が、少なくとも多くのエラーをもたらすことを示す。
論文 参考訳(メタデータ) (2023-01-31T18:47:42Z) - How Does Pseudo-Labeling Affect the Generalization Error of the
Semi-Supervised Gibbs Algorithm? [73.80001705134147]
擬似ラベル付き半教師付き学習(SSL)におけるGibsアルゴリズムによる予測一般化誤差(ゲンエラー)を正確に評価する。
ゲンエラーは、出力仮説、擬ラベルデータセット、ラベル付きデータセットの間の対称性付きKL情報によって表現される。
論文 参考訳(メタデータ) (2022-10-15T04:11:56Z) - A Law of Robustness beyond Isoperimetry [84.33752026418045]
我々は、任意の分布上でニューラルネットワークパラメータを補間する頑健性の低い$Omega(sqrtn/p)$を証明した。
次に、$n=mathrmpoly(d)$のとき、スムーズなデータに対する過度なパラメータ化の利点を示す。
我々は、$n=exp(omega(d))$ のとき、$O(1)$-Lipschitz の頑健な補間関数の存在を否定する。
論文 参考訳(メタデータ) (2022-02-23T16:10:23Z) - Black-Box Generalization [31.80268332522017]
微分一般化によるブラックボックス学習のための最初の誤り解析を行う。
どちらの一般化も独立$d$,$K$であり、適切な選択の下では学習率がわずかに低下していることを示す。
論文 参考訳(メタデータ) (2022-02-14T17:14:48Z) - Optimal Robust Linear Regression in Nearly Linear Time [97.11565882347772]
学習者が生成モデル$Y = langle X,w* rangle + epsilon$から$n$のサンプルにアクセスできるような高次元頑健な線形回帰問題について検討する。
i) $X$ is L4-L2 hypercontractive, $mathbbE [XXtop]$ has bounded condition number and $epsilon$ has bounded variance, (ii) $X$ is sub-Gaussian with identity second moment and $epsilon$ is
論文 参考訳(メタデータ) (2020-07-16T06:44:44Z) - Online Robust Regression via SGD on the l1 loss [19.087335681007477]
ストリーミング方式でデータにアクセス可能なオンライン環境において、ロバストな線形回帰問題を考察する。
この研究で、$ell_O( 1 / (1 - eta)2 n )$損失の降下は、汚染された測定値に依存しない$tildeO( 1 / (1 - eta)2 n )$レートで真のパラメータベクトルに収束することを示した。
論文 参考訳(メタデータ) (2020-07-01T11:38:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。