論文の概要: An Exploratory Replica-Overlap Probe of the Grokking Transition
- arxiv url: http://arxiv.org/abs/2609.25634v1
- Date: Tue, 22 Sep 2026 03:44:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.196168
- Title: An Exploratory Replica-Overlap Probe of the Grokking Transition
- Title(参考訳): グラッキング遷移の探索的レプリカ・オーバーラッププローブ
- Abstract要約: 4つの構成で64の独立したシードネットワークをトレーニングしました。
我々は、RSBにインスパイアされた対の重みの分布が、グルーキング遷移において重なり合うかどうかを問う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We trained 64 independently seeded networks in four configurations, continuing each to sustained convergence or a 40,000-epoch ceiling. We then asked whether an RSB-inspired distribution of pairwise weight overlaps changes across the grokking transition. It is the alignment step, not the overlap statistic, that determines what this registered probe can report. The registered implementation permutes hidden units without the corresponding bias and head-internal permutations and therefore does not preserve the network function. Every q_wt value computed through this alignment inherits the defect; q_fn does not, because it is computed from predictions of the unpermuted models. The numerical-precision requirement also failed, and an audit found protocol deviations. Consequently, the pre-registered rule gives no verdict: registered outcome UNDETERMINED (reason code C0_INSTRUMENT_INVALID). These data provide neither a confirmatory null nor a validated reading of the Parisi order parameter. Only frac40 cleared the 12/16 checkpoint-completeness requirement. For this configuration, a post-hoc criterion applied to the same data gave a Hartigan-dip interval containing zero (95% CI for Delta dip = [-0.017, 0.034]), whereas the overlap standard deviation increased by a factor of about 5.6. A post-hoc calibration assigns the dip test zero power at the simulated separations; the interval is therefore uninformative, not evidence of no change. The standard-deviation ratio is the only statistic here with power at the observed effect. Ensemble loss was near-flat only under the pre-specified 1% threshold. Finally, grokking rates of 0/16, 11/16 and 16/16 remain descriptive because train fraction is confounded with split identity.
- Abstract(参考訳): 4つの構成で64の独立したシードネットワークをトレーニングし、それぞれが持続的収束または4万エポシック天井を維持しました。
次に、RSBにインスパイアされた対の重みの分布が、グルーキング遷移における変化と重なり合うかどうかを問うた。
これはアライメントステップであり、オーバーラップ統計ではなく、登録されたプローブが何を報告できるかを決定するものである。
登録された実装は、対応するバイアスや頭内置換を伴わずに隠れたユニットを置換するので、ネットワーク機能を保存することはできない。
このアライメントを通じて計算されるすべてのq_wt値は欠陥を継承する。
数値精度の要求も失敗し、監査によってプロトコルの偏差が見つかった。
その結果、事前登録されたルールは、判定を下さない: 登録された結果 UNDETERMINED (Rereason code C0_INSTRUMENT_INVALID)。
これらのデータは、パリの順序パラメータの確認nullも検証された読み取りも提供しない。
FR40のみが12/16のチェックポイント完全性要件をクリアした。
この構成のために、同じデータに適用されたポストホック基準は、ゼロを含むハーディガン・ディップ間隔(デルタディップの95% CI = [-0.017, 0.034])を与えたが、重なり合う標準偏差は約5.6である。
ポストホックキャリブレーションは、模擬分離におけるディップテストゼロパワーを割り当てる。
標準偏差比は、観測された効果で力を持つ唯一の統計量である。
アンサンブル損失は、予め指定された1%の閾値でのみほぼ平坦であった。
最後に、0/16、11/16、および16/16のグルーキングレートは、列車の分数分が分割IDで構成されているため、記述的のままである。
関連論文リスト
- QEMScore: How Much Does the Measurement Add to Learned Quantum Error Mitigation? [23.55753073065416]
精度表は、手渡された回路構造が、測定を全く読まずによく得点できるので、言い切れない。
QEMScoreは、可能な比較を追加する。
学習したミチゲータは、同じ回路記述を読み込むが測定をしないモデルであるキャパシティマッチング制御の横にスコアされる。
論文 参考訳(メタデータ) (2026-09-15T22:39:09Z) - SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation [22.56867206175605]
SCOPE-OPSDは、特権教師の残余を冷凍ランク64因子に投影する。
OPSDがすでに必要としているフォワードを再利用し、ロールアウトも推論時モジュールも追加しない。
Qwen3-1.7B、4B、8Bの完全な25/50/75/100ステップの軌道は、Structuredは純粋なOPSD以下ではない。
論文 参考訳(メタデータ) (2026-09-11T08:33:52Z) - What Fixed-Rollout pass@k Evaluations Can Identify [3.0318216701273397]
繰り返しサンプリング評価は、問題毎に収集されたサンプル数nをはるかに超え、pass@kを外挿する。
プール/ランダム・タスク条件付きビノミカルモデルでは、固定nの成功回数は、潜在タスク毎の成功分布の n 自由モーメントのみを識別する。
論文 参考訳(メタデータ) (2026-09-08T10:27:52Z) - Data Diversity, Not Frequency Invariance: A Controlled and Self-Audited Study of Compression-Robust Deepfake Detection [0.26856688022781555]
周波数特徴と圧縮不変表現学習は、ビデオ圧縮に耐えるディープフェイク検出の鍵であると広く考えられている。
本稿では, CAFRL - block-DCT および FFT-phase ストリーム, 圧縮レベル条件付き帯域アテンション, 逆(逆)圧縮でこれを検証する。
キャパシティと拡張整合制御を備えた事前登録されたプロトコルの下では、マルチ品質データに対するプレーンなEfficientNet-B0が、各圧縮レベルで指定されたCAFRLを上回った。
論文 参考訳(メタデータ) (2026-08-26T12:05:10Z) - The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models [22.461983628330277]
多くの少数ショット適応手法は、ゼロショットテキストプロトタイプとKラベル付き画像特徴の平均の凸の組み合わせで分類される。
正しい比率は何か、検証データなしで見積もることができるのか、パフォーマンスがどこにあるのかを尋ねる。
4800以上の細胞(SigLIPを含む5つのバックボーン、5つのショットカウント、5つのシード、4つのプロンプトレベル)が、理論上最適な比率は間違った量の信頼できる推定値である。
検証不要な線形プローブは、オラクルチューニングされたブレンド(CLAPは+1.9ポイント、LP++は+1.5ポイント)を破る。
論文 参考訳(メタデータ) (2026-08-23T15:02:33Z) - Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection [0.0]
ベンチマーク汚染はn-gram重なり、可能性に基づくメンバーシップ推論、カナリア文字列と診断される。
これを行う自然な方法はうまくいかないことを示し、測定を生き残るものを特定し、それを動作させる補正が、テストされるnullよりも多くのばらつきをもたらすことを見つけます。
論文 参考訳(メタデータ) (2026-08-12T23:27:20Z) - Beyond Marginal Validity: Finite-Sample Guarantees for Localized Conformal Prediction [25.59471163637912]
コンフォーマル予測は、有限サンプルで分布のない辺縁被覆を持つ任意のブラックボックス予測子を与える。
我々は、条件付き妥当性とオラクル効率を協調的に制御する実現された局所集合に対して有限サンプル保証を提供する。
スコアがピボットスコアを目標とする場合、均一な局所保証は固定スコアキャリブレーションと均一なスコア推定誤差に分解される。
論文 参考訳(メタデータ) (2026-08-06T15:59:57Z) - Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models [0.0]
ClosurePairsは、繰り返し発生する障害を伴う互換性のあるマイクロステートを横断します。
ソースの属性は確実に回復する。
非線形相互作用ベンチマークにおける等予算分解誤差を低減する。
論文 参考訳(メタデータ) (2026-08-01T11:07:24Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - PAIR-CI: Calibrated Conditional Independence Testing for Causal Discovery with Incomplete Data [0.0]
PAIR-CIは非パラメトリック条件独立(CI)テストであり,複数の命令を直接推論手順に統合することによりキャリブレーションを回復する。
確率的に一貫した分散推定器は、クロスバリデーションと多重計算による不確かさを共同で説明する。
論文 参考訳(メタデータ) (2026-05-06T12:34:37Z) - Conformal changepoint localization [36.191356601153146]
配電系統におけるオフライン変更点の局所化問題について検討する。
我々は、他の仮定をせずに変化が起こる指数に対して有限サンプルの信頼セットを生成する。
実験によると、CONCHは画像やテキストを含む困難な設定であっても、正確な信頼セットを提供する。
論文 参考訳(メタデータ) (2026-02-05T23:50:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。