論文の概要: A Two-Parameter Weibull Framework for Diagnosing Transformer Weight Distributions
- arxiv url: http://arxiv.org/abs/2605.18898v1
- Date: Sun, 17 May 2026 11:00:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:08.858885
- Title: A Two-Parameter Weibull Framework for Diagnosing Transformer Weight Distributions
- Title(参考訳): 変圧器重量分布診断のための2パラメータワイブルフレームワーク
- Authors: Tiexin Ding,
- Abstract要約: 変圧器の重量分布の診断枠組みとしてWeibull分布を適用した。
SwiGLU/GeLUアクティベーション、プレLN/QK-Norm配置、70M-14Bサイズで共有されるFFNモジュールとアテンション出力プロジェクションW_oが狭帯域に落下することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We apply the Weibull distribution -- a two-parameter family from extreme-value theory -- as a diagnostic framework for element-wise weight magnitude distributions in transformers. At initialization, i.i.d. Gaussian weights give |w| ~ HalfNormal, yielding k ~ 1.20 via middle-80% probability-plot fit (the protocol used throughout this work). This anchor makes k a principled, architecture-independent measuring stick for training dynamics; fitting each weight matrix independently at every layer at every checkpoint enables per-component, per-layer, and per-step diagnostics that aggregate statistics cannot resolve. Applying this framework to 12 model entries spanning 7 architectural families (Pythia, OLMo-1/2, LLaMA-3, Mistral, Qwen2.5/3) reveals three findings. First, FFN modules and the attention output projection W_o -- the Transmission Class -- fall in a narrow k band: median terminal k in [1.186, 1.204] across 12 entries (cross-family CV = 0.51%), shared across SwiGLU/GeLU activations, Pre-LN/QK-Norm placements, and 70M-14B sizes. Second, the attention input projections W_q, W_k -- the Selection Class -- depart from the Weibull family, with severity shaped by storage: separately-stored Q/K (OLMo-1, OLMo-2) yields k in [0.76, 0.99] (deep); GQA models yield k in [1.10, 1.16] (mild); Pythia's merged W_qkv occupies a transitional zone tracking training budget T/tau monotonically. Third, lambda grows substantially during training and scales with sqrt(eta/lambda_wd) within the Pythia family (Pearson r = 0.94, three Transmission kinds), directionally consistent with Fan et al. (2025). The two parameters carry independent information: k labels the functional class, lambda labels training progress. We release npm-weibull-py v0.4 (Python library) and DATABASE_v9_1 at https://github.com/tiexinding/NPM-Weibull-public .
- Abstract(参考訳): 極値理論の2パラメータファミリーであるWeibull分布を、変圧器の要素量等級分布の診断フレームワークとして適用する。
初期化において、すなわちガウス重みは |w| ~ HalfNormal を与え、k ~ 1.20 を中間80%の確率プロット整合(この研究で使われるプロトコル)によって得る。
それぞれの重み行列を各チェックポイントに独立して配置することで、統計を集計できないコンポーネント毎、レイヤ毎、ステップ毎の診断が可能になる。
このフレームワークを7つのアーキテクチャファミリ(Pythia, OLMo-1/2, LLaMA-3, Mistral, Qwen2.5/3)にまたがる12のモデルエントリに適用すると、3つの結果が明らかになる。
まず、FFNモジュールとアテンション出力プロジェクションW_o -- 送信クラス -- は、12エントリ(クロスファミリーCV = 0.51%)にわたる[1.186, 1.204]中央の端子k、SwiGLU/GeLUアクティベーション、プレLN/QK-Norm配置、70M-14Bサイズで共有される、狭いkバンドに該当する。
第2に、注目入力射影 W_q, W_k -- 選択クラス -- はWeibullファミリーから分離して、保存によって形づくられた重大さを持つ: 個別に保存された Q/K (OLMo-1, OLMo-2) は [0.76, 0.99] (ディープ) GQA モデルは [1.10, 1.16] (ミルド) で k を出力し、Pythia の合併した W_qkv はトランジショナルゾーン追跡トレーニング予算 T/tau を独占的に占有する。
第3に、ラムダはトレーニング中に大きく成長し、Pythiaファミリー内のsqrt(eta/lambda_wd)でスケールする(Pearson r = 0.94, three Transmission kinds)。
kは関数クラスをラベル付けし、ラムダラベルはトレーニングの進捗をラベル付けする。
npm-weibull-py v0.4(Pythonライブラリ)とdataBASE_v9_1をhttps://github.com/tiexinding/NPM-Weibull-publicでリリースします。
関連論文リスト
- Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - Metric Unreliability in Multimodal Machine Unlearning: A Systematic Analysis and Principled Unified Score [14.579552536669217]
一般データ保護規制法に準拠するためには、ビジョンランゲージモデル(VLM)のアンラーニングが必要である。
マルチモーダル・アンラーニングにおける信頼性の最初の研究について述べる。
統一品質スコア(Unified Quality Score, UQS)は, 各計量のスピアマン相関と距離の関係から得られる重みを持つ計量である。
論文 参考訳(メタデータ) (2026-05-04T04:13:00Z) - Posterior Augmented Flow Matching [64.1559809786948]
後拡張フローマッチング(PAFM)はフローマッチング(FM)の一般化である
PAFMは、異なるモデルスケールで最大3.4FID50KでFMよりも改善されていることを示す。
論文 参考訳(メタデータ) (2026-05-01T17:59:59Z) - Zoom Consistency: A Free Confidence Signal in Multi-Step Visual Grounding Pipelines [0.880899367147235]
マルチステップズームインパイプラインはGUIグラウンディングに広く利用されている。
中間出力は、無償で有用な信頼信号: ズーム一貫性を含む。
理想化条件下でのステップ1空間誤差の線形推定器であることを示す。
論文 参考訳(メタデータ) (2026-04-15T20:47:08Z) - MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts [0.0]
大規模言語モデル(LLM)は、主に高密度トランスフォーマーとしてデプロイされ、すべてのトークンに対してフィードフォワードブロック内の全てのパラメータがアクティブになる。
MoEfication、CMoE、ToMoE、MoOREといった最近のアップサイクリング手法は、高密度フィードフォワードネットワーク内の疎小で半モジュラーなサブ構造に有用な計算の大部分が存在していることを明らかにしている。
本稿では,高密度の変圧器ブロックを静的な高心性混合体に再構成する学習自由変換であるMoE(MLP-Experts)を紹介する。
論文 参考訳(メタデータ) (2025-11-26T06:14:26Z) - MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes [60.57770396565211]
強い推論能力は、はるかに少ないデータで実現可能であることを示す。
MobileLLM-R50MのAIMEスコアは15.5であり、OLMo-2-1.48Bは0.6、SmolLM-2-1.7Bは0.3である。
論文 参考訳(メタデータ) (2025-09-29T15:43:59Z) - Lookup multivariate Kolmogorov-Arnold Networks [5.639419519849473]
高次元線形写像は、現代のディープラーニングモデルのパラメータ数と計算コストの両方を支配している。
汎用的なドロップイン置換, ルックアップ多変数Kolmogorov-Arnold Networks (lmKANs)を導入する。
lmKANはキャパシティと推論コストのトレードオフを著しく改善します。
論文 参考訳(メタデータ) (2025-09-08T18:00:35Z) - KPZ scaling from the Krylov space [83.88591755871734]
近年,Cardar-Parisi-Zhangスケーリングをリアルタイムの相関器や自動相関器に示す超拡散が報告されている。
これらの結果から着想を得て,Krylov演算子に基づく相関関数のKPZスケーリングについて検討する。
論文 参考訳(メタデータ) (2024-06-04T20:57:59Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。