論文の概要: Wiring Beats Blending: What Transfers Between Transformer Sizes -- and What Doesn't
- arxiv url: http://arxiv.org/abs/2608.02829v2
- Date: Mon, 10 Aug 2026 18:36:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.347229
- Title: Wiring Beats Blending: What Transfers Between Transformer Sizes -- and What Doesn't
- Title(参考訳): Wiring Beats: トランスフォーマーサイズの違いと、そうでないこと
- Abstract要約: Wecharacterize the 1.4B->410M conversion in the Pythia family end to end。
重量の残留物は、ノイズアンダーシャッフル制御と統計的に区別できない。
補償は普遍的よりもトークン効率が高く低予算の勝利である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model families are typically trained size by size, each from scratch. Can apretrained large model instead be converted into a smaller sibling? Wecharacterize the 1.4B->410M conversion in the Pythia family end to end.Representations align strongly across sizes (ridge R^2=0.84) while parametersalign weakly. Dense weight projection is functionally destructive, and abit-exact reconstruction control shows this is not an assembly artifact: basismixing breaks rotary, per-head, GELU, and LayerNorm structure. After the best-fitlinear operator, weight residuals are statistically indistinguishable from noiseunder shuffle controls. Conversion value therefore lives in initialization. Inmatched-budget continued pre-training we decompose conversion into twoindependent levers: least-squares compensation (a function lever, best zero-shot)and variance-preserving rescale (a dynamics lever, best endpoints). Compensationis a token-efficient, low-budget win rather than a universal one. At 30M tokens itbeats the strongest subcloning variant on both a width-reduced pair (84.0 +/- 1.8vs. 89.7 +/- 3.7, 3/3 seeds) and a held-out depth-reduced pair (109.3 vs. 117.9,3/3 seeds), reaching a given quality with fewer tokens. At a 33x larger budget thetwo converge to parity (40.0 vs. 40.0), both far ahead of from-scratch, whichtransfer initialization always beats: by up to 18x at low budget, with the marginnarrowing at convergence and at the largest scale. We also map the method'sboundary. At about 5x the donor scale (6.9B->1.4B) stacking both leversover-corrects, consistent with ill-conditioning of the compensation solve at largewidth, which points to dimension-aware regularization as a fix. At matched budgetour initialization also beats structured pruning with distillation, the standardpipeline for this task, and improves further when combined with it. Code,checkpoints, and the frozen evaluation corpus are released.
- Abstract(参考訳): モデルファミリーは通常、スクラッチから、サイズによって訓練されたサイズである。
事前制限された大きなモデルは、代わりにより小さな兄弟に変換できるのか?
Wecharacterize the 1.4B->410M conversion in the Pythia family end to end.Representationsaligned strong across sizes (ridge R^2=0.84) while parametersalignly。
密度の重み予測は機能的に破壊的であり、abit-exact Restruction Controlはこれがアセンブリーアーティファクトではないことを示している:basemixingはロータリ、パーヘッド、GELU、LayerNorm構造を破る。
ベストフィリニア演算子の後、重量残差はノイズアンダーシャッフル制御と統計的に区別できない。
そのため、変換値は初期化される。
Inmatched-budget の事前トレーニングでは、最小二乗補正(関数レバー、ベストゼロショット)と分散保存再スケール(動的レバー、ベストエンドポイント)という、2つの非依存レバーに変換を分解する。
補償は普遍的よりもトークン効率が高く低予算の勝利である。
30Mトークンでは、幅調整されたペア (84.0 +/- 1.8vs. 89.7 +/- 3.7, 3/3 シード) と保持された深さ調整されたペア (109.3 vs. 117.9,3/3 シード) の両方で最強のサブクローニング変種を破り、トークンが少なくて所定の品質に達する。
33倍の予算で2つがパリティ(40.0対40.0)に収束し、どちらもボトムスクラッチよりもはるかに先行し、初期化が常に打ち負かされる。
メソッドのバウンダリもマップします。
約5倍のドナースケール (6.9B->1.4B) は両レバーバー補正を積み重ね、大幅での補償の条件の悪さと一致する。
一致した予算の初期化では、蒸留に伴う構造化プルーニング、このタスクの標準ピペリンも打ち負かされ、それと組み合わせることでさらに改善される。
コード、チェックポイント、凍結した評価コーパスがリリースされる。
関連論文リスト
- SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers [50.00050394179417]
ループ変換器はレイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズと比較される。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
一連のアブリケーションを通じて、私たちはSMELTと呼ばれるレシピに到達します。これは3つの予算のすべてで未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
論文 参考訳(メタデータ) (2026-09-01T14:52:57Z) - Frozen Cores Need Task Signal: Fisher-Whitened Cross-Covariance for Low-Resource LLM Adaptation [18.8104643146881]
厳格な訓練州予算の下で, コンストラクタ効率の高い微調整の選択について検討した。
我々は、署名された入力-エラーの相互共分散を推定し、対角的なフィッシャーモーメントと白くし、その結果の局所距離でそれを切り離し、選択した方向を写像し、より薄いQRを適用して安定したコア座標を得るFCCAを紹介する。
Qwen2.5-3B では、FCCA は 83.0 のマクロ平均値に達し、その2.3 ポイントは、マッチした予算のコンストラクタよりも高く、11 タスクすべてにおいて未白の RawGrad コントロールを超えている。
論文 参考訳(メタデータ) (2026-09-01T05:52:38Z) - DepthART: Scaling Foundation Monocular Depth to Tiny Models [51.10174763031444]
DepthARTは、様々なシーンにまたがるデバイス上のデプロイメントのためのコンパクトなMDEモデルである。
ゼロショット一般化とメートル法精度の両方において、DepthARTが従来の小さなベースラインを一貫して上回っていることを示す。
また、GTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで2242/4482ドル、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達したスケーラブルなモデルファミリも提供しています。
論文 参考訳(メタデータ) (2026-07-19T06:54:52Z) - Cross-Layer Error Compensation and Finite-Sample Feature-Statistics Matching for Extreme Low-Bit Quantization of Large Language Models [0.0]
すべてのレイヤの離散コードとスケールに対する共同最適化として量子化を定式化する。
FP16教師に対して,誤差補償のみのパープレキシティ比が9.56+/-0.15に達することを示す。
Qwen2.5-1.5B で 1.125 ビットのグループバイナリの重みを持つ場合、誤差補償だけで FP16 の教師に対して 9.56 +/- 0.15 のパープレキシティ比に達する。
論文 参考訳(メタデータ) (2026-07-16T06:47:52Z) - Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers [0.0]
出力が安定すると、各トークンが4.94平均ループで均一な深さ8品質に達すると、各トークンを停止する訓練自由規則を示す。
同じモデルから抽出された収束ラベルに基づいて訓練された線形ルータは、ほぼ完全な深さを必要とし、還元しない。
実際の高速化ではなく,3点壁面ブラケットを用いたFLOPプロキシとしての平均深度を報告する。
論文 参考訳(メタデータ) (2026-07-15T23:38:44Z) - No Subspace to Track: Non-Identifiability and Optimizer State in Low-Rank Training [0.0]
GaLoreのようなメモリ効率は、ランク-r部分空間に勾配を投影することで、大きな言語モデルを訓練する。
私たちは、小さな再現可能なコアを超えて、そのようなオブジェクトは存在しないことを示します。
論文 参考訳(メタデータ) (2026-07-07T06:06:04Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Normalized Architectures are Natively 4-Bit [49.13186675123547]
重みと隠れ表現を単位超球面に制限するアーキテクチャであるnGPTは、本質的に低精度算術よりも堅牢である。
本手法は,最大3B/30Bパラメータの1.2B密度モデルとハイブリッド(Mamba-Transformer)MoEモデルの両方で検証する。
論文 参考訳(メタデータ) (2026-05-07T11:54:07Z) - Variance Is Not Importance: Structural Analysis of Transformer Compressibility Across Model Scales [0.0]
スペクトル圧縮,ブロックレベル関数置換,回転ベース量子化,アクティベーション幾何,適応早期出口について検討した。
圧縮に関連する5つの構造特性を同定する。
論文 参考訳(メタデータ) (2026-04-22T15:31:46Z) - Geometric Properties of the Voronoi Tessellation in Latent Semantic Manifolds of Large Language Models [0.0]
Qwen3.5-4B-Base上での表現多様体上のボロノイテッセルレーション
ヴォロノワ・テッセルレーションはマージンリファインメント法により緩和可能であることを示す。
論文 参考訳(メタデータ) (2026-04-08T07:36:04Z) - SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing [77.91660464664615]
Diffusion Transformers (DiTs) はビデオ生成において主要なバックボーンとなっているが、その二次的注意コストは依然として大きなボトルネックとなっている。
本稿では,不足しているコントリビューションをトレーニングなしで回収できることを示す。
パラメータフリーな線形補償分岐であるSVG-EARを導入する。
論文 参考訳(メタデータ) (2026-03-09T22:15:31Z) - Robust inverse material design with physical guarantees using the Voigt-Reuss Net [0.0]
本稿では, ハード物理保証を伴う前方および逆機械的均質化のためのスペクトル正規化サロゲートを提案する。
バイファシック・マイクロ構造のオープンデータセット上の3次元線形弾性では、完全に接続されたVoigt-Reussネットは、236のイソトロピーインディスクリプタを持つFFTベースのラベルでトレーニングされている。
全体として、Voigt-Reussネットは、大バッチで制約に一貫性のある逆設計で正確で物理的に許容できる前方予測を統一する。
論文 参考訳(メタデータ) (2025-11-14T15:17:37Z) - Temporal Zoom Networks: Distance Regression and Continuous Depth for Efficient Action Localization [6.908972852063454]
時間的行動の局所化は、正確な境界検出と計算効率の両方を必要とする。
我々は、境界距離回帰(BDR)と適応時間制限(ATR)という2つの補完的なイノベーションを通じてこの問題に対処する。
THUMOS14では、ActionFormer++ (55.7% mAP@0.7 at 235G) よりも36%少ないFLOPを用いて、151GのFLOPで56.5% mAP@0.7を達成する。
論文 参考訳(メタデータ) (2025-11-06T00:41:54Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - KrADagrad: Kronecker Approximation-Domination Gradient Preconditioned
Stochastic Optimization [69.47358238222586]
第2の順序付けにより、パラメータのステップサイズと方向を変更でき、損失曲率に適応できる。
最近、シャンプーはこれらの要求を減らすためにクローネッカーファクター付きプレコンディショナーを導入した。
不条件行列の逆行列根を取る。
これは64ビットの精度が必要で、ハードウェアの制約が強い。
論文 参考訳(メタデータ) (2023-05-30T21:15:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。