論文の概要: Coupled Scaling: A Representational Accessibility Framework for Neural Scaling Laws
- arxiv url: http://arxiv.org/abs/2609.03533v1
- Date: Thu, 03 Sep 2026 08:32:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.983794
- Title: Coupled Scaling: A Representational Accessibility Framework for Neural Scaling Laws
- Title(参考訳): Coupled Scaling: ニューラルスケーリング法のための表現アクセシビリティフレームワーク
- Abstract要約: 本稿では,有限予算スケーリングがタスク構造とアーキテクチャ最適化システムへのアクセス可能な幾何学との関係に依存するフレームワークであるCoupled Scalingを紹介する。
固定カーネルは、損失適合とは独立に定義されたタスク重み付きスペクトル測度の近ゼロテールからトレーニング時間指数を導出する。
- 参考スコア(独自算出の注目度): 2.345146665577353
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing theories derive neural scaling from data geometry or a specified data-model spectrum, but systems trained on the same data can scale differently when architecture or optimization changes the representations they can efficiently reach. We introduce Coupled Scaling, a task-conditioned framework in which finite-budget scaling depends on the relation between task structure and the geometry accessible to an architecture-optimization system. In a solvable mode-truncation model, loss separates into target energy outside architectural support and an unresolved supported tail. For an arbitrary priority order, the residual lies between the best-N supported tail and the tail beyond the largest completed high-value prefix. If the cumulative-tail and coverage log-rates are $γ_{A,T}$ and $ρ_{A,O,T}$, the residual exponent lies in $[ρ_{A,O,T}γ_{A,T},γ_{A,T}]$. Under bounded off-prefix gain, the completed prefix is rate-determining and $α_{A,O,T}=ρ_{A,O,T}γ_{A,T}$; for $a_{A,T,j}\asymp j^{-b_{A,T}}$, this gives $α_{A,O,T}=ρ_{A,O,T}(b_{A,T}-1)$. A fixed-kernel specialization derives the training-time exponent from the near-zero tail of a task-weighted spectral measure defined independently of the loss fit. The framework separates architectural support from finite-budget acquisition and motivates two tests: static task-relevant geometry should track loss at a common budget, while multiscale geometry should track coupling-specific exponent ordering, including reversal across contrasting tasks. An audit of released emergence trajectories identifies the controls needed for a direct factorial test that measures geometry separately from the scaling fit.
- Abstract(参考訳): 既存の理論は、データ幾何学や特定のデータモデルスペクトルから神経スケーリングを導き出すが、同じデータで訓練されたシステムは、アーキテクチャや最適化が効率的に到達可能な表現を変更すると、異なるスケールをすることができる。
本稿では,有限予算スケーリングがタスク構造とアーキテクチャ最適化システムへのアクセス可能な幾何の関係に依存するタスク条件付きフレームワークであるCoupled Scalingを紹介する。
可解モードトランケーションモデルでは、損失はアーキテクチャサポート外の目標エネルギーと未解決の支持テールに分離される。
任意の優先順序では、最良N支持尾と最良高値プレフィックスを超える尾の間に残留する。
累積テールと被覆ログレートが$γ_{A,T}$および$ρ_{A,O,T}$であれば、残留指数は$[ρ_{A,O,T}γ_{A,T},γ_{A,T}]$である。
有界オフプレフィックスゲインでは、完了したプレフィックスはレート決定され、$α_{A,O,T}=ρ_{A,O,T}γ_{A,T}$; for $a_{A,T,j}\asymp j^{-b_{A,T}}$に対して$α_{A,O,T}=ρ_{A,O,T}(b_{A,T}-1)$が与えられる。
固定カーネルの特殊化は、損失適合とは独立に定義されたタスク重み付きスペクトル測度のほぼゼロテールからトレーニング時間指数を導出する。
静的なタスク関連幾何は共通の予算での損失を追跡すべきであり、マルチスケールな幾何は、対照的なタスクの反転を含む結合固有の指数順序を追跡すべきである。
放出された出現軌跡の監査は、スケーリング適合性から別々に幾何学を測定する直接分解試験に必要な制御を特定する。
関連論文リスト
- Mesh Graph Neural Network Framework for Accelerating Finite Element Simulation for Arbitrary Geometries [0.126928839393823]
この研究は、任意の穴形状を持つ2次元構造体におけるフォン・ミセスの応力場を予測するメッシュグラフネットワーク(MGN)を提案する。
絶対ノード座標を特徴とする従来の機械学習アプローチとは異なり、提案されたモデルは既存のMGNフレームワークに基づいて構築される。
従来のモデルでは$R2 approx 0.01$-$0.86$と対照的に、このモデルは目に見えない幾何と見えない負荷で$R2 geq 0.97$を達成する。
論文 参考訳(メタデータ) (2026-06-06T18:17:08Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Lighter-X: An Efficient and Plug-and-play Strategy for Graph-based Recommendation through Decoupled Propagation [49.865020394064096]
我々は,既存のGNNベースのレコメンデータアーキテクチャとシームレスに統合可能な,効率的かつモジュール化されたフレームワークである textbfLighter-X を提案する。
提案手法は,基本モデルの理論的保証と経験的性能を保ちながら,パラメータサイズと計算複雑性を大幅に低減する。
実験の結果、Lighter-Xはパラメータが大幅に少ないベースラインモデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-11T08:33:08Z) - Test time training enhances in-context learning of nonlinear functions [51.56484100374058]
テストタイムトレーニング(TTT)は、各予測に先立って指定されたパラメータを明示的に更新することで、モデル性能を向上させる。
本研究では,TTTとテキスト内学習(ICL)の組み合わせについて検討する。
論文 参考訳(メタデータ) (2025-09-30T03:56:44Z) - From Editor to Dense Geometry Estimator [77.21804448599009]
密度幾何予測のための拡散変換器(DiT)アーキテクチャに基づく高度な編集モデルを適用するフレームワークである textbfFE2E を紹介する。
FE2EはETH3Dデータセットで35%以上のパフォーマンス向上を実現し、100$times$データでトレーニングされたDepthAnythingシリーズを上回っている。
論文 参考訳(メタデータ) (2025-09-04T15:58:50Z) - Turbocharging Gaussian Process Inference with Approximate Sketch-and-Project [12.874219128885064]
本稿では,線形システムを解くための近似的,分散的,高速化されたスケッチ・アンド・プロジェクトアルゴリズム(texttADASAP$)を提案する。
決定点過程の理論を用いて、スケッチ・アンド・プロジェクションによって誘導される後進平均が、真の後進平均に急速に収束することを示す。
$texttADASAP$は$>3 cdot 108$のデータセットにスケールする。
論文 参考訳(メタデータ) (2025-05-19T20:46:26Z) - Symmetry-Breaking Descent for Invariant Cost Functionals [0.0]
タスクコストの関数的$W : Hs(M) を mathbbR$ に還元する問題について検討する。
信号の対称性を破る変形はコストを低減できることを示す。
論文 参考訳(メタデータ) (2025-05-19T15:06:31Z) - Near-Optimal Online Learning for Multi-Agent Submodular Coordination: Tight Approximation and Communication Efficiency [52.60557300927007]
離散部分モジュラー問題を連続的に最適化するために,$textbfMA-OSMA$アルゴリズムを提案する。
また、一様分布を混合することによりKLの発散を効果的に活用する、プロジェクションフリーな$textbfMA-OSEA$アルゴリズムも導入する。
我々のアルゴリズムは最先端OSGアルゴリズムによって提供される$(frac11+c)$-approximationを大幅に改善する。
論文 参考訳(メタデータ) (2025-02-07T15:57:56Z) - Oblivious Stochastic Composite Optimization [47.48197617884748]
我々のアルゴリズムは問題のパラメータに関する事前の知識なしで収束することを示す。
3つのアルゴリズムは全て、実現可能な集合の直径、リプシッツ定数、あるいは目的関数の滑らかさについて事前の知識なしに機能する。
我々は,フレームワークを比較的大規模に拡張し,大規模半確定プログラム上での手法の効率性と堅牢性を実証する。
論文 参考訳(メタデータ) (2023-06-30T08:34:29Z) - Arch-Graph: Acyclic Architecture Relation Predictor for
Task-Transferable Neural Architecture Search [96.31315520244605]
Arch-Graphはタスク固有の最適アーキテクチャを予測するトランスファー可能なNASメソッドである。
Arch-Graphの転送性と,多数のタスクにわたる高いサンプル効率を示す。
わずか50モデルの予算の下で、2つの検索スペースで平均して0.16%と0.29%のアーキテクチャを見つけることができる。
論文 参考訳(メタデータ) (2022-04-12T16:46:06Z) - Decentralized Sparse Linear Regression via Gradient-Tracking: Linear Convergence and Statistical Guarantees [23.256961881716595]
エージェントネットワーク上の疎線形回帰を非指向グラフとしてモデル化し,サーバノードを持たない。
分布予測勾配追跡に基づくアルゴリズムの収束率と統計的保証を解析する。
論文 参考訳(メタデータ) (2022-01-21T01:26:08Z) - Last iterate convergence of SGD for Least-Squares in the Interpolation
regime [19.05750582096579]
基本最小二乗構成におけるノイズレスモデルについて検討する。
最適予測器が完全に入力に適合すると仮定し、$langletheta_*, phi(X) rangle = Y$, ここで$phi(X)$は無限次元の非線型特徴写像を表す。
論文 参考訳(メタデータ) (2021-02-05T14:02:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。