論文の概要: Hierarchical Grading in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.22757v1
- Date: Thu, 23 Jul 2026 20:14:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.866817
- Title: Hierarchical Grading in Large Language Models
- Title(参考訳): 大規模言語モデルにおける階層的グラフ化
- Abstract要約: GLLM( Graded Large Language Models)を紹介する。
GLLMは変換器の表現空間に階調を付与するフレームワークである。
この構造は、階調ニューラルネットワークと階調変換器の理論を自己回帰言語モデルに拡張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce Graded Large Language Models (GLLMs), an algebraic framework that equips the representation space of a transformer with a grading and propagates the induced weighted scalar action through embeddings, self-attention, and the training objective. The construction extends the theory of graded neural networks and graded transformers to autoregressive language models while preserving expressive power, asymptotic computational complexity, and inference cost. The governing geometric picture is that of geometric invariant theory. The benefit of a grading is expressed by a Kempf--Ness functional on the grading torus; the grades that improve upon the uniform architecture form an open convex cone whose membership is decided by a Hilbert--Mumford-type criterion pairing a grade direction against two measurable profiles of the target and the data; the optimal grades are the coincidence point of two moment maps, given in closed form; and the ordinary transformer appears as a semistable isotropic point on the boundary of the cone: one member of a larger graded family rather than a distinguished optimum. Separately, for level-stratified targets we prove a minimax separation between the graded prior and its absence: over all estimators the risks of the graded and uniform target classes separate throughout an explicit window of sample sizes, by a factor that decays exponentially in the number of levels under geometric stratification. Both profiles are estimable offline, so the optimal grades solve a convex program certified before training begins. Because the grading is absorbed into the learned parameters after training, every GLLM compiles to a standard transformer of identical architecture and inference complexity.
- Abstract(参考訳): 本稿では,代数的フレームワークであるLarged Large Language Models (GLLMs)を紹介した。
この構造は、表現力、漸近的な計算複雑性、推論コストを保ちながら、グレードされたニューラルネットワークとグレードされたトランスフォーマーの理論を自己回帰言語モデルに拡張する。
幾何図形は幾何不変理論のものである。
階数化の利点は、階数化トーラス上のケンプ-ネッス関数で表され、一様アーキテクチャにより改善される階数は、ヒルベルト-マンフォード型基準によって決定される開凸錐であり、目標とデータの2つの可測プロファイルに対して次数方向をペアリングするヒルベルト-マンフォード型基準、最適階数は閉形式で与えられる2つのモーメント写像の一致点であり、通常の変圧器は、円錐の境界上の半安定等方点として現れる。
第二に、レベル階層化された対象に対しては、次数付き事前と不在の間のミニマックス分離を証明し、全ての推定器において、次数付きおよび均一なターゲットクラスのリスクは、標本サイズの明示的な窓を通して、幾何学的成層下のレベル数で指数関数的に減衰する因子によって分離される。
両方のプロファイルはオフラインで推定可能であるため、最適グレードはトレーニング開始前に認定された凸プログラムを解決する。
グラデーションは学習したパラメータに吸収されるため、全てのGLLMは同一アーキテクチャと推論複雑性の標準変換器にコンパイルされる。
関連論文リスト
- Hyper-Fold: Exploring the Expressive Limit of Sequence-Geometry Learning for Proteins via Hypergraph Modeling [55.36837305276515]
コンテント幾何学的外積に対する完全双線型作用素、すなわち2階の相互作用の十分統計は、表現的天井であることを示す。
次に、メッセージパッシングコストで天井に近づく、ランク-K分離可能な畳み込みバックボーンであるHyper-Foldを紹介します。
論文 参考訳(メタデータ) (2026-08-29T11:43:25Z) - Tropical Algebraic Geometry for Neuronal Representations: An Arakelov-Green Measure Based Descriptor for Graph Learning [14.563432689352084]
本稿では,熱帯代数幾何学に基づくトレーニング不要な幾何学的事前手法を提案する。
空間木を熱帯ヤコビアンへの埋め込みに適した巡回計量グラフに変換する。
離散的なアラケロフ・グリーン測度は、グラフラプラシアンの一般化された逆数を通して閉じた形で計算され、この被覆上の不定分極距離を除いた固有経路計量に正確に分解されることを示す。
論文 参考訳(メタデータ) (2026-08-05T05:34:50Z) - Restricted Dynamic Geometric Complexity: Path-Space Reduction and Möbius--Jacobi Response [0.0]
経路空間値問題として制限された動的幾何学的複雑性について検討する。
主な応答結果は、アダマール状態空間におけるグローバルである。
論文 参考訳(メタデータ) (2026-07-08T09:36:45Z) - Statistically Meaningful Geometry (SMG) Beyond the Euclidean Paradigm, with Application to Generative AI [0.7766379063545538]
本稿では,パラメトリックモデルから無限次元最小化非漸近統計へ持ち上げる情報幾何学的パラダイムである統計的意味幾何(SMG)フレームワークを紹介する。
接続フィルタによる事前学習の下では、分布外分布予測分散は、同定可能な基底多様体 $mathcalB$ の有限径によって厳密に上界となり、生成幻覚の厳密な幾何学的包含が確立される。
論文 参考訳(メタデータ) (2026-07-03T13:46:31Z) - D-Convexity: A Unified Differentiable Convex Shape Prior via Quasi-Concavity for Data-driven Image Segmentation [5.445483153964301]
凸性は、多くの自然および人造構造の基礎となる基本的な幾何学的先行である。
本稿では,ネットワークの出力マスク関数 u の準凸性に基づいて,統一された閾値のない凸性を提案する。
我々の分析は、離散1-0-1ライン制約から曲率や符号付き距離 Laplacian based level-set priors まで、以前の凸形状モデルの幅広いスペクトルを統一する。
論文 参考訳(メタデータ) (2026-05-19T00:27:41Z) - The Geometric Wall: Manifold Structure Predicts Layerwise Sparse Autoencoder Scaling Laws [13.054357482525505]
Gemma 2 2B および 9B の68 層に収着・退避する第1 層間SAEスケーリング研究を行った。
多様体幾何は、両方のモデルにおいて、層ごとの幅指数を予測する。
論文 参考訳(メタデータ) (2026-05-11T02:24:46Z) - Layerwise LQR for Geometry-Aware Optimization of Deep Networks [38.84575015854741]
我々は,グローバルな階層的最適制御目標の下で,構造化逆プレコンディショナを学習するためのフレームワークであるLayerwise LQRを紹介する。
対角線、(E-)Kronecker-factored、または他の構造化された逆プレコンディショナーを学習するスケーラブルな緩和法を導出する。
ResNetsとTransformersの実験では、LLQRは最適化のダイナミクスを改善し、これらのゲインを最終的なテストパフォーマンスに変換する。
論文 参考訳(メタデータ) (2026-05-05T19:16:00Z) - Graded Transformers [0.0]
そこで我々は,ベクトル空間上のグレーディングを通じて帰納バイアスを埋め込む新しいシーケンスモデルである Graded Transformer フレームワークを紹介した。
このフレームワークは、以前のモデルの固定グレードの制限を克服し、適応的な特徴優先順位付けを可能にする。
Graded Transformerは、階層的学習とニューロシンボリック推論に対する数学的に原則化されたアプローチを提供する。
論文 参考訳(メタデータ) (2025-07-27T02:34:08Z) - Generalized Gradient Norm Clipping & Non-Euclidean $(L_0,L_1)$-Smoothness [51.302674884611335]
本研究は、急勾配と条件勾配のアプローチを組み合わせることでノルムクリッピングを一般化するハイブリッド非ユークリッド最適化手法を提案する。
本稿では、ディープラーニングのためのアルゴリズムのインスタンス化について論じ、画像分類と言語モデリングにおけるそれらの特性を実証する。
論文 参考訳(メタデータ) (2025-06-02T17:34:29Z) - What Improves the Generalization of Graph Transformers? A Theoretical Dive into the Self-attention and Positional Encoding [67.59552859593985]
自己アテンションと位置エンコーディングを組み込んだグラフトランスフォーマーは、さまざまなグラフ学習タスクのための強力なアーキテクチャとして登場した。
本稿では,半教師付き分類のための浅いグラフ変換器の理論的検討について紹介する。
論文 参考訳(メタデータ) (2024-06-04T05:30:16Z) - Convergence of Adam Under Relaxed Assumptions [72.24779199744954]
我々は、アダムがより現実的な条件下で、$O(epsilon-4)$勾配複雑性で$epsilon$-定常点に収束することを示している。
また、Adamの分散還元版を$O(epsilon-3)$の加速勾配複雑性で提案する。
論文 参考訳(メタデータ) (2023-04-27T06:27:37Z) - Leveraging Non-uniformity in First-order Non-convex Optimization [93.6817946818977]
目的関数の非一様洗練は、emphNon-uniform Smoothness(NS)とemphNon-uniform Lojasiewicz inequality(NL)につながる
新しい定義は、古典的な$Omega (1/t2)$下界よりも早く大域的最適性に収束する新しい幾何学的一階法を刺激する。
論文 参考訳(メタデータ) (2021-05-13T04:23:07Z) - Self-supervised Geometric Perception [96.89966337518854]
自己教師付き幾何知覚(self-supervised geometric perception)は、基底幾何モデルラベルなしで対応マッチングのための特徴記述子を学ぶためのフレームワークである。
また,SGPは,地上トラスラベルを用いて訓練した教師付きオークルよりも同等か優れる最先端性能を達成できることを示す。
論文 参考訳(メタデータ) (2021-03-04T15:34:43Z) - Cogradient Descent for Bilinear Optimization [124.45816011848096]
双線形問題に対処するために、CoGDアルゴリズム(Cogradient Descent Algorithm)を導入する。
一方の変数は、他方の変数との結合関係を考慮し、同期勾配降下をもたらす。
本アルゴリズムは,空間的制約下での1変数の問題を解くために応用される。
論文 参考訳(メタデータ) (2020-06-16T13:41:54Z) - Towards Better Understanding of Adaptive Gradient Algorithms in
Generative Adversarial Nets [71.05306664267832]
適応アルゴリズムは勾配の歴史を用いて勾配を更新し、深層ニューラルネットワークのトレーニングにおいてユビキタスである。
本稿では,非コンケーブ最小値問題に対するOptimisticOAアルゴリズムの変種を解析する。
実験の結果,適応型GAN非適応勾配アルゴリズムは経験的に観測可能であることがわかった。
論文 参考訳(メタデータ) (2019-12-26T22:10:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。