論文の概要: Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.19604v1
- Date: Tue, 21 Jul 2026 22:09:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.936306
- Title: Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
- Title(参考訳): 大規模言語モデルにおけるハイパーネットワークに基づく知識注入のスケーリング法則
- Abstract要約: 我々は、ハイパーネットワークが列車時の知識注入に利用できるかどうか検討する。
損失, 推論精度, アウト・オブ・ディストリビューション(OOD)の一般化がハイパーネットワークの深さ, 幅, ターゲットネットワークサイズによってどのように異なるのかを特徴付ける。
- 参考スコア(独自算出の注目度): 6.546866759954739
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Injecting factual knowledge into large language models (LLMs) reliably and at scale remains an open challenge. Hypernetworks provide a promising solution to large-scale knowledge injection. Although hypernetworks are typically applied for test-time adaptation, we explore their use in train-time knowledge injection, where, given a large corpus of facts, we train a hypernetwork to generate a fixed LoRA adapter that, when inserted into the target model, enable the model to answer questions about those facts. In this work, we investigate whether hypernetworks can be used to perform train-time knowledge injection and how this ability varies with scale. The scaling behavior of hypernetworks remains largely unstudied. Our design decouples the hypernetwork's injection capacity from the target model's general capability, enabling, for the first time, a rigorous study of scaling laws for hypernetwork architectures. We characterize how loss, reasoning accuracy, and out-of-distribution (OOD) generalization vary with hypernetwork depth, width, and target network size. We construct a large-scale dataset, called MegaWikiQA, containing tens of millions of multi-hop question-answer examples across 39 domains constructed from examples in Wikidata5M. Our results reveal: (i) hypernetwork-based injection exhibits broadly predictive power law scaling along all architecture axes; and (ii) hypernetworks are capable of reliable OOD generalization at increasing scales, suggesting that hypernetwork provides a promising alternative to other train-time adaptation methods such as LoRA finetuning and full fine-tuning, exhibiting steeper scaling exponents in all OOD evaluations. Together, these results establish hypernetworks as a principled and scalable substrate for train-time adaptation, and provide the first empirically grounded scaling laws to guide hypernetworks for factual reasoning in large language models.
- Abstract(参考訳): 大規模言語モデル(LLM)に事実知識を確実に、かつ大規模に注入することは、依然としてオープンな課題である。
Hypernetworksは、大規模ナレッジインジェクションに対する有望なソリューションを提供する。
ハイパーネットは一般にテスト時間適応に応用されるが、列車時の知識注入での利用を探索し、大量の事実を考慮すれば、ターゲットモデルに挿入するとモデルがその事実に関する質問に答える固定されたLoRAアダプタを生成するためにハイパーネットワークを訓練する。
本研究では,ハイパーネットワークが列車時の知識注入に利用できるか,その能力がスケールによってどのように変化するかを検討する。
ハイパーネットのスケーリングの挙動は、まだほとんど研究されていない。
我々の設計は、ハイパーネットワークのインジェクション能力をターゲットモデルの汎用能力から切り離し、ハイパーネットワークアーキテクチャのスケーリング法則を厳格に研究することを可能にした。
損失, 推論精度, アウト・オブ・ディストリビューション(OOD)の一般化がハイパーネットワークの深さ, 幅, ターゲットネットワークサイズによってどのように異なるのかを特徴付ける。
我々はMegaWikiQAと呼ばれる大規模データセットを構築し、Wikidata5Mの例から構築された39のドメインにわたる何千万ものマルチホップ質問応答例を含む。
私たちの結果は明らかです。
(i)ハイパーネットワークベースのインジェクションは、すべてのアーキテクチャ軸に沿って幅広い予測力の法則を示す。
ハイパーネットワークは、LORA微調整やフル微調整といった他の列車時間適応手法に代わる有望な代替手段を提供し、すべてのOOD評価においてより急激なスケーリング指数を示すことを示唆している。
これらの結果は、列車時適応のための原則的かつスケーラブルな基板としてハイパーネットワークを確立し、大規模な言語モデルにおける事実推論のためにハイパーネットワークをガイドする最初の経験的基礎的なスケーリング法則を提供する。
関連論文リスト
- A Wireless Foundation Model for Multi-Task Prediction [50.21098141769079]
多様な予測区間をサポートする無線ネットワークにおけるマルチタスク予測のための統合基盤モデルを提案する。
大規模データセットをトレーニングした後、提案した基礎モデルは、新しいタスクにおいて、目に見えないシナリオとゼロショットのパフォーマンスに強力な一般化を示す。
論文 参考訳(メタデータ) (2025-07-08T12:37:55Z) - Network Sparsity Unlocks the Scaling Potential of Deep Reinforcement Learning [57.3885832382455]
静的ネットワークの疎結合を単独で導入することで,最先端アーキテクチャの高密度化を超えて,さらなるスケーリング可能性を実現することができることを示す。
解析の結果,高密度DRLネットワークをネーティブにスケールアップするのとは対照的に,疎ネットワークは高いパラメータ効率とネットワーク表現性を両立させることがわかった。
論文 参考訳(メタデータ) (2025-06-20T17:54:24Z) - Identifying Super Spreaders in Multilayer Networks [0.6990493129893112]
本稿では,グラフニューラルネットワークを利用して,そのようなネットワーク内のスーパースプレッダを識別する手法を提案する。
この目的のために、数百のネットワークにまたがる情報拡散をシミュレートしてデータセットを構築する。
我々のモデルであるTopSpreadersNetworkは、関係に依存しないエンコーダとカスタムアグリゲーション層で構成されています。
論文 参考訳(メタデータ) (2025-05-27T10:14:14Z) - Unified Neural Network Scaling Laws and Scale-time Equivalence [10.918504301310753]
本稿では、モデルサイズ、トレーニング時間、データボリュームの3つの要因がどのように相互作用し、ディープニューラルネットワークの性能を決定するかという、新しい理論的特徴を示す。
まず、ニューラルネットワークのサイズを拡大し、トレーニング時間を比例的に増加させることで、理論的かつ経験的な等価性を確立する。
次に、スケール時間同値と二重降下の線形モデル解析を組み合わせ、統一された理論的スケーリング法則を得る。
論文 参考訳(メタデータ) (2024-09-09T16:45:26Z) - A method for quantifying the generalization capabilities of generative models for solving Ising models [5.699467840225041]
我々は、ハミング距離正規化器を用いて、VANと組み合わせた様々なネットワークアーキテクチャの一般化能力を定量化する。
フィードフォワードニューラルネットワーク,リカレントニューラルネットワーク,グラフニューラルネットワークなど,VANと組み合わせたネットワークアーキテクチャの数値実験を行う。
本手法は,大規模Isingモデルの解法において,最適なネットワークアーキテクチャを探索するニューラルネットワーク探索の分野を支援する上で,非常に重要である。
論文 参考訳(メタデータ) (2024-05-06T12:58:48Z) - Generalization and Estimation Error Bounds for Model-based Neural
Networks [78.88759757988761]
スパースリカバリのためのモデルベースネットワークの一般化能力は、通常のReLUネットワークよりも優れていることを示す。
我々は,高一般化を保証したモデルベースネットワークの構築を可能にする実用的な設計規則を導出する。
論文 参考訳(メタデータ) (2023-04-19T16:39:44Z) - Magnitude Invariant Parametrizations Improve Hypernetwork Learning [0.0]
Hypernetworksは、別のニューラルネットワークのパラメータを予測する強力なニューラルネットワークである。
トレーニングは通常、非ハイパーネットワークモデルよりもはるかにゆっくりと収束する。
我々は、ハイパーネットワークのトレーニングの課題に寄与する、基本的な未確認の問題を識別する。
我々は、MIP(Magnitude Invariant Parametrizations)と呼ばれる改訂されたハイパーネットワークの定式化を用いて、この問題に対する簡単な解決策を提案する。
論文 参考訳(メタデータ) (2023-04-15T22:18:29Z) - Semi-supervised Network Embedding with Differentiable Deep Quantisation [81.49184987430333]
我々はネットワーク埋め込みのための微分可能な量子化法であるd-SNEQを開発した。
d-SNEQは、学習された量子化符号にリッチな高次情報を与えるためにランク損失を組み込む。
トレーニング済みの埋め込みのサイズを大幅に圧縮できるため、ストレージのフットプリントが減少し、検索速度が向上する。
論文 参考訳(メタデータ) (2021-08-20T11:53:05Z) - Hypernetwork Dismantling via Deep Reinforcement Learning [1.4877837830677472]
ハイパーネットワーク解体問題をノードシーケンス決定問題として定式化する。
深層強化学習型ハイパーネットワーク分解フレームワークを提案する。
5つの実世界のハイパーネットワークの実験結果は,提案フレームワークの有効性を示している。
論文 参考訳(メタデータ) (2021-04-29T13:35:29Z) - Deep Autoencoding Topic Model with Scalable Hybrid Bayesian Inference [55.35176938713946]
我々は、ガンマ分布の階層構造を用いて、その多確率層生成ネットワークを構築するディープ・オートエンコーディング・トピック・モデル(DATM)を開発した。
Weibull上向き変分エンコーダを提案する。このエンコーダは深層ニューラルネットワークを介して情報を上向きに伝播し,次いで下向き生成モデルを提案する。
大規模コーパス上での教師なしおよび教師なしの学習タスクにおいて,モデルの有効性とスケーラビリティを実証した。
論文 参考訳(メタデータ) (2020-06-15T22:22:56Z) - On Infinite-Width Hypernetworks [101.03630454105621]
我々は、ハイパーネットワークが、下降中のグローバルなミニマを保証していないことを示す。
我々は,これらのアーキテクチャの機能的先行を,対応するGPカーネルとNTKカーネルを導出することによって同定する。
この研究の一環として、標準完全連結ReLUネットワークの高次テイラー項の厳密な境界を導出した数学的貢献を行う。
論文 参考訳(メタデータ) (2020-03-27T00:50:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。