論文の概要: Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
- arxiv url: http://arxiv.org/abs/2608.01624v1
- Date: Mon, 03 Aug 2026 02:57:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.305513
- Title: Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
- Title(参考訳): 次元ではなくノルム:言語モデルのグラディエントフリーウェイト摂動における重要なこと
- Abstract要約: 言語モデルをタスクに適応させるには、もはやすべての重みをトレーニングする必要がありません。
ランダムな重みの摂動をサンプリングし、スコアをよく維持するグラディエントフリー適応は、その軌道に従わなかった。
フルウェイト探索が必要なのか、より根本的には摂動のどの特性が機能させるのかは不明である。
- 参考スコア(独自算出の注目度): 2.7591243203421083
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Adapting a language model to a task no longer requires training all of its weights, and a line of parameter-efficient methods has driven the trainable count from billions down to a handful of scalars. Gradient-free adaptation, which samples random weight perturbations and keeps the ones that score well, has not followed that trajectory and still perturbs every entry of the weight tensor. It is unknown whether that full-weight search is necessary, and more fundamentally which property of a perturbation makes it work at all, because existing methods vary the search space, the perturbation scale, and the aggregation together. We resolve this by intervening on one factor at a time inside a fixed pipeline, holding candidate scoring and voting constant while we vary the search dimension, the subspace that carries the perturbation, and its norm. Perturbing a frozen frame of 12 to 16 scalars stays 1.8 accuracy points behind full-weight search on average across 49 model-benchmark cells, trailing it in 36 of them. Neither the dimension nor the choice of basis explains that performance. A random frame whose Grassmann overlap with the SVD frame is at chance level performs identically once a single scale factor is matched, and at large scales the SVD directions collapse first. What survives is the perturbation norm, whose usable range closes within a factor of five across seven models and stays flat inside. The perturbation norm is therefore the one factor with a failure mode, and its safe region transfers across scale and family. The design question narrows from which subspace to perturb to how hard to shake.
- Abstract(参考訳): 言語モデルをタスクに適応させるには、もはやすべての重みをトレーニングする必要はなく、パラメータ効率のよい一連のメソッドは、トレーニング可能な数を数十億から少数のスカラーに減らした。
ランダムなウェイト・テンソルの摂動をサンプリングし、スコアをよく維持するグラディエント・フリー・アダプションは、その軌道に従わず、ウェイト・テンソルの全てのエントリーを摂動する。
フルウェイト探索が必要なのか、あるいは、既存の手法が探索空間、摂動スケール、集約の異なるため、摂動のどの特性が機能するかは、根本的には分かっていない。
我々は、固定パイプライン内の1つの要素に介入し、探索次元、摂動を運ぶ部分空間、およびそのノルムを変化させながら、候補の採点と投票定数を保持することでこれを解決する。
12から16個のスカラーの凍結フレームの摂動は、49個のモデルベンチマークセルで平均1.8の精度を保ち、36個のモデルベンチマークセルに追従する。
寸法もベースの選択も、そのパフォーマンスを説明できない。
SVDフレームとグラスマンが重なり合うランダムフレームは、単一のスケール係数が一致すると同一に実行され、大規模な場合にはSVD方向が最初に崩壊する。
生き残るのは摂動規範であり、使用可能な範囲は7つのモデルの5倍以内であり、内部は平坦である。
したがって、摂動規範は障害モードの1つの要因であり、その安全な領域はスケールと家族間で伝達される。
設計上の問題は、どの部分空間が摂動するかという問題から、どれだけ震えにくいかという問題だ。
関連論文リスト
- Scalable Lindblad Noise Learning via Stochastic Tensor-Network Simulation [48.887627688666974]
大規模オープン量子システムにおける学習散逸率は、短期量子技術の大きな障害である。
本稿では,シミュレーション手法であるJump Method(TJM)を組み合わせたLindblad散逸率のスケーラブルなノイズ学習フレームワークを提案する。
我々は,Isingモデルにおける2つのノイズモデルに対するアプローチを実証し,各サイトについて,N_mathrmsite=16$まで独立散逸率を学習した。
スケーラブルな数値と厳密な理論的保証の組み合わせは、TJMベースのノイズ学習を大きな量子デバイスにおける散逸を特徴づける実用的な基礎として位置づけている。
論文 参考訳(メタデータ) (2026-08-25T15:07:11Z) - Orientation, not magnitude: the causal structure of task-vector interference in merged language models [0.0]
タスク算術はそうでなければ機能し、フィールドはマグニチュードで原因を診断する。
層状フラックスの正確な分解は、既存の断続輸送の増幅によって支配されていることを示している。
ナイーブのbfloat16生成の「ユニバーサリティ」は、量子化粗さであることが判明した。
論文 参考訳(メタデータ) (2026-08-12T08:40:24Z) - Why Large Language Models Fail at Tabular Prediction [1.1908340728628395]
大規模言語モデル(LLM)は、目覚ましいタスクのデフォルトツールとなっている。
しかし彼らは、最も一般的な機械学習ワークロードの1つで、目立ってあまり成功していない。
論文 参考訳(メタデータ) (2026-08-03T15:52:51Z) - First-Order Predictable but Pairwise Fragile: Local Task Adaptation in Trained Transformers [0.05729426778193398]
マルチタスクのLORA操作点付近で同じハーネスで8つの特性を測定する。
テストスケール10-2$までの1方向の検証ウィンドウが共有されているが、ペアの合成や更新順序に対する普遍半径は存在しない。
論文 参考訳(メタデータ) (2026-07-18T13:43:44Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics [92.39053980710702]
グラディエント・Descent (SGD) は通常ランゲヴィン過程としてモデル化され、ミニバッチノイズがブラウン運動として働くと仮定される。
この近似は、連続時間制限と、離散的なSGD更新を有限学習率で一致しないsqrt(eta)ノイズスケーリングに依存している。
ミニバッチサンプリングによって誘導されるゆらぎのある損失景観における決定論的力学としてのSGDの別の定式化を提案する。
論文 参考訳(メタデータ) (2026-05-21T15:50:40Z) - BASIS: Balanced Activation Sketching with Invariant Scalars for "Ghost Backpropagation" [0.0]
正確なバックプロパゲーションに必要な活性化メモリは、ネットワーク深さ、コンテキスト長、特徴次元と線形にスケールする。
本稿では,活性化メモリをバッチ次元とシーケンス次元から完全に分離する効率的なバックプロパゲーションアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-05T20:38:25Z) - Attention Is Not What You Need [0.0]
標準的なマルチヘッドアテンションはテンソルリフトの一形態と見なされる。
本稿では,グラスマンフローに基づく無注意アーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-12-22T14:29:18Z) - Environment-Aware Indoor LoRaWAN Path Loss: Parametric Regression Comparisons, Shadow Fading, and Calibrated Fade Margins [3.776919981139063]
内部のLoRaWAN伝播は、構造的および時間的変化の文脈因子によって形成される。
リークセーフなクロスバリデーションを用いて評価した,環境に配慮した統計的に規律のある経路損失フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-05T20:14:48Z) - Variance-Dependent Regret Bounds for Linear Bandits and Reinforcement
Learning: Adaptivity and Computational Efficiency [90.40062452292091]
本稿では,不整合雑音を持つ線形帯域に対する計算効率のよい最初のアルゴリズムを提案する。
我々のアルゴリズムは未知のノイズの分散に適応し、$tildeO(d sqrtsum_k = 1K sigma_k2 + d)$ regretを達成する。
また、強化学習において、線形混合マルコフ決定過程(MDP)に対する分散適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-02-21T00:17:24Z) - Learning Globally Smooth Functions on Manifolds [94.22412028413102]
スムーズな関数の学習は、線形モデルやカーネルモデルなどの単純なケースを除いて、一般的に難しい。
本研究は,半無限制約学習と多様体正規化の技法を組み合わせることで,これらの障害を克服することを提案する。
軽度条件下では、この手法は解のリプシッツ定数を推定し、副生成物として大域的に滑らかな解を学ぶ。
論文 参考訳(メタデータ) (2022-10-01T15:45:35Z) - Robust Training of Neural Networks using Scale Invariant Architectures [70.67803417918854]
SGDとは対照的に、Adamのような適応勾配法は、現代のディープネットワークの堅牢なトレーニングを可能にする。
この一般的なアプローチは、パラメータと損失の再スケーリングに頑健であることを示す。
我々は、単にバニラSGDで訓練された場合、Adamのような適応的な手法で訓練されたBERTに匹敵する性能を達成する、SIBERTと呼ばれるスケール不変バージョンのBERTを設計する。
論文 参考訳(メタデータ) (2022-02-02T11:58:56Z) - Pathologies in priors and inference for Bayesian transformers [71.97183475225215]
ベイズ推定を用いた予測不確実性の観点からトランスフォーマーモデルを改善する試みは成功していない。
変換器の重み空間推定は, 近似後部に関係なくうまく動作しないことがわかった。
本稿では,ディリクレ分布の暗黙的再パラメータ化に基づく新しい手法を提案する。
論文 参考訳(メタデータ) (2021-10-08T10:35:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。