論文の概要: Behaviorally Effective LoRA Writes Are Sparse and Structured
- arxiv url: http://arxiv.org/abs/2609.01374v1
- Date: Tue, 01 Sep 2026 15:09:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.792925
- Title: Behaviorally Effective LoRA Writes Are Sparse and Structured
- Title(参考訳): 振る舞いに効果的なLoRA書き込みはスパースで構造化されている
- Authors: Haruto Sato, Yuki Tanaka, Ren Nakamura, Aoi Kobayashi, Mei Ito,
- Abstract要約: 低ランク適応では更新のランクが固定されるが、トレーニング済みの書き込みのどの部分が実際に動作しているかは特定できない。
動作に有効なLoRA書き込みは、生の低ランクパラメータ化が示唆するよりも疎く、構造化され、はるかに集中していることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Low-rank adaptation fixes the rank of the update, but it does not identify which parts of a trained write actually carry behavior. We study that question directly and show that behaviorally effective LoRA writes are sparse, structured, and far more concentrated than the raw low-rank parameterization suggests. We use Learned-Basis LoRA, a learned-basis continuation recipe, to expose that structure. The recipe warms up an unconstrained adapter, converts its learned write columns into a module-wise orthonormal basis, freezes that basis, and continues training inside the constrained parameterization. Across 14 exact switches from unconstrained to constrained form, held-out accuracy is unchanged at the conversion step and reconstructed write matrices differ by at most 0.25% relative Frobenius error. Same-state continuation then shows that the same trained checkpoint develops differently under different write subspaces, establishing write geometry as a causal state variable. A no-retraining projection test shows that useful write signal stays inside the learned write space and largely disappears from random or frozen-activation PCA controls. The concentration pattern is strong at both local and global scales. Across GSM8K, MathQA, and AQuA, per-module top-k continuation reaches its optimum at k in {2, 4} in all twelve seed-level cases we test. A stricter global ranking test shows that learned top-16 and top-32 subsets outperform matched random subsets, especially on GSM8K/Qwen and MathQA/Qwen. Single-direction ablations further reveal a sparse set of late q_proj, o_proj, and down_proj components with outsized behavioral impact.
- Abstract(参考訳): 低ランク適応では更新のランクが固定されるが、トレーニング済みの書き込みのどの部分が実際に動作しているかは特定できない。
我々は,この疑問を直接研究し,行動に有効なLoRA書き込みは,生の低ランクパラメータ化が示唆するよりも疎く,構造化され,はるかに集中していることを示す。
学習ベース継続レシピであるLearted-Basis LoRAを使用して、その構造を公開する。
レシピは制約のないアダプタをウォームアップし、学習した書き込み列をモジュールワイドな正規のベースに変換し、そのベースを凍結し、制約されたパラメータ化内でのトレーニングを継続する。
14個の正確なスイッチを非拘束状態から制約状態に切り替えると、変換ステップで保持精度は変化せず、再構成された書き込み行列は少なくとも0.25%の相対的なフロベニウス誤差で異なる。
同じ状態継続は、同じ訓練されたチェックポイントが異なる書き込み部分空間の下で異なる方法で発達し、因果状態変数として書き込み幾何学が確立されることを示す。
制約なしのプロジェクションテストでは、有用な書き込み信号が学習された書き込み空間内に留まり、ランダムまたは凍結活性化PCA制御からほとんど消えることを示す。
濃度パターンは局所スケールと大域スケールの両方で強い。
GSM8K、MathQA、AQuA全体では、テストした12のシードレベルのすべてのケースにおいて、加群ごとのトップk継続は k において最適に達する。
特にGSM8K/QwenとMathQA/Qwenでは、学習した上位16サブセットと上位32サブセットが一致したランダムサブセットを上回っている。
単一方向の短縮により、より小さな振る舞いの影響で、q_proj、o_proj、down_projコンポーネントのスパースセットがさらに明らかになる。
関連論文リスト
- Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach [58.15427952222424]
汎用的なテキスト埋め込みはそのようなタスクに広くデプロイされているが、意味的類似性は意味的に似ているがタスク固有の例を示すことができる。
本稿では,凍結したテキスト埋め込み上に構築された幾何正規化モジュールであるPGCL(Prototype-Guided Contrastive Learning)を紹介する。
論文 参考訳(メタデータ) (2026-08-15T13:19:25Z) - DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models [26.283978881046107]
検証可能な報酬による強化学習は、大きな言語モデルの推論能力を向上させる。
On-policy self-distillationは、学生が訪問する接頭辞で特権教師に問い合わせることで、信号の疎結合を緩和する。
標準のOPSDはロールアウトの時間構造をまだ明らかにしていない。
DASHは各局所蒸留信号とシーケンスレベル平均とのギャップを適応伝搬ゲートにマッピングする。
論文 参考訳(メタデータ) (2026-08-06T16:29:24Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - Instruction Tuning Changes How Upstream State Conditions Late Readout: A Cross-Patching Diagnostic [9.8812664524155]
我々は、いつから後期のスタックが協力して、相違点を次の利幅に変えるのかを尋ねる。
私たちは、各モデルの後期スタックで、各モデルの初期段階の状態を横断します。
強制的なスコアリングは、局所的なトークンの選択が、後の正確な回答の成功を変える可能性があることを示している。
論文 参考訳(メタデータ) (2026-05-08T05:47:10Z) - IGU-LoRA: Adaptive Rank Allocation via Integrated Gradients and Uncertainty-Aware Scoring [9.250460219785188]
IGU-LoRAは、階層内統合勾配(IG)の感度を計算し、それらをランク割り当てのための階層レベルスコアに集約する適応ランクLoRAである。
IGU-LoRAは、一致したパラメータ予算でPEFTベースラインを一貫して上回り、下流の精度とロバスト性を改善している。
論文 参考訳(メタデータ) (2026-03-14T06:45:54Z) - Relative Scaling Laws for LLMs [91.73497548097775]
スケーリング法則は、追加のデータ、パラメータ、計算によって言語モデルがどのように改善されるかを記述する。
相対的なスケーリング法則を導入し、テスト分布間のパフォーマンスギャップをスケールで追跡する。
これらの結果は、スケーリングは全体的なパフォーマンスを改善するが、普遍的等化器ではないことを示している。
論文 参考訳(メタデータ) (2025-10-28T16:55:22Z) - Consistent-Teacher: Towards Reducing Inconsistent Pseudo-targets in
Semi-supervised Object Detection [28.40887130075552]
擬似ターゲットは正確な検出器の訓練を損なう。
生徒のトレーニングにノイズを注入し、過度な過度な問題を引き起こす。
不整合を低減するために,ConsistentTeacherと呼ばれる体系的ソリューションを提案する。
論文 参考訳(メタデータ) (2022-09-04T10:21:02Z) - Tail-to-Tail Non-Autoregressive Sequence Prediction for Chinese
Grammatical Error Correction [49.25830718574892]
本稿では,Tail-to-Tail (textbfTtT) という新しいフレームワークを提案する。
ほとんどのトークンが正しいので、ソースからターゲットに直接転送でき、エラー位置を推定して修正することができる。
標準データセット、特に可変長データセットに関する実験結果は、文レベルの精度、精度、リコール、F1-Measureの観点からTtTの有効性を示す。
論文 参考訳(メタデータ) (2021-06-03T05:56:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。