論文の概要: LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment
- arxiv url: http://arxiv.org/abs/2608.03020v2
- Date: Fri, 07 Aug 2026 02:11:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:30.950949
- Title: LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment
- Title(参考訳): LoCA: ワンショットキャリブレーションとローカルクレジットアサインメントを併用した前向きLLMチューニング
- Authors: Linhan Xia, Rui Liu, Zhaofeng Zhang, Yihao Wang, Binrui Shen, Shengxin Zhu,
- Abstract要約: LoCA(Local Credit Assignment)は、小シフト適応のための2段階の方法である。
1つのプローブの後方通過は、最終予測誤差から局所的な隠れ状態補正まで、各変圧器ブロックのローランクマップに適合する。
したがって、LoCAはグローバルクレジットの割り当てを1つのキャリブレーションに減らし、後続のフォワードオンリーチューニングを可能にする。
- 参考スコア(独自算出の注目度): 12.282686233879012
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-efficient post-training reduces the number of trainable parameters, but still requires repeated end-to-end backpropagation through the frozen backbone. Every adaptation step therefore needs backward-capable hardware and must store or recompute activations. We ask whether this repeated backward chain can be replaced by a one-time calibration. We introduce Local Credit Assignment (LoCA), a two-stage method for small-shift adaptation. One probe backward pass fits a low-rank map at each transformer block from the final prediction error to a local hidden-state correction. LoCA then reuses these maps to form blockwise regression targets from forward activations and fits low-rank adapters with closed-form ridge solves. No further backbone backward pass is required. We evaluate LoCA on five discriminative benchmarks with Qwen2.5 models from 0.5B to 14B. In 16 of 25 reported task--scale comparisons, LoCA yields lower evaluation cross-entropy than the corresponding LoRA run. Its measured full-run GPU peak, including calibration, is 26--29\% lower than LoRA's. After calibration, its CPU steady-state memory is 36--52\% lower and its per-pass time is 43--48\% lower. A shared scale-normalized candidate set is reused across all tested Qwen2.5 sizes and on SmolLM2-1.7B. LoCA thus amortizes global credit assignment into one calibration and enables later forward-only tuning when repeated backpropagation is impractical. The code associated with this paper is available \href{https://github.com/Xia12121/LoCA}{here}.
- Abstract(参考訳): パラメータ非効率な後トレーニングはトレーニング可能なパラメータの数を減らしますが、凍結したバックボーンを通したエンドツーエンドのバックプロパゲーションを繰り返す必要があります。
したがって、すべての適応ステップは後方対応ハードウェアを必要とし、アクティベーションを保存または再計算する必要がある。
この繰り返しの逆行鎖が1回キャリブレーションで置き換えられるかどうかを問う。
小シフト適応のための2段階法であるLoCA(Local Credit Assignment)を導入する。
1つのプローブの後方通過は、最終予測誤差から局所的な隠れ状態補正まで、各変圧器ブロックのローランクマップに適合する。
その後、LoCAはこれらのマップを再利用して前方アクティベーションからのブロックワイド回帰ターゲットを形成し、ローランクアダプタに閉形式リッジの解を適合させる。
バックボーンの後方通過は不要である。
0.5Bから14BまでのQwen2.5モデルを用いた5つの判別ベンチマークでLoCAを評価する。
25のタスクスケール比較のうち16の報告では、LoCAは対応するLoRAランよりも低い評価エントロピーが得られる。
キャリブレーションを含むフルランGPUピークは、LoRAよりも26--29\%低い。
キャリブレーション後、CPUの定常メモリは36--52\%低下し、パス毎の時間は43--48\%低下する。
共有スケール正規化候補セットは、テストされた全てのQwen2.5サイズとSmolLM2-1.7B上で再利用される。
したがって、LoCAはグローバルクレジットの割り当てを1つのキャリブレーションに減らし、繰り返しバックプロパゲーションが非現実的な場合、後続のフォワードオンリーチューニングを可能にする。
この論文に関連するコードは、 \href{https://github.com/Xia12121/LoCA}{here} で公開されている。
関連論文リスト
- A Better Start for Language Models: Domain-Conditional Position Offsets [0.0]
オフセットは、およそ100のドキュメントで数分でトレーニングし、シーケンス状態を追加せずにドメイン間を切り替え、測定可能な遅延オーバーヘッドがない。
チューニングされたLoRAは低いパープレキシティに達するが、2~3桁のパラメータとアクティブな低ランクウェイトパスを使用し、ソフトプロンプトはシーケンス位置を付加する。
論文 参考訳(メタデータ) (2026-07-17T02:12:09Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization [48.87937677659571]
本稿では, HARP (Hadamard-preconditioned Adaptive Rotation Processor) を導入する。
1Bから70Bまでのモデルの2-4ビット設定では、HARPは固定RHTよりもパープレキシティとゼロショット精度を改善している。
HarPはデプロイ効率を保ち、FP16では128トン/秒、61トン/秒に達する。
論文 参考訳(メタデータ) (2026-05-28T12:24:15Z) - Attractor FCM [0.0]
本稿では、アトラクタFCMを作成し、テストし、分析する。
これは勾配降下に基づく、物理学に制約のある、FCMのヤコビアン版である。
論文 参考訳(メタデータ) (2026-04-30T14:44:47Z) - BASIS: Balanced Activation Sketching with Invariant Scalars for "Ghost Backpropagation" [0.0]
正確なバックプロパゲーションに必要な活性化メモリは、ネットワーク深さ、コンテキスト長、特徴次元と線形にスケールする。
本稿では,活性化メモリをバッチ次元とシーケンス次元から完全に分離する効率的なバックプロパゲーションアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-05T20:38:25Z) - All is Not Lost: LLM Recovery without Checkpoints [0.1638581561083717]
CheckFreeは、失敗するステージを最も近いステージの重み付き平均で置き換える効率的なリカバリ手法である。
CheckFreeとCheckFree+は、ウォールクロック時間の収束率でチェックポイントと冗長な計算を12%以上上回った。
論文 参考訳(メタデータ) (2025-06-18T13:48:33Z) - Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model [89.8764435351222]
分散を低減した行列生成のために, WTA-CRS と呼ばれる新しい非バイアス推定系を提案する。
我々の研究は、チューニング変換器の文脈において、提案した推定器が既存のものよりも低い分散を示すという理論的および実験的証拠を提供する。
論文 参考訳(メタデータ) (2023-05-24T15:52:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。