論文の概要: Fine-Tuning of Transformer models with Frames
- arxiv url: http://arxiv.org/abs/2608.26430v1
- Date: Wed, 26 Aug 2026 22:13:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.18119
- Title: Fine-Tuning of Transformer models with Frames
- Title(参考訳): フレームを用いた変圧器モデルの微調整
- Abstract要約: 本稿では,Fusion Frame を用いた事前学習モデルの微調整手法を提案する。
FrameFT は最先端のPEFT 技術と同等の性能を発揮することを示す。
実験の結果、FrameFTは最先端のPEFT技術と同等の性能を発揮するが、訓練可能なパラメータははるかに少ないことがわかった。
- 参考スコア(独自算出の注目度): 47.891438890695014
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-Efficient Fine-Tuning (PEFT) strategies such as Low-Rank Adaptation (LoRA) are effective solutions for fine-tuning large-scale pre-trained models; however, their memory requirements scale with the size of the model, $\mathcal{O}(dr)$, where $d$ is the model's hidden dimension and $r$ is the rank. Our proposal, FrameFT, models the parameter update $ΔW$ with a sparse coefficient matrix in a Fusion Frame basis. Fusion Frames can be generated algorithmically and shared across model layers, enabling very efficient updates. Only the sparse coefficients of the basis expansion are stored/optimized, reducing the memory footprint. The sparse structure of the coefficient matrix in FrameFT and the sparsity in the Fusion Frames give large compute benefits, and our analysis provides formal convergence results. We evaluate the idea across a suite of supervised fine-tuning benchmarks, focusing on language tasks, but also report application to vision models. Our experiments show that FrameFT achieves performance on par with/exceeding state-of-the-art PEFT techniques, but needs far fewer trainable parameters.
- Abstract(参考訳): Low-Rank Adaptation (LoRA) のようなパラメータ効率の良いファインチューニング(PEFT)戦略は、大規模な事前訓練モデルの微調整に有効なソリューションであるが、それらのメモリ要求はモデルのサイズに合わせてスケールする$\mathcal{O}(dr)$、$d$はモデルの隠れ次元であり、$r$はランクである。
我々の提案であるFrameFTは、パラメータ更新$ΔW$をFusion Frameベースでスパース係数行列でモデル化する。
フュージョンフレームはアルゴリズムによって生成され、モデル層間で共有され、非常に効率的な更新を可能にする。
ベース展開のスパース係数のみが記憶/最適化され、メモリフットプリントが減少する。
FrameFTの係数行列のスパース構造とFusion Framesのスパース性は大きな計算効果をもたらし,解析により公式収束結果が得られた。
このアイデアは,教師付き微調整ベンチマークによって評価され,言語タスクに焦点をあてるだけでなく,視覚モデルへの応用も報告する。
実験の結果、FrameFTは最先端のPEFT技術と同等の性能を発揮するが、訓練可能なパラメータははるかに少ないことがわかった。
関連論文リスト
- Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts [13.835014453826057]
モデルアーキテクチャとシステムの共同設計を定式化したMOSAICを開発した。
スパースMixture-of-Experts(MoE)言語モデルのためのフレームワークをインスタンス化する。
キャリブレーションされた空間範囲内において,効率非依存のモデルFLOPs予算は内部最適空間を許容しないことを示す。
論文 参考訳(メタデータ) (2026-08-11T07:49:00Z) - Elastic ViTs from Pretrained Models without Retraining [74.5386166956142]
ビジョンファウンデーションモデルは優れたパフォーマンスを達成するが、事前決定されたサイズの限られたセットでしか利用できない。
本稿では, プルーニングされた視覚変換器のためのシングルショットネットワーク近似であるSnapViTを紹介する。
提案手法は,進化的アルゴリズムを用いて近似した勾配情報とクロスネットワーク構造相関を効率的に結合する。
論文 参考訳(メタデータ) (2025-10-20T16:15:03Z) - From LLMs to Edge: Parameter-Efficient Fine-Tuning on Edge Devices [3.4233698915405544]
本稿では,資源制約されたエッジ環境に通常デプロイされる畳み込みアーキテクチャのPEFT手法をベンチマークし,解析する。
評価されたPEFT法は, 深部分離可能な畳み込みアーキテクチャに適用した場合, メモリ効率が半減することがわかった。
論文 参考訳(メタデータ) (2025-07-31T13:23:21Z) - Expanding Sparse Tuning for Low Memory Usage [103.43560327427647]
メモリ使用量が少ないスパースチューニングのためのSNELL(Sparse tuning with kerNelized LoRA)法を提案する。
低メモリ使用量を達成するため、SNELLはスカラー化のための調整可能な行列を2つの学習可能な低ランク行列に分解する。
コンペティションに基づくスペーシフィケーション機構は、チューナブルウェイトインデックスの保存を避けるためにさらに提案される。
論文 参考訳(メタデータ) (2024-11-04T04:58:20Z) - LoRTA: Low Rank Tensor Adaptation of Large Language Models [70.32218116940393]
Low Rank Adaptation (LoRA) は、PEFT (Efficient Fine Tuning) 法として人気がある。
よりコンパクトで柔軟な表現を可能にする高階Candecomp/Parafac(CP)分解を提案する。
本手法は,比較性能を維持しつつパラメータ数を削減できる。
論文 参考訳(メタデータ) (2024-10-05T06:59:50Z) - A Convex-optimization-based Layer-wise Post-training Pruner for Large Language Models [24.185245582500876]
本稿では,凸最適化モデルとアルゴリズムに基づく最初のポストトレーニングプルーナであるFISTAPrunerを紹介する。
FISTAPrunerは層内累積誤差補正機構を搭載し、並列プルーニングをサポートする。
OPT, LLaMA, LLaMA-2, LLaMA-3 などのモデルにおける FISTAPruner の評価を行った。
論文 参考訳(メタデータ) (2024-08-07T12:33:46Z) - WeGeFT: Weight-Generative Fine-Tuning for Multi-Faceted Efficient Adaptation of Large Models [8.481707805559589]
WeGeFT(Weight-Generative Fine-Tuning)は、トレーニング済みの重みから直接微調整重みを生成することを学習する新しい手法である。
この設計は、パラメータ、表現、計算、メモリの多面的効率を実現し、LoRAとその変種の性能を維持したり、超えたりしている。
論文 参考訳(メタデータ) (2023-12-01T16:33:57Z) - MatFormer: Nested Transformer for Elastic Inference [91.45687988953435]
MatFormerは、多様なデプロイメント制約にまたがる弾性推論を提供するように設計された、新しいTransformerアーキテクチャである。
MatFormerは、標準的なTransformerモデルにネストフィードフォワードネットワーク(FFN)ブロック構造を組み込むことで、これを実現している。
8億5000万デコーダのみのMatFormer言語モデル(MatLM)により,5億2200万から8億5千万のパラメータにまたがる複数の小さなモデルを抽出できることを示す。
論文 参考訳(メタデータ) (2023-10-11T17:57:14Z) - Scaling Pre-trained Language Models to Deeper via Parameter-efficient
Architecture [68.13678918660872]
行列積演算子(MPO)に基づくより有能なパラメータ共有アーキテクチャを設計する。
MPO分解はパラメータ行列の情報を再編成し、2つの部分に分解することができる。
私たちのアーキテクチャは、モデルのサイズを減らすために、すべてのレイヤで中央テンソルを共有しています。
論文 参考訳(メタデータ) (2023-03-27T02:34:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。