論文の概要: TopoTuner: Topological Finetuning of Large Language Models
- arxiv url: http://arxiv.org/abs/2607.16637v1
- Date: Sat, 18 Jul 2026 04:50:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.213737
- Title: TopoTuner: Topological Finetuning of Large Language Models
- Title(参考訳): TopoTuner: 大規模言語モデルのトポロジカル微調整
- Authors: Abdulkadir Erol, Yash Mahajan, Vepaul Hariprashad, Baha Rababah, Santu Karmaker, Cuneyt G. Akcora, Mubarak Shah,
- Abstract要約: TopoTunerは、注意投影行列の選択的凍結のためのトポロジー誘導微調整フレームワークである。
TopoTunerはソースデータセットから再利用可能な凍結プロファイルを学び、ドメイン外のデータセット上で効率的に微調整モデルに転送する。
- 参考スコア(独自算出の注目度): 36.513099592367496
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Full fine-tuning remains a strong way to adapt pretrained LLMs, but it updates all weights and can be expensive. LoRA reduces the number of trainable parameters, but it does not directly answer which pretrained components should be trained and which can be frozen during adaptation. We introduce TopoTuner, a topology-guided fine-tuning framework for selective freezing of attention projection matrices. \method treats each projection matrix as a row cloud and uses Wasserstein distances between persistence diagrams to measure how its topology changes during fine-tuning. TopoTuner learns a reusable freezing profile from a source dataset and transfers it to efficiently fine-tune models on out-of-domain datasets, evaluating whether task-specific topological drift generalizes across question answering and sentiment analysis tasks. Across LLaMA-3.1-8B, Mistral-7B-v0.3, and Qwen3-8B-Base, TopoTuner is competitive with full fine-tuning while training only 1-2\% of the model parameters, and outperforms LoRA in 7 out of 9 model-dataset settings, which can change up to 39.57\% of the projection parameters. Along with minimized updates, TopoTuner reduces training time by 20.4\% relative to full fine-tuning and 5.5\% relative to LoRA on average. TopoTuner opens a new direction for reusable freezing profiles, where fine-tuning behavior learned on one dataset can be shared across multiple tasks.
- Abstract(参考訳): 完全な微調整は、トレーニング済みのLLMに適応するための強力な方法だが、すべての重みを更新し、高価になる可能性がある。
LoRAはトレーニング可能なパラメータの数を減らしますが、どのトレーニング済みコンポーネントをトレーニングすべきか、適応中に凍結するかを直接答えることはできません。
TopoTunerは,注目射影行列の選択的凍結のためのトポロジー誘導微調整フレームワークである。
\method は各プロジェクション行列を行クラウドとして扱い、永続図間のワッサーシュタイン距離を用いて、微調整中にそのトポロジーがどのように変化するかを測定する。
TopoTunerはソースデータセットから再利用可能な凍結プロファイルを学習し、ドメイン外のデータセット上で効率的に微調整モデルに転送し、タスク固有のトポロジカルドリフトが質問応答と感情分析タスクにまたがって一般化するかどうかを評価する。
LLaMA-3.1-8B、Mistral-7B-v0.3、Qwen3-8B-Baseの他、TopoTunerはモデルパラメータの1-2倍のトレーニングをしながら、完全な微調整と競合する。
更新の最小化に加えて、TopoTunerは、完全な微調整と比較してトレーニング時間を20.4\%、LoRAに対して5.5\%削減する。
TopoTunerは、再利用可能な凍結プロファイルのための新しい方向を開放し、ひとつのデータセットで学んだ微調整の振る舞いを複数のタスク間で共有する。
関連論文リスト
- FuRA: Full-Rank Parameter-Efficient Fine-Tuning with Spectral Preconditioning [7.497481049158277]
フルファインチューニング (Full FT) とパラメータ効率の良いファインチューニングはどちらも、事前トレーニング中に確立されたスペクトル構造を考慮せずに重み更新を導入する。
本稿では,ブロックテンソル-トレイン因数分解 W = LSR に基づく効率的なフルランク適応フレームワーク FuRA を提案する。
この設計は同時にフルランクのスペクトルプリコンディショニングを提供し、フルランクの更新表現を保ち、パラメータ、メモリ、ステップタイム効率をLoRAに匹敵するものにしている。
論文 参考訳(メタデータ) (2026-05-19T22:11:25Z) - Layer-wise LoRA fine-tuning: a similarity metric approach [0.6323908398583081]
Low-Rank Adaptation (LoRA) 技術は、事前学習されたモデルを凍結し、少数のパラメータを更新することで、このプロセスの計算コストを削減することを目的としている。
従来の問題に対して,LoRAやその変種を用いて,少数の層のみを微調整に体系的に選択することで対処する。
異なるモデルやタスク間で予測性能を維持しながら、LoRAベースのテクニックのトレーニング可能なパラメータを最大50%削減する。
論文 参考訳(メタデータ) (2026-02-05T18:38:53Z) - Gradient-based Fine-Tuning through Pre-trained Model Regularization [20.823624386591902]
重み行列の行や列を更新する効率的な勾配ベースおよび正規化微調整法(GRFT)を提案する。
GRFTは最先端のパフォーマンスを実現し、GPS、Adapter Tuning、LoRAといった既存の手法を超越している。
論文 参考訳(メタデータ) (2025-06-14T14:41:03Z) - PointLoRA: Low-Rank Adaptation with Token Selection for Point Cloud Learning [54.99373314906667]
ポイントクラウドのための自己教師付き表現学習は、様々なタスクで事前訓練されたモデルパフォーマンスを改善する効果を実証した。
事前訓練されたモデルは複雑さが増すにつれて、下流のアプリケーションに完全に微調整を施すには、かなりの計算資源とストレージ資源が必要である。
そこで我々は,低ランク適応(LoRA)とマルチスケールトークン選択を併用した簡易かつ効果的なPointLoRAを提案する。
論文 参考訳(メタデータ) (2025-04-22T16:41:21Z) - ConvLoRA and AdaBN based Domain Adaptation via Self-Training [4.006331916849688]
マルチターゲットドメイン適応のための畳み込み低ランク適応(ConvLoRA)を提案する。
ConvLoRAはトレーニング済みのモデルウェイトを凍結し、畳み込み層にトレーニング可能な低ランク分解行列を追加し、勾配をバックプロパゲートする。
提案手法はトレーニング可能なパラメータを少なくし,大規模独立微調整ネットワークと同等あるいは同等に動作する。
論文 参考訳(メタデータ) (2024-02-07T15:43:50Z) - Prompt Tuning for Parameter-efficient Medical Image Segmentation [79.09285179181225]
2つの医用画像データセットのセマンティックセグメンテーションにパラメータ効率が良いが効果的な適応を実現するために,いくつかのコントリビューションを提案し,検討する。
我々はこのアーキテクチャを、オンライン生成プロトタイプへの割り当てに基づく専用密集型セルフスーパービジョンスキームで事前訓練する。
得られたニューラルネットワークモデルにより、完全に微調整されたモデルとパラメータに適応したモデルとのギャップを緩和できることを実証する。
論文 参考訳(メタデータ) (2022-11-16T21:55:05Z) - DSEE: Dually Sparsity-embedded Efficient Tuning of Pre-trained Language
Models [152.29364079385635]
事前訓練されたモデルが大きくなればなるほど、微調整のプロセスは時間がかかり、計算コストがかかる可能性がある。
本稿では,重み更新と最終モデルの重み付けに先立って,疎度を活用することで,資源・パラメータ効率の微調整を行うフレームワークを提案する。
提案するフレームワークは,Dually Sparsity-Embeded Efficient Tuning (DSEE)と呼ばれ,パラメータ効率のよい微調整とリソース効率の推論という2つの重要な目標を達成することを目的としている。
論文 参考訳(メタデータ) (2021-10-30T03:29:47Z) - LoRA: Low-Rank Adaptation of Large Language Models [71.75808607987281]
Low-Rank Adaptation (LoRA)はトレーニング済みモデルの重みを凍結し、トレーニング可能な階数分解をTransformerアーキテクチャの各層に注入する。
GPT-3では、LoRAはトレーニング可能なパラメータの数を1万倍に減らし、計算ハードウェアの要求をフル微調整の3倍に削減できる。
論文 参考訳(メタデータ) (2021-06-17T17:37:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。