論文の概要: Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation
- arxiv url: http://arxiv.org/abs/2608.08336v1
- Date: Sat, 08 Aug 2026 21:04:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.781929
- Title: Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation
- Title(参考訳): 高速変圧器適応のための回路微細調整
- Abstract要約: CFT(Circuit Fine-Tuning)は、回路探索を用いて、トレーニング前に微細チューニングを行うモジュールを選択する計算効率の高いフレームワークである。
CFTは学習速度のウォームアップを必要とせず、平均して$sim20$ epochsのピーク精度に達する。
- 参考スコア(独自算出の注目度): 3.52359746858894
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-Efficient Fine-Tuning (PEFT) has become the de facto standard for adapting Vision Transformers (ViTs) to downstream tasks. While parameter count has been the dominant efficiency metric in PEFT, it does not imply \textit{compute efficiency}: parameter-sparse methods can still incur full-model training cost per step, and typically need long schedules to reach peak accuracy. We introduce Circuit Fine-Tuning (CFT), a compute-efficient framework that uses circuit discovery---conventionally used to explain trained models---to select modules for fine-tuning before training. Whereas attribution is conventionally formulated against a trained task head, we formulate it against a near-zero-initialized probe head, which isolates the response of the backbone to the target distribution rather than the preferences of a particular classifier. CFT then fine-tunes only the recovered subgraph. CFT needs no learning-rate warmup and reaches peak accuracy in ${\sim}20$ epochs on average---versus $44$--$96$ for strong PEFT baselines---yielding $2.3$--$6.6\times$ fewer training FLOPs and up to $16\times$ less wall-clock time, while adding zero parameters and no inference operations. Experiments across a standard visual transfer benchmark (VTAB-1k), hierarchical backbones (Swin), domain-shifted medical imaging (CBIS-DDSM), and a vision-language model (Gemma-3 on CUB-200) demonstrate the effectiveness of CFT. Code is available at https://github.com/UriKialy/CFT
- Abstract(参考訳): パラメータ効率のよいファインチューニング(PEFT)は、視覚変換器(ViT)を下流タスクに適用するためのデファクトスタンダードとなっている。
パラメータカウントはPEFTの主要な効率指標であるが、パラメータスパース法はステップ毎にフルモデルトレーニングコストを発生させることができ、通常はピーク精度に達するのに長いスケジュールを必要とする。
本稿では,回路探索を利用する計算効率の高いフレームワークであるCircuit Fine-Tuning(CFT)について紹介する。
従来、訓練されたタスクヘッドに対して属性が定式化されているのに対して、特定の分類器の選好ではなく、バックボーンの応答をターゲット分布に分離する、ほぼゼロの初期化プローブヘッドに対して定式化されている。
その後、CFTは回収された部分グラフのみを微調整する。
CFTは学習率のウォームアップを必要とせず、平均で${\sim}20$ epochsの最高値に達する--強いPEFTベースラインに対して$44$--96$-----yielding $2.3$--$6.6\times$ less training FLOPs and up $116\times$ down wall-clock time。
標準的な視覚伝達ベンチマーク(VTAB-1k)、階層バックボーン(Swin)、ドメインシフト医療画像(CBIS-DDSM)、ビジョン言語モデル(Gemma-3 on CUB-200)による実験は、CFTの有効性を実証している。
コードはhttps://github.com/UriKialy/CFTで入手できる。
関連論文リスト
- Quantum Tunneling-Aware Machine Learning: Physics-Derived Noise Models for Robust Deployment [5.373588450790602]
量子トンネル対応機械学習(QTAML)を紹介する。
We derived the deployment-time weight-error distribution from first principles using the Wentzel-Kramers-Brillouin (WKB) approximation。
我々は,これらの構造特性を単一配置時アルゴリズムであるTunning-Aware Compensation (TAC) にパッケージ化し,閉形式平均補正と最適層予算配分を組み合わせた。
論文 参考訳(メタデータ) (2026-05-30T14:21:16Z) - PreFT: Prefill-only finetuning for efficient inference [54.58291801311547]
我々は,vLLM推論エンジン上で,プリフィルのみのPEFTであるLoRAとReFTの効率的な実装を開発し,リリースする。
Llama 3.1 70Bで512ドルのアダプタを提供する場合のスループットは,従来のPEFTよりも効率的であることを示す。
論文 参考訳(メタデータ) (2026-05-14T00:19:41Z) - DualTCN: A Physics-Constrained Temporal Convolutional Network for 2 Time-Domain Marine CSEM Inversion [1.2031796234206138]
DualTCNは、時間領域の海洋電磁制御源(MCSEM)過渡データを反転させるための最初のディープラーニングフレームワークである。
このフレームワークは、4つのアースモデルパラメータを回帰し、微分可能なソフトステップデコーダを用いてプロファイルを再構成する。
このフレームワークは、カリキュラムベースの振幅増大によるノイズに対する高い堅牢性を示し、平均$barR2$ 0.858 at $pm2%$ランダム振幅誤差を維持している。
論文 参考訳(メタデータ) (2026-05-06T14:58:17Z) - Self-Auditing Parameter-Efficient Fine-Tuning for Few-Shot 3D Medical Image Segmentation [0.0]
SEA-PEFTは、微調整時に解決したオンラインアロケーション問題としてアダプタ構成を扱う。
SEA-PEFTは、アクティブアダプタを訓練するサーチオーディットアルループを使用し、各アダプタのDiceユーティリティを一時的にトグルオフして推定し、パラメータ予算の下でアクティブセットを再選択する。
TotalSegmentatorとFLARE'22では、SEA-PEFTは最強の固定位相PEFT平滑化よりも平均Diceを2.4~2.8ポイント改善している。
論文 参考訳(メタデータ) (2026-03-06T02:17:12Z) - VectorFit : Adaptive Singular & Bias Vector Fine-Tuning of Pre-trained Foundation Models [0.8875650122536799]
本稿では,VectorFitを紹介する。VectorFitは,その特異ベクトルとバイアスを適応的にトレーニングすることで,$W$に埋め込まれた既存の知識を効率的に活用する。
この方法では、$W$の構造的および変換的性質を利用することで、完全な微調整に匹敵する高階インクリメンタルウェイト行列が$Delta W$となることが示される。
論文 参考訳(メタデータ) (2025-03-25T10:36:27Z) - From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers [52.199303258423306]
本稿では,事前学習したモデルにおいて,高い活性化空間性を促進する新しい密度損失を提案する。
提案手法である textbfDEFT は,RoBERTa$_mathrmLarge$ で textbf44.94% ,Flan-T5$_mathrmXXL$ で textbf53.19% (エンコーダ密度) と textbf90.60% (デコーダ密度) で常に活性化密度を減少させることができる。
論文 参考訳(メタデータ) (2024-02-02T21:25:46Z) - Data-Free Dynamic Compression of CNNs for Tractable Efficiency [46.498278084317704]
構造化プルーニング手法は, 精度が大幅に低下することなく浮動小数点演算を低下させる可能性を示唆している。
HASTE(Hashing for Tractable Efficiency)は,データフリーでプラグイン・アンド・プレイのコンボリューションモジュールで,トレーニングや微調整なしにネットワークのテスト時間推論コストを瞬時に低減する。
CIFAR-10とImageNetでは46.72%のFLOPを1.25%の精度で削減した。
論文 参考訳(メタデータ) (2023-09-29T13:09:40Z) - Does Continual Learning Equally Forget All Parameters? [55.431048995662714]
連続学習(CL)における分散シフト(タスクやドメインシフトなど)は通常、ニューラルネットワークを壊滅的に忘れてしまう。
ニューラルネットワークのどのモジュールが、CL中のトレーニングダイナミクスを調査することによって忘れやすいかを検討する。
CL中に周期的にトリガされるFPFの1段階ごとのリプレイを完全に取り除き,わずか$k$で置き換える,より効率的でシンプルな手法を提案する。
論文 参考訳(メタデータ) (2023-04-09T04:36:24Z) - Strong Baselines for Parameter Efficient Few-Shot Fine-tuning [50.83426196335385]
FSC (Few-shot Classification) は、事前訓練(メタトレーニング)フェーズの後にクラス毎にいくつかの例を与えられた新しいクラスを学習する。
近年の研究では、新しいテストクラスで事前訓練された視覚変換器(ViT)を微調整することが、FSCにとって強力なアプローチであることが示されている。
しかし、微調整のViTは、時間、計算、ストレージに費用がかかる。
これにより、Transformerのパラメータのごく一部だけを微調整するPEFT法が考案された。
論文 参考訳(メタデータ) (2023-04-04T16:14:39Z) - Improving Representational Continuity via Continued Pretraining [76.29171039601948]
トランスファーラーニングコミュニティ(LP-FT)は、ナイーブトレーニングやその他の継続的な学習方法よりも優れている。
LP-FTは、リアルタイム衛星リモートセンシングデータセット(FMoW)における忘れを減らす。
LP-FTの変種は、NLP連続学習ベンチマークで最先端の精度を得る。
論文 参考訳(メタデータ) (2023-02-26T10:39:38Z) - Online Hyperparameter Optimization for Class-Incremental Learning [99.70569355681174]
クラス増分学習(Class-incremental Learning, CIL)は、クラス数がフェーズごとに増加する一方で、分類モデルを訓練することを目的としている。
CILの固有の課題は、安定性と塑性のトレードオフである。すなわち、CILモデルは古い知識を保ち、新しい知識を吸収するためにプラスチックを保たなければならない。
本稿では,事前設定を知らずにトレードオフを適応的に最適化するオンライン学習手法を提案する。
論文 参考訳(メタデータ) (2023-01-11T17:58:51Z) - Decoder Tuning: Efficient Language Understanding as Decoding [84.68266271483022]
本稿では,タスク固有のデコーダネットワークを出力側で最適化するデコーダチューニング(DecT)を提案する。
勾配ベースの最適化により、DecTは数秒以内にトレーニングでき、サンプル毎に1つのPクエリしか必要としない。
我々は、広範囲にわたる自然言語理解実験を行い、DecTが200ドル以上のスピードアップで最先端のアルゴリズムを大幅に上回っていることを示す。
論文 参考訳(メタデータ) (2022-12-16T11:15:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。