論文の概要: Mixture-of-Control: State-Aware Fine-Tuning for Transformer-based Models
- arxiv url: http://arxiv.org/abs/2606.31397v1
- Date: Tue, 30 Jun 2026 09:25:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.164952
- Title: Mixture-of-Control: State-Aware Fine-Tuning for Transformer-based Models
- Title(参考訳): Mixture-of-Control:変圧器モデルのための状態認識ファインチューニング
- Authors: Duc Anh Nguyen, Tien Ngoc Luu, Tung Pham, Toan Tran,
- Abstract要約: 状態ベースファインチューニングは、トランスフォーマーの重量ベース適応の魅力的な代替手段として登場した。
ローカルおよびグローバルな制御信号を統合する軽量な微調整フレームワークであるMixture-of-Control(MoC)を紹介する。
MoCはスパース・ミックス・オブ・エキスパート・プロセスのエキスパートとしてブロックワイズ制御状態を扱い、トランスフォーマーブロック間の効率的な通信を可能にする。
- 参考スコア(独自算出の注目度): 9.447789020103487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State-based fine-tuning has emerged as a compelling alternative to weight-based adaptation for transformers, updating lightweight controls into states rather than model weights, offering substantial memory savings while retaining parameter efficiency. However, most existing state-based methods typically apply only per-block control updates, which limits inter-block information exchange and restricts representational adaptation. Meanwhile, prior mechanisms that enable cross-block communication often introduce considerable computational overhead, reducing their practicality for efficient fine-tuning. We introduce Mixture-of-Control (MoC), a lightweight fine-tuning framework that adaptively integrates local and global control signals to enhance representation learning. MoC treats block-wise control states as experts in a sparse mixture-of-experts process, enabling efficient communication across transformer blocks. Empirical results across diverse transformer-based benchmarks demonstrate that MoC outperforms state-based methods while maintaining a comparable memory and computational efficiency.
- Abstract(参考訳): 状態ベースの微調整は、トランスフォーマーの重みに基づく適応の魅力的な代替手段として現れ、モデルウェイトではなく州への軽量な制御を更新し、パラメータ効率を維持しながらかなりのメモリ節約を提供している。
しかし、既存の状態ベースのほとんどのメソッドはブロックごとの制御更新しか適用せず、ブロック間の情報交換を制限し、表現適応を制限する。
一方、クロスブロック通信を実現する前のメカニズムでは、計算オーバーヘッドが大きくなり、効率的な微調整のための実用性が低下する。
局所的およびグローバルな制御信号を適応的に統合して表現学習を強化する軽量な微調整フレームワークであるMixture-of-Control(MoC)を紹介する。
MoCはスパース・ミックス・オブ・エキスパート・プロセスのエキスパートとしてブロックワイズ制御状態を扱い、トランスフォーマーブロック間の効率的な通信を可能にする。
様々なトランスフォーマーベースのベンチマークによる実証的な結果は、MoCがメモリと計算効率を同等に保ちながら、状態ベースのメソッドよりも優れていることを示している。
関連論文リスト
- Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - In-memory Training on Analog Devices with Limited Conductance States via Multi-tile Residual Learning [59.091567092071564]
インメモリトレーニングは通常、デジタルベースラインに合わせて少なくとも8ビットのコンダクタンス状態を必要とする。
ReRAMのような多くの有望な中間デバイスは、製造制約のため、約4ビットの解像度しか提供しない。
本稿では,残差を補うために複数のクロスバータイルを逐次学習する語彙学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-02T19:44:25Z) - Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving [4.429810985618279]
トランスフォーマーは、今日のLarge Language Models(LLM)の原動力であり、そのパフォーマンスと汎用性の基盤となっている。
これに対し、アルゴリズムコミュニティはステートスペースモデル(SSM)、線形アテンション、リカレントニューラルネットワーク(RNN)などの代替アーキテクチャを模索している。
論文 参考訳(メタデータ) (2025-07-14T11:40:17Z) - OminiControl2: Efficient Conditioning for Diffusion Transformers [68.3243031301164]
我々は,効率的な画像条件生成を実現する効率的なフレームワークであるOminiControl2を提案する。
OminiControl2は、(1)生成時に最も意味のあるトークンだけを保存することによって条件入力を合理化する動的圧縮戦略、(2)条件トークンの特徴を1回だけ計算し、段階的に再利用する条件的特徴再利用機構である。
論文 参考訳(メタデータ) (2025-03-11T10:50:14Z) - Memory Efficient Transformer Adapter for Dense Predictions [42.413108132475855]
本稿では,メモリ効率を向上し,メモリ消費を低減できるメモリ効率の良いViTアダプタMETAを提案する。
提案するブロック内では、モデルの頻繁な再形成操作を減らすために、断面形状の自己注意が使用される。
METAは予測される品質を大幅に向上し、新しい最先端の精度効率トレードオフを実現している。
論文 参考訳(メタデータ) (2025-02-04T03:19:33Z) - PointMT: Efficient Point Cloud Analysis with Hybrid MLP-Transformer Architecture [46.266960248570086]
本研究は,効率的な特徴集約のための複雑局所的注意機構を導入することで,自己注意機構の二次的複雑さに取り組む。
また,各チャネルの注目重量分布を適応的に調整するパラメータフリーチャネル温度適応機構を導入する。
我々は,PointMTが性能と精度の最適なバランスを維持しつつ,最先端手法に匹敵する性能を実現することを示す。
論文 参考訳(メタデータ) (2024-08-10T10:16:03Z) - Transforming Image Super-Resolution: A ConvFormer-based Efficient Approach [58.57026686186709]
本稿では, Convolutional Transformer Layer (ConvFormer) を導入し, ConvFormer-based Super-Resolution Network (CFSR) を提案する。
CFSRは畳み込みベースのアプローチとトランスフォーマーベースのアプローチの両方の利点を継承する。
CFSRは計算コストと性能のバランスが最適であることを示す実験である。
論文 参考訳(メタデータ) (2024-01-11T03:08:00Z) - Real-Time Motion Prediction via Heterogeneous Polyline Transformer with
Relative Pose Encoding [121.08841110022607]
既存のエージェント中心の手法は、公開ベンチマークで顕著な性能を示した。
K-nearest neighbor attention with relative pose encoding (KNARPE) は、トランスフォーマーがペアワイズ相対表現を使用できる新しいアテンション機構である。
エージェント間でコンテキストを共有し、変化しないコンテキストを再利用することで、私たちのアプローチはシーン中心のメソッドと同じくらい効率的になり、最先端のエージェント中心のメソッドと同等に実行されます。
論文 参考訳(メタデータ) (2023-10-19T17:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。