論文の概要: FRAME: Learning the Adaptation Domain with a Mixture of Fractional-Fourier Experts
- arxiv url: http://arxiv.org/abs/2607.00162v1
- Date: Tue, 30 Jun 2026 20:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.634871
- Title: FRAME: Learning the Adaptation Domain with a Mixture of Fractional-Fourier Experts
- Title(参考訳): FRAME: フラクショナル・フーリエの専門家の混在による適応ドメインの学習
- Abstract要約: 本稿では,Frictional-Fourier Mixture of Expertsについて紹介する。
各専門家は、空間領域とフーリエ領域の間に連続的に補間する学習可能な分数-フーリエ順序を持つ。
順序は専門家ごとに1つのスカラーで、別々のチャープで訓練され、変換は$mathcalOdlog d)$-FFTサロゲートで計算される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-efficient fine-tuning (PEFT) reparameterizes weight updates in a fixed basis: low-rank adapters operate in the spatial domain, while a recent line of spectral methods operates in a fixed Fourier domain. We argue that the choice of domain is itself a design degree of freedom that should be learned, and that no single basis is optimal across tasks, layers, or tokens. We introduce Fractional-Fourier Mixture of Experts, a mixture-of-experts adapter in which every expert carries a learnable fractional-Fourier order that continuously interpolates between the spatial domain (recovering vanilla LoRA) and the Fourier domain (recovering a spectral adapter). Routing tokens through experts that occupy different points on this spatial-spectral continuum lets the model place each low-rank update in the domain where it is most compact, and -- because fractional-Fourier operators of different orders are mutually incoherent -- makes the experts naturally decorrelated, which reduces interference and improves multi-task composition. The order is a single scalar per expert, trained with a separate optimizer, and the transform is computed with an $\mathcal{O}(d\log d)$ chirp--FFT surrogate, so Fractional-Fourier Mixture of Experts adds negligible cost over standard MoE-LoRA. Across commonsense, mathematical, code, and knowledge benchmarks on LLaMA-3.1-8B and Qwen2.5-7B, Fractional-Fourier Mixture of Experts improves over strong MoE-LoRA and spectral baselines -- including FlyLoRA, FourierMoE, and HMoRA -- while keeping the active-parameter budget small, and analysis shows that the learned orders specialize by task and layer in interpretable ways.
- Abstract(参考訳): 低ランクアダプタは空間領域で動作し、最近のスペクトル法では固定フーリエ領域で動作している。
ドメインの選択はそれ自体が学習すべき設計の自由度であり、タスクやレイヤ、トークンに対してひとつのベースが最適ではない、と私たちは主張しています。
本稿では,各専門家が空間領域(バニラロラの回収)とフーリエ領域(スペクトルアダプタの回収)を連続的に補間する学習可能な分数-フーリエオーダーを担持する,エキスパートの混合であるフラクタル-フーリエ混合器について紹介する。
この空間スペクトル連続体上の異なる点を占有する専門家を通してトークンをルーティングすることで、モデルが最もコンパクトな領域に各低ランク更新を配置することができる。
この順序は専門家ごとに1つのスカラーであり、別のオプティマイザで訓練され、変換は$\mathcal{O}(d\log d)$ chirp--FFT シュロゲートで計算されるので、Fractional-Fourier Mixture of Expertsは標準のMoE-LoRAよりも無視できるコストを加算する。
LLaMA-3.1-8BとQwen2.5-7Bのコモンセンス、数学的、コード、知識ベンチマーク全体にわたって、FlyLoRA、FourierMoE、HMoRAを含む強力なMoE-LoRAとスペクトルベースラインを改良し、アクティブパラメータ予算を小さく保ちながら、学習された命令はタスクとレイヤによって解釈可能な方法で特殊化されている。
関連論文リスト
- ACE: Adapter Consolidation across Experts for Parameter-Efficient Fine-Tuning of MoE LLMs [5.509795962249259]
そこで我々はACE(Adapter Consolidation across Experts)を提案し、冗長な専門家をグループ化し、専門家固有のアダプタをグループ共有の上位LoRAモジュールに置き換える。
12のデータセットと4つのMoEバックボーンを網羅した評価において、ACEはパラメータマッチングPEFT法の中で最も高い平均精度を達成している。
論文 参考訳(メタデータ) (2026-09-05T13:05:01Z) - RAPTOR: Role-Aware Private Training for Mixture-of-Experts [68.5626338219096]
RAPTORはRole-Aware Private Trainingフレームワークである。
RAPTORは共有と専門家の最適化を交互に行い、各障害を直接ターゲットする。
GLUEタスク間でのSwitch TransformerとOLMoEの微調整およびDeepSeek-VL2-Tinyの実験では、標準のDPベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-09-04T23:16:12Z) - Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms [50.28963615440865]
再利用した人工物によって3つの融合パラダイムを編成する。
モデルスケールとマルチベンチマークスイートで、共有専門家とデータを使用して、これら3つを比較します。
論文 参考訳(メタデータ) (2026-08-27T17:38:04Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA [15.068543696107227]
Federated PEFTは、LLMが生のサンプルを共有することなく、分散化されたプライベートデータに協調的に適応できるようにする。
既存のメソッドは通常、クライアントの粒度を専門とし、暗黙的にタスクコヒーレントなクライアントを仮定する。
非対称アグリゲーションを採用したフレームワークであるFedWeaveを提案し、ルータ最適化から専門家アグリゲーションを分離する。
論文 参考訳(メタデータ) (2026-07-29T08:47:58Z) - Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models [15.447455377430634]
FourierMoEは、異なる周波数帯域の専門家にトークンをディスパッチする周波数適応ルータである。
シングルタスクとマルチタスクの両方で、競争ベースラインを一貫して上回る。
その結果,LLM微調整のための有効かつパラメータ効率の高いパラダイムとして,スペクトル領域の専門家適応が期待できることが明らかになった。
論文 参考訳(メタデータ) (2026-04-02T08:30:06Z) - CoMoL: Efficient Mixture of LoRA Experts via Dynamic Core Space Merging [49.87105462292961]
Core Space Mixture of LoRA (bfCoMoL)は、専門家の多様性、パラメータ効率、きめ細かい適応を取り入れた新しいMoE-LoRAフレームワークである。
CoMoLは、複数のタスクで既存のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-02-28T09:40:11Z) - How Much is Too Much? Exploring LoRA Rank Trade-offs for Retaining Knowledge and Domain Robustness [0.8757823830026766]
大規模な言語モデルは、微調整によって下流タスクに適応する傾向にある。
完全教師付きファインチューニング(SFT)とパラメータ効率のファインチューニング(PEFT)手法(Lo-Rank Adaptation(LoRA))は2つの主要なアプローチである。
論文 参考訳(メタデータ) (2025-12-17T17:44:09Z) - Mixture-of-Transformers Learn Faster: A Theoretical Study on Classification Problems [59.94955550958074]
本研究では,各変圧器ブロックが連続的に訓練されたゲーティングネットワークによって制御される専門家として機能する,トラクタブルな理論的枠組みについて検討する。
専門家の専門化は、勾配の衝突を減らし、各サブタスクを強く凸させることを示す。
トレーニングによって予測損失が$O(log(epsilon-1)$のステップでゼロに近づき、単一変圧器の$O(epsilon-1)$のレートよりも大幅に向上することが証明された。
論文 参考訳(メタデータ) (2025-10-30T21:07:36Z) - Adaptive Shared Experts with LoRA-Based Mixture of Experts for Multi-Task Learning [49.90176890917986]
マルチタスク学習(MTL)のための強力なフレームワークとして、Mixture-of-Experts(MoE)が登場した。
既存のMoE-MTL法は、しばしばシングルタスクで事前訓練されたバックボーンに依存し、冗長な適応と非効率的な知識共有に悩まされる。
低ランク適応 (LoRA) に基づく MoE の適応型共有専門家 (ASE) を提案する。
論文 参考訳(メタデータ) (2025-10-01T06:49:19Z) - FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge [7.976167864455345]
フェデレート・ラーニング(FL)はフェデレーション・ファイン・チューニング(FFT)を通じて魅力的なソリューションを提供する
FFT MoE は LoRA を sparse Mixture of Experts (MoE) アダプタに置き換える新しい FFT フレームワークである。
MoEは、一般化性能とトレーニング効率において、アートFFTベースラインの状態を一貫して上回る。
論文 参考訳(メタデータ) (2025-08-26T04:09:18Z) - Multi-Task Dense Prediction via Mixture of Low-Rank Experts [35.11968315125389]
MLoRE(Mixture-of-Low-Rank-Experts)と呼ばれる,マルチタスクの高密度予測のためのデコーダに着目した新しい手法を提案する。
グローバルなタスク関係をモデル化するために、MLoREは元のMoE構造に汎用的な畳み込みパスを追加し、各タスク機能は、明示的なパラメータ共有のためにこのパスを通ることができる。
実験の結果,MLoREは従来のすべてのメトリクスの最先端手法に比べて優れた性能を示すことがわかった。
論文 参考訳(メタデータ) (2024-03-26T14:40:17Z) - Mitigating the Alignment Tax of RLHF [76.4300447532456]
強化学習(Reinforcement Learning)とヒューマンフィードバック(Human Feedback)の下のLLMの調整は、事前訓練された能力(アライメント税(アライメント税)としても知られる)を忘れてしまう可能性がある。
最小アライメント税を課しながらアライメント性能を最大化するためのモデル平均化を提案する。
我々は,OpenLLaMA-3B上でのRLHFアルゴリズムによるHMAの性能評価を行い,さらにMistral-7Bまで拡張した。
論文 参考訳(メタデータ) (2023-09-12T14:16:54Z) - Deep Frequency Filtering for Domain Generalization [55.66498461438285]
Deep Neural Networks(DNN)は、学習プロセスにおいて、いくつかの周波数成分を優先する。
本稿では、ドメイン一般化可能な特徴を学習するためのDeep Frequency Filtering (DFF)を提案する。
提案したDFFをベースラインに適用すると,ドメインの一般化タスクにおける最先端の手法よりも優れることを示す。
論文 参考訳(メタデータ) (2022-03-23T05:19:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。