論文の概要: The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs
- arxiv url: http://arxiv.org/abs/2607.29601v1
- Date: Fri, 31 Jul 2026 16:33:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.797564
- Title: The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs
- Title(参考訳): 多目的LLMの効率的な訓練のための自動タスクシークエンシング
- Abstract要約: 本稿では,大規模言語モデルのパラメータ効率向上のための最適化パス組織化フレームワークを提案する。
TRACEベンチマークの実験では、従来の単極PEFTから多極PEFTまで性能が一貫して改善されている。
- 参考スコア(独自算出の注目度): 7.319201651289863
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Parameter-Efficient Fine-Tuning (PEFT) commonly adapts large language models using a single shared Low-Rank Adapter (LoRA). This shared optimization space often suffers from interference when adapting heterogeneous task sequences, leading to poor transfer and catastrophic forgetting. Existing approaches mainly improve adapter expressiveness by increasing parameter capacity or composing multiple adapters, yet they still rely on a shared optimization path. In this paper, we propose an optimization-path organization framework for parameter-efficient fine-tuning of large language models, implemented as an automatic multi-policy PEFT architecture. Specifically, optimization-compatible adaptation paths are automatically organized through task grouping and task sequencing under a fixed parameter budget. The organized optimization paths are implemented as independent Quantized Low-Rank Adapters (QLoRA), enabling heterogeneous tasks to be optimized in decoupled adaptation spaces while preserving positive transfer among compatible tasks. Experiments on the TRACE benchmark demonstrate that performance consistently improves from conventional single-policy PEFT to multi-policy PEFT, with the proposed automatic multi-policy framework achieving the best performance of 44.78 under the same trainable capacity. This suggests that optimization-path organization is more effective than simply increasing adapter capacity for heterogeneous parameter-efficient fine-tuning.
- Abstract(参考訳): パラメータ効率のよいファインチューニング(PEFT)は、単一の共有ローランドアダプタ(LoRA)を使用して大きな言語モデルを適応させるのが一般的である。
この共有最適化空間は、不均一なタスクシーケンスを適応する際にしばしば干渉に悩まされ、転送不良と破滅的な忘れが生じる。
既存のアプローチは主にパラメータ容量を増やしたり、複数のアダプタを構成することでアダプタ表現性を改善するが、それでも共有最適化パスに依存している。
本稿では,大規模言語モデルのパラメータ効率向上のための最適化パス組織化フレームワークを提案し,自動多言語PEFTアーキテクチャとして実装した。
具体的には、最適化互換適応パスは、固定パラメータ予算の下でタスクグループ化とタスクシークエンシングによって自動的に編成される。
組織化された最適化パスは、独立量子化低ランクアダプタ(QLoRA)として実装され、不均一なタスクを非結合適応空間で最適化し、互換性のあるタスク間で正の転送を保持する。
TRACEベンチマークの実験では、従来のシングルポリティPEFTからマルチポリティPEFTまで、同じ訓練能力で44.78の最高のパフォーマンスを達成するための自動マルチポリティフレームワークが一貫して改善されている。
このことは、最適化パスの組織は、不均一なパラメータ効率の微調整のためのアダプタ容量を単純に増やすよりも効果的であることを示している。
関連論文リスト
- Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning [46.539149169728624]
大規模な微調整の大きな障害は、バックプロパゲーションのメモリオーバーヘッドである。
$texttAdaNAGED$は、勾配なしトレーニング、適応チューニング、非ユークリッド更新幾何学を統一するメソッドである。
論文 参考訳(メタデータ) (2026-06-12T21:46:54Z) - AutoScout: Structured Optimization for Automating ML System Configuration [12.657466158068972]
AutoScoutは機械学習トレーニング、微調整、推論のための汎用システムである。
ハイインパクトな設定を優先し、様々な忠実度を持つシミュレータをアンサンブルする。
高性能な設定を一貫して定義し、専門家が調整した設定よりも2.7-3.0$timesのトレーニングスピードアップを実現している。
論文 参考訳(メタデータ) (2026-03-12T06:56:12Z) - Task-free Adaptive Meta Black-box Optimization [55.461814601130044]
対象タスクからのみ最適化データを用いてオンラインパラメータ適応を行うアダプティブメタブラックボックス最適化モデル(ABOM)を提案する。
メタトレーニングと最適化フェーズを分離する従来のメタBBOフレームワークとは異なり、ABOMはクローズドループパラメータ学習機構を導入し、パラメータ化された進化演算子を継続的に自己更新する。
このパラダイムシフトはゼロショット最適化を可能にする: 合成BBOベンチマークにおけるABOMの競合性能と、手作りのトレーニングタスクを伴わない現実的な無人飛行路計画問題。
論文 参考訳(メタデータ) (2026-01-29T09:54:10Z) - Relation-Aware Bayesian Optimization of DBMS Configurations Guided by Affinity Scores [2.474203056060563]
データベース管理システム(DBMS)は,大規模および異種データの管理に基本的であり,その性能は構成パラメータの影響を強く受けている。
近年の研究では、機械学習を用いた自動構成最適化に焦点が当てられているが、既存のアプローチにはいくつかの重要な制限がある。
パラメータ依存をグラフとして表現する新しいフレームワークであるRelTuneを提案し,パフォーマンス関連セマンティクスを符号化したGNNベースの潜伏埋め込みを学習する。
論文 参考訳(メタデータ) (2025-10-31T03:46:42Z) - Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization [13.271737599933147]
本稿では,エントロピー強化フレームワークであるEntroPOを紹介し,既存の優先最適化アルゴリズムをマルチターンツール支援設定に適用する。
EntroPOは、さまざまな家族やサイズのモデル群を微調整することで検証する。
swebenchのリーダーボードでは、オープンウェイトモデルの間で、新しい最先端の結果が確立される。
論文 参考訳(メタデータ) (2025-09-15T20:36:19Z) - FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts [47.35092228595656]
FLoEは、(i)MoEベースの低ランク適応のためのタスククリティカルトランスフォーマー層を動的に識別するFisher情報誘導重要度スコアリング機構、(ii)網羅的検索なしで特定のデータセット上で最適なLoRAランクを自動的に決定するベイズ最適化駆動ランクアロケータである。
多様なLCMとベンチマークの実験により、FLoEは顕著な効率と精度のトレードオフを達成し、FLoEは特に迅速な適応を必要とする資源制約環境において有利であることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-31T10:27:08Z) - Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System [75.25394449773052]
大規模言語モデル (LLM) に基づくマルチエージェントシステム (MAS) は協調的問題解決において顕著な可能性を示している。
通信効率の低下、スケーラビリティの低下、効果的なパラメータ更新方法の欠如などです。
本稿では,コミュニケーション効率とタスク効率を両立させ,これらの課題に対処する新しいフレームワークOptimaを提案する。
論文 参考訳(メタデータ) (2024-10-10T17:00:06Z) - Adaptive Preference Scaling for Reinforcement Learning with Human Feedback [103.36048042664768]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の価値を合わせるための一般的なアプローチである。
本稿では,分散ロバスト最適化(DRO)に基づく適応的優先損失を提案する。
提案手法は多用途であり,様々な選好最適化フレームワークに容易に適用可能である。
論文 参考訳(メタデータ) (2024-06-04T20:33:22Z) - Parameter-Efficient Fine-Tuning With Adapters [5.948206235442328]
本研究では,UniPELTフレームワークをベースとした新しい適応手法を提案する。
提案手法では, ベースモデルパラメータの最小限の再学習を行うことなく, 事前学習したモデルを新しいタスクに効率的に転送できるアダプタを用いる。
論文 参考訳(メタデータ) (2024-05-09T01:40:38Z) - Controllable Prompt Tuning For Balancing Group Distributional Robustness [53.336515056479705]
グループ間で優れたパフォーマンスを実現するための最適化スキームを導入し、それらの性能を著しく犠牲にすることなく、全員に良い解決策を見出す。
本稿では,制御可能なプロンプトチューニング(CPT)を提案する。
突発的相関ベンチマークでは, 変換器と非変換器の両アーキテクチャ, および非モーダルおよびマルチモーダルデータにまたがって, 最先端の結果が得られた。
論文 参考訳(メタデータ) (2024-03-05T06:23:55Z) - AutoPEFT: Automatic Configuration Search for Parameter-Efficient
Fine-Tuning [77.61565726647784]
ニューラルアーキテクチャ検索の進歩により,自動PEFT設定選択のためのAutoPEFTを提案する。
本稿では,AutoPEFTが検出した構成が既存のPEFT法よりも大幅に優れており,FFTと同等かそれ以上であることを示す。
論文 参考訳(メタデータ) (2023-01-28T08:51:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。