論文の概要: TEXAS: Task-Expert-Aware Supervision for Downstream Mixture-of-Experts LLM Adaptation
- arxiv url: http://arxiv.org/abs/2608.06396v1
- Date: Fri, 31 Jul 2026 09:52:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.233573
- Title: TEXAS: Task-Expert-Aware Supervision for Downstream Mixture-of-Experts LLM Adaptation
- Title(参考訳): TEXAS: ダウンストリーム・ミックス・オブ・エクササイズLLM適応のためのタスク・エクスプロイト・アウェア・スーパービジョン
- Abstract要約: Mixture-of-Experts (MoE)言語モデルは、専門家の小さなサブセットを介して各トークンをルーティングする。
本稿では,正当性条件付きタスクエキスパート発見とトークンレベルの監督アロケーションを組み合わせたTEXAS(Task-Expert-Aware Supervision)を紹介する。
- 参考スコア(独自算出の注目度): 24.434444417809953
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) language models route each token through a small subset of experts, making routing patterns useful for identifying task-relevant experts during downstream adaptation. Yet current approaches have two limitations: task experts are typically identified from aggregate routing statistics that reflect usage rather than association with successful task completion, and task-expert activations remain underexplored as signals for supervision allocation. We introduce Task-Expert-Aware Supervision (TEXAS), which combines correctness-conditioned task expert discovery with token-level supervision allocation. TEXAS compares expert activations on instances that the base model solves successfully and those it fails to solve, and retains experts more strongly activated on successful instances. During fine-tuning, it upweights answer tokens in failed instances when they activate these experts. TEXAS therefore leverages existing routing behavior without restricting adaptation to a fixed expert subset or imposing an explicit target routing distribution. Across three MoE models and six benchmarks, TEXAS achieves the best or tied-best performance in 17 of 18 settings and improves over the strongest baseline by 1.3--1.5 points on average. Ablations and further analyses validate both the discovered experts and the resulting supervision strategy.
- Abstract(参考訳): Mixture-of-Experts (MoE)言語モデルは、各トークンを専門家の小さなサブセットを通してルーティングし、下流適応中にタスク関連の専門家を特定するのに有用なルーティングパターンを作成する。
しかし、現在のアプローチには2つの制限がある: タスクエキスパートは一般的に、タスク完了と結びつくのではなく、使用法を反映する集計ルーティング統計から特定され、タスクエキスパートのアクティベーションは、アロケーションのシグナルとして未調査のままである。
本稿では,正当性条件付きタスクエキスパート発見とトークンレベルの監督アロケーションを組み合わせたTEXAS(Task-Expert-Aware Supervision)を紹介する。
TEXASは、ベースモデルの解決に成功し、解決に失敗するインスタンスで専門家のアクティベーションを比較し、成功したインスタンスで専門家がより強く活性化する。
微調整中は、これらの専門家をアクティベートすると、失敗したインスタンスのトークンに応答する。
したがって、TEXASは、固定された専門家サブセットへの適応を制限したり、明示的なターゲットルーティング分布を課すことなく、既存のルーティング挙動を利用する。
3つのMoEモデルと6つのベンチマークで、TEXASは18のセットのうち17のセットで最高または最良のパフォーマンスを達成し、最強のベースラインを平均1.3-1.5ポイント改善した。
アブレーションとさらなる分析は、発見された専門家と結果の監視戦略の両方を検証する。
関連論文リスト
- SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning [83.66308307152808]
マルチモーダル・インストラクション・チューニング(MCIT)のためのStAbilized Mixture-of-Experts(SAME)を提案する。
プロプライエタリは、サブスペースへのルーティングダイナミクスを分解し、タスク関連方向のみを更新することで、専門家の選択を安定化する。
また、トレーニング中に選択した専門家を凍結するためにアダプティブな専門家アクティベーションを導入し、冗長でクロスタスクな干渉を減らす。
論文 参考訳(メタデータ) (2026-02-02T11:47:06Z) - Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers [27.817039954088315]
ツールレベルの専門知識を学習するための自己進化型マルチエージェントシステムである textbfGeoEvolver を紹介する。
GeoEvolverはエンドツーエンドのタスクの成功を継続的に改善し、複数のバックボーンで平均12%向上することを示す。
論文 参考訳(メタデータ) (2026-01-30T15:11:07Z) - Token-Level LLM Collaboration via FusionRoute [60.72307345997823]
FusionRouteはトークンレベルのマルチLLMコラボレーションフレームワークである。
各デコーディングステップで最も適した専門家を選択し、選択した専門家の次のTokenディストリビューションを洗練または修正する補完ロジットをコントリビュートする。
シーケンスレベルのコラボレーションとトークンレベルのコラボレーション、モデルマージ、ダイレクト微調整の両方に優れています。
論文 参考訳(メタデータ) (2026-01-08T16:53:16Z) - Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss [14.774710748687383]
Mixture-of-Experts (MoE)モデルは、ルータの決定が専門家の能力とうまく一致することを保証するための明確な制約を欠いている。
本稿では、ルータの判断を専門家の能力と密に結合する軽量な補助的損失であるエキスパート・ルータ結合(ERC)損失を提案する。
提案手法では,各専門家のルータ埋め込みを,専門家に割り当てられたトークンのプロキシトークンとして扱う。
論文 参考訳(メタデータ) (2025-12-29T13:03:18Z) - Beyond Redundancy: Diverse and Specialized Multi-Expert Sparse Autoencoder [59.89996751196727]
スパースオートエンコーダ(SAE)は、大規模な言語モデルを解釈するための強力なツールとして登場した。
SAEの隠蔽層は、空間的制約を満たすために高い次元性を持ち、結果として禁止的なトレーニングと推論コストをもたらす。
近年のMixture of Experts (MoE) アプローチは、SAEsによってゲートアクティベーションを持つより狭い専門家ネットワークにこの問題に対処しようとしている。
本稿では,(1)専門化を促進するために意味的に重み付けされた専門家サブセットを同時に関与する複数の専門家活性化,(2)適応的な高周波スケーリングによって多様性を高める特徴スケーリングという2つの重要なイノベーションを提案する。
論文 参考訳(メタデータ) (2025-11-07T22:19:34Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Separation and Collaboration: Two-Level Routing Grouped Mixture-of-Experts for Multi-Domain Continual Learning [7.361665112773847]
破滅的忘れを緩和する2レベル混合実験法(TRGE)を提案する。
TRGEはトレーニング済みのCLIPモデルを動的に拡張し、各タスクに特定の専門家グループを割り当てる。
我々は,タスク記述を生成し,正しいタスク識別子を認識するために,強力なマルチモーダル理解機能を持つマルチモーダル大規模言語モデル(MLLM)を利用する。
論文 参考訳(メタデータ) (2025-08-11T08:18:22Z) - Advancing MoE Efficiency: A Collaboration-Constrained Routing (C2R) Strategy for Better Expert Parallelism Design [36.35520569052556]
Mixture-of-Experts (MoE)は、ほぼ一定の計算コストを維持しながら、モデルをスケールアップすることに成功している。
我々は、より専門的な専門家グループを促進するために、新しい協調制約付きルーティング(C2R)戦略を提案する。
我々は10下流のNLPベンチマークで0.51%と0.33%の平均性能改善を実現した。
論文 参考訳(メタデータ) (2025-04-02T03:51:59Z) - Why Do Multi-Agent LLM Systems Fail? [87.90075668488434]
MAST-Dataは7つの人気のあるMASフレームワークで収集された1600以上の注釈付きトレースの包括的なデータセットである。
我々はMAST(Multi-Agent System Failure Taxonomy)を初めて構築する。
MASTとMAST-Dataを利用して、モデル(GPT4、Claude 3、Qwen2.5、CodeLlama)とタスク(コーディング、数学、汎用エージェント)の障害パターンを分析します。
論文 参考訳(メタデータ) (2025-03-17T19:04:38Z) - Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement [50.481380478458945]
反復的なステップレベルプロセスリファインメント(IPR)フレームワークは、エージェントトレーニングを強化するためのステップバイステップのガイダンスを提供する。
3つの複雑なエージェントタスクに関する我々の実験は、我々のフレームワークが様々な強力なベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2024-06-17T03:29:13Z) - MoEC: Mixture of Expert Clusters [93.63738535295866]
Sparsely Mixture of Experts (MoE)は、安価な計算オーバーヘッドを持つ有望なスケーリング能力のため、大きな関心を集めている。
MoEは密度の高い層をスパースの専門家に変換し、ゲートルーティングネットワークを使用して専門家を条件付きで活性化させる。
しかし、専門家の数が増加するにつれて、乱雑なパラメータを持つMoEはデータアロケーションの過度な調整とスパースに悩まされる。
論文 参考訳(メタデータ) (2022-07-19T06:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。