論文の概要: Signature-Guided Capacity Occupancy for Dense Expert Merging
- arxiv url: http://arxiv.org/abs/2608.09201v1
- Date: Mon, 10 Aug 2026 07:16:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.1235
- Title: Signature-Guided Capacity Occupancy for Dense Expert Merging
- Title(参考訳): Dense Expert Mergingのためのシグナチャガイド付容量利用
- Abstract要約: SigMergeは、密集したエキスパートマージのための構造化キャパシティ割り当てフレームワークである。
7つの密集したベース・マージと3つのモデル・プールにまたがる21組のペア・セッティングでは、SigMergeは6つのマージ・メソッドの中で最高の平均ランク(1.67)を達成する。
- 参考スコア(独自算出の注目度): 22.955240153617485
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dense expert merging combines domain-specialized language models into one single checkpoint, typically by admitting task-vector support in weight space. However, this admission is governed by three decisions that existing methods answer only partially: where to open layer capacity from cross-expert conflict, who should occupy that capacity based on domain demand, and how to admit the resulting support without relying on costly recipe search. To tackle these issues, we propose SigMerge (Signature-Guided Capacity Occupancy), a structured capacity assignment framework for dense expert merging. Starting from a dense base merge, conflict signatures set each layer's capacity from cross-expert conflict, positive base-merge deficits set each domain's share of that capacity, and a sequential occupancy rule admits each expert delta up to the resulting layer-domain budget. Across 21 paired settings spanning seven dense base merges and three model pools, SigMerge improves every one (by 15.0% on average) and achieves the best average rank (1.67) among six merging methods, outperforming three categories of merging baselines.
- Abstract(参考訳): Dense Expert merging はドメイン特化言語モデルを1つのチェックポイントに統合する。
しかし、この許可は、既存のメソッドが部分的にしか答えない3つの決定によって統治される: クロスエキスパートの衝突からレイヤーの容量を開放する場所、ドメインの要求に基づいてその容量を占有する人、そして、コストのかかるレシピ検索に頼ることなく、そのサポートをどうやって受け入れるか。
これらの課題に対処するため,我々はSigMerge (Signature-Guided Capacity Occupancy) を提案する。
コンフリクトシグネチャは、密集したベースマージから始まり、各レイヤのキャパシティをクロスエキスパートのコンフリクトから設定し、ポジティブなベースマージ欠陥は各ドメインのキャパシティのシェアを設定し、シーケンシャルな占有ルールは、各エキスパートのデルタをその結果のレイヤドメイン予算まで認める。
SigMergeは7つの密集したベース・マージと3つのモデル・プールにまたがる21のペア・セッティング・セッティングで、1つ1つ(平均15.0%)を改良し、6つのマージ・メソッドの中で最高の平均ランク(1.67)を達成し、マージ・ベースラインの3つのカテゴリを上回っている。
関連論文リスト
- Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms [50.28963615440865]
再利用した人工物によって3つの融合パラダイムを編成する。
モデルスケールとマルチベンチマークスイートで、共有専門家とデータを使用して、これら3つを比較します。
論文 参考訳(メタデータ) (2026-08-27T17:38:04Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - MasDrift: Benchmarking Authorization Preservation Across Multi-Agent Architectures [23.859862132370168]
MasDriftは8つのドメインにまたがる600の生産性タスクのベンチマークである。
MasDriftは、階層の深さとピア幅を変えながら、単一エージェント、集中型、分散化されたコーディネーションを比較する。
我々は,認証証拠の在り処で異なる2つの防衛措置を比較した。一方は,元のユーザ要求に待ち受けている毎回再審理を行い,もう一方はデリゲートチェーンに沿って緩和された政策を実行する。
論文 参考訳(メタデータ) (2026-08-02T04:46:15Z) - UMoE:Unlocking Every Expert in Domain-Specific Training [21.878914936561486]
Mixture-of-Experts (MoE)モデルは、比例計算コストなしでキャパシティをスケールする。
我々は、微調整前にエキスパートプールをターゲットドメインに設定する、シンプルな、予算保存パイプラインを提案する。
論文 参考訳(メタデータ) (2026-07-13T11:52:42Z) - Conflict-Free Replicated Data Types for Neural Network Model Merging: A Two-Layer Architecture Enabling CRDT-Compliant Model Merging Across 26 Strategies [0.0]
CRDTStateは、すべてのマージ戦略をCRDT準拠の層にラップする。
Layer 1はOR-Set CRDTセマンティクスを通じてコントリビューションを管理する。
レイヤ2は、列挙されたコントリビューションセット上の決定論的純粋関数としてマージ戦略を適用します。
論文 参考訳(メタデータ) (2026-05-16T07:08:52Z) - Discrete Diffusion for Complex and Congested Multi-Agent Path Finding with Sparse Social Attention [23.40140861152013]
MAPF(Multi-Agent Path Finding)は、グローバルに一貫した計算を必要とする協調問題である。
密集した環境では、最適でない初期計画は複合的な紛争を引き起こし、実現可能な修復を妨げる。
本稿では,分散拡散確率モデル(D3PM)をLSS2と統合したハイブリッドフレームワークDiffSLNを提案する。
論文 参考訳(メタデータ) (2026-05-13T10:10:22Z) - Hierarchical Mixture-of-Experts with Two-Stage Optimization [84.70724165894501]
ルーティング制御を2つの結合レベルに分解するグループ化されたMoEフレームワークであるHi-MoEを提案する。
我々は,最近のスパースルーティングやグループ化されたMoEベースラインに対する一貫した改善をNLPおよびビジョンベンチマークで観察する。
58Bトークンの大規模事前トレーニングでは、Hi-MoE-7Bは5.6%のパープレキシティ低減と、OLMoE-7Bよりも40%のエキスパートバランスの改善を実現している。
論文 参考訳(メタデータ) (2026-05-08T09:21:46Z) - UniPool: A Globally Shared Expert Pool for Mixture-of-Experts [25.706769452657458]
専門家の能力をグローバルな建築予算として扱うMOEアーキテクチャであるUniPoolを提案する。
一致したバニラMOEベースラインに対して,UniPoolは検証損失とパープレキシティを継続的に改善することを示す。
さらなる分析により、UniPoolの利点はよりきめ細かい専門家分解によって構成されることが示された。
論文 参考訳(メタデータ) (2026-05-07T17:59:44Z) - Token-Level LLM Collaboration via FusionRoute [60.72307345997823]
FusionRouteはトークンレベルのマルチLLMコラボレーションフレームワークである。
各デコーディングステップで最も適した専門家を選択し、選択した専門家の次のTokenディストリビューションを洗練または修正する補完ロジットをコントリビュートする。
シーケンスレベルのコラボレーションとトークンレベルのコラボレーション、モデルマージ、ダイレクト微調整の両方に優れています。
論文 参考訳(メタデータ) (2026-01-08T16:53:16Z) - Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts [75.20929587906228]
LLM(Large Language Model)を利用したマルチエージェントシステム(MAS)は、複雑なタスクにおける協調推論、ツールの使用、役割特化調整を急速に進めている。
しかし、信頼性クリティカルなデプロイメントは、体系的な障害モード、すなわち命令の競合による階層的コンプライアンスによって妨げられている。
論文 参考訳(メタデータ) (2025-09-27T08:43:34Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Why Do Multi-Agent LLM Systems Fail? [87.90075668488434]
MAST-Dataは7つの人気のあるMASフレームワークで収集された1600以上の注釈付きトレースの包括的なデータセットである。
我々はMAST(Multi-Agent System Failure Taxonomy)を初めて構築する。
MASTとMAST-Dataを利用して、モデル(GPT4、Claude 3、Qwen2.5、CodeLlama)とタスク(コーディング、数学、汎用エージェント)の障害パターンを分析します。
論文 参考訳(メタデータ) (2025-03-17T19:04:38Z) - Localized Adversarial Domain Generalization [83.4195658745378]
対数領域の一般化は、領域の一般化に対する一般的なアプローチである。
空間コンパクト性維持(LADG)を用いた局所対向領域の一般化を提案する。
我々はWilds DGベンチマークで包括的な実験を行い、我々のアプローチを検証する。
論文 参考訳(メタデータ) (2022-05-09T08:30:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。