論文の概要: Systematic Exploration of 4-Expert Heterogeneous Mixture-of-Experts via Automated Pipeline Search
- arxiv url: http://arxiv.org/abs/2606.23739v1
- Date: Sun, 21 Jun 2026 13:43:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.592734
- Title: Systematic Exploration of 4-Expert Heterogeneous Mixture-of-Experts via Automated Pipeline Search
- Title(参考訳): 自動パイプライン探索による4次元不均一混合実験の系統的探索
- Authors: Yashkumar R Lukhi, Harsh Rameshbhai Moradiya, Radu Timofte, Dmitry Ignatov,
- Abstract要約: 不均一な4-Expert Mixture-of-Experts (MoE4) のための自動探索パイプラインを提案する。
パイプラインは197バッチで4,463の候補モデルを生成し、1,021が成功した。
キャンペーンから重要な発見が現れた:イタトールによるアルファベット順列挙による。
- 参考スコア(独自算出の注目度): 44.70501115891534
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present an automated large-scale search pipeline for heterogeneous 4-Expert Mixture-of-Experts (MoE4) architectures within the LEMUR neural network dataset ecosystem. Building on a hand-crafted heterogeneous MoE reference model, we replace manual design with a deterministic code-assembly generator that systematically combines base architecture families drawn from the LEMUR database into MoE4 ensembles, each governed by a convolutional gating network with temperature scaling, mixup augmentation, and cosine-annealed learning rate scheduling. Over a 28-day campaign on an NVIDIA RTX 4090, the pipeline generated 4,463 candidate models across 197 batches, of which 1,021 were evaluated successfully. A critical finding emerged from the campaign: due to alphabetical enumeration via itertools.combinations, the entire explored search space (4.8% of the theoretical 23,751 possible 4-family combinations) is anchored to a single family, AirNet. We characterise this coverage bias precisely, identify the root cause in the generator, and propose a stratified random sampling fix. Within the AirNet anchored scope, ShuffleNet and MobileNetV3 consistently co-produce the highest-accuracy ensembles (mean accuracy up to 0.632), while FractalNet and MNASNet are identified as low-yield families warranting exclusion in future campaigns. The pipeline, analysis artefacts, and corrected generator are released as part of the open-source NNGPT project at https://github.com/ABrain-One/nn-gpt
- Abstract(参考訳): LEMURニューラルネットワークデータセットエコシステム内の不均一な4-Expert Mixture-of-Experts (MoE4) アーキテクチャを対象とした大規模探索パイプラインを提案する。
手作りヘテロジニアスMOE参照モデルに基づいて手動設計を決定論的コードアセンブリジェネレータに置き換え、LEMURデータベースから引き出されたベースアーキテクチャファミリをMoE4アンサンブルに体系的に結合し、それぞれ温度スケーリング、ミックスアップ拡張、コサインアニール学習率スケジューリングを備えた畳み込みゲーティングネットワークによって制御する。
NVIDIA RTX 4090の28日間のキャンペーンで、パイプラインは197バッチで4,463の候補モデルを生成し、1,021が成功した。
Itertools.combinationsによるアルファベット順列挙により、探索された検索空間全体の4.8%(理論上の23,751の4つの組み合わせの4.8%)が1つのファミリーであるAirNetに固定されている。
我々は、このカバレッジバイアスを正確に評価し、ジェネレータの根本原因を特定し、階層化されたランダムサンプリング修正を提案する。
AirNetのアンカー範囲内では、ShuffleNetとMobileNetV3が一貫して最高精度のアンサンブル(平均精度0.632)を生産し、FractalNetとMNASNetは将来のキャンペーンで除外を保証している低利回りのファミリーとして特定されている。
パイプライン、分析成果物、修正されたジェネレータは、https://github.com/ABrain-One/nn-gptでオープンソースNNGPTプロジェクトの一部としてリリースされた。
関連論文リスト
- Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study [48.83701310501069]
本稿では, 一つのレシピがヘテロジニアスなアーキテクチャプールに十分であるか, 最適ペアリングが構造的に多様なモデルによって異なるかを検討する。
我々は,CEL(Cross-Entropy),NLL(Negative Log-Likelihood),および最近導入された遺伝学的に進化したNGL損失を,LEMURヘテロジニアス・アーキテクチャー・プールの6つの画像分類データセット上に提示したベースモデル間で比較検討した。
我々の結果は、単一のペアリングが普遍的に最適でないことを確認した。AdamやAdamWとのクロスエントロピーは、最も堅牢な選択である。
論文 参考訳(メタデータ) (2026-06-18T20:51:42Z) - StereoFactory: A Unified Merging Framework for Robust Stereo Matching [61.973843344605655]
ステレオマッチングは、大規模なデータセットでトレーニングされた基礎モデルを通じて進歩しているが、このパラダイムはスケーラビリティのボトルネックに悩まされている。
モデルマージは、ソースチェックポイントが利用可能になった後、特別なモデルからの知識を統合することで、スケーラブルなポストホックな代替手段を提供する。
本稿では,適応モデルマージのための粗大な進化的フレームワークであるStereoFactoryを提案する。
論文 参考訳(メタデータ) (2026-06-16T03:36:59Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - DEI: Diversity in Evolutionary Inference for Quality-Diversity Search [0.14323566945483496]
本稿では,分散品質多様性(QD)検索フレームワークである進化推論における多様性について述べる。
均質な並列探索とは異なり、DEI はそれぞれの LLM の独特な創造性を、行動の新規性の相補的な源として扱う。
ノードは各ラウンドの最後に 最適な解決策を共有します 次のラウンドの人口を シードするために
論文 参考訳(メタデータ) (2026-05-26T15:00:57Z) - A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection [0.42970700836450487]
本稿では,風力タービン羽根試験用分離・エッジ展開可能なパイプラインについて述べる。
The EyesはY26-x-obb指向のバウンディングボックスで、データセットネイティブの解像度で欠陥をローカライズする。
ブリッジは決定論的でパラメータフリーな符号化モジュールであり、検出された各バウンディングボックスをグリッド参照トークンにマップする。
論文 参考訳(メタデータ) (2026-05-26T04:27:38Z) - Global and Local Topology-Aware Attention with Persistent Homology and Euler Biases for Time-Series Forecasting [0.0]
時系列はしばしば、接続性、サイクル、シェルのような幾何学、方向変化、非線形近傍を含む予測幾何学構造を符号化する。
永続的ホモロジー(H0-H2)を用いた注意ログにそのような構造を加えるトポロジ対応アテンションフレームワークを提案する。
我々は,軽量アテンション/ライダー,PatchTSTForRegression,TimeSeriesTransformerForPredictionという3つのアーキテクチャファミリの保護されたトポロジ対応のバリエーションを評価した。
論文 参考訳(メタデータ) (2026-05-04T21:19:12Z) - ARCS: Autoregressive Circuit Synthesis with Topology-Aware Graph Attention and Spec Conditioning [0.0]
ARCSは、検索ベースの手法で必要とされる分ではなく、完全なSPICEシミュラブルな設計をミリ秒で生成する。
単モデル推論では、ベストオブ3候補選択を備えたトポロジ対応グラフ変換器が97msで85%のシミュレーション精度に達し、ランダム検索より600倍以上高速である。
論文 参考訳(メタデータ) (2026-03-30T23:14:08Z) - Evaluating Embedding Models and Pipeline Optimization for AI Search Quality [0.0]
我々は,AI駆動検索システムにおける各種テキスト埋め込みモデルとパイプライン構成の性能を評価する。
11,975対のクエリチャンクペアのカスタム評価データセットを,米国市議会の会議記録から合成した。
論文 参考訳(メタデータ) (2025-11-27T09:09:39Z) - ANNETTE: Accurate Neural Network Execution Time Estimation with Stacked
Models [56.21470608621633]
本稿では,アーキテクチャ検索を対象ハードウェアから切り離すための時間推定フレームワークを提案する。
提案手法は,マイクロカーネルと多層ベンチマークからモデルの集合を抽出し,マッピングとネットワーク実行時間推定のためのスタックモデルを生成する。
生成した混合モデルの推定精度と忠実度, 統計モデルとルーフラインモデル, 評価のための洗練されたルーフラインモデルを比較した。
論文 参考訳(メタデータ) (2021-05-07T11:39:05Z) - Inception Convolution with Efficient Dilation Search [121.41030859447487]
拡散畳み込みは、効果的な受容場を制御し、オブジェクトの大規模な分散を処理するための標準的な畳み込みニューラルネットワークの重要な変異体である。
そこで我々は,異なる軸,チャネル,層間の独立な拡散を有する拡張畳み込みの新たな変異体,すなわち開始(拡張)畳み込みを提案する。
本稿では,データに複雑なインセプション・コンボリューションを適合させる実用的な手法を探索し,統計的最適化に基づく簡易かつ効果的な拡張探索アルゴリズム(EDO)を開発した。
論文 参考訳(メタデータ) (2020-12-25T14:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。