論文の概要: From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts
- arxiv url: http://arxiv.org/abs/2609.06403v1
- Date: Sun, 06 Sep 2026 05:43:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.24738
- Title: From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts
- Title(参考訳): 濃度から分化・バックへ:MoE推論コホートにおける有効ランクのルーティング
- Abstract要約: テストタイムスケーリングは、推論ロールアウトのコホートを生成するが、推論が展開するにつれて内部計算がどのように再編成されるかについて、標準的なラベルのない説明はない。
本稿では,MoEの専門家による類似性から構築したクロスロールアウトグラフのエントロピー有効次元性であるルーティング有効ランクデフを導入する。
- 参考スコア(独自算出の注目度): 61.695980784491475
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time scaling produces cohorts of reasoning rollouts, yet there is no standard label-free account of how their internal computation reorganizes as inference unfolds. We introduce routing effective rank deff, the entropy-effective dimensionality of a cross-rollout graph built from MoE expert-routing similarity. Across ten MoE configurations and five math/science benchmarks, deff exhibits a reproducible low-high-low trajectory, with a prominent interior maximum in 98.5% of 3,105 model-question cohorts: routing similarity is concentrated early, maximally differentiated at intermediate budgets, and reconcentrated later, and the timing of this maximum varies systematically with architecture and reasoning effort. An exact decomposition separates cohort-wide common-mode mass from residual spectral dimensionality: common-mode reallocation accounts for about two thirds of the trajectory, while the residual spectrum contributes about one quarter and retains substantial variation beyond the common mode. The decomposition further localizes behavior: among non-unanimous cohorts, increases in common-mode concentration strongly predict same-answer recoverability, and higher reasoning effort delays the maximum by 2.59 octaves (doublings of the token budget) and consistently expands the high-rank period across all four tested architectures, locating the effort effect in timing and duration rather than peak amplitude. Correctness comparisons separate structural monitoring from answer selection, positioning routing effective rank as a decomposable, label-free diagnostic of cohort organization - a principled spectral lens on how MoE reasoning cohorts differentiate and reconcentrate over inference time.
- Abstract(参考訳): テストタイムスケーリングは、推論ロールアウトのコホートを生成するが、推論が展開するにつれて内部計算がどのように再編成されるかについて、標準的なラベルのない説明はない。
本稿では,MoEの専門家による類似性から構築したクロスロールアウトグラフのエントロピー有効次元性であるルーティング有効ランクデフを導入する。
10のMoE構成と5つの数学/科学ベンチマークで、デフは再現可能な低低軌道を示し、3,105のモデル探索コホートのうち98.5%の顕著な内部最大値を示す: ルーティングの類似性は早期に集中し、中間予算で最大化され、後で再集中され、この最大値のタイミングはアーキテクチャや推論の努力と体系的に異なる。
コホート・ワイド・コモンモード質量と残留スペクトル次元を正確に分解すると、コホート・ワイド・コモンモード質量は軌道の約3分の2を占めるが、残留スペクトルは約4分の1を占め、コモンモードを超えてかなりの変動を保っている。
この分解により、非一様コホートの間では、共通モード濃度の増加は、同じ解答確率を強く予測し、より高い推理努力は最大2.59オクターブ(トークン予算の倍)を遅延させ、試験された4つのアーキテクチャすべてにわたって常にハイランク期間を拡大し、ピークピークではなくタイミングと時間における労力効果を定めている。
正当性比較は、解答選択から分離した構造的モニタリング、解答ルーティング有効ランクを、コホート組織を分解可能なラベルなし診断として位置付ける - MoE推論コホートが推論時間とともにどのように差別化し、再集中するかに関する、原則化されたスペクトルレンズである。
関連論文リスト
- DiffIE: Diffusion-based Open Information Extraction [4.37919186746582]
本稿では,条件付き離散拡散を抽出機構として扱うDIFFIEを紹介する。
DIFFIEはCARBにおける新しい最先端技術を実現し、ベンチエにおける最強のルールベースシステム(ClausIE)を上回っている。
論文 参考訳(メタデータ) (2026-09-02T09:01:42Z) - Beyond Random Partitioning: Unsupervised Spatio-Temporal Stratification for Cohort Balancing in Longitudinal Medical Imaging [0.9530026127073782]
標準化された6次元関節強度時間的特徴空間上での肘群K平均クラスタリングを組み合わせた非教師付き時間的コホートバランス標準動作手順(SOP)を定式化する。
コントラストが強化された$T1$-izable 脳MRIコホートでは、従来のランダムシャッフルでは最大サブセット強度バイアスが34.1%から2.1%以下に減少する。
論文 参考訳(メタデータ) (2026-07-29T09:33:19Z) - Invariant Gradient Alignment for Robust Reasoning Distillation [9.39195684989942]
大規模言語モデル(LLM)は、論理構造が同一であっても、意味的表面がトレーニングデータと異なるOOD入力で失敗する。
このことは知識蒸留パイプラインを弱め、より小規模の学生にチェーン・オブ・ソート・推論を伝達する。
Invariant Gradient Alignment (IGA)は、意味的に多様だが論理的に同型な例にまたがって勾配更新を調整するトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-06-03T15:48:52Z) - AnchorMoE: Interpretable Time Series Classification via Anchor-Routed MoE [51.994752158953084]
AnchorMoEは、解釈可能な構成別分類フレームワークである。
ローカルパッチのマルチビュー表現をエンコードし、専門の専門家にルーティングする。
実世界のベンチマークと合成ベンチマークの実験は、AnchorMoEが非常に競争力のある分類性能を達成することを示した。
論文 参考訳(メタデータ) (2026-06-02T13:30:54Z) - Contrast to Detect: Dynamic Graph Contrastive Regularization for Unsupervised Anomaly Detection in Multivariate Time Series [24.192601578775186]
構造進化を抑圧するのではなく,学習信号に変換する,教師なしのフレームワークであるContrastADを提案する。
5つの実世界のベンチマークで、ContrastADは3つのデータセットでF1の平均値とAUCの最高値に達した。
論文 参考訳(メタデータ) (2026-05-22T15:18:53Z) - CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating [49.94171749437024]
本稿では,ビジョンランゲージモデルに基づく粗大な異常報酬モデルである集中と集中(CaC)を提案する。
フレーム単位のバウンディングボックスアノテーション,時間的異常ウィンドウ,微粒な属性ラベルを備えた,最初の大規模ビデオ異常データセットを構築した。
実験では、CaCは微妙な異常に安定して集中することができ、微細な異常ベンチマークの精度が25.7%向上した。
論文 参考訳(メタデータ) (2026-05-12T08:08:33Z) - Continuous-Time Distribution Matching for Few-Step Diffusion Distillation [57.28746398500951]
本稿では,CDM(Continuous-Time Distribution Matching)を導入し,DMDフレームワークを個別アンカーから連続最適化へ移行する。
まず、固定離散スケジュールをランダム長の動的連続スケジュールに置き換える。
第二に、学生の速度場を介して外挿された潜伏者に対してアクティブな軌道外マッチングを行う連続時間アライメント目的を提案する。
論文 参考訳(メタデータ) (2026-05-07T14:56:39Z) - Loop-Extrusion Linkage: Spectral Ordering and Interval-Based Structure Discovery for Continuous Optimization [0.0]
本稿では,適応変数インター推定,ファイドラーベクトルによるスペクトルセレーション,適応間隔に基づく部分空間探索を組み合わせた構造学習ラッパーであるLoop-Extrusion(LEL)演算子を紹介する。
特定の構造仮説を変調したd=96の6つの診断関数についてLELを評価した。
結果は、ホルム=ボンフェロニ補正とヴァルガ=デレーニーA12効果の大きさでウィルコクソンのサインランク試験によって評価される。
論文 参考訳(メタデータ) (2026-04-05T21:26:21Z) - On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning [63.41902113656453]
長いチェーン・オブ・ソート(CoT)軌道上でのSFT(Supervised Fine-Tuning)は、大きな推論モデルを構築する上で重要なフェーズとなっている。
2つの競合モデルによって生成された2つの検証されたCoT軌道源を用いて比較研究を行う。
textttDeepSeek-R1-0528データ上のSFTは、トレーニング損失を著しく低減するが、一般化性能は著しく低下する。
論文 参考訳(メタデータ) (2026-04-02T07:00:54Z) - A Systematic Empirical Study of Grokking: Depth, Architecture, Activation, and Regularization [0.0]
暗記からニューラルネットワークの一般化への遅れた遷移をグロッキングすることは、まだ理解されていない。
モジュラー加算に関する因子を系統的に分散させる制御された研究(mod 97)を提案する。
我々の中心的な発見は、グラッキングダイナミクスはアーキテクチャーによって決定されるのではなく、安定性と正規化の間の相互作用によって決定されることである。
論文 参考訳(メタデータ) (2026-03-26T04:16:01Z) - WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training [64.0932926819307]
本稿では,学習速度減衰とモデルマージの正式な関係を確立するフレームワークであるWarmup-Stable and Merge(WSM)を紹介する。
WSMは様々な崩壊戦略をエミュレートするための統一された理論基盤を提供する。
私たちのフレームワークは、複数のベンチマークで広く採用されているWarmup-Stable-Decay(WSD)アプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-07-23T16:02:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。