論文の概要: From Expert Reduction to Behavioral Divergence: Tracing Numerical State through Sparse MoE Inference
- arxiv url: http://arxiv.org/abs/2607.28097v1
- Date: Thu, 30 Jul 2026 12:07:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.548485
- Title: From Expert Reduction to Behavioral Divergence: Tracing Numerical State through Sparse MoE Inference
- Title(参考訳): エキスパートリダクションから行動多様性へ:スパースMoE推論による数値状態の追跡
- Abstract要約: 専門家還元命令は、観測可能な異なるスパース-MoE実行を生成することができる。
ローカルMoE状態の凍結とアグリゲーションのセマンティクスの変化により、ネイティブのDeepSeek-V4-Flashでこの効果を分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mathematically equivalent expert-reduction orders can produce observably different sparse-MoE executions. We isolate this effect in native DeepSeek-V4-Flash by freezing local MoE state and varying only aggregation semantics. Four schemes separate operand representation from accumulator precision. At one layer-5 fork, 720 A-mode orders yield 10 continuation basins; 720 B-mode orders form 360 exact structural classes and 11 basins. Under one Chinese prompt, the B classes split into 202 layoffs, 113 hiring, and 45 other continuations. Maximum-L-infinity B-branch selection separates 12, 24, and 36 of 50 prompts by 8, 16, and 32 tokens. Across 192 persistent trajectories per scheme, P32, A, and B change every native-reference route trajectory, while C preserves routes, token sequences, and texts. A separate 192-trajectory C check matches native MoE, post-mHC, next-router, and LM states bitwise. For one controlled B branch, exact post-mHC endpoint reconstruction reproduces the measured downstream trajectory. At the next decode boundary, exact FP64 reconstruction of the branch's full persistent state yields agreement for 301 downstream post-mHC states, 301 persistent-state checkpoints, 301 routes, predictions, and text over seven steps, given the same naturally generated next input. These controls identify post-mHC as an intra-token boundary and full persistent state as a cross-token continuation boundary. Identical tokens need not imply identical autoregressive state: divergence can survive a token boundary and become visible later. These results make expert operand conversion, accumulator precision, and reduction order part of a numerical compatibility contract for sparse-MoE runtimes and hardware backends. They establish controlled causal possibility, not deployment incidence; C's order invariance is limited to evaluated six-term states and schedules.
- Abstract(参考訳): 数学的に等価な専門家還元命令は、観測可能な異なるスパース-MoE実行を生成することができる。
ローカルMoE状態の凍結とアグリゲーションのセマンティクスの変化により、ネイティブのDeepSeek-V4-Flashでこの効果を分離する。
4つのスキームは、アキュムレータの精度からオペランド表現を分離する。
1層5のフォークでは、720のAモードオーダーが10の連続盆地を形成し、720のBモードオーダーが360の正確な構造クラスと11の盆地を形成している。
1つの中国のプロンプトの下で、Bクラスは202のレイオフ、113の雇用と45の継続に分かれた。
最大L-無限Bブランチ選択は、50のプロンプトのうち12,24,36を8,16,32のトークンで分離する。
P32、A、Bの各スキームあたり192回にわたって、Cはルート、トークンシーケンス、テキストを保存しながら、すべてのネイティブ参照ルートを変更できる。
192行のCチェックは、ネイティブのMoE、ポストmHC、next-router、LMステートとビットワイズにマッチする。
1つの制御されたB分岐に対して、mHC後のエンドポイントの正確な再構成は、測定された下流軌道を再現する。
次のデコード境界では、ブランチの完全な永続状態の正確なFP64再構成は、同じ自然に生成された次の入力に対して、301の下流mHC状態、301の永続状態チェックポイント、301のルート、予測、および7つのステップ上のテキストに対する合意を得る。
これらの制御は、ポストmHCをトーケン内境界と完全持続状態と、クロストーケン連続境界と同定する。
発散はトークン境界を生き残ることができ、後で見えるようになる。
これらの結果から,Sparse-MoEランタイムとハードウェアバックエンドの数値互換性契約に,熟練したオペランド変換,アキュムレータ精度,およびリダクションオーダを組み込むことができた。
それらは、デプロイメントの頻度ではなく、制御された因果可能性を確立し、Cの順序の不変性は評価された6つの期間の状態とスケジュールに限られる。
関連論文リスト
- SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation [51.46828526392219]
推論セグメンテーションは暗黙の言語学的結論を正確なマスクに変換する。
既存のMLLMセグメンタインタフェースでは、特別なトリガーを使用するか、両方の信号を1つのコンテキストに圧縮する。
明示的なWhat-whereインターフェースであるSeGDePを提示する。
論文 参考訳(メタデータ) (2026-09-08T15:11:32Z) - SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models [53.86918766240095]
Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
我々は,チャンク内並列構造を保ちながら,チャンク境界における適応$tanh$圧縮を適用したtextbfState Anomaly Neutralization (SANE)を提案する。
論文 参考訳(メタデータ) (2026-08-23T10:41:07Z) - The Integer Alibi: Localizing Cross-Kernel Divergence in INT8-Quantized LLM Inference [0.10152838128195468]
同じスケールのINT8 GEMMインターフェースを実装した2つのGPUカーネルは通常、交換可能である。
チェックポイント、プロンプト、ハードウェア、推論エンジン、デコード、量子化設定を固定し、vLLM内のINT8リニアカーネルのみを交換する。
1.7B では、各アームはコールドリスタートでビット・フォー・ビットを再生するが、実行したエンドツーエンドの比較(0/8、0/16、0/64)では、腕は一致しない。
論文 参考訳(メタデータ) (2026-08-13T20:34:36Z) - QuoteBench: How Matched Scores Can Hide Command-Path Failures [30.480838412827907]
実行スコアだけでは、ジェネレーションエラーとジェネレーション後に導入された失敗を区別できない。
QuoteBenchはこの境界線を、インシデントから派生した14のファミリーから56のワンショットタスクに対して正確に最終状態の検証を行う。
コマンド発行エージェントの評価は、一致したスコアを本質的なモデル特性として扱うよりも、モデル構成、生成契約、実行経路、操作点、最終状態などを報告すべきである。
論文 参考訳(メタデータ) (2026-08-13T17:57:20Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - PULSE: An Executable Contract Language for Spatiotemporal Knowledge Graph Engineering [2.2262915480980063]
PULSEはObject-Process-Methodologyにインスパイアされた言語で、4つの運用ロールをローカライズし、その書き込み効果を1つの型付きランタイムで表現する。
実装されたコントラクトは、非オーバーライト、ブランチアイソレーション、接地されたマルチオブジェクトタイマー、ガードされた状態変更、時間と空間に関する宣言付きイベント順序のエビデンスを修正する。
Lean 4は、位置、エビデンス、クロック、モニター、アトミック性、ブランチソース保持のカーネルアナログをチェックする。
論文 参考訳(メタデータ) (2026-07-26T17:44:05Z) - Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation [0.0]
フェデレーションクラスをフロンティアの大規模言語モデルで文書化する。
故障は最初の観測で再現されるが、経験的表面は不安定である。
規制されたフロンティアモデルの正確性は、注意を払わずにシフトする移動したコンプライアンス境界である。
論文 参考訳(メタデータ) (2026-07-25T22:40:02Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - Structured-Sparse Attention for Entity Tracking with Subquadratic Sequence Complexity [45.829192030010006]
また, 大部分の質量は, 光遮断残余を有する局所ブロック対角近傍に集中していることが示唆された。
ブロック内相互作用を正確に保ち、還元されたシステムを介してブロック間相互作用を経路するリゾルペント型演算子のブロックワイズ評価を導出する。
本手法は,高密度演算子の精度に一致し,標準化された測定プロトコルの下で壁面時間を12~29%削減する。
論文 参考訳(メタデータ) (2026-05-21T13:35:48Z) - Reading Calibrated Uncertainty from Language Model Trajectories [46.663987199083245]
モデルの内部アクティベーションを調査する手法は、生の隠れた状態を不透明なスナップショットにフィードし、表現が形成される層回りの軌跡を暗黙的に残す。
我々は11のスケール不変な幾何学的特徴を抽出し、層ごとの更新の累積経路をトレースし、それらをスパース線形プローブに供給する。
このプローブは、最大21のAURCポイントでベースラインスケーリングを行い、選択的な棄権下でMPPより優れる。
論文 参考訳(メタデータ) (2026-05-19T19:24:29Z) - Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling [46.16066322190728]
完全連続配列混合アーキテクチャであるCAWN(Continuous Acoustic Wave Network)を導入する。
CAWNは離散行列ベースの注意を代わりに、多面体複素ドメインファサーに隠された状態を計画している。
超長コンテキスト上での信号劣化を防止するため,デュアルゲート選択位相共振機構を導入する。
論文 参考訳(メタデータ) (2026-04-05T20:13:22Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - Arcee: Differentiable Recurrent State Chain for Generative Vision Modeling with Mamba SSMs [3.5590835022089813]
状態空間モデル(SSM)は、長文シーケンスモデリングにますます採用されている。
最近の"Mamba-for-vision"変種は、非順序信号に対する厳密な因果関係を緩和するために、主に複数のスキャン順序を探索している。
Arceeはブロック間のリカレントステートチェーンであり、各ブロックの端末状態空間表現を再利用する。
論文 参考訳(メタデータ) (2025-11-14T12:44:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。