論文の概要: Why SWAVE May Not Be All You Need:A Concept-Evolution Retrospective on Complex-Valued Recurrent Language Models
- arxiv url: http://arxiv.org/abs/2606.18324v1
- Date: Tue, 16 Jun 2026 16:05:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:50.826564
- Title: Why SWAVE May Not Be All You Need:A Concept-Evolution Retrospective on Complex-Valued Recurrent Language Models
- Title(参考訳): なぜSWAVEがすべてではないのか:複雑な値の反復言語モデルに関する概念進化のふりかえり
- Authors: Ramprasath Ganesaraja, Swathika N, Sahil Dilip Panse,
- Abstract要約: SWaveは2xH100 NVLを用いてFineWeb-Eduで訓練された複雑な値のリカレント言語モデル(169.26Mパラメータ、D=384、L=16、T48)である。
言語を実数値ではなく複雑な波として表現することで、よりリッチな情報符号化が可能になる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: SWave is a complex-valued recurrent language model (169.26M parameters, D=384, L=16, T=2048) trained on FineWeb-Edu using 2xH100 NVL. It was designed around three founding premises: that representing language as complex waves rather than real-valued numbers enables richer information encoding; that a Cayley-parameterised unitary transition provides a mathematical guarantee against state decay or explosion; and that a hidden state which rotates rather than shrinks preserves signal integrity over arbitrarily long contexts. The core of SWave evolved substantially across three development phases. The Resonance Head was found to structurally admit imaginary-channel collapse as a global loss minimum (a failure mode we term cos-domination collapse) and was superseded by an untied head with independent real and imaginary embedding tables from the Phase-Associative Memory (PAM) architecture. This resolved the degenerate minimum and enabled stable 200,000-step training (best-step PPL 22.0 at step 89,861). ComplexNorm and the Wave Propagation Scan proved load-bearing throughout all three phases and were retained to the final architecture. ProtectGatedScan was reframed as a structural prior rather than a learned behaviour. The four multi-scale retention concepts showed no measurable improvement under controlled evaluation and were found non-load-bearing. The ComplexGatedUnit was superseded by a real-valued squared-ReLU channel mixer with fewer parameters. The auxiliary training objectives showed no benefit once structural constraints were resolved. The investigation yields a formal characterisation of cos-domination collapse, a parallel scan with a log-space backward pass for numerical stability, six transferable engineering principles for complex-valued recurrent training, and a plan-to-code traceability methodology for catching structural divergences that conventional test suites miss.
- Abstract(参考訳): SWaveは2xH100 NVLを用いてFineWeb-Eduで訓練された複素数値反復言語モデル(169.26Mパラメータ、D=384、L=16、T=2048)である。
実数値ではなく複素波として言語を表現することは、よりリッチな情報符号化を可能にすること、ケイリーパラメータ化されたユニタリ遷移は状態崩壊や爆発に対する数学的保証を提供すること、縮小ではなく回転する隠れ状態は、任意に長い文脈で信号の整合性を保っていること、である。
SWaveのコアは3つの開発フェーズで大きく進化した。
共振ヘッド(Resonance Head)は、仮想チャネルの崩壊を世界的損失最小限(cos-domination collapse)として構造的に認め、相連想メモリ(PAM)アーキテクチャから独立した実数および虚数埋め込みテーブルを持つ未使用のヘッドに取って代わられた。
これにより、縮退した最小限を解決し、安定な20,000ステップのトレーニングを可能にした(ステップ89,861のベストステップ PPL 22.0)。
ComplexNorm と Wave Propagation Scan は3つのフェーズすべてにわたってロードバランシングを証明し、最終的なアーキテクチャに留まった。
ProtectGatedScanは、学習された振る舞いではなく、構造的なプリミティブとして再編成された。
4つのマルチスケール保持概念は、制御された評価下において測定可能な改善を示さず、非負荷保持が認められた。
ComplexGatedUnitは、パラメータが少ない実数値の2乗ReLUチャネルミキサーに取って代わられた。
補助訓練の目的は、構造的制約が解決されると利益が得られなかった。
この調査は、cos-dominationの崩壊の形式的特徴付け、数値安定性のための対数空間後方通過による並列スキャン、複素数値反復訓練のための6つの転移可能なエンジニアリング原則、および従来のテストスイートが見逃す構造的相違を捉えるためのプラン・ツー・コードトレーサビリティ・方法論を導出する。
関連論文リスト
- When Do Autoregressive Sequence Models Forecast Physical Wavefields? A Controlled Study on Synthetic Seismograms [43.8784307709823]
物理信号の長距離自己回帰予測は誤差蓄積によって制限される。
物理的に構造化されたテストベッドとして,合成3成分地震計を用いて,このようなロールアウトが安定であるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-09T13:46:14Z) - Convergence Theory for Iterative LLM-Based Neural Architecture Search: A Parametric Cross-Entropy Framework with Closed-Form Proxy Reliability [48.83701310501069]
大規模言語モデル(LLM)は、反復型ニューラルアーキテクチャサーチ(NAS)におけるジェネレータとしてますます使われている。
我々は,LCM-NASを,実行可能プログラム上でのパラメトリッククロスエントロピー(CE)法としてモデル化する。
我々は,(1)エリートアーキテクチャの反復LEM微調整は,LLMファミリーに制限されたCE更新と同等であり,(2)期待されるアーキテクチャ品質はサイクル毎に単調に低下せず,(3)エリートセットの確率は幾何率で一定点に収束する,という6つの結果を示した。
論文 参考訳(メタデータ) (2026-05-28T15:45:19Z) - When do complex-valued neural networks help? A study of representation, geometry, and optimization [1.4935265696074094]
複雑な数値入力だけでは、複雑な算術が学習を改善するかどうかを判断できないことを示す。
合成RFタスク全体において、複素表現は有用であるが、普遍的に優れているものではない。
CVNNは、表現、対称性、最適化に依存している構造的帰納バイアスと見なされる。
論文 参考訳(メタデータ) (2026-05-26T20:49:23Z) - The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems [0.0]
この論文は、好奇心から不合理性の結果を設計規則に変える。
そのフラッグシップとなる結果は、アーキテクチャだけで設定された精度の高い天井を証明している。
同じ引数がサブフィールドにまたがって再キャストされる。
論文 参考訳(メタデータ) (2026-05-21T20:48:35Z) - Beyond LLMs, Sparse Distributed Memory, and Neuromorphics <A Hyper-Dimensional SRAM-CAM "VaCoAl" for Ultra-High Speed, Ultra-Low Power, and Low Cost> [18.56157183294801]
超高次元RAM/DRAM-CAM上の超高次元二元空間上でのVaCoAlを提案する。
認知的境界 -- フロンティアサイズ -- をアーキテクチャに組み込み、パス積分的信頼度で候補をランク付けする。
ウィキデータから約470万のメンター-学生関係についてマルチホップ推論を評価し,57世代まで追跡した。
論文 参考訳(メタデータ) (2026-04-13T16:13:17Z) - CircuitSynth: Reliable Synthetic Data Generation [44.80087038178069]
大規模言語モデル(LLM)は、しばしば幻覚、論理的不整合、構造化された生成をタスクする場合のモード崩壊に悩まされる。
既存のアプローチ、例えば、プロンプトや検索強化ジェネレーションは、言語表現性と、妥当性とカバレッジに関する正式な保証のバランスをとるメカニズムを欠いている。
サーキットシンス(Circuit Synth)は,表面実現から意味論的推論を分離する新しいニューロシンボリックフレームワークである。
論文 参考訳(メタデータ) (2026-04-11T09:18:52Z) - CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling [46.16066322190728]
完全連続配列混合アーキテクチャであるCAWN(Continuous Acoustic Wave Network)を導入する。
CAWNは離散行列ベースの注意を代わりに、多面体複素ドメインファサーに隠された状態を計画している。
超長コンテキスト上での信号劣化を防止するため,デュアルゲート選択位相共振機構を導入する。
論文 参考訳(メタデータ) (2026-04-05T20:13:22Z) - Toward Complex-Valued Neural Networks for Waveform Generation [49.128847336227636]
我々は、生成器と識別器がネイティブな複素算術を使用する複素数値ニューラルボコーダであるComVoを提案する。
実験により,ComVoは実数値ベースラインよりも高い品質を実現し,ブロック行列方式によりトレーニング時間を25%短縮した。
論文 参考訳(メタデータ) (2026-03-12T06:24:11Z) - Evolving, Not Training: Zero-Shot Reasoning Segmentation via Evolutionary Prompting [44.347846669388446]
推論時間進化探索プロセスとして推論セグメントを再構成するゼロショットフレームワークEVOL-SAM3を提案する。
EVOL-SAM3は静的ベースラインを大幅に上回るだけでなく、ゼロショット設定で挑戦するReasonSegベンチマークにおいて、完全に教師された最先端メソッドをはるかに上回る。
論文 参考訳(メタデータ) (2025-12-31T08:10:03Z) - The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems [0.0]
外部からのフィードバックのない再帰的な自己評価は、進歩よりもむしろ改革をもたらすことが多い。
3つのモデル(OpenAI GPT-4o-mini, Anthropic Claude 3 Haiku, Google Gemini 2.0 Flash)と4つのタスクファミリー(パラメータ、コード、説明、リフレクション)にまたがる144の推論シーケンスについて検討する。
我々はこれを、生成的推論における自己補正の構造的限界の証拠として解釈する。
論文 参考訳(メタデータ) (2025-10-23T07:53:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。