論文の概要: The Orthogonalized Read Is a Removable Training Scaffold for Recurrent Memory
- arxiv url: http://arxiv.org/abs/2607.19390v2
- Date: Thu, 23 Jul 2026 12:47:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.149891
- Title: The Orthogonalized Read Is a Removable Training Scaffold for Recurrent Memory
- Title(参考訳): オルソグナライズされたリードは、リカレントメモリのためのトレーニング用マスク
- Authors: Keston Aquino-Michaels,
- Abstract要約: 効果は再現されるが、メモリ改善ではない。
この任務の訓練は、急激な脱出に続き、長い確率の台地である。
公開された利益の多くは、アーキテクチャをまったく必要としない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A recent report finds that orthogonalizing the mLSTM memory matrix at read time (five Newton-Schulz iterations, trained through) substantially improves noisy associative recall. The effect replicates, but it is not a memory improvement. Training on this task is a long chance plateau followed by a sharp escape, and the orthogonalized read acts by re-conditioning the learning problem during the plateau. Three properties establish this. It must be self-consistent: an exact recursive least-squares read (the Mesa layer) reproduces it, while straight-through halves, delta-rule writes, frozen random keys, and plain normalization all fail. It is uniform: across a learning-rate x hardness grid it multiplies the escape hazard roughly six-fold with no detectable hardness dependence, widening the workable learning-rate corridor that narrows for the baseline. And it is removable: applied to failed models at inference it rescues none, and annealed away on an escape-triggered schedule it leaves numerically stock mLSTMs at full accuracy. Much of the published gain needs no architecture at all: solved-rate at a fixed budget measures escape hazard, which follows a heat/noise law (learning-rate elasticity +3.0, gradient-noise elasticity -1.65) under which the original vocab-96 result is a large-batch noise condition rather than a capacity one. Decoding the memory state directly shows failed models carry roughly half their associations in linearly recoverable form: the plateau is a readout failure over half-written storage. Two conclusions travel beyond the intervention: recall benchmarks used for architecture selection partly measure trainability, and the system is a fully instrumented model organism of "emergence," in which a sharp behavioral threshold demonstrably arises from a censored metric over gradually accumulating structure.
- Abstract(参考訳): 最近の報告では、mLSTMメモリマトリックスの読み出し時の直交化(ニュートン・シュルツの5つのイテレーション、トレーニング)により、ノイズの連想的リコールが大幅に改善されている。
効果は再現されるが、メモリ改善ではない。
このタスクのトレーニングは、長い確率で高原に続き、急激な脱出、そして直交した読み出しは、高原で学習問題をリコンディションすることで行動する。
3つの性質が成立する。
完全に再帰的な最小二乗の読み出し(Mesa層)はそれを再生するが、ストレートスルー・ハーフ、デルタルール書き込み、凍結ランダムキー、平常化は全て失敗する。
学習速度xの硬度グリッドを横切ると、検出可能な硬度依存を伴わずに、約6倍のハザードを掛け、ベースラインを狭める実行可能な学習速度回廊を広げる。
そして、それは取り外し可能で、推測されたモデルに当てはめられず、エスケープトリガーされたスケジュールでアニールされ、数値的にストックされたmLSTMを完全な精度で残します。
固定予算での解決レートは、熱/雑音法(学習速度弾力性 +3.0、勾配ノイズ弾力性 -1.65)に従って、キャパシティよりも大きなバッチノイズ条件となる。
メモリ状態の復号化は、故障したモデルが約半数の関連を線形に復元可能な形で保持することを示している。
アーキテクチャ選択に使用されるリコールベンチマークは、部分的にトレーニング可能性を測定し、システムは、徐々に蓄積される構造上の検閲されたメートル法から、シャープな行動しきい値が明らかに生じる「創発」の完全な計測モデル生物である。
関連論文リスト
- Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps [4.422349568747053]
本稿では,大規模モデル事前学習の既定であるウォームアップ安定度学習スケジュール(WSD)の段階について検討する。
提案手法は, 勾配雑音の構造と勾配雑音の構造が正規化するか否かという2つの特性を同時に有する。
論文 参考訳(メタデータ) (2026-07-14T05:21:38Z) - Learning to Solve Generative ODEs Beyond the Linear Span [50.13853710831612]
空間残留演算子を用いてスカラー係数更新を増強する軽量ニューラルソルバであるSpanLiftを提案する。
SpanLiftは、ピクセル空間の拡散、潜水流のマッチング、降水は今、最先端の数ステップのサンプリングを実現している。
論文 参考訳(メタデータ) (2026-06-07T15:22:13Z) - PURGE: Projected Unlearning via Retain-Guided Erasure [5.069332646113575]
PURGEは、単純だが未発見の観測(継続学習(CL)と機械未学習(MU))に基づいて構築された機械学習アルゴリズムである。
CLは古いタスクを忘れずに新しいタスクを学習しようとします。MUは、反対方向に同じ根底にある緊張力を表す保持パフォーマンスを損なうことなく、特定のデータを消去しようとします。
PURGEは、MIA AUROCを0.5(理想)に近い精度で達成し、勾配上昇、KLユニフォーム、プライバシーユーティリティフロンティアのいくつかのベースラインを達成しながら、常に96%以上の精度を維持している。
論文 参考訳(メタデータ) (2026-06-02T15:53:01Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation [89.70897512515477]
アクション制御された画像対ビデオ生成は、インタラクティブな世界シミュレーションにおいて有望なパラダイムであり、各制御信号が即時視覚応答を誘発する。
長時間の自己回帰的なロールアウトに対する視覚的忠実さと3D一貫性を維持することは依然として難しい。
既存の3D認識手法は、textitLatent--RGB Cyclingからの情報損失と、textiterror-free仮説によって引き起こされるトレーニング-推論ギャップという2つの障害により、破滅的なドリフトに悩まされることが多い。
textbfRobust Dreamerという,メモリ拡張フレームワークについて紹介する。
論文 参考訳(メタデータ) (2026-05-29T05:21:33Z) - AEL: Agent Evolving Learning for Open-Ended Environments [43.56685432981852]
本稿では,この障害に対処する2段階のフレームワークであるemphAgent Evolving Learning (ael)を紹介する。
ael はシャープ比 2.13$pm$0.47 を達成し、5つの自己改善法を上回ります。
これは、エージェントの自己改善におけるボトルネックが、アーキテクチャの複雑さを追加するのではなく、経験の使い方を自覚していることを示している。
論文 参考訳(メタデータ) (2026-04-23T14:29:25Z) - Endogenous Information in Routing Games: Memory-Constrained Equilibria, Recall Braess Paradoxes, and Memory Design [2.28438857884398]
本研究では,旅行者が特定の行動セットではなく,記憶されたルートや表面化されたルートを最適化するルーティングゲームについて検討する。
本稿では、内因性リコールのためのトラクタブル設計理論を開発し、それを明示的な有限メモリマイクロモデルに接続する。
より大規模な記憶のために、明示的なLRU-to-TTL-to-salience近似パイプラインを開発し、サロゲートマップの誤差を固定点と福祉点の誤差に変換する収縮に基づく境界を追加する。
論文 参考訳(メタデータ) (2026-04-13T17:08:47Z) - Is Gradient Ascent Really Necessary? Memorize to Forget for Machine Unlearning [71.96329385684395]
勾配上昇(GA)に代わるモデル外挿法を提案する。
言い換えると、記憶モデルから参照モデルへの外挿によって、忘れモデルが得られる。
モデル外挿法の実装はシンプルで効率的であり、トレーニング全体を通して効果的に収束し、未学習のパフォーマンスを向上させることができる。
論文 参考訳(メタデータ) (2026-02-06T07:11:27Z) - Process-Tensor Tomography of SGD: Measuring Non-Markovian Memory via Back-Flow of Distinguishability [1.078600700827543]
我々は,識別可能性のオンフバックフローに基づく学習記憶のモデルに依存しない簡易な目撃者を構築した。
高い運動量下での増幅, よりマイクロステップで, 厳密なブートストラップ信頼区間による一貫した正の逆流を観察した。
我々はこれを、実用的なSGDがマルコフの理想化から逸脱する、原則化された診断および実証的な証拠として位置付ける。
論文 参考訳(メタデータ) (2026-01-23T09:03:25Z) - Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression [53.48692193399171]
Gated KalmaNet(GKA)は、次のトークンを予測する際に、すべての過去を説明することによってギャップを低減するレイヤである。
テスト時間におけるオンラインリッジ回帰問題を一定メモリと線形計算コストで解決する。
ロングコンテキストでは、GKAは現実世界のRAGタスクとLongQAタスクを最大128kトークンまで拡張し、他の薄型メモリベースラインよりも10ドル%以上の相対的な改善を実現している。
論文 参考訳(メタデータ) (2025-11-26T03:26:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。