論文の概要: SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models
- arxiv url: http://arxiv.org/abs/2608.22354v2
- Date: Tue, 25 Aug 2026 03:15:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.083614
- Title: SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models
- Title(参考訳): SANE: 安定極環境デルタルールモデルのための状態異常ニュートラル化
- Abstract要約: Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
我々は,チャンク内並列構造を保ちながら,チャンク境界における適応$tanh$圧縮を適用したtextbfState Anomaly Neutralization (SANE)を提案する。
- 参考スコア(独自算出の注目度): 53.86918766240095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Delta-Rule recurrent models maintain a fixed-size state, enabling $O(1)$ inference memory but potentially becoming unstable under extreme-context extrapolation. By tracking RWKV-7 over sequences of up to 100M tokens, we empirically identify a distinct failure pattern: \textbf{localized norm explosion atop a relatively sparse substrate}, rather than global state saturation. Analysis of the recurrent update suggests that persistent decay keeps weakly updated entries small, whereas uneven injections allow a few channels to accumulate extreme values. Motivated by this diagnosis, we propose \textbf{State Anomaly Neutralization (SANE)}, which applies adaptive $\tanh$ compression at chunk boundaries while preserving the intra-chunk parallel structure. Within a safe threshold range ($3 \le α\le 5$), SANE matches the baseline on 11 short-context reasoning benchmarks with no statistically significant degradation. After a 100M-token prefix, which exceeds the training length by over $24{,}000\times$, SANE retains functional reasoning ($33.46$--$35.56$) while the baseline encounters numerical overflow. In contrast, overly permissive thresholds ($α\ge 8$) remain numerically stable but lose reasoning capability entirely, showing that numerical stabilization alone does not guarantee functional reasoning and revealing a capacity--stability trade-off in state compression.
- Abstract(参考訳): Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
最大100万個のトークンのシーケンス上でRWKV-7を追跡することで、異なる障害パターンを実証的に特定する。
繰り返し更新の分析は、持続的な減衰が弱い更新されたエントリを小さく保ち、不均一な注入によっていくつかのチャネルが極端な値の蓄積を可能にしていることを示唆している。
そこで我々は, チャンク内並列構造を保ちながら, チャンク境界における適応$\tanh$圧縮を適用した \textbf{State Anomaly Neutralization (SANE) を提案する。
安全なしきい値範囲 (3 \le α\le 5$) 内では、SANEは統計的に有意な劣化のない11の短コンテキスト推論ベンチマークのベースラインと一致している。
トレーニング長が240{,000\times$を超える100万のプレフィックスの後、SANEは機能的推論(33.46$--35.56$)を維持し、ベースラインは数値的オーバーフローに遭遇する。対照的に、過度に許容されるしきい値(α\ge 8$)は数値的に安定しているが、完全に推論能力を失うため、数値的安定化だけでは機能的推論を保証せず、状態圧縮においてキャパシティ-安定性のトレードオフが明らかになる。
関連論文リスト
- Constrained Online Learning with Noisy Constraint Values [55.29259818039367]
一般的な実現可能性の下では、我々のLEDGERアルゴリズムは、期待される損失$O(sqrt T)と期待される予算違反$O(sqrtTlog(eT))を達成します。
スレーター条件、フィードバックチャネル間の独立性、絶対的制約値境界は不要である。
論文 参考訳(メタデータ) (2026-09-07T01:38:41Z) - Fast Weight Attention for Continual Learning [75.34672054079408]
リカレント高速記憶と選択状態空間モデルは、拡張コンテキストを固定サイズのリカレント状態に圧縮する。
正則化された二乗誤差回帰と負の内積目標の1次更新を導出する。
我々は、数値的に安定な正のデカイ再正規化とともに、繰り返し、マスクパラレル、チャンクパラレル形式を提供する。
論文 参考訳(メタデータ) (2026-08-27T22:55:11Z) - Stateful CARS: Exact Cross-History Reuse for Policy-Constrained LLM Agents [0.9558392439655014]
ハードステートフル検証器に条件付されたモデル分布の正確なサンプリングについて検討する。
ステートフルCARSはサウンドステートのバンクを凍結します。
クロスヒストリー転送は、内部整合キーアブレーションでのみ有効である。
論文 参考訳(メタデータ) (2026-08-08T18:26:25Z) - Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions [51.50375419691955]
分布的に堅牢なマルコフ決定プロセスは、モデルの不確実性の下でのシーケンシャルな意思決定のための原則化されたフレームワークを提供する。
我々は,平均回帰基準の下で,$varepsilon$-Optimal robust policyを学習するのに必要なサンプル数と十分なサンプル数について検討した。
論文 参考訳(メタデータ) (2026-08-06T19:49:48Z) - Naju: A Native Discrete State-Space Model with Independent Retention and Writing for Long-Sequence Memory [7.4750926696730895]
Najuはリカレント更新を、スキーマ的に$x_n = f_nodot x_n-1 + i_nodot(B_n u_n)$に分解する。
ナジュは、強い長距離メモリと競争力や優れたパフォーマンスを一貫して組み合わせている。
論文 参考訳(メタデータ) (2026-07-23T07:34:07Z) - Is Spurious Correlation Removal Always Learnable? [56.28155520961125]
不変学習は、構造が統計的に識別可能であっても失敗することがある。
ブラックボックスサンプリング可能な教師付きスパースリカバリプリミティブの下では、実証可能な多次元環境が存在する。
合成および実際のデータセットは、予測されたギャップと遷移を示し、単純な多様性診断を動機付ける。
論文 参考訳(メタデータ) (2026-06-11T05:49:43Z) - When Does Dynamic Preconditioning Preserve the Polyak-Ruppert CLT? A Stabilization Threshold [12.805268849262243]
ウォルド型オンライン推論は、安定化率が閾値を超える動的プレコンディション付き平均SGDに対して有効である。
我々は、上界で使われるレート仮説のクラスにおいて、それを弱めることはできないことを証明した。
論文 参考訳(メタデータ) (2026-04-26T02:14:19Z) - Score-Repellent Monte Carlo: Toward Efficient Non-Markovian Sampler with Constant Memory in General State Spaces [48.37754141688874]
本稿では,スコアと状態表現の次元である$Rd$のスコア評価の実行平均で履歴を要約するフレームワークを提案する。
この歴史は指数的なスコア傾きによって代理対象に変換され、歴史に基づく反発の大きさを制御する際の反発の強さを表す$$がインデックス付けされる。
連続目標モデルと離散エネルギーベースモデルの実験では、メモリ使用率を$O(d)$に抑えつつ、推定値の分散とモードカバレッジを改善した。
論文 参考訳(メタデータ) (2026-04-24T18:39:50Z) - Benchmarking the Utility of Privacy-Preserving Cox Regression Under Data-Driven Clipping Bounds: A Multi-Dataset Simulation Study [0.0]
微分プライバシー(DP)は、個人のプライバシーを保証する数学的枠組みである。
本研究では,データ駆動クリッピング境界を持つDP機構がCox比例ハザードモデルに与える影響を系統的に評価した。
論文 参考訳(メタデータ) (2026-04-23T09:53:15Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Avoiding Premature Collapse: Adaptive Annealing for Entropy-Regularized Structural Inference [1.7523718031184992]
この障害の基本的なメカニズムは、 textbf Premature Mode Collapseである。
提案手法は,適応型スケジューリングアルゴリズムであるtextbfEfficient Piecewise Hybrid Adaptive Stability Control (EPH-ASC) で,推論過程の安定性をモニタする。
論文 参考訳(メタデータ) (2026-01-30T14:47:18Z) - Spectral Sentinel: Scalable Byzantine-Robust Decentralized Federated Learning via Sketched Random Matrix Theory on Blockchain [0.0]
ビザンチンのクライアントは、不均一な(Non-IID)データの下での濃度勾配を中毒する。
本稿では,ビザンチン検出・集約フレームワークであるSpectral Sentinelを提案する。
Polygonネットワーク上でブロックチェーンを統合することで,完全なシステムを実現しています。
論文 参考訳(メタデータ) (2025-12-14T09:43:03Z) - Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits [49.96531901205305]
我々は$f$-divergence-regularized offline policy learningを分析する。
逆Kullback-Leibler (KL) の発散に対して、単極集中性の下での最初の$tildeO(epsilon-1)$サンプル複雑性を与える。
これらの結果は,$f$-divergence-regularized policy learningの包括的理解に向けて大きな一歩を踏み出したものと考えられる。
論文 参考訳(メタデータ) (2025-02-09T22:14:45Z) - Robust Implicit Networks via Non-Euclidean Contractions [63.91638306025768]
暗黙のニューラルネットワークは、精度の向上とメモリ消費の大幅な削減を示す。
彼らは不利な姿勢と収束の不安定さに悩まされる。
本論文は,ニューラルネットワークを高機能かつ頑健に設計するための新しい枠組みを提供する。
論文 参考訳(メタデータ) (2021-06-06T18:05:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。