論文の概要: Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning
- arxiv url: http://arxiv.org/abs/2607.12204v1
- Date: Mon, 13 Jul 2026 23:13:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.978919
- Title: Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning
- Title(参考訳): Forgetful Attention: 認定された選択と実践的未学習を備えたトレーニング可能なサポートベクターメモリ
- Authors: Vishwajith Ramesh,
- Abstract要約: 固定ボックスパラメータCの1クラスSfpの支持係数が重みを持つメモリであるSupport Vector Attention(SV-Attention)を導入する。
アクティブセットのパーティションは、リザーブトークンを正確にゼロウェイト、出力ウェイトを与え、インクリメンタルインクリメンタルソルバトークンは、同じCの下で再トレーニングせずに生成した状態を回復する。
また,実文埋め込み上での外科的排除,正確な編集,患者記録の削除,忘れやすい検索メモリも示す。
- 参考スコア(独自算出の注目度): 0.16921396880325776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Attention can be viewed as an online learner over context, yet existing test-time memories cannot certify that dropping a token leaves outputs unchanged or delete its influence outright. We introduce Support Vector Attention (SV-Attention), a max-margin memory whose weights are support coefficients of a one-class SVM with fixed box parameter C. Its active-set partition gives reserve tokens exactly zero weight, certifying output-preserving eviction; a reversible incremental solver deletes a token to recover the state produced by retraining without it under the same C. In fp64 experiments, decrement and refit recover identical partitions whenever the optimum is unique, and their decision functions match to a median deviation of about 10^-9 (10^-13 on learned keys); the 10^-2 worst case is confined to ill-conditioned duplicates and remains below coefficient decay in every regime. The exact path reuses the maintained KKT inverse in a custom backward. Training uses a separate stabilized batched approximation and does not carry the exact-deletion certificate; it reaches 9,125 tokens/s on a 3.22M-parameter model, while remaining 35.8 times slower than an MPS softmax reference. At matched budgets, certified selection reaches 0.86 vs. 0.32 rare-item recall and retains 0.80 vs. 0.05 deterioration hours on real MIMIC-IV streams. We also demonstrate surgical forgetting, exact editing, patient-record deletion, and a forgettable retrieval memory over real sentence embeddings. On enwik8, the hybrid obtains 2.178 BPC vs. 2.383 for a matched-state sliding-window Transformer across seven seeds (8.6% paired improvement, p=0.001); a three-seed TinyStories result is directionally positive but not significant (p=0.057).
- Abstract(参考訳): 注意は文脈よりもオンライン学習者と見なすことができるが、既存のテストタイム記憶では、トークンを落とすと出力が変化せず、影響が完全に削除されることは証明できない。
アクティブセットのパーティションは、完全にゼロのリザーブトークンを付与し、出力保存の限界を証明し、可逆的なインクリメンタルソルバは、同じCでリトレーニングされた状態の回復のためのトークンを削除します。fp64実験では、最適値がユニークで、その決定関数は10^-9(学習キー上の10^-13)の中央偏差に一致します。
正確な経路は、保守されたKKT逆をカスタムバックワードで再利用する。
トレーニングでは、個別に安定化されたバッチ近似を使用し、正確な削除証明書は持たず、3.22Mパラメータモデルで9,125トークン/秒に達するが、MPSソフトマックス基準の35.8倍遅い。
一致した予算では、認定された選択は0.86対0.32レアイテムリコールに達し、実際のMIMIC-IVストリームでは0.80対0.05劣化時間を保持する。
また, 実文埋め込みによる外科的忘れ忘れ, 正確な編集, 患者記録の削除, 記憶可能な検索メモリも示す。
enwik8では、7つの種にまたがる整合状態のスライドウインドウ変圧器(p=0.001)に対して2.178 BPC vs. 2.383を得る(p=0.057)。
関連論文リスト
- CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention [0.0]
リカレントモデルは思い出すために忘れなければならないが、芸術の状態は保存されているものを参照せずに、何を削除するかを決定する。
このメモリブラインドゲーティングは、主要なデルタルールアーキテクチャ(GDN-2)における3つの結合欠陥の1つである。
我々はCARVEを導入し、鍵軸のみを消去するという3つの問題を1つの原理で解決する。
論文 参考訳(メタデータ) (2026-06-25T16:16:51Z) - Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations [1.2763567932588586]
ForgetEvalは1000ケースのテンプレート・スイートと385ケースの対向層(手作り+253 LLMのオラクル・バリデーション)
決定論的プリミティブは語彙的・時間的カテゴリーで十分だが、正準化に失敗する。
1000ケースのテンプレートスイートと385ケースの反対層であるForgetEvalを通じて、トレードオフを公開しています。
論文 参考訳(メタデータ) (2026-06-14T16:32:15Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators [45.88028371034407]
スペクトルクープマン注意(SKA)を中心に構築されたKV-cacheフリー連想リコールアーキテクチャ
我々は、SKA(Spectral Koopman Attention)を中心に構築されたKV-cacheフリーな連想型リコールアーキテクチャであるEchoを紹介する。
論文 参考訳(メタデータ) (2026-05-07T22:26:27Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - Predicting Overtakes in Trucks Using CAN Data [51.28632782308621]
CANデータからトラックの積載量の検出について検討する。
私たちの分析では、オーバーテイクイベントの最大10秒前をカバーしています。
我々は、オーバーテイク・トリガーに近づくと、オーバーテイク・クラスの予測スコアが増加する傾向にあることを観察する。
論文 参考訳(メタデータ) (2024-04-08T17:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。