論文の概要: Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating
- arxiv url: http://arxiv.org/abs/2607.24667v1
- Date: Mon, 27 Jul 2026 17:08:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.519085
- Title: Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating
- Title(参考訳): 推定としてのエヴィジョン:テストタイムメモリの固定ラグ平滑化と累積ビートの測定
- Abstract要約: 有界なワーキングメモリを持つ言語モデルは、保持すべき格納アイテムを繰り返し決定する必要がある。
我々は、H2Oの厳密な一般化であるトレーニングフリーポリシー、RMMとして、これをインスタンス化する。
しかし、NVIDIAのKVPressハーネス内で、独自のSnapKV、H2O、StreamingLLM実装に対して実行される独立したベンチマークでは、そのアドバンテージはほとんど失われている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A language model with a bounded working memory must repeatedly decide which stored items to keep. Every deployed method decides the moment an item arrives, from the past (StreamingLLM, H2O) or from a guess about the future (SnapKV). We recast the choice as an estimation problem on a hidden signal, whether an item will be reused, placing existing methods on one axis, the commit lag $H$: online filters and learned predictors commit at $H=0$, while Belady's offline optimum sits where the whole future is known. The missing regime in between, fixed-lag smoothing, waits a bounded number of steps, observes which items a correct near-future prediction attended to, and only then commits. This measurement, demonstrated utility, turns Belady's unobservable future request into something we read off the model itself. We instantiate it as a training-free policy, RMM, a strict generalization of H2O that reduces to it exactly when the measurement is uniform. In controlled settings where reuse is endogenous and separated in time, demonstrated utility identifies used memory far better than accumulated attention, and a small bounded memory behaves like a much larger one. But on independent third-party benchmarks, run inside NVIDIA's KVPress harness against its own SnapKV, H2O, and StreamingLLM implementations, the advantage mostly disappears: RMM is on par with H2O for single-turn question answering and loses to both H2O and SnapKV in a streaming multi-turn setting. The cause is simple: on natural text the model is correct about most tokens, so weighting attention by correctness barely changes it, and demonstrated utility collapses onto accumulated attention unless reuse is sharp and endogenous, which standard benchmarks do not exercise. Our contribution is the framework and an honest map of when measuring beats accumulating, not a new state of the art.
- Abstract(参考訳): 有界なワーキングメモリを持つ言語モデルは、保持すべき格納アイテムを繰り返し決定する必要がある。
すべてのデプロイされたメソッドは、アイテムが到着した時点、過去(StreamingLLM, H2O)、または未来(SnapKV)の推測から決定します。
私たちは、アイテムが再利用されるかどうか、既存のメソッドを1軸に配置するかどうか、オンラインフィルタと学習予測器が$H=0$でコミットするかどうか、その選択を隠れた信号で推定問題として再キャストします。
固定ラグのスムーズな間にある欠落した状態は、境界付けられたステップを待ち、どの項目が正しい近未来予測に付随するかを観察し、そのあとのみコミットする。
この測定は実用性を示し、ベラディーの観測不能な将来の要求をモデル自体から読み取るものに変えます。
トレーニングフリーポリシーとして RMM をインスタンス化し,H2O の厳密な一般化を行い,測定値が一様である場合に正確に還元する。
再利用が内在的かつ時間的に分離される制御された環境では、ユーティリティは、蓄積された注意よりも使用済みメモリを識別し、小さな境界メモリは、はるかに大きなメモリのように振る舞う。
しかし、NVIDIAのKVPressを使って独自のSnapKV、H2O、StreamingLLM実装を実行する独立したサードパーティのベンチマークでは、RMMはH2Oと同等で、ストリーミングマルチターン環境ではH2OとSnapKVの両方に負けている。
自然文では、モデルはほとんどのトークンについて正しいので、正確さによる注意の重み付けはほとんど変化せず、再利用が鋭く内在的で、標準ベンチマークが実行しない限り、実用性は集中的な注意に崩壊することを示した。
私たちの貢献は、新しい最先端ではなく、計測がいつ蓄積されるかという枠組みと正直な地図です。
関連論文リスト
- The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents [0.0]
永続メモリはパーソナライズされたエージェントをサポートするが、古い保存された事実は警告なしで現在の信頼できる証拠をオーバーライドすることができる。
モデル能力が変化するにつれて、この害がいつ始まるかを研究する。
論文 参考訳(メタデータ) (2026-09-01T20:35:00Z) - When the Martingale Never Stops Firing: Anytime-Valid Gating on Real Forecast Streams [0.614481021961242]
任意の時間価推論は、いつでも実行できる証拠を約束する。
デプロイは、監視するストリームが交換可能に振る舞う場合に限り、それを継承する。
論文 参考訳(メタデータ) (2026-08-31T09:32:11Z) - Interaction Scaling: Grounding the Third Axis of Test-Time Compute [0.33451037881913753]
一つの変数がこの第3の軸を接地として支配し、ループの両側に保持しなければならないと論じる。
固定トークン予算でのハードコーディングタスクでは、推論のみとベストオブNの両方をサンプリングする。
提案手法は, ラン・ツー・ラン分散を伴わず, 100%パスレートに到達した。
論文 参考訳(メタデータ) (2026-07-13T14:22:06Z) - Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention [0.48342038441006796]
本稿では,入力が新規である場合にのみスロットを割り当てるスパースキャッシュについて検討する。
固定濃度の静的キャッシュと,最近の新規性率に追従したサプライズ適応変種という2つの形態で開発する。
論文 参考訳(メタデータ) (2026-07-10T18:28:21Z) - What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents [1.0742675209112622]
4つの研究コミュニティがそれぞれ,大規模言語メモリのコンパクト化を学んでいることを示す。
我々は、これらが1つの問題の例であると主張する。
このレンズを1つのコンパクト化目標と層に依存しない下界で正確にし、スタック全体からメソッドを一様に分類する7軸分類法を構築するために使用する。
論文 参考訳(メタデータ) (2026-07-09T01:15:03Z) - What Should a Streaming Video Model Remember? [28.189301152079214]
ストリーミングビデオ理解モデルは、現在進行中のストリームの間、常にクエリに答えなければならない。
提案するTextbfSelectStreamは,クエリ条件のコンパクトなエビデンス予算を通じてのみ履歴情報を公開しながら,現在の観測結果を凍結したVLMに直接可視的に保持する,選択的潜在メモリフレームワークである。
実験の結果、SelectStreamは強力なオンラインストリーミング性能を示し、一般的なビデオ理解を保ち、StreamingBenchでは82.67%、OVO-Benchでは67.03%、オフラインビデオベンチマークでは74.4%に達した。
論文 参考訳(メタデータ) (2026-06-15T07:50:19Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - Don't Pause! Every prediction matters in a streaming video [55.509551643600794]
一般的なストリーミング知覚とアシスト機能を評価するマルチターンプロアクティブクエリを特徴とするSPOT-Benchを提案する。
SPOT-BenchにはTimeliness-F1が付属している。
i)オフラインモデルは、確実にイベントを検知するが、スパム予測は失敗する; (ii) サイレントをトレーニングした後、スパムを減らし、応答を低下させる; (iii) ストリーミングビデオの半分は応答を期待しない。
論文 参考訳(メタデータ) (2026-04-27T11:07:03Z) - Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression [53.48692193399171]
Gated KalmaNet(GKA)は、次のトークンを予測する際に、すべての過去を説明することによってギャップを低減するレイヤである。
テスト時間におけるオンラインリッジ回帰問題を一定メモリと線形計算コストで解決する。
ロングコンテキストでは、GKAは現実世界のRAGタスクとLongQAタスクを最大128kトークンまで拡張し、他の薄型メモリベースラインよりも10ドル%以上の相対的な改善を実現している。
論文 参考訳(メタデータ) (2025-11-26T03:26:37Z) - Rethinking Metrics and Benchmarks of Video Anomaly Detection [58.37571339811799]
ビデオ異常検出(VAD)は、期待から外れた異常を検出することを目的としている。
既存のVADメトリクスは、単一のアノテーションバイアスの影響を受けます。
既存のベンチマークには、完全に/弱い教師付きアルゴリズムのシーンオーバーフィットを評価する能力がない。
論文 参考訳(メタデータ) (2025-05-25T08:09:42Z) - Simple linear attention language models balance the recall-throughput tradeoff [60.06020449520365]
線形およびすべり窓の注意を結合したシンプルなアーキテクチャであるBASEDを提案する。
我々は、最大1.3bパラメータの言語モデルをトレーニングし、BASEDがパープレキシティにおいて最強のサブクワッドラティックモデルと一致し、実世界のリコール集約タスクにおいて6.22の精度ポイントでそれらのモデルを上回っていることを示す。
論文 参考訳(メタデータ) (2024-02-28T19:28:27Z) - Streaming Anomaly Detection [7.60882697435906]
まず、カウントミンスケッチを用いて動的グラフの異常エッジをオンラインで検出するMIDASを提案する。
次に、カウントミンスケッチをHigher-Orderスケッチに拡張し、グラフデータの複雑な関係をキャプチャします。
このスケッチを用いて,エッジおよびサブグラフ異常を検出する4つのストリーミング手法を提案する。
論文 参考訳(メタデータ) (2023-01-30T18:59:51Z) - Real-Time Anomaly Detection in Edge Streams [49.26098240310257]
マイクロクラスタ異常の検出に焦点を当てたMIDASを提案する。
さらに、アルゴリズムの内部状態に異常が組み込まれている問題を解くために、MIDAS-Fを提案する。
実験の結果,MIDAS-Fの精度はMIDASよりも有意に高かった。
論文 参考訳(メタデータ) (2020-09-17T17:59:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。