論文の概要: Separating Stream Stability from Long-Term Recall in Language Models
- arxiv url: http://arxiv.org/abs/2609.07282v1
- Date: Mon, 07 Sep 2026 09:49:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 00:57:18.221099
- Title: Separating Stream Stability from Long-Term Recall in Language Models
- Title(参考訳): 言語モデルにおける長期リコールからのストリーム安定性の分離
- Abstract要約: 注意シンクは、不確定に長いストリーム上で自己回帰生成を安定化させることができる一方で、モデルは最近のキャッシュを残したコンテンツを使用することができない。
予測行動が良好に振る舞う安定性の地平線,過去のコンテンツが出力に因果的に影響を与えうるアクセスの地平線,タスクが許容される性能を維持するユーティリティの地平線という3つの地平線を導入する。
アテンションシンクストリーミングにフレームワークを適用することで、アンカートークンをセマンティックメモリとして扱うことなく、その強度、定数メモリ、安定した生成が明確になる。
- 参考スコア(独自算出の注目度): 14.319140213074045
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Methods for streaming language models are often discussed alongside long-context and memory systems, although they solve different problems. An attention sink can stabilize autoregressive generation over an indefinitely long stream while the model remains unable to use content that has left its recent-token cache. We argue that this distinction should be explicit in system claims and evaluation. We introduce three horizons: the stability horizon, over which predictive behavior remains well behaved; the access horizon, over which past content can still causally affect the output; and the utility horizon, over which a task retains acceptable performance. We show constructively that the stability horizon can be infinite while the access and utility horizons are finite. We then propose ThreeH, an evaluation contract that measures all three horizons under a common state and compute budget. Applying the framework to attention-sink streaming clarifies its strength, constant-memory, stable generation, without treating anchor tokens as semantic memory. The framework exposes roles for cache policies, recurrent state, retrieval, and external memory. Experiments on 128K-token streams, delayed binding recall, and delayed decisions show that attention sinks preserve local modeling but not content beyond the active cache; recurrent and retrieval state extend the semantic horizon.
- Abstract(参考訳): ストリーミング言語モデルの手法は、長いコンテキストとメモリシステムと共に議論されることが多いが、それらは異なる問題を解決する。
注意シンクは、不確定に長いストリーム上で自己回帰生成を安定化させることができる一方で、モデルは最近のキャッシュを残したコンテンツを使用することができない。
この区別は、システムクレームと評価において明確であるべきだと我々は主張する。
予測行動が良好に振る舞う安定性の地平線,過去のコンテンツが出力に因果的に影響を与えうるアクセスの地平線,タスクが許容される性能を維持するユーティリティの地平線という3つの地平線を導入する。
アクセスとユーティリティの地平線が有限である間、安定性の地平線は無限であることを示す。
次に、共通状態と計算予算の下での3つの地平線すべてを測定する評価契約であるThreeHを提案する。
アテンションシンクストリーミングにフレームワークを適用することで、アンカートークンをセマンティックメモリとして扱うことなく、その強度、定数メモリ、安定した生成が明確になる。
このフレームワークはキャッシュポリシ、リカレントステート、検索、外部メモリの役割を公開している。
128Kのストリーム、遅延バインディングリコール、遅延決定の実験では、アテンションシンクは局所的なモデリングを保存するが、アクティブキャッシュ以外のコンテンツは保存しない。
関連論文リスト
- Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding [64.34948094316685]
latentStreamは、ストリーミングメモリをストア・アンド・レトリーブから検索・インターナライズへシフトする、プログレッシブな潜伏型ワーキングメモリフレームワークです。
LatentStreamは、既存のオンラインおよびオフラインビデオベンチマークで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2026-09-03T17:28:14Z) - LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation [22.878882105342182]
自己回帰ビデオ拡散は、境界付けられた最近の文脈からチャンクを生成する。
頻度ベースのキャッシュは、被写体、オブジェクト、シーン、または属性が再び現れるときに必要となる歴史的手がかりを排除します。
LayerRecallは関連するK/V状態を取得し、バックボーン固有のメモリ依存レイヤにのみ注入する。
論文 参考訳(メタデータ) (2026-08-28T15:49:13Z) - TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation [17.429355392513354]
リアルタイムのロングフォームデジタル・ヒューマン・ジェネレーションは、音声視覚コンテンツを拡張するための因果モデルに依存している。
Methodは、数ステップのジョイントオーディオビデオ生成のためのアンカー誘導永続メモリフレームワークである。
論文 参考訳(メタデータ) (2026-07-27T12:35:32Z) - LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams [59.485485426790966]
このLiveStarProは、長時間のストリーミング上でのプロアクティブなビデオ理解のために設計されたライブストリーミングアシスタントである。
LiveStarProは既存のメソッドを一貫して上回り、セマンティックな正確性は28.9%向上した。
そのストリーミングキーバリューキャッシュは、キャッシュなしで同じモデル上で1.58倍の推論速度を得る。
論文 参考訳(メタデータ) (2026-06-16T11:18:05Z) - FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion [59.207505503284715]
FadeMemは、歴史的なKVブロックを固定キャッシュ予算の下で時間階層に整理する。
新しい歴史はきめ細かいエントリとして挿入され、古い隣のエントリは徐々にマージされる。
実験では、既存の有界キャッシュ戦略よりも、被験者の一貫性、背景安定性、時間的コヒーレンスが改善された。
論文 参考訳(メタデータ) (2026-06-09T10:22:18Z) - DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation [51.58559206569209]
我々は,コンパクトなメモリバンクを保守し,動的フレームシンクとして視覚的に関連する歴史的フレームを選択する検索ベースのフレームワークであるDySinkを提案する。
分長ビデオの実験では、DySinkは強いベースラインよりもダイナミックな度合いを一貫して改善し、同時に時間的品質も向上している。
論文 参考訳(メタデータ) (2026-05-20T11:01:01Z) - Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation [73.84423888025171]
オートレグレッシブ(AR)ビデオ拡散は,近年,長大なビデオ生成において有望なパラダイムとして浮上している。
時間的劣化が進行しているため, 生成から微小スケールの地平線への延長は依然として困難であることを示す。
本稿では,AR拡散のための時間記憶機構であるRelax Forcingを紹介する。
論文 参考訳(メタデータ) (2026-03-22T18:59:24Z) - FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction [51.56484100374058]
ストリーミング3D再構築は、受信フレームからオンラインで更新される永続的な潜伏状態を維持する。
FILT3Rは、トークン空間における状態推定として、リカレントな状態更新をキャストする。
コードはhttps://github.com/jinotter3/FILT3Rでリリースされる。
論文 参考訳(メタデータ) (2026-03-19T04:56:36Z) - Bounded State in an Infinite Horizon: Proactive Hierarchical Memory for Ad-Hoc Recall over Streaming Dialogues [27.69314585543646]
textbfProStreamは,ストリーム対話のためのアクティブな階層型メモリフレームワークである。
マルチグラニュラー蒸留による連続ストリームを推論することで、オンデマンドでのアドホックメモリリコールを可能にする。
実験によると、ProStreamは精度と効率の両方でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-05T07:25:25Z) - OccSTeP: Benchmarking 4D Occupancy Spatio-Temporal Persistence [19.81329748424203]
我々は4D Occupancy Spatio-Temporal Persistence(OccSTeP)という新しい概念を導入する。
この概念は,(1)反応予測:「何が起こるか」,(2)前向き予測:「特定の将来の行動が与えられたら何が起こるか」という2つの課題に対処することを目的としている。
OccSTeP-WMは,高密度なボクセルベースのシーン状態を維持し,時間とともに段階的に時間的コンテキストを融合するトークンフリー世界モデルである。
論文 参考訳(メタデータ) (2025-12-17T17:29:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。