論文の概要: Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations
- arxiv url: http://arxiv.org/abs/2609.03426v1
- Date: Thu, 03 Sep 2026 06:33:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.946963
- Title: Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations
- Title(参考訳): Lngram v2: 解釈可能離散表現を用いた潜時N-Gramメモリ
- Abstract要約: トランスフォーマーにはネイティブなルックアップ機構がなく、ローカルな静的パターンを認識して再利用するためには、繰り返し密集した計算が必要である。
Lngram v1は、離散的なn-gramアドレッシングを通じてトークン化非依存の条件記憶を導入する。
Lngram v2はルート数、メモリ次元、バックボーン幅を分離する。
- 参考スコア(独自算出の注目度): 8.050927352582827
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transformers lack a native lookup mechanism, requiring repeated dense computation to recognize and reuse local static patterns. Lngram v1 introduces tokenizer-independent conditional memory through discrete latent n-gram addressing, but its memory capacity is coupled with the backbone width, limiting scalability due to high parameter and activation costs. We propose Lngram v2, which decouples the number of routes, memory dimension, and backbone width, and introduces a context-aware grouped-query attention readout to scale memory capacity independently. A zero-value Sink and counterfactual surrogate gradients further improve readout selectivity and routing trainability while preserving hard discrete addressing. Experiments across vision--language models (VLMs) of different scales show consistent improvements, including successful scaling to a 30B-parameter model. Compared with Lngram v1, Lngram v2 substantially reduces both total and activated memory parameters while maintaining or improving language modeling performance. Further analysis shows that its discrete IDs preserve substantial semantic structure of continuous hidden states, enabling semantic recovery from IDs alone and stable ID--semantic associations across datasets. These results establish Lngram v2 as an efficient and scalable latent conditional memory mechanism whose discrete addresses also provide a structured interface for analyzing internal model representations.
- Abstract(参考訳): トランスフォーマーにはネイティブなルックアップ機構がなく、ローカルな静的パターンを認識して再利用するためには、繰り返し密集した計算が必要である。
Lngram v1は、離散遅延n-gramアドレッシングを通じてトークン化非依存の条件メモリを導入するが、そのメモリ容量はバックボーン幅と結合され、高いパラメータとアクティベーションコストによるスケーラビリティが制限される。
本稿では,ルート数,メモリ次元,バックボーン幅を分離したLngram v2を提案する。
ゼロ値シンクと反ファクトサロゲート勾配は、ハードな離散アドレスを保持しながら読み出し選択性とルーティングトレーサビリティをさらに向上させる。
異なるスケールの視覚言語モデル(VLM)による実験では、30Bパラメータモデルへのスケーリングの成功など、一貫した改善が示されている。
Lngram v1と比較すると、Lngram v2は言語モデリング性能を維持したり改善したりしながら、総メモリパラメータとアクティブメモリパラメータの両方を大幅に削減する。
さらに分析したところ、その離散IDは連続した隠蔽状態の実質的な意味構造を保持しており、IDのみからのセマンティックリカバリとデータセット間の安定したID-セマンティックアソシエーションを可能にしている。
これらの結果は、Lngram v2を、離散アドレスが内部モデル表現を解析するための構造化インターフェースを提供する、効率的でスケーラブルな潜在条件記憶機構として確立する。
関連論文リスト
- Dynamic Linear Attention [33.7476613423211]
多状態線形アテンションのための動的メモリモデリングフレームワークであるDLAを提案する。
2つの異なる線形アテンションモデルでDLAを事前訓練し、3つのカテゴリで16のデータセットを評価する。
論文 参考訳(メタデータ) (2026-06-09T09:57:48Z) - Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - MoVE: Mixture of Value Embeddings -- A New Axis for Scaling Parametric Memory in Autoregressive Models [0.9222161299777548]
我々は,モデルキャパシティの剛性構造結合を計算コストに分解するメカニズムである$textbfMoVE (Mixture of Value Embeddings)$を紹介した。
MoVEは、すべての注目層間で共有される学習可能な値埋め込みのグローバルバンクを導入することで、メモリを計算から切り離す。
自動回帰モデリングの2つの代表的応用であるテキスト生成と画像生成に関する厳密に制御された実験を通してMoVEを検証する。
論文 参考訳(メタデータ) (2026-01-30T12:07:23Z) - LINA: Linear Autoregressive Image Generative Models with Continuous Tokens [56.80443965097921]
連続トークンを持つ自己回帰モデルは、特にテキスト・トゥ・イメージ(T2I)合成において、視覚生成に有望なパラダイムを形成する。
このフレームワーク内での計算効率のよい線形アテンションの設計法について検討する。
LINAは、線形注意に基づくシンプルで計算効率の良いT2Iモデルであり、ユーザ命令から高忠実度1024x1024画像を生成することができる。
論文 参考訳(メタデータ) (2026-01-30T06:44:33Z) - CroBIM-V: Memory-Quality Controlled Remote Sensing Referring Video Object Segmentation [0.3099118620919279]
本稿では、データと方法論の二重貢献を通してRS-RVOSの研究を進める。
まず,111の動画シーケンス,約25,000のフレーム,213,000の時間参照アノテーションからなる最初の大規模ベンチマークであるRS-RVOS Benchを構築した。
第2に、セグメンテーションモデル(MQC-SAM)を用いたメモリ品質制御と呼ばれる、メモリ品質を考慮したオンライン参照セグメンテーションフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-17T14:52:46Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - Dynamic Memory-enhanced Transformer for Hyperspectral Image Classification [3.5093938502961763]
ハイパースペクトル画像(HSI)分類は、複雑な空間スペクトル相関のため、依然として困難な課題である。
既存のトランスモデルは、長距離依存を捉えるのに優れているが、情報冗長性と注意力の非効率さに悩まされることが多い。
MemFormerは、動的メモリモジュールを反復的に洗練するメモリ強化型マルチヘッドアテンションメカニズムを導入している。
動的メモリ富化戦略は、複雑な空間的およびスペクトル的依存関係を段階的にキャプチャし、より表現力のある特徴表現をもたらす。
論文 参考訳(メタデータ) (2025-04-17T17:43:34Z) - TF-SASM: Training-free Spatial-aware Sparse Memory for Multi-object Tracking [6.91631684487121]
コンピュータビジョンにおけるマルチオブジェクト追跡(MOT)は依然として重要な課題であり、ビデオシーケンス内の複数のオブジェクトの正確な位置決めと連続的な追跡が必要である。
本稿では,オブジェクトの動きと重なり合う認識に基づいて,重要な特徴を選択的に記憶するメモリベースの新しいアプローチを提案する。
提案手法はDanceTrackテストセットのMOTRv2よりも有意に改善し,AsAスコアが2.0%,IFF1スコアが2.1%向上した。
論文 参考訳(メタデータ) (2024-07-05T07:55:19Z) - Self-Gated Memory Recurrent Network for Efficient Scalable HDR
Deghosting [59.04604001936661]
本稿では,任意の長さの動的シーケンスを浮き彫りにする新しいネットワーク型HDRデゴースト法を提案する。
本稿では,SGM(Self-Gated Memory)セルという新たなリカレントセルアーキテクチャを導入する。
提案手法は,既存の3つの公開データセットを定量的に比較して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2021-12-24T12:36:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。