論文の概要: SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents
- arxiv url: http://arxiv.org/abs/2608.08055v1
- Date: Sat, 08 Aug 2026 10:42:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.626379
- Title: SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents
- Title(参考訳): SodaMem: LLMエージェントの時間グラフメモリのエビデンス
- Authors: Fengrong Wan, Chengcan Wu, Ningtao Lyu,
- Abstract要約: 提案するSodaMemは,FactEvents型を出力スパンで抽出する,エビデンス基底の時間グラフメモリである。
LongMemEval-Sでは、記録の保存構成が92.8%の精度 (464/500; Best of Nseek) で、平均0.00161/questionです。
私たちは、APIコストを見積もったパブリックシステムを、コストテーブルとコスト精度マップにコンパイルします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents that assist users over weeks of conversation must remember what is currently true, not merely what was once said. Flat RAG diaries and Markdown logs optimize needle retrieval but under-serve currency, provenance, and ordered temporal reasoning (Maharana et al. 2024; Wu et al. 2024; Packer et al. 2023; Chhikara et al. 2025). We present SodaMem, an evidence-grounded temporal graph memory that (i) extracts typed FactEvents with mandatory provenance spans, (ii) persists mention time, occurrence time, and validity with SUPERSEDES/CONTRADICTS/UPDATES edges under hybrid lexical-dense indexing, and (iii) answers via a planner-reader loop that gathers citable evidence before composing a final response. On LongMemEval-S, our store-of-record configuration reaches 92.8% accuracy (464/500; best of N=3) at mean $0.00161/question (approximately 18.3k tokens; median $0.00111 / approximately 14.6k) with deepseek-v4-flash. We compile public systems with estimable API cost into a cost table and cost-accuracy map; under these estimates SodaMem sits near the accuracy frontier at Flash-tier spend and strictly dominates several higher-cost, lower-accuracy points. Accuracy uses the same Flash model as reader and judge (self-grading); costs exclude ingest/judge and cross-system comparisons are compiled estimates rather than a single-harness bake-off.Our code is available at https://github.com/SodaMem/SodaMem
- Abstract(参考訳): 数週間にわたる会話を支援する大規模言語モデル(LLM)エージェントは、かつての発言だけでなく、現在何が真実であるかを思い出さなければならない。
フラットRAG日記とマークダウンログは針の検索を最適化するが、不足通貨、証明、時間的推論を最適化する(Maharana et al 2024; Wu et al 2024; Packer et al 2023; Chhikara et al 2025)。
我々は,エビデンス基底の時間グラフメモリであるSodaMemを提示する。
(i)強制的な前置詞で型付きFactEventsを抽出する。
(二)ハイブリッド辞書インデックス作成におけるSuperSEDES/CONTRADICTS/UPDATESエッジによる言及時間、発生時間、有効性を維持し、
三 最終応答を構成する前に、検証可能な証拠を収集するプランナー・リーダー・ループを介して回答すること。
LongMemEval-Sでは、記録の保存構成が92.8%の精度 (464/500; best of N=3) に達し、平均0.00161/question (約18.3kトークン、中央値0.00111 / 約14.6k) で、ディープシークv4-flashである。
私たちは,APIコストを見積もった公開システムを,コストテーブルとコスト精度マップにコンパイルします。
正確性は、リーダーとジャッジと同じFlashモデルを使用し(自己評価)、コストはインジェスト/ジャッジを除外し、クロスシステム比較は、単一ハーネスのベークオフではなく、コンパイルされた見積もりである。
関連論文リスト
- SARC-DQ: Runtime Data-Quality Gating for Agentic AI: Silent Evidence Defects, the Incompetence Shield, and Downstream-Only Remediation [0.0]
最も危険なエンタープライズの欠陥はメタデータに依存している。
有能なエージェントは、注入されたメタデータに作用する欠陥を、約60%のコストのかかるアクションに変換する。
下流のみのメタデータ対応のプリアクションゲートは、その述語カバーの信号で完全に損失を回復する。
論文 参考訳(メタデータ) (2026-07-28T22:22:52Z) - Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents [0.0]
大規模言語モデル(LLM)エージェントは、事実が変化する長い多セッションの相互作用で機能する。
正しく行動するためには、事実の現在の値を使用し、置き換えられた値を捨てる必要がある。
この測定結果をトレーニング信号に変換するオープンな強化学習環境であるSupersedeをリリースする。
論文 参考訳(メタデータ) (2026-06-25T18:50:32Z) - A Survey of Spatial Memory Representations for Efficient Robot Navigation [4.560386676154887]
52のシステムにまたがる88の参照の空間記憶効率の問題を調査した。
M_textpeak / M_textmap$は、ピーク時メモリ(操作中に消費される全RAMまたはGPUメモリ)と保存されたマップサイズとの比率である。
論文 参考訳(メタデータ) (2026-04-13T02:12:17Z) - Selective Memory for Artificial Intelligence: Write-Time Gating with Hierarchical Archiving [0.0]
パラメトリックアプローチは、選択的な更新を前に、知識を重みに圧縮する。
合成サリエンススコアを用いて、入ってくる知識オブジェクトをフィルタリングする書き込み時間ゲーティングを導入する。
論文 参考訳(メタデータ) (2026-03-16T23:06:44Z) - Process-Tensor Tomography of SGD: Measuring Non-Markovian Memory via Back-Flow of Distinguishability [1.078600700827543]
我々は,識別可能性のオンフバックフローに基づく学習記憶のモデルに依存しない簡易な目撃者を構築した。
高い運動量下での増幅, よりマイクロステップで, 厳密なブートストラップ信頼区間による一貫した正の逆流を観察した。
我々はこれを、実用的なSGDがマルコフの理想化から逸脱する、原則化された診断および実証的な証拠として位置付ける。
論文 参考訳(メタデータ) (2026-01-23T09:03:25Z) - FuXi-β: Towards a Lightweight and Fast Large-Scale Generative Recommendation Model [87.38823851271758]
本稿では,Transformerライクなリコメンデーションモデルのための新しいフレームワークを提案する。
FuXi-$beta$は従来の最先端モデルより優れ、大幅な加速を実現している。
私たちのコードはパブリックリポジトリで利用可能です。
論文 参考訳(メタデータ) (2025-08-14T13:12:29Z) - $\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts [55.231201692232894]
$textttSPECS$は、投機的デコードにインスパイアされた遅延対応のテスト時間スケーリングメソッドである。
我々の結果は、$textttSPECS$matchはビームサーチの精度を上回り、最大$sim$19.1%のレイテンシを削減していることを示している。
論文 参考訳(メタデータ) (2025-06-15T05:50:05Z) - Exploiting Pre-trained Models for Drug Target Affinity Prediction with Nearest Neighbors [58.661454334877256]
薬物-標的結合親和性(DTA)予測は、薬物発見に不可欠である。
DTA予測へのディープラーニング手法の適用にもかかわらず、達成された精度は依然として準最適である。
事前学習したDTA予測モデルに適用した非表現埋め込みに基づく検索手法である$k$NN-DTAを提案する。
論文 参考訳(メタデータ) (2024-07-21T15:49:05Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z) - H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large
Language Models [110.06476624089679]
メモリフットプリントを大幅に削減する新しいKVキャッシュの実装手法を提案する。
我々のアプローチは、トークンのごく一部が、注意点の計算において、ほとんどの価値に寄与する、という観察に基づいている。
我々は,最近のトークンとH$のバランスを動的に保持するKVキャッシュ消去ポリシーであるヘビーヒッター(H$O)を提案する。
論文 参考訳(メタデータ) (2023-06-24T20:11:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。