論文の概要: FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents
- arxiv url: http://arxiv.org/abs/2607.26076v1
- Date: Tue, 14 Jul 2026 02:58:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.099375
- Title: FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents
- Title(参考訳): FinCacheServe: 変更可能なエンタープライズドキュメントに対処する費用効率のよいRAGに対する依存性のある回答
- Abstract要約: FinCacheServeは、生成された各回答を、企業意図によってインデックスされたサービスオブジェクトとして扱う。
vLLM実装は、Qwen2.5モデルでSEC由来の財務文書ワークロードを評価する。
- 参考スコア(独自算出の注目度): 2.7688478017544274
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation services over mutable enterprise documents repeatedly execute semantically equivalent analysis requests. Answer reuse can remove GPU-bound generation work, yet response caches require dependency consistency when filings, evidence chunks, and tool outputs change. FinCacheServe treats each generated answer as a serving object indexed by enterprise intent and guarded by document versions, evidence fingerprints, tool fingerprints, model identity, and decoding configuration. A vLLM implementation evaluates SEC-derived financial-document workloads with Qwen2.5 models. On a 2,230-request hosted 7B trace, FinCacheServe skips 53.27% of LLM calls with zero observed dependency-stale outputs. Across three hosted 32B operator-suite seeds, it skips 53.31% of 544 requests, compared with 38.97% for versioned semantic caching and 22.43% for grounded-style reuse. Capacity, backend, and SLO replays show oracle-bounded cache management, 100k-entry transactional metadata behavior, and 44.30% lower estimated Wh per dependency-fresh 2s-SLO success than versioned semantic caching.
- Abstract(参考訳): 変更可能なエンタープライズドキュメントに対する検索拡張生成サービスは、セマンティックに等価な分析要求を繰り返し実行します。
アンサーの再利用はGPUバウンド生成作業を削除することができるが、応答キャッシュはファイリングやエビデンスチャンク、ツール出力の変更時に依存性の一貫性を必要とする。
FinCacheServeは、生成された各回答を、企業意図によってインデックスされ、ドキュメントバージョン、エビデンス指紋、ツール指紋、モデルID、デコード構成で保護されたサービスオブジェクトとして扱う。
vLLM実装は、Qwen2.5モデルでSEC由来の財務文書ワークロードを評価する。
2,230の要求でホストされた7Bトレースで、FinCacheServeは、観測された依存性ステージ出力がゼロのLLMコールの53.27%をスキップする。
3つの32Bオペレータースーツシードで53.31%の544リクエストをスキップし、バージョン別セマンティックキャッシュでは38.97%、接地型再利用では22.43%である。
キャパシティ、バックエンド、SLOのリプレイでは、オラクルバウンドキャッシュ管理、100kエントリのトランザクショナルメタデータの振る舞い、および44.30%の依存性更新2s-SLO成功率が、バージョン付きセマンティックキャッシュよりも低い。
関連論文リスト
- Same Request, Different Answer: Quantization Amplifies Cache-Induced Divergence in LLM Serving [0.0]
サービスエンジンがリクエスト間で共有プロンプトプレフィックスのキーと値テンソルを再利用するプリフィックスキャッシュは、主要なオープンソーススタックでデフォルトで有効になっている。
キャッシュを有効にし、2つのエンジンと4つの重み付けフォーマットで無効にする。
繰り返し実行はすべての構成においてビット識別され、800回中0回であり、他の非決定性源を0.5%に制限している。
論文 参考訳(メタデータ) (2026-09-04T05:27:34Z) - VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval [65.89247522243959]
VisDocAgentBenchは、静的検索とエージェント検索を比較したクローズドコーパスベンチマークである。
100の文書から2,375ページ、120のユニークなターゲットクエリが直接、一橋、二橋のエビデンス構造でバランスを取っている。
強力な遅延対話型ビジュアルレトリバーは、直接アイテムで97.50%のRecall@1に達するが、2ブリッジアイテムでは2.50%に達し、関連性がコーパスコンテキストに依存する場合のクエリ-ターゲットマッチングの限界を明らかにする。
論文 参考訳(メタデータ) (2026-08-18T15:23:06Z) - KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation [53.952294884822955]
大規模言語モデル(LLM)APIは、顧客の認証を別々に行うが、多くの場合、共有プロバイダ認証を通じて要求を転送する。
KeyPoolingは、キャッシュのルックアップと書き込みを通じて顧客のアイデンティティをトレースする測定方法である。
すべての顧客がプロバイダ強化されたドメインに入る必要があります。
論文 参考訳(メタデータ) (2026-08-18T08:12:34Z) - Learning Agent Execution for KV-Cache Management in Agentic Serving [25.021363822677515]
マルチエージェントLLMサービスのためのエージェント対応KV-cacheランタイム層であるCacheScoutを提案する。
鍵となる洞察は、将来のKV-cacheの再利用は、キャッシュのレイテンシ単独ではなく、エージェントの実行セマンティクスによって管理されることである。
CacheScout は KV-cache のヒット率を 10-18 ポイント改善し,平均 TTFT を 18-45% 削減し,平均 TTFT を 29-38% 削減し,ピークスループットを 57% 向上させることを示した。
論文 参考訳(メタデータ) (2026-07-16T22:28:19Z) - MEME: Multi-entity & Evolving Memory Evaluation [76.57263966646404]
MEMEは、マルチエンタリティと進化する軸によって定義される全空間にまたがる6つのタスクを定義している。
3つの記憶パラダイムにまたがる6つの記憶システムの評価。
デフォルト設定の下では、すべてのシステムが依存性の推論で崩壊しているのが分かります。
論文 参考訳(メタデータ) (2026-05-12T17:55:10Z) - StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving [0.0]
StepCacheはバックエンドに依存しないステップレベルの再利用レイヤで、出力を順序付けられたステップに分割します。
StepCacheは、選択的パッチによって失敗したリージョンのみを再生する。
平均レイテンシは2.13秒から0.67秒、中央レイテンシは2.42秒から0.01秒、p95レイテンシは3.38秒から3.30秒に減少する。
論文 参考訳(メタデータ) (2026-03-24T17:19:26Z) - Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks [1.2292307778008844]
本稿では,3大言語モデル(LLM)プロバイダ間でのプロンプトキャッシュの総合評価について述べる。
以上の結果から,プロンプトキャッシングによりAPIコストが45~80%削減され,プロバイダ間で13~31%短縮された。
論文 参考訳(メタデータ) (2026-01-09T18:41:57Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - MeanCache: User-Centric Semantic Caching for LLM Web Services [8.350378532274405]
キャッシングは、繰り返しクエリの推論コストを削減するための自然なソリューションである。
本稿では,LLMベースのサービスのためのユーザ中心セマンティックキャッシュであるMeanCacheを紹介する。
MeanCacheは、セマンティックに類似したクエリを特定して、キャッシュヒットやミスを判定する。
論文 参考訳(メタデータ) (2024-03-05T06:23:50Z) - DSI++: Updating Transformer Memory with New Documents [95.70264288158766]
DSI++は、DSIが新たなドキュメントをインクリメンタルにインデクシングするための継続的な学習課題である。
新たな文書の連続的な索引付けは,それまでの索引付け文書をかなり忘れてしまうことを示す。
文書の擬似クエリをサンプルとして生成メモリを導入し、連続的なインデックス付け中に補足することで、検索タスクの忘れを防止する。
論文 参考訳(メタデータ) (2022-12-19T18:59:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。