論文の概要: KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation
- arxiv url: http://arxiv.org/abs/2608.17485v2
- Date: Sun, 23 Aug 2026 04:39:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:42.73226
- Title: KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation
- Title(参考訳): KeyPooling: LLM APIの遅延パスを計測する
- Authors: Bowen Sun, Yixi Cai, Xiaogeng Liu, Zhengyue Zhao, Yinzhi Cao, Chaowei Xiao,
- Abstract要約: 大規模言語モデル(LLM)APIは、顧客の認証を別々に行うが、多くの場合、共有プロバイダ認証を通じて要求を転送する。
KeyPoolingは、キャッシュのルックアップと書き込みを通じて顧客のアイデンティティをトレースする測定方法である。
すべての顧客がプロバイダ強化されたドメインに入る必要があります。
- 参考スコア(独自算出の注目度): 53.952294884822955
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) API relays authenticate customers separately but often forward requests through shared provider credentials. Providers scope prompt caches to upstream principals and namespaces, so relay customers mapped to one cache identity can observe each other's cache state. Prior work showed cache sharing at selected endpoints but did not identify which credential, pool, adapter, or nested hop controls the finalidentity. We present KeyPooling, a measurement method that traces customer identity through cache lookup and write, verifies runtime transformations, and tests one predicted identity component at a time. Across five open-source gateways connected to OpenAI and Anthropic, none bound customers to upstream credentials by default; under a shared credential, all five exposed cross-customer cache reads for both providers. Principal and namespace splits, pool associations, and adapter and nested-relay contrasts localized the controlling transformations. In an outcome-independent weekly OpenRouter frame, tests covered 80.5% of eligible token volume and found cross-account reads for 12 of 28 labels carrying 33.7% of volume. On one production route, a controlled procedure recovered eight consecutive target positions without target access. Broader tests identify cache granularity, routing, rate limits, attribution, and budget as conditions for token-by-token recovery, not security controls. We derive a defense contract: every customer must enter a provider-enforced domain, or a namespace derived from authenticated identity must survive every final cache lookup and write. Placing this split after reusable public prefixes preserved most modeled reuse at a 1.7-2.5% cost increase.
- Abstract(参考訳): 大規模言語モデル(LLM)APIは、顧客の認証を別々に行うが、多くの場合、共有プロバイダ認証を通じて要求を転送する。
プロバイダのスコープは、アップストリームのプリンシパルとネームスペースにキャッシュをプロンプトするので、リレーの顧客は、1つのキャッシュIDにマップされ、互いのキャッシュ状態を監視できる。
以前の作業では、選択したエンドポイントでキャッシュ共有が見られたが、どのクレデンシャル、プール、アダプタ、ネストされたホップが最終的なアイデンティティを制御するかを特定できなかった。
KeyPoolingは、キャッシュのルックアップと書き込みを通じて顧客のアイデンティティをトレースし、実行時の変換を検証し、予測された1つのIDコンポーネントを一度にテストする。
OpenAIとAnthropicに接続された5つのオープンソースゲートウェイにまたがって、顧客はデフォルトでアップストリーム認証に縛られることはない。
主および名前空間の分割、プールアソシエーション、アダプタと入れ子リレーは、制御変換をローカライズする。
結果に依存しない毎週のOpenRouterフレームでは、テストは80.5%のトークンボリュームをカバーし、33.7%のボリュームを持つ28のラベルのうち12のクロスアカウントの読み込みが見つかった。
1つの生産経路では、制御された手順が目標アクセスなしで8つの連続的な目標位置を回収した。
より広いテストでは、セキュリティコントロールではなく、キャッシュの粒度、ルーティング、レート制限、属性、予算をトークン単位のリカバリの条件として特定する。
すべての顧客がプロバイダ強化されたドメインを入力しなければなりません。あるいは認証されたIDから派生した名前空間は、最終的なキャッシュのルックアップと書き込みのたびに生き残らなければなりません。
再利用可能な公的な接頭辞の後、この分割は1.7-2.5%のコスト増加で最もモデル化された再利用を保存した。
関連論文リスト
- Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference [0.0]
キーバリュー(KV)キャッシュは、現代の大言語モデル(LLM)推論における主要なスループット最適化である。
3つの攻撃がそれを悪用し、保護されていないvLLMとSGに対する攻撃の成功率が最大100%に達する。
我々は3つの攻撃ファミリーのプレフィックスキャッシュパスに対処するガバナンス層であるKVGovを紹介する。
論文 参考訳(メタデータ) (2026-08-10T07:47:57Z) - The Trust-Free Aggregation Layer of the Unicity Infrastructure [1.1766230941766413]
Unicityは、オフチェーンピアツーピアトークントランザクションの実行を可能にする、新たなブロックチェーンインフラストラクチャである。
インフラストラクチャの主要なコンポーネントは、トークンの消費状態に関する情報を格納するアグリゲーション・レイヤである。
我々の実装では、信頼されたセットアップを使わず、単一のコンシューマクラスCPU上で毎秒10,000の挿入とミリ秒の範囲検証のスループットを実現する。
論文 参考訳(メタデータ) (2026-08-05T18:18:16Z) - LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference [63.932718076408584]
LASTは、エッジクラウド協調MLLM推論におけるクエリ依存のビジュアルトークンプルーニングのための、トレーニング不要のフレームワークである。
完全な精度の95.4%を維持し、視覚トークンの12.5%しか保持せず、エッジ側の選択オーバーヘッドは低く、クラウド側の計算は少ない。
論文 参考訳(メタデータ) (2026-07-30T09:59:25Z) - GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents [61.50171793000712]
GateMemはマルチプリンシパル共有メモリエージェントのベンチマークである。
医療、事務、教育、家庭の領域にまたがる。
強力なユーティリティ、堅牢なアクセス制御、信頼性のある忘れを同時に実現する方法は存在しない。
論文 参考訳(メタデータ) (2026-06-17T09:06:15Z) - CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs [0.0]
本稿では,OpenのAPIゲートウェイアーキテクチャが,プロバイダレベルのインシデントキャッシュアイソレーション保証を回避可能な,インシデントキャッシュ脆弱性を導入したかどうかを検討する。
ほとんどの推論プロバイダは、データリークを防ぐために、アカウントごとまたは組織ごとのプロンプトキャッシュを実装していますが、Open経由のルーティングは、すべてのOpenユーザ間でグローバルキャッシュ共有を生成していますか?
論文 参考訳(メタデータ) (2026-05-28T22:06:54Z) - StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving [0.0]
StepCacheはバックエンドに依存しないステップレベルの再利用レイヤで、出力を順序付けられたステップに分割します。
StepCacheは、選択的パッチによって失敗したリージョンのみを再生する。
平均レイテンシは2.13秒から0.67秒、中央レイテンシは2.42秒から0.01秒、p95レイテンシは3.38秒から3.30秒に減少する。
論文 参考訳(メタデータ) (2026-03-24T17:19:26Z) - VA-DAR: A PQC-Ready, Vendor-Agnostic Deterministic Artifact Resolution for Serverless, Enumeration-Resistant Wallet Recovery [1.7429038786735553]
VA-DARはACE-GFベースのウォレットのための鍵付き発見プロトコルである。
ユーザが提供する識別子と単一のリカバリパスフレーズのみを使用して、デバイス間のリカバリをサポートする。
論文 参考訳(メタデータ) (2026-03-03T07:33:10Z) - Auditing Prompt Caching in Language Model APIs [77.02079451561718]
大規模言語モデル(LLM)における即時キャッシュによるプライバシリークについて検討する。
OpenAIを含む7つのAPIプロバイダのユーザ間でのグローバルキャッシュ共有を検出します。
OpenAIの埋め込みモデルがデコーダのみのトランスフォーマーであることの証拠が見つかりました。
論文 参考訳(メタデータ) (2025-02-11T18:58:04Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。