論文の概要: When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs
- arxiv url: http://arxiv.org/abs/2608.04893v1
- Date: Wed, 05 Aug 2026 14:18:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.958668
- Title: When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs
- Title(参考訳): リレーKVキャッシュのマルチエージェントLCMにおける因果監査
- Authors: Jiaming Cheng, Subhransu Das, Rajiv Ramnath,
- Abstract要約: マルチエージェントLLMシステムは、テキストの代わりにキー値キャッシュをリレーし、その利得を交換された潜在思想に信用する」。
リリースされたシステムで慎重に監査します。
- 参考スコア(独自算出の注目度): 5.329759624351636
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent LLM systems relay key--value caches instead of text and credit their gains to exchanged ``latent thoughts''. That credit is a claim about \emph{which} example's cache is relayed, not merely that one is. We audit it causally in released systems. The cache is replaced with deranged (mismatched-example), zeroed, and moment-matched random counterparts, under two regimes defined by whether the receiver needs the sender's private information. Where it does, the battery reads ceiling: 100\% against 23--25\% for answer-irrelevant relays on the primary backbone, a contrast replicated across three families, five checkpoints, and a prose document-QA surface. Where it does not, a pre-registered five-seed protocol establishes equivalence within 2.8 points, a margin anchored to the audited system's reported gain, under Holm-corrected TOST on GSM8K and ARC-Challenge across three Qwen3 scales and on MedQA at 8B (one cell shows a small detected advantage inside the margin); a second family shows no detected advantage. A large cache effect need not be a pairing effect. In one natural cell, zeroing the relay costs 14.7 points; a mismatched cache, 0.4. Nor is need sufficient: under the same test, delivered channels span ceiling (LatentMAS's native relay), partial (KVComm's layer subset), and no detected example-specific transfer (C2C's released projector). Benchmark deltas do not by themselves establish latent-thought transmission; establishing it takes a mismatched-cache audit, which we release.
- Abstract(参考訳): マルチエージェント LLM システムは、テキストの代わりにキー値キャッシュをリレーし、 ' `latent thoughts'' と交換する。
このクレジットは \emph{which} の例のキャッシュがリレーされているという主張であり、単にそのものであるわけではない。
リリースされたシステムで慎重に監査します。
キャッシュは、受信側が送信側の個人情報を必要とするかどうかで定義された2つの条件の下で、非分散化(ミスマッチした例)、ゼロ化、およびモーメントマッチングされたランダムな値に置き換えられる。
メインのバックボーンの応答非関連リレーは、100-%対23-25-%、コントラストは3つのファミリー、5つのチェックポイント、5つのドキュメント-QA面で再現される。
その場合、事前登録された5シードプロトコルは2.8ポイント以内の等価性を確立し、GSM8KとARC-Challengeのホルム補正TOST、Qwen3スケールの3つのQwen3スケール、MedQAの8BでのMedQA(一方のセルはマージン内で小さな検出された優位性を示す)では、2番目のファミリーは検出された優位性を示しない。
大きなキャッシュ効果はペアリング効果である必要はない。
1つのナチュラルセルでは、リレーのゼロ化は14.7ポイント、ミスマッチキャッシュは0.4である。
同じテストでは、配信チャネルが天井(LatentMASのネイティブリレー)、部分(KVCommのレイヤサブセット)、検出されたサンプル固有の転送(C2Cのリリースプロジェクタ)が不要である。
ベンチマークデルタは、それ自体が潜在思想の伝達を確立していない。
関連論文リスト
- Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention [0.48342038441006796]
本稿では,入力が新規である場合にのみスロットを割り当てるスパースキャッシュについて検討する。
固定濃度の静的キャッシュと,最近の新規性率に追従したサプライズ適応変種という2つの形態で開発する。
論文 参考訳(メタデータ) (2026-07-10T18:28:21Z) - Re-feeding Is Not Replaying: Measuring Replay Noise in Counterfactual Token-Credit Estimation [0.0]
言語モデルのロールアウトにおいて、どのトークンが最終回答が正しいか間違っているかを尋ねる。
我々は、この仮定がストック推論エンジンのコストを3パスの設計で測定する。
6つの構成と3つのモデルにまたがって、リフィーディングはレプリカフロアよりも14-28ポイント高いレートでクレジットの見積もりを変更する。
論文 参考訳(メタデータ) (2026-06-14T06:09:16Z) - RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference [0.0]
トレーニングフリー推論フレームワークであるRKSC(Reasoning-Aware KV Cache Sharing)を紹介する。
マルチブランチLPM推論パイプラインにおける2つの構造的冗長性を取り除く。
RKSCは、No-KVベースライン上での平均速度を3.008倍に向上させる。
論文 参考訳(メタデータ) (2026-06-07T21:36:20Z) - Auditing CoT Answer-Hijack Patches: Source-Control Certificates with Type-I Guarantees [0.0]
Chain-of- Thought (CoT) の回答ハイジャックテンプレートは GSM8K または MATH-500 上で 7B-8B 言語モデルの最終数値を反転させることができる。
クリーンソースパッチの成功は、しばしば、パッチされたアクティベーションが回復したコンテンツを運ぶ証拠として読まれる。
我々は,各候補パッチを事前登録されたType-I保証付きソース制御証明書に変換する監査を構築する。
論文 参考訳(メタデータ) (2026-06-03T10:49:43Z) - Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer? [0.0]
我々は、4つの安価なゲートが同時に保持されている場合にのみキャッシュされた応答を許容するエビデンス検証キャッシュルータであるGroundedCacheを提案する。
我々は、ヒットレートだけでなく、キャッシュ安全性をストレステストする6段階のワークロードを構築し、オペレーター向けメトリックであるunsafe-served rate (USR)を導入する。
2つのデータセットと12,000の実LLM世代(Qwen2.5-7B-Instruct on vLLM with Automatic Prefix Caching)、GroundedCacheはUSRをすべてのHotpotQAシステムで0.0%、mtRAGドキュメントドリフトで1.5%まで駆動する。
論文 参考訳(メタデータ) (2026-05-26T16:50:02Z) - Good Agentic Friends Do Not Just Give Verbal Advice: They Can Update Your Weights [58.27172968382275]
マルチエージェントLLMシステムは、通常自然言語メッセージを交換することで協調する。
送信者のメッセージを受信者のコンテキストに付加する代わりに、送信者の隠された状態を過渡的で受信者固有の重み摂動にコンパイルする。
論文 参考訳(メタデータ) (2026-05-13T17:58:32Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。