論文の概要: Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models
- arxiv url: http://arxiv.org/abs/2607.28979v1
- Date: Fri, 31 Jul 2026 03:07:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 16:35:22.215863
- Title: Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models
- Title(参考訳): 変換器の混合:不均一な大言語モデル間のKVキャッシュの変換
- Authors: Jin-woo Lee, Minkyung Song, Junghyun Oh, Seunghoon Han, Soyoung Park, Gwangseon Jang, Sungsu Lim,
- Abstract要約: Mixture-of-Translators (MoT)は、ソースLLMからターゲットLLMのキャッシュ空間にコンテキストKVキャッシュをマッピングするキャッシュ変換フレームワークである。
MoTはキャッシュ変換において競合する2つの障害モードに対処する。
実践的なケーススタディでは、MoTはマルチエージェント推論のための品質保存メモリの再利用を可能にし、長文キャッシュ拡張生成における直接コンテキスト品質の96.3%を維持している。
- 参考スコア(独自算出の注目度): 6.808338637726806
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Heterogeneous Large Language Model (LLM) systems increasingly rely on shared contexts, retrieved evidence, and multi-agent dialogue histories, yet their internal key-value (KV) caches remain model-specific and cannot be reused across architectures. Consequently, each model must repeatedly prefill or store caches for the same context, limiting the scalability of multi-model reasoning and long-context generation. We propose Mixture-of-Translators(MoT), a cache translation framework that maps context KV caches from a source LLM into the cache space of a target LLM. Unlike prior approaches that depend on a single projection path or global shared latent space, MoT uses multiple translator modules to capture diverse source--target mappings. To further reduce residual translation error, we introduce a Context Correction Loss that aligns the replayed target trajectory with the native target trajectory. We reveal two competing failure modes in cache translation: propagated translation shift from early injection and last-state shift from late injection. MoT addresses them through translator mixtures and target-side correction. Across homogeneous and heterogeneous translations among Qwen2.5, GPT-2, and OPT models, MoT preserves downstream QA performance, including Qwen2.5-7B-scale translation with 51.0% average closed-set QA accuracy and 0.43 average extractive QA F1. In practical case studies, MoT enables quality-preserving memory reuse for multi-agent reasoning and retains 96.3% of direct-context quality in long-context cache-augmented generation, demonstrating scalable KV cache reuse across heterogeneous LLMs.
- Abstract(参考訳): 不均一大言語モデル(LLM)システムは、共有コンテキスト、証拠の検索、マルチエージェント対話履歴にますます依存しているが、内部キー値(KV)キャッシュはモデル固有のままであり、アーキテクチャ全体にわたって再利用できない。
その結果、各モデルはキャッシュを同じコンテキストで繰り返しプリフィルまたは保存し、マルチモデル推論と長期コンテキスト生成のスケーラビリティを制限する必要がある。
我々は、ソースLLMからターゲットLLMのキャッシュ空間にコンテキストKVキャッシュをマッピングするキャッシュ翻訳フレームワークであるMixture-of-Translators(MoT)を提案する。
単一のプロジェクションパスやグローバル共有潜在空間に依存する従来のアプローチとは異なり、MoTは複数のトランスレータモジュールを使用して多様なソース-ターゲットマッピングをキャプチャする。
さらに残差翻訳誤差を低減するために,リプレイされたターゲット軌道とネイティブなターゲット軌道とを一致させるコンテキスト補正損失を導入する。
キャッシュ変換において競合する2つの障害モードを明らかにする。
MoTはそれらを翻訳器の混合物とターゲット側の補正によって処理する。
Qwen2.5, GPT-2, OPTモデル間の同種および異種変換全体にわたって、MoTは、平均クローズドセットQA精度51.0%、平均抽出QAF1.43を含む、下流QA性能を保っている。
実践的なケーススタディでは、MoTはマルチエージェント推論のための品質保存メモリの再利用を可能にし、長文キャッシュ拡張生成における直接コンテキスト品質の96.3%を保持し、異種LCM間でスケーラブルなKVキャッシュの再利用を実証する。
関連論文リスト
- Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation [39.51953946287085]
本稿では,このジレンマを非対称な双方向文脈で解決する新しいパラダイムであるBifocal dLLMsを紹介する。
60BトークンによるQwen3-1.7Bの継続事前トレーニング実験では、R2LMは双方向のdLLMよりも高いスループットで2.4times$から12.9times$1.9times$を達成することが示された。
論文 参考訳(メタデータ) (2026-06-26T05:26:11Z) - Enabling KV Caching of Shared Prefix for Diffusion Language Models [0.2740273306918099]
共有プレフィックスに対するキーバリュー(KV)キャッシュは、高スループットの大規模言語モデル(LLM)サービスに不可欠である。
拡散言語モデル(DLM)における共有プレフィックスのための最初のKVキャッシュ手法であるbicacheを提案する。
従来の精度崩壊のない手法と比較して,bicacheはサービススループットを36.3%~98.3%向上させることがわかった。
論文 参考訳(メタデータ) (2026-05-26T05:27:57Z) - Latent-Condensed Transformer for Efficient Long Context Modeling [60.72493959155964]
大規模言語モデルに対するLCA(Latent-Condensed Attention)を提案する。
LCAはMLAの潜伏空間内のコンテキストを凝縮し、表現はセマンティック潜伏ベクトルと位置キーに切り離される。
LCAは、最大2.5$times$プリフィルスピードアップと128Kコンテキストでの90%のKVキャッシュ削減を実現している。
論文 参考訳(メタデータ) (2026-04-14T08:40:31Z) - RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse [5.597099794399441]
RelayCachingはトレーニング不要な推論手法で、前のエージェントから復号フェーズKVキャッシュを直接再利用する。
RelayCachingは80%以上のKVキャッシュの再利用を実現し、TTFTを標準パイプラインと比較して最大4.7倍のコストで削減できることを示す。
論文 参考訳(メタデータ) (2026-02-28T04:46:28Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z) - KVShare: An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse [17.301289617498448]
マルチテナントシナリオ下で要求間でKVキャッシュを共有するKVキャッシュ管理モジュールを提案する。
KVShareはTTFTを最大9.39倍に削減し、完全なKV再計算に比べてスループットを1.2倍に向上させる。
KVShareはSOTA法に比べて精度が20.38%向上している。
論文 参考訳(メタデータ) (2025-03-17T16:43:35Z) - RustRepoTrans: Repository-level Code Translation Benchmark Targeting Rust [50.65321080814249]
RustRepoTransは、インクリメンタル翻訳をターゲットにした、最初のリポジトリレベルのコンテキストコード変換ベンチマークである。
複雑な翻訳シナリオの制約を評価するために, 7つの代表的なLLMを評価し, それらの誤差を分析した。
論文 参考訳(メタデータ) (2024-11-21T10:00:52Z) - Tight Integrated End-to-End Training for Cascaded Speech Translation [40.76367623739673]
カスケード音声翻訳モデルは、離散的および非微分可能転写に依存している。
直接音声翻訳は、誤りの伝播を避けるための代替手法である。
この研究は、カスケードコンポーネント全体を1つのエンドツーエンドのトレーニング可能なモデルにまとめることの可能性を探る。
論文 参考訳(メタデータ) (2020-11-24T15:43:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。