論文の概要: KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling
- arxiv url: http://arxiv.org/abs/2607.09153v1
- Date: Fri, 10 Jul 2026 07:16:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.804269
- Title: KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling
- Title(参考訳): KV-PRM:マルチエージェントテスト時間スケーリングのためのKVキャッシュ転送による効率的なプロセスリワードモデリング
- Authors: Peng Kuang, Haibo Jin, Xiaoyu Han, Yanli Wang, Xiaopeng Yuan, Ye Yu, Kaidi Xu, Haohan Wang,
- Abstract要約: プロセス・リワード・モデル(PRM)はテスト・タイム・スケーリング(TTS)手法を導くのに非常に効果的であることが証明されている。
既存のPRMはテキストベースで、トラジェクトリのテキスト全体をスクラッチから再エンコードする。
長いマルチエージェントロールアウトでは、シークエンス長さLに対して2次的に増大するスコアリングコストが、深刻な計算ボトルネックを生み出します。
我々は,KVキャッシュを直接読み取ることで,重文の復号化を解消する,高効率なプロセス報酬モデルであるKV-PRMを紹介する。
- 参考スコア(独自算出の注目度): 43.43702580827712
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Process Reward Models (PRMs) have been proven to be highly effective in guiding test-time scaling (TTS) methods, which significantly boost the capabilities of LLM-based multi-agent systems. However, existing PRMs are text-based: they re-encode the entire trajectory text from scratch. In long multi-agent rollouts, the scoring cost, growing quadratically with respect to sequence length L, creates a severe computational bottleneck, severely limiting PRMs' application in long-context scenarios. To resolve this, we introduce KV-PRM, a highly efficient process reward model that eliminates the heavy text re-encoding by directly reading the KV cache produced naturally during the LLM's generation phase. By processing a single "verify token" against the pre-existing KV cache, KV-PRM reduces the scoring cost from O(L^2) to O(L). We formally prove that the KV cache contains strictly greater information capacity than text, and is more efficient for downstream reward modeling. Empirically, across the MATH, GSM8K, and AIME benchmarks, KV-PRM matches or strictly outperforms text-PRMs under various TTS methods such as Beam Search, MCTS, and Weighted Voting, with up to a 5,000x reduction in scoring FLOPs, a 37x reduction in latency, and a 34x reduction in per-sequence memory footprint compared to text-based PRMs.
- Abstract(参考訳): プロセス・リワード・モデル(PRM)はテスト・タイム・スケーリング(TTS)手法の指導に非常に効果的であることが証明されており、LLMベースのマルチエージェントシステムの能力を大幅に向上させる。
しかし、既存のPRMはテキストベースであり、トラジェクトリのテキスト全体をスクラッチから再エンコードする。
長いマルチエージェントロールアウトでは、シークエンス長Lに対して2次的に増大するスコアリングコストが深刻な計算ボトルネックを生み出し、長期コンテキストシナリオにおけるPRMの応用を著しく制限する。
そこで本研究では,LLM生成時に生成したKVキャッシュを直接読み取ることで,高効率なプロセス報酬モデルであるKV-PRMを導入する。
KV−PRMは、既存のKVキャッシュに対して1つの「検証トークン」を処理することにより、スコアリングコストをO(L^2)からO(L)に削減する。
我々は、KVキャッシュがテキストよりも厳密な情報容量を持つことを正式に証明し、下流の報酬モデリングにおいてより効率的であることを示す。
実証的には、MATH、GSM8K、AIMEのベンチマークにおいて、KV-PRMはビームサーチ、MCTS、Weighted Votingといった様々なTTS手法でテキストPRMを厳密に上回り、FLOPのスコアの最大5000倍、レイテンシの37倍、テキストベースのPRMに比べてシーケンス毎のメモリフットプリントの34倍に減少する。
関連論文リスト
- RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse [5.597099794399441]
RelayCachingはトレーニング不要な推論手法で、前のエージェントから復号フェーズKVキャッシュを直接再利用する。
RelayCachingは80%以上のKVキャッシュの再利用を実現し、TTFTを標準パイプラインと比較して最大4.7倍のコストで削減できることを示す。
論文 参考訳(メタデータ) (2026-02-28T04:46:28Z) - ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs [1.1267872663780352]
大規模言語モデル(LLM)は、超長期のコンテキスト推論を必要とするシナリオにますますデプロイされている。
既存のメモリ削減技術、例えば消去や量子化は、しばしば静的キャッシュに依存している。
キャッシュされたトークンに精度レベルを動的に割り当てる軽量で適応的なフレームワークARKVを提案する。
論文 参考訳(メタデータ) (2026-02-19T16:24:08Z) - SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models [25.509962883211]
大きな推論モデル(LRM)は、チェーン・オブ・ソート(CoT)推論プロセスで線形に成長するため、重要なキー値(KV)キャッシュのオーバーヘッドがかかることが多い。
粗い文レベルのシーケンスを除去するKV圧縮手法である textbfSkipKV を提案する。
論文 参考訳(メタデータ) (2025-12-08T19:32:06Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - HACK: Homomorphic Acceleration via Compression of the Key-Value Cache for Disaggregated LLM Inference [24.068304021577358]
Disaggregated Large Language Model (LLM) 推論は、計算集約型プリフィルステージとメモリ集約型デコードステージを分離する。
キーバリュー(KV)データを2つのステージ間で送信することは、特に長いプロンプトにおいてボトルネックとなる可能性がある。
分散LDM推論のためのKVキャッシュ(HACK)の圧縮によるホモモルフィック高速化を提案する。
論文 参考訳(メタデータ) (2025-02-05T20:09:51Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。