論文の概要: PARTREP: Learning What to Repeat for Decoder-only LLMs
- arxiv url: http://arxiv.org/abs/2607.01792v1
- Date: Thu, 02 Jul 2026 07:07:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.714896
- Title: PARTREP: Learning What to Repeat for Decoder-only LLMs
- Title(参考訳): PartREP: デコーダのみのLLMで何を実行するかを学ぶ
- Abstract要約: PartRepは、最も情報性の高いトークンのみを付加する選択的な拡張方法である。
我々は、初期層隠れ状態から高NLLトークンを予測する軽量ゲートを訓練する。
PartRep は KV キャッシュの 59.4% と 79.0% のプレフィル FLOP を使用しながら、フル繰り返しの利益のほとんどを維持している。
- 参考スコア(独自算出の注目度): 12.053018926036678
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While decoder-only LLMs excel at a vast array of natural language tasks, it suffers from an asymmetric information flow induced by causal attention: later tokens are richer in contextual grounding than earlier ones. A simple and effective remedy is prompt repetition -- just appending a second copy of prompt before generation can redistribute grounding across positions and improve reasoning performance. However, full repetition of the original prompt doubles the KV cache footprint and quadruples attention cost during prefill, making it impractical for long-context settings. We propose PartRep, a selective augmentation method that appends only the most informative tokens -- rather than the entire prompt. We use token-wise negative log-likelihood (NLL) as a selection signal, motivated by the hypothesis that less predictable tokens are less recoverable from surrounding context and therefore benefit more from late-position repetition. To avoid the heavy cost of a full forward pass for scoring, we train a lightweight gate that predicts high-NLL tokens from early-layer hidden states, enabling token selection during mid-prefill via early exit. Across eight benchmarks (including MMLU, GSM8K, and RULER) and three model families (Qwen2.5, Llama3.2, Gemma4), PartRep retains most of the gains of full repetition while using only 59.4\% of its KV cache and 79.0\% of its prefill FLOPs.
- Abstract(参考訳): デコーダのみのLLMは、多くの自然言語タスクで優れているが、因果的注意によって引き起こされる非対称な情報フローに悩まされている。
生成前にプロンプトの2番目のコピーを追加するだけで、位置をまたいでグラウンドが再配布され、推論のパフォーマンスが向上する。
しかし、元のプロンプトの完全な繰り返しは、KVキャッシュのフットプリントを2倍にし、プリフィル時の注意コストを4倍にし、長いコンテキスト設定では実用的ではない。
提案するPartRepは,プロンプト全体ではなく,最も情報性の高いトークンのみを付加する,選択的拡張手法である。
トークン単位の負の対数類似度 (NLL) を選択信号として用いて, 予測可能なトークンの減少が周囲の状況から回復しにくく, 故意にレイトポジションの繰り返しによる恩恵が大きいという仮説に動機付けられている。
スコアリングのためのフルフォワードパスの重いコストを回避するため、初期層隠れ状態から高NLLトークンを予測する軽量ゲートを訓練し、初期出口を経由したプリフィル中のトークン選択を可能にする。
8つのベンチマーク(MMLU、GSM8K、RULERを含む)と3つのモデルファミリ(Qwen2.5、Llama3.2、Gemma4)のうち、PartRepはKVキャッシュの59.4\%とプリフィルFLOPの79.0\%しか使用せず、完全な繰り返しの利益のほとんどを保持している。
関連論文リスト
- Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers [76.15132587294862]
Wide-In, Narrow-Out (WINO) は、リボッキング可能な並列生成を可能にするトレーニング不要の復号アルゴリズムである。
WINO+は、WINOが生成した検証された認知軌道をモデルパラメータに注入し、トレーニングを効率的な推論と整合させる。
LLaDAとMMaDAの実験では、WINOは品質と効率の両方を改善し、WINO+はこの進歩をさらに強化している。
論文 参考訳(メタデータ) (2026-05-16T11:27:40Z) - Behavior-Equivalent Token: Single-Token Replacement for Long Prompts in LLMs [55.827877498548965]
単一プロンプト固有の振る舞い等価トークン([BE])を学習する軽量なトレーニングフレームワークを提案する。
フレームワークはまず[BE]に、元のシステムプロンプトの自然言語内容を再構成してエンコードし、その後、プロンプトの下流の振る舞いをこの単一のトークンに蒸留するように訓練する。
3つのデータセットに対する実証的な評価は、1つの[BE]トークンが3000倍の高速化を実現し、元のシステムの下流性能の約98%を維持していることを示している。
論文 参考訳(メタデータ) (2025-11-28T15:22:52Z) - Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models [22.525318796588568]
シンク・アット・ハード(Think-at-Hard, TaH)は、ハードトークンでのみ深く反復する動的潜在思考法である。
TaHは5つの挑戦的なベンチマークで推論のパフォーマンスを向上する。
論文 参考訳(メタデータ) (2025-11-11T18:57:02Z) - FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution [3.4666771782038652]
大規模言語モデル(LLM)は、その恒星の性能の大部分を入力コンテキストの拡大に負っているが、そのような冗長性は金銭的コスト、炭素フットプリント、推論時間の遅延を膨らませている。
本稿では,LLMのための新しいプロンプト圧縮フレームワークであるFrugalPromptを紹介する。
我々は,4つのNLPタスク(感性分析,コモンセンスQA,要約,数学的推論)にまたがるアプローチを評価する。
論文 参考訳(メタデータ) (2025-10-18T10:22:13Z) - Multipole Attention for Efficient Long Context Reasoning [64.94673641704289]
大規模推論モデル (LRM) は複雑な問題解決タスクにおいて有望な精度の向上を示す。
LRMは、答える前に考えるために、長い連鎖推論を生成する必要がある。
本稿では,重要なトークンに対してのみ正確に注意を払うことで,自己回帰推論を高速化するマルチポール注意法を提案する。
論文 参考訳(メタデータ) (2025-06-16T03:00:40Z) - Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning [53.57895922042783]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット(CoT)データに基づいて訓練された場合、推論と計画が優れている。
そこで我々は,遅延離散トークンを用いて推論過程を部分的に抽象化するハイブリッド表現を提案する。
論文 参考訳(メタデータ) (2025-02-05T15:33:00Z) - An Early FIRST Reproduction and Improvements to Single-Token Decoding for Fast Listwise Reranking [50.81324768683995]
FIRSTは、学習からランクへの目的を統合し、最初の生成されたトークンのみのロジットを活用する新しいアプローチである。
我々は、FIRSTの評価をTRECディープラーニングデータセット(DL19-22)に拡張し、様々な領域でその堅牢性を検証する。
我々の実験は、単一トークンの高速リランクは、ドメイン外リランクの品質を損なうものではないことを確認した。
論文 参考訳(メタデータ) (2024-11-08T12:08:17Z) - Mitigating the Learning Bias towards Repetition by Self-Contrastive
Training for Open-Ended Generation [92.42032403795879]
GPT2のような事前訓練された言語モデル(LM)は、繰り返しテキストを生成する傾向にあることを示す。
トークンレベルの反復確率の過大評価は学習バイアスに起因している。
LMは文レベルの繰り返しループの原因となる非繰り返しトークンよりも長い範囲依存を用いて繰り返しトークンを予測する。
論文 参考訳(メタデータ) (2023-07-04T07:53:55Z) - RetroMAE v2: Duplex Masked Auto-Encoder For Pre-Training
Retrieval-Oriented Language Models [3.4523793651427113]
本稿では,[] と通常のトークンの両方のコンテキスト化埋め込みにおける意味表現能力の向上を目標とする,二重マスク付き自動エンコーダ DupMAE を提案する。
DupMAEは単純だが経験的競争力があり、デコードコストが小さいため、モデルの表現能力と転送可能性に大きく貢献する。
論文 参考訳(メタデータ) (2022-11-16T08:57:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。