論文の概要: Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression
- arxiv url: http://arxiv.org/abs/2608.04569v1
- Date: Wed, 05 Aug 2026 07:58:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.781712
- Title: Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression
- Title(参考訳): 関連性はあるものの不完全性:ハードプロンプト圧縮におけるパラダイムレベル障害モードとしての参照ダンピング
- Authors: Zhengpei Hu, Kai Li, Dapeng Fu, Xuechao Zou, Yuanhao Tang, Yue Li, Tengfei Cao, Jianqiang Huang,
- Abstract要約: 保持されたテキストが応答を含む場合、削除されたテキストは、それを解釈するために必要なエンティティを定義し、結果参照ダングリングを呼び出します。
提案手法では, 省略文に対して, 保持テキストの解釈が必要か否かを判断し, アノテーションを推論時にサポートせずに上位候補を再試行する。
- 参考スコア(独自算出の注目度): 18.435649248662944
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hard prompt compression reduces long-context inference cost by independently scoring tokens, sentences, or chunks and retaining the highest-scoring units under a budget. We identify a structural failure in this procedure: independent selection can split dependent evidence pairs, retaining one member while deleting the other. When retained text contains an answer but deleted text defines the entity needed to interpret it, we call the result referential dangling. At a compression ratio of 0.30, Beaver, which ranks coherent chunks using Qwen3-0.6B embeddings, leaves the answer path incomplete in 34-54% of bridge examples across three multi-hop question answering datasets. On a shared HotpotQA bridge set, all six hard compressors we test exhibit dangling at rates up to 60%, and every document in LongBench-v2 Single-Document QA contains at least one dangling reference. On dangling examples evaluated with Qwen3-8B, reinserting the missing supporting paragraph while removing nonsupporting paragraphs to maintain the token budget improves accuracy by 29-34 percentage points (p < 0.0001), recovering at least 88% of the gap to contexts retaining both supporting paragraphs. Stronger answer models do not absorb the loss: on MuSiQue, GPT-5.5 is 8.8 points less accurate on compressed contexts than on contexts retaining both supporting paragraphs. Finally, we train a compact classifier to rank omitted sentences by whether they are needed to interpret retained text and reinsert the top-ranked candidates without support annotations at inference. On HotpotQA with Qwen3-8B, this automatic restoration improves accuracy by 4.7 points while changing the compression ratio only from 0.30 to 0.31. Hard compressors should optimize both relevance and referential completeness.
- Abstract(参考訳): ハードプロンプト圧縮は、トークン、文、チャンクを独立してスコア付けし、予算の下で最高水準の単位を保持することで、長いコンテキスト推論コストを削減する。
独立した選択は、依存するエビデンスペアを分割し、一方のメンバを保持し、もう一方のメンバを削除できる。
保持されたテキストが応答を含んでいるが、削除されたテキストがそれを解釈するために必要なエンティティを定義する場合、結果参照ダングリングを呼び出します。
圧縮比0.30で、Qwen3-0.6B埋め込みを用いてコヒーレントチャンクをランク付けするBeaverは、3つのマルチホップ質問応答データセットの34-54%のブリッジ例で解答パスが不完全である。
共有HotpotQAブリッジセットでは、6つのハード圧縮機が最大60%の速度でダングリングし、LongBench-v2 Single-Document QAの各文書には少なくとも1つのダングリング参照が含まれている。
Qwen3-8Bで評価したダングリング例では,非支持段落を除去してトークン予算を維持することにより,29~34ポイント(p < 0.0001)の精度が向上し,両支持段落を保持する文脈に対するギャップの少なくとも88%が回復する。
強い解答モデルは損失を吸収しない: MuSiQue では、GPT-5.5 は圧縮された文脈では両段落を保持する文脈よりも8.8 ポイント精度が低い。
最後に,コンパクトな分類器を訓練して省略文のランク付けを行う。そこでは,保持テキストの解釈が必要かどうかを判断し,推論時にアノテーションをサポートせずに上位候補を再試行する。
Qwen3-8BのHotpotQAでは、圧縮比を0.30から0.31に変更し、精度を4.7ポイント向上させる。
ハード圧縮機は、関連性と参照完全性の両方を最適化する必要がある。
関連論文リスト
- ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation [72.54604107217669]
textscpass@$k$は圧縮後にほぼ消滅するが、textscpass@$k$は繰り返しサンプリングの下でほぼ回復する。
回復は、密集したトークンレベルの監督の下で、圧縮されたモデル自身のオン政治状態で訓練すべきである。
我々は,教師が確認した反復接尾辞を検知する短時間のOPDスケジュールであるtextbfshortopdを提案する。
論文 参考訳(メタデータ) (2026-07-14T17:50:50Z) - How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit [5.366718741784969]
KV-cache圧縮法は、圧縮前にコンテキストに付加されたクエリで主に評価される。
本稿では,3つの自明なベースラインに対する6つの圧縮手法の一致した予算監査について述べる。
論文 参考訳(メタデータ) (2026-07-11T09:30:35Z) - Length Penalties Make Chain-of-Thought Less Monitorable [0.0]
長いペナルティのトレーニングは、ステアリングモデルのヒントを誤解させるのを止めない。
ターゲット鎖長の異なるQwen3-4BとQwen3-14Bを訓練する。
MMLU-Pro-Rと4つの転送ベンチマークのバイアスヒント介入による評価を行った。
論文 参考訳(メタデータ) (2026-07-08T14:18:26Z) - What Survives Into Context: A Diagnostic for Budget-Constrained Multi-Hop RAG and When Submodular Evidence Packing Improves It [0.0]
文書のリコールは、固定された読者コンテキスト予算で最適化するのに間違った量である、と我々は主張する。
本報告では,ゴールドの回答が,読解コンテキストの連続したスパンとして存続するかどうかを判定する診断手法である「in-in-context」を導入する。
i)マルチホップ補完構造、(ii)エビデンスを表わす検索、(iii)バインドだが極端な予算ではない検索、(iv)読み出し能力ではなく、証拠密度がボトルネックとなるほど弱くなること。
論文 参考訳(メタデータ) (2026-07-01T10:12:15Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - Fixed RAG Compression Collapses Measured Reader Scaling [2.9089118242427627]
固定圧縮は、読者のアップグレードを隠蔽し、モデルランキングを逆転させながら平均精度を高めることができることを示す。
これは177,000行の行レベルの圧縮トランジションに基づいて構築されたツールキットで、1日で3人の読者と監査読者のスケーリングを行います。
論文 参考訳(メタデータ) (2026-06-20T00:04:31Z) - Context Compression Is Not One Thing: Readable Symbolic Re-expression vs. Coherent Summary at Matched Budget [0.0]
本研究では,小言語モデルを用いたマルチホップ質問応答の文脈圧縮について検討する。
本稿では,検索した文を構造化エンティティ関連文に書き換える可読な記号形式であるTelegraph Englishを提案する。
MuSiQue、TwoWiki、HotpotQAの制御実験では、Telegraph Englishは3つの一致した予算圧縮ベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-12T18:27:23Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - Span Pointer Networks for Non-Autoregressive Task-Oriented Semantic
Parsing [55.97957664897004]
seq2seq、非自動回帰的、タスク指向を構築するための効果的なレシピは、3つのステップで発話とセマンティックフレームをマッピングする。
これらのモデルは通常、長さ予測によってボトルネックとなる。
本研究では,デコードタスクをテキスト生成からスパン予測へシフトさせる非自己回帰手法を提案する。
論文 参考訳(メタデータ) (2021-04-15T07:02:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。