論文の概要: Highlight-Then-Summarize: Learning to Compress Evidence for Long-Context Understanding
- arxiv url: http://arxiv.org/abs/2609.31382v1
- Date: Fri, 25 Sep 2026 15:16:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.45327
- Title: Highlight-Then-Summarize: Learning to Compress Evidence for Long-Context Understanding
- Title(参考訳): Highlight-Then-Summarize:Long-Context Understandingのためのエビデンス圧縮学習
- Abstract要約: 本稿では,H2S(Highlight-Then-Summarize)を提案する。
H2Sは、ソースグラウンドで質問関連エビデンスを特定し、それをコンパクトで質問条件の要約に統合する。
7タスク長文スイートH2S-Benchについて検討した。
- 参考スコア(独自算出の注目度): 3.916405844749549
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context understanding requires large language models (LLMs) to reason over lengthy documents, conversations, and code, yet task-relevant evidence is often sparse and scattered amid substantial irrelevant and redundant content. We propose Highlight-Then-Summarize (H2S), a compress-then-reason paradigm that first identifies source-grounded, question-relevant evidence and then integrates it into a compact, question-conditioned summary before producing the final answer. To train this behavior, we construct H2S-Dataset, comprising 6,647 examples from 11 benchmark families with an average context length of 43.9K tokens, and introduce H2S-RL, which provides process-level rewards for evidence selection and summary construction in addition to final-answer correctness. We evaluate on H2S-Bench, a seven-task long-context suite. Under a shared 128K input and 4K output budget, H2S-14B achieves an average score of 32.60, outperforming Qwen3.8-27B by 10.17 points and obtaining the strongest overall result among the evaluated open-source models. H2S-14B also achieves the highest Evidence-Summary Quality score and retains 97.1% of its 16K-budget performance with only a 4K output budget. These results show that explicitly selecting and integrating evidence improves long-context reasoning while enabling more compact generation.
- Abstract(参考訳): 長いコンテキストの理解には、長い文書、会話、コードを推論するために大きな言語モデル(LLM)が必要であるが、タスク関連エビデンスはしばしば、相当に無関係で冗長なコンテンツの中でばらばらに散らばっている。
提案手法は,まず,原点と疑問関連エビデンスを識別し,最後に結論を出す前に,コンパクトで質問条件の要約に組み込む圧縮理論であるHighlight-Then-Summarize (H2S)を提案する。
この動作をトレーニングするために、平均コンテキスト長43.9Kの11のベンチマークファミリーから6,647個のサンプルで構成されたH2S-Datasetを構築し、最終回答の正しさに加えて、エビデンスの選択と要約構築のためのプロセスレベルの報酬を提供するH2S-RLを紹介した。
7タスク長文スイートH2S-Benchについて検討した。
共通の128K入力と4K出力予算の下で、H2S-14Bは平均スコア32.60を達成し、Qwen3.8-27Bを10.17ポイント上回り、評価されたオープンソースモデルの中で最も高い総合結果を得る。
H2S-14BはEvidence-Summary Qualityでも最高点に達し、4K出力予算のみで16K予算のパフォーマンスの97.1%を維持している。
これらの結果から,エビデンスを明示的に選択・統合することにより,よりコンパクトな生成が可能となる。
関連論文リスト
- Pay More Attention To Text In High-Resolution MLLMs [19.66158464093865]
EviSpecはトレーニング不要のコンパイラで、補完的なエビデンス仕様を導出しつつ、最終的な推論のための元の質問を保存します。
EviSpec は3つのベンチマークで対応するベースラインを一貫して改善し、それぞれ Vtextsuperscript*Bench, HR-Bench-4K, HR-Bench-8K でtextbf10.4%, 8.8%, 12.4% の平均相対的なゲインを得た。
論文 参考訳(メタデータ) (2026-09-20T09:30:05Z) - Decomposition-Enhanced Training for Post-Hoc Attributions In Language Models [64.49342399229529]
我々は、ポストホック帰属を推論問題として再編成し、回答を構成単位に分解し、それぞれ特定の文脈に結び付けることができると論じる。
DecompTuneは、モデルに中間的推論ステップとして解解分解を生成することを教えるポストトレーニング手法である。
DecompTuneは、広範な実験と改善を通じて、属性の品質を大幅に改善し、先行手法より優れ、最先端のフロンティアモデルに適合または超えている。
論文 参考訳(メタデータ) (2025-10-29T17:58:59Z) - Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts [20.901983944214532]
本研究では,長期の文脈から逐次情報を抽出する大規模言語モデルの能力を評価するためのベンチマークであるSequential-NIAHを紹介する。
ベンチマークには3つの針生成パイプラインが含まれている: 合成時間、実時間、実時間、実時間、コンテキストの長さは8Kから128Kである。
我々は6つのよく知られたLCM実験を行い、最も優れたモデルでさえ、このベンチマークのテストセットで63.50%の最大精度を達成できたことを明らかにした。
論文 参考訳(メタデータ) (2025-04-07T03:50:12Z) - CNNSum: Exploring Long-Context Summarization with Large Language Models in Chinese Novels [11.614599448394374]
CNNSumは,中国小説をベースとした多スケール長文要約ベンチマークである。
CNNSumは4つのサブセットにまたがって、合計695のサンプルで、長さは16kから128kである。
我々は、多数のLCMをベンチマークし、異常な出力タイプを要約するために詳細な人間の評価を行う。
論文 参考訳(メタデータ) (2024-12-03T20:35:57Z) - ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities [53.97515452727115]
ChatQA 2は、128Kコンテキストウィンドウを備えたLlama 3.0ベースのモデルである。
Llama3-70Bベースのコンテキストウィンドウを8Kから128Kまで拡張するためのトレーニングレシピを提案する。
RAGを用いた長文LLMの性能は,多数のチャンクを検索した場合に向上することがわかった。
論文 参考訳(メタデータ) (2024-07-19T17:35:47Z) - LV-Eval: A Balanced Long-Context Benchmark with 5 Length Levels Up to 256K [57.0244259406764]
LV-Evalは5つの長さレベルが256kまで達する長文の長文ベンチマークである。
LV-Evalの利点は、異なるコンテキストの長さにわたる制御可能な評価、紛らわしい事実を持つテストインスタンスへの挑戦、より客観的な評価である。
論文 参考訳(メタデータ) (2024-02-06T13:11:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。