論文の概要: Preserving What Matters: Semantic Scaffolds Beyond Saturation in Summarization Evaluation
- arxiv url: http://arxiv.org/abs/2609.22603v2
- Date: Wed, 23 Sep 2026 14:49:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.657072
- Title: Preserving What Matters: Semantic Scaffolds Beyond Saturation in Summarization Evaluation
- Title(参考訳): 重要事項の保存: 要約評価における飽和を超えるセマンティック・サッフルズ
- Abstract要約: 本稿では,テキストから事実,質問,エンティティ属性の階層的表現を抽出する評価フレームワークであるSemantic Scaffoldを紹介する。
FPS(Fact Preservation Score)、QPS(Q Question Preservation Score)、EPS(Entity Preservation Score)の3つの診断基準を導出する。
ROUGE と LLM-as-judge の4つの繰り返し故障モードを解析し,従来の測定基準が崩壊した場合の足場に基づく評価が有益であることを実証した。
- 参考スコア(独自算出の注目度): 3.16442030072367
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Summarization ships in countless production systems, making model selection a routine decision that depends on measuring summary quality. Existing metrics struggle to support this: ROUGE captures only surface overlap, while LLM-as-judge scores saturate to near-identical values that fail to rank models effectively. We observe this saturation across three public datasets, two proprietary datasets, and multilingual settings. Motivated by this, we introduce Semantic Scaffold, an evaluation framework that extracts a hierarchical representation of facts, questions, and entity attributes from a source text, labeling each as a main point or supporting detail, and reusing this structure as a fixed reference for scoring summaries. From this representation, we derive three diagnostic metrics: Fact Preservation Score (FPS), Question Preservation Score (QPS), and Entity Preservation Score (EPS), designed to reward the preservation of essential information while penalizing detail overload, and position them as interpretable diagnostics that remain informative where holistic axes collapse. Finally, we analyze four recurring failure modes of ROUGE and LLM-as-judge scores, demonstrating that scaffold-based evaluation remains informative where conventional metrics collapse.
- Abstract(参考訳): 要約は無数の生産システムに出荷され、モデル選択は要約品質の測定に依存する日常的な決定となる。
ROUGEは表面のオーバーラップのみをキャプチャし、LSM-as-judgeスコアは、モデルを効果的にランク付けできないほぼ同一の値に飽和する。
この飽和は、3つのパブリックデータセット、2つのプロプライエタリデータセット、多言語設定にまたがる。
そこで,本論文では,本文から事実,質問,エンティティ属性の階層的表現を抽出し,各属性を主点としてラベル付けし,詳細を裏付ける評価フレームワークであるSemantic Scaffoldを紹介し,この構造を要約評価のための固定基準として再利用する。
この表現から,Fact Preservation Score (FPS), Question Preservation Score (QPS), Entity Preservation Score (EPS)の3つの診断指標を導出した。
最後に, ROUGE と LLM-as-judge の4つの繰り返し故障モードを解析し, 従来の測定基準が崩壊した場合の足場に基づく評価が有益であることを実証した。
関連論文リスト
- The RAT: A Unified Bayesian Model for RAG Evaluation [8.650407684623714]
本稿では,検索成功,棄却行動,回答正当性を共同でモデル化するベイズ評価フレームワークを提案する。
フレームワークを3つのデータセット、3つのレトリバー、3つのジェネレータにわたる27のRAG構成に適用する。
我々は、LLM-as-a-judgeアノテーションをキャリブレーションされたノイズ観測として組み込むようモデルを拡張した。
論文 参考訳(メタデータ) (2026-08-25T15:54:30Z) - ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - Re-FRAME the Meeting Summarization SCOPE: Fact-Based Summarization and Personalization via Questions [9.381476258394175]
本稿では,要約をセマンティックエンリッチメントタスクとして再構成するモジュールパイプラインFRAMEを紹介する。
FRAMEは健全な事実を抽出し、それらを主題的に整理し、それらを抽象的な要約にまとめる。
要約をパーソナライズするために、コンテンツ選択の前に9つの質問に答えることにより、推論トレースをモデルに構築する、推論アウトルードプロトコルであるSCOPEを導入する。
論文 参考訳(メタデータ) (2025-09-19T11:58:17Z) - Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs [38.837810490068556]
大規模言語モデル(LLM)におけるアンラーニングは、指定されたデータを削除することを目的としているが、その効果は通常、正確性や複雑度のようなタスクレベルのメトリクスで評価される。
最小限の微調整によって元の動作が容易に復元される間、モデルは忘れることができることを実証する。
この表現可能性の現象は、情報は単に抑圧されているだけであり、真に消去されていないことを示唆している。
論文 参考訳(メタデータ) (2025-05-22T16:02:10Z) - GUM-SAGE: A Novel Dataset and Approach for Graded Entity Salience Prediction [12.172254885579706]
格付けされたエンティティサリエンス(英語版)は、テキストにおける相対的な重要性を反映したエンティティスコアを割り当てる。
両アプローチの強みを組み合わせた,格付けされたエンティティ・サリエンスのための新しいアプローチを提案する。
提案手法は,人間の要約やアライメントに基づくスコアとの相関が強く,既存の手法よりも優れていた。
論文 参考訳(メタデータ) (2025-04-15T01:26:14Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - Discover, Explanation, Improvement: An Automatic Slice Detection
Framework for Natural Language Processing [72.14557106085284]
スライス検出モデル(SDM)は、データポイントの低パフォーマンスなグループを自動的に識別する。
本稿では,NLPタスクの分類のための "Discover, Explain, improve (DEIM)" というベンチマークを提案する。
評価の結果,Edisaは情報的セマンティックな特徴を持つ誤り発生データポイントを正確に選択できることがわかった。
論文 参考訳(メタデータ) (2022-11-08T19:00:00Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z) - Abstractive Query Focused Summarization with Query-Free Resources [60.468323530248945]
本稿では,汎用的な要約リソースのみを利用して抽象的なqfsシステムを構築する問題を考える。
本稿では,要約とクエリのための新しい統一表現からなるMasked ROUGE回帰フレームワークであるMargeを提案する。
最小限の監視から学習したにもかかわらず,遠隔管理環境において最先端の結果が得られた。
論文 参考訳(メタデータ) (2020-12-29T14:39:35Z) - Structured Prediction with Partial Labelling through the Infimum Loss [85.4940853372503]
弱い監督の目標は、収集コストの安いラベル付け形式のみを使用してモデルを学習できるようにすることである。
これは、各データポイントに対して、実際のものを含むラベルのセットとして、監督がキャストされる不完全なアノテーションの一種です。
本稿では、構造化された予測と、部分的なラベリングを扱うための無限損失の概念に基づく統一的なフレームワークを提供する。
論文 参考訳(メタデータ) (2020-03-02T13:59:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。