論文の概要: Averaging Bias: Human Faithfulness Annotations are not Locally Faithful
- arxiv url: http://arxiv.org/abs/2608.00205v1
- Date: Fri, 31 Jul 2026 18:39:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.359747
- Title: Averaging Bias: Human Faithfulness Annotations are not Locally Faithful
- Title(参考訳): 平均バイアス:人間の信条は局所的に信条ではない
- Abstract要約: 広く使用されている忠実度ベンチマークの人間ラベルには、測定可能な平均バイアスが含まれていることを示す。
我々の結果は、信頼できる人間のアノテーションのための注意深く構造化された設計を要求する。
- 参考スコア(独自算出の注目度): 12.06469264062117
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluation of faithfulness of text summarization treats a model generated summary as faithful only if every of its sentences is supported by the source document: a strict conjunctive rule under which a single unsupported sentence makes the whole summary unfaithful. Yet most faithfulness benchmarks collect only one global human annotation label per summary. We ask whether such global human labels actually implement the conjunctive rule. We hypothesize that annotators may accept a summary as faithful when most sentences are faithful, not only when all are faithful. To test our hypothesis, we use five large language model (LLM) judges as per-sentence raters across four widely used faithfulness benchmarks. We find that global human labels correlate better with the average of per-sentence LLM judgments than with the implementation of the strict conjunctive rule. A manual review confirms that a substantial fraction of summaries labeled faithful by humans contain genuine local factual errors. We call this tendency Averaging Bias. Our results reveal that human labels on widely used faithfulness benchmarks contain measurable Averaging Bias, calling for carefully structured designs for trustworthy human annotations
- Abstract(参考訳): テキスト要約の忠実さの評価は、生成した要約を、すべての文がソース文書によって支持されている場合にのみ忠実に扱う。
しかし、最も忠実なベンチマークは、要約ごとに1つのグローバルな人間のアノテーションラベルのみを収集する。
このようなグローバルな人間ラベルが実際に結束ルールを実装しているかどうかを問う。
我々は、ほとんどの文が忠実である場合に限らず、すべての文が忠実であるときに限って、注釈者が要約を忠実であるとして受け入れるかもしれないと仮定する。
仮説を検証するために,5つの大きな言語モデル(LLM)の判断を,広く使用されている4つの忠実度ベンチマークに対して,文ごとのレーダとして使用する。
グローバルな人間ラベルは,厳密な接続規則の実装よりも,文ごとのLCM判定の平均値と相関することがわかった。
手作業によるレビューでは、人間によって忠実にラベル付けされた要約のかなりの部分が、本当の地元の事実の誤りを含んでいることが確認されている。
私たちはこの傾向を平均バイアスと呼んでいる。
我々の結果は、広く使用されている忠実度ベンチマークの人間ラベルには測定可能な平均的バイアスが含まれており、信頼に値する人間のアノテーションのための注意深く構造化された設計が求められていることを示している。
関連論文リスト
- The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection [27.25270218197248]
既存のベンチマークは、許容可能な外部知識の境界が不明確なため、アノテーションの曖昧さに悩まされている。
本稿では,中間カテゴリであるOut-Dependentを導入した新しい忠実度アノテーションフレームワークを提案する。
このフレームワークを用いて、要約における新しい不誠実検出ベンチマークであるVeriGrayを構築する。
論文 参考訳(メタデータ) (2025-10-24T03:13:51Z) - Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation [29.44609627447293]
本稿では,複数のエージェントに初期スタンスを割り当てた忠実度評価を要約する手法を提案する。
我々は、このような特殊な事例を特定するために、新しい次元、曖昧さ、詳細な分類を導入します。
実験により、我々のアプローチはあいまいさの識別に役立ち、曖昧でない要約でもより強力なパフォーマンスが得られることが示された。
論文 参考訳(メタデータ) (2025-02-12T15:46:50Z) - On Positional Bias of Faithfulness for Long-form Summarization [83.63283027830657]
LLM(Large Language Models)は、長いコンテキスト設定において、入力の途中で情報に過小評価される位置バイアスを示すことが多い。
長文要約におけるこのバイアスの存在、その忠実性への影響、およびこのバイアスを軽減するための様々な技術について検討する。
論文 参考訳(メタデータ) (2024-10-31T03:50:15Z) - FABLES: Evaluating faithfulness and content selection in book-length summarization [55.50680057160788]
本稿では,本書の忠実度と内容選択の大規模評価を行う。
LLMが生成した26冊のサマリーで作成した3,158冊の注釈のデータセットであるFABLESを5.2KUSDで収集する。
注釈の分析によると、ほとんどの不誠実な主張は出来事や登場人物の状態に関係しており、物語を無効にするために間接的推論を必要とする。
論文 参考訳(メタデータ) (2024-04-01T17:33:38Z) - Bias in Language Models: Beyond Trick Tests and Toward RUTEd Evaluation [49.3814117521631]
大規模言語モデル(LLM)におけるバイアスと公平性の標準ベンチマークは、プロンプトによって記述されたユーザー属性とインプットの関係を測定する。
本研究では, 子どもの就寝時間, ユーザ・ペルソナ, 英語学習演習の3つの文脈から, RUTEdの類似性を評価する。
標準偏差指標は、より現実的な偏差指標と有意な相関関係がないことがわかった。
論文 参考訳(メタデータ) (2024-02-20T01:49:15Z) - On Context Utilization in Summarization with Large Language Models [83.84459732796302]
大きな言語モデル(LLM)は抽象的な要約タスクに優れ、流動的で関連する要約を提供する。
最近の進歩は、100kトークンを超える長期入力コンテキストを扱う能力を拡張している。
要約における文脈利用と位置バイアスに関する最初の総合的研究を行う。
論文 参考訳(メタデータ) (2023-10-16T16:45:12Z) - BUMP: A Benchmark of Unfaithful Minimal Pairs for Meta-Evaluation of
Faithfulness Metrics [70.52570641514146]
不誠実な最小対 (BUMP) のベンチマークを示す。
BUMPは、889人の人間が書いた最小限のサマリーペアのデータセットである。
非ペアベースのデータセットとは異なり、BUMPはメトリクスの一貫性を測定するために使用することができる。
論文 参考訳(メタデータ) (2022-12-20T02:17:30Z) - Evaluating the Factual Consistency of Large Language Models Through News
Summarization [97.04685401448499]
本稿では,要約タスクに着目したFIB(Factual Inconsistency Benchmark)と呼ばれる新しいベンチマークを提案する。
現実的に一貫した要約では、手作業で事実的に一貫したものとして検証する、人書きの参照要約を使用します。
現実的に矛盾しない要約に対して、我々は、事実的に矛盾しているとして手動で注釈付けした一連の要約モデルから要約を生成する。
論文 参考訳(メタデータ) (2022-11-15T18:50:34Z) - Extractive is not Faithful: An Investigation of Broad Unfaithfulness
Problems in Extractive Summarization [91.86501509439815]
本研究は,抽出要約に現れる5種類の広い不信問題を持つ類型論を定義する。
我々は16の多様な抽出システムによって生成された1600の英語の要約の中から、これらの問題をラベル付けするよう人間に求めている。
これらの問題を自動検出するために,要約のための既存の5つの信頼度評価指標は,人間の判断と相関が低いことがわかった。
論文 参考訳(メタデータ) (2022-09-08T03:25:18Z) - On the Interpretability and Significance of Bias Metrics in Texts: a
PMI-based Approach [3.2326259807823026]
我々は、テキスト中のバイアスを定量化するために、別のPMIベースのメトリクスを分析する。
これは条件付き確率の関数として表すことができ、単語共起の言葉で簡単に解釈できる。
論文 参考訳(メタデータ) (2021-04-13T19:34:17Z) - Uncovering Latent Biases in Text: Method and Application to Peer Review [38.726731935235584]
本稿では,サブグループメンバーシップ指標の可視性に起因するテキストのバイアスを定量化する新しいフレームワークを提案する。
評価された機械学習会議からのピアレビューのテキストにおけるバイアスの定量化に,我々のフレームワークを適用した。
論文 参考訳(メタデータ) (2020-10-29T01:24:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。