論文の概要: XQDT: eXplainable and Quantitative Data-Text Alignment Metric with Feedback Signals
- arxiv url: http://arxiv.org/abs/2608.29948v2
- Date: Tue, 01 Sep 2026 10:50:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 14:14:25.987342
- Title: XQDT: eXplainable and Quantitative Data-Text Alignment Metric with Feedback Signals
- Title(参考訳): XQDT:フィードバック信号付きeXplainable and Quantitative Data-Text Alignment Metric
- Authors: Kun Efimov-Zhang, Yifei Song, Claire Gardent,
- Abstract要約: データ-テキストペア内の省略データ、余分データ、誤りデータ、正しいデータユニットを識別するために、言語モデルを微調整するエンドツーエンドで説明可能な評価指標を提案する。
我々のモデルは誤り予測においてLLM-as-Judge法を上回り、競合精度、リコール、F1スコアを達成する。
- 参考スコア(独自算出の注目度): 8.283940114367677
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating data-text alignment remains challenging: existing metrics often provide limited explanations for the scores, while prompt-based LLM-as-Judge methods can be expensive and unreliable. We present an end-to-end explainable evaluation metric that fine-tunes a language model to identify omitted, extra, incorrect, and correct data units in a data-text pair. These local judgements are aggregated into precision, recall, and F1 scores, providing both fine-grained diagnostic feedback and an interpretable measure of alignment quality. Across benchmarks, our fine-tuned models outperform LLM-as-Judge methods in error prediction and achieve competitive precision, recall, and F1 scores, while maintaining strong correlation with human judgements. Beyond evaluation, our verifier outputs also provide useful feedback signals for downstream correction and refinement, supporting alignment-oriented improvement of data-to-text and text-to-data. Code and resources are available at https://github.com/guihuzhang/xqdt.
- Abstract(参考訳): 既存のメトリクスはスコアの限定的な説明を提供することが多いが、プロンプトベースのLCM-as-Judgeメソッドは高価で信頼性が低い。
データ-テキストペア内の省略データ、余分データ、誤りデータ、正しいデータユニットを識別するために、言語モデルを微調整するエンドツーエンドで説明可能な評価指標を提案する。
これらの局所的な判断は精度、リコール、F1スコアに集約され、微粒な診断フィードバックとアライメント品質の解釈可能な尺度の両方を提供する。
ベンチマーク全体を通じて、我々の微調整モデルは、LLM-as-Judge法よりも優れた誤差予測を行い、人間の判断と強い相関を保ちながら、競争精度、リコール、F1スコアを達成する。
評価以外にも、検証器出力は下流の修正や改善に有用なフィードバック信号を提供し、データ・トゥ・テキストとテキスト・トゥ・データのアライメント指向の改善をサポートする。
コードとリソースはhttps://github.com/guihuzhang/xqdt.comで入手できる。
関連論文リスト
- LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation [3.4595918693014203]
実データのセマンティックな劣化を制御して合成評価データセットを生成するスケーラブルなフレームワークであるMeta-JudgeとしてtextitLLMを提案する。
我々は、合成データから得られたメートル法ランキングと、標準的なヒトのベンチマークから得られたメートル法ランキングのアライメントを測定し、テクトメタ相関を用いてアプローチを検証する。
論文 参考訳(メタデータ) (2026-03-10T09:15:19Z) - Towards Consistent Detection of Cognitive Distortions: LLM-Based Annotation and Dataset-Agnostic Evaluation [2.699704259580951]
テキストに基づく自動認知歪み検出は、主観的な性質のため難しい課題である。
一貫性のある信頼性のあるアノテータとしてLarge Language Models (LLM)の使用について検討する。
論文 参考訳(メタデータ) (2025-11-03T11:45:26Z) - Long-Form Information Alignment Evaluation Beyond Atomic Facts [60.25969380388974]
明示的な幻覚を導入することなく、真理のステートメントを"モンテージ"することで、偽りの物語を構築するベンチマークであるMontageLieを紹介します。
本稿では,事実の正確性とイベント順序の整合性を共同で検証する新しいフレームワークであるDoveScoreを提案する。
論文 参考訳(メタデータ) (2025-05-21T17:46:38Z) - Beyond the Singular: The Essential Role of Multiple Generations in Effective Benchmark Evaluation and Analysis [10.133537818749291]
大規模言語モデル(LLM)は、現実世界のアプリケーションにおいて重要なユーティリティを実証している。
LLMの能力を評価するにはベンチマーク評価が不可欠である。
論文 参考訳(メタデータ) (2025-02-13T03:43:33Z) - Who Wrote This? The Key to Zero-Shot LLM-Generated Text Detection Is GECScore [51.65730053591696]
我々は,人文テキストがLLM生成テキストよりも文法的誤りを多く含んでいるという観察に基づく,シンプルで効果的なブラックボックスゼロショット検出手法を提案する。
実験結果から,本手法はゼロショット法や教師あり手法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2024-05-07T12:57:01Z) - The Devil is in the Errors: Leveraging Large Language Models for
Fine-grained Machine Translation Evaluation [93.01964988474755]
AutoMQMは,大規模な言語モデルに対して,翻訳におけるエラーの識別と分類を求めるプロンプト技術である。
テキスト内学習と微調整によるラベル付きデータの影響について検討する。
次に, PaLM-2モデルを用いてAutoMQMを評価し, スコアのプロンプトよりも性能が向上することがわかった。
論文 参考訳(メタデータ) (2023-08-14T17:17:21Z) - Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。
FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。
その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文 参考訳(メタデータ) (2023-07-13T17:14:38Z) - Evaluating Factual Consistency of Texts with Semantic Role Labeling [3.1776833268555134]
本稿では,テキスト要約を念頭に設計した参照不要評価指標SRLScoreを紹介する。
最終事実度スコアは、調整可能なスコアリング機構により算出される。
英語の要約データセットにおける人間の判断との相関は、SRLScoreが最先端の手法と競合していることを示している。
論文 参考訳(メタデータ) (2023-05-22T17:59:42Z) - On the Blind Spots of Model-Based Evaluation Metrics for Text Generation [79.01422521024834]
テキスト生成評価指標のロバスト性分析に有用であるが,しばしば無視される手法を探索する。
我々は、幅広い潜在的な誤差を設計、合成し、それらが測定値の余計な低下をもたらすかどうかを確認する。
私たちの実験では、既存のメトリクスの興味深い不感、バイアス、あるいは抜け穴が明らかになりました。
論文 参考訳(メタデータ) (2022-12-20T06:24:25Z) - TRUE: Re-evaluating Factual Consistency Evaluation [29.888885917330327]
TRUE: 多様なタスクから既存のテキストの標準化されたコレクション上での、事実整合性メトリクスの総合的な研究である。
我々の標準化により、前述した相関よりも動作可能で解釈可能なサンプルレベルのメタ評価プロトコルが実現される。
さまざまな最先端のメトリクスと11のデータセットから、大規模NLIと質問生成と回答に基づくアプローチが、強力で相補的な結果をもたらすことが分かりました。
論文 参考訳(メタデータ) (2022-04-11T10:14:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。