論文の概要: How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation
- arxiv url: http://arxiv.org/abs/2609.01369v1
- Date: Tue, 01 Sep 2026 15:06:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.790279
- Title: How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation
- Title(参考訳): あなたの答えはどのように正しいのか?オープンQA評価のための意味的正確性フレームワーク
- Authors: Elitsa Yotkova, Violeta Kastreva, Petar Velkov, Hristo Boyanov, Dimitar Dimitrov, Ivan Koychev, Preslav Nakov,
- Abstract要約: 本研究では,8つのクラスに有意な回答を割り当てる意味的正当性分類を導入し,有意な内容によって汚染されたものから有意な回答を分離する。
次に、広く使用されているQAデータセットにまたがる8.8kサンプルベンチマークであるCAP-Correctnessと、質問応答ペアを宣言文に変換する11kサンプルデータセットであるCAP-Statementsをリリースする。
第三にCAP(Context-Aware Precision)は、双方向NLIを用いて質問条件文をスコアする参照ベースのメトリクスである。
- 参考スコア(独自算出の注目度): 38.482877747109946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable evaluation of open-ended question answering remains a bottleneck for measuring answer correctness of modern LLMs. Unlike multiple-choice tasks, free-form answers may be correct in many surface forms and may fail in qualitatively different ways, including incompleteness, contradiction, overgeneration, and endorsement of false premises. Existing judgment-based and similarity-based metrics often collapse these distinctions. We address this gap with three reusable contributions. First, we introduce a semantic correctness taxonomy that assigns open-ended answers to eight ordered classes, separating verbose-but-correct answers from those contaminated by hallucinated content. Second, we release CAP-Correctness, an 8.8k-example benchmark spanning widely used QA datasets, and CAP-Statements, an 11k-example dataset for converting question-answer pairs into declarative statements for natural language inference (NLI) training and statement-based evaluation. Third, we introduce CAP (Context-Aware Precision), a reference-based metric that scores question-conditioned statements using bidirectional NLI. Under a monotonicity protocol testing whether metrics respect the taxonomy's intended ordering, CAP outperforms established baselines.
- Abstract(参考訳): オープンエンド質問応答の信頼性評価は, 現代LLMの回答正当性評価のボトルネックとして残っている。
多重選択タスクとは異なり、自由形式の答えは多くの曲面形式で正しいが、不完全性、矛盾、過剰生成、偽の前提の支持など、定性的に異なる方法で失敗することがある。
既存の判断に基づく類似性に基づくメトリクスは、しばしばこれらの区別を崩壊させる。
3つの再利用可能なコントリビューションで、このギャップに対処します。
まず,8つのクラスにオープンエンド回答を割り当てる意味的正当性分類を導入する。
次に、広く使用されているQAデータセットにまたがる8.8kサンプルベンチマークであるCAP-Correctnessと、質問応答ペアを自然言語推論(NLI)トレーニングとステートメントに基づく評価のための宣言文に変換する11kサンプルデータセットであるCAP-Statementsをリリースする。
第三にCAP(Context-Aware Precision)は、双方向NLIを用いて質問条件文をスコアする参照ベースのメトリクスである。
メトリクスが分類の意図した順序を尊重するかどうかをテストする単調なプロトコルの下で、CAPは確立された基準よりも優れている。
関連論文リスト
- CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering [6.875316321208349]
CapProbeは、詳細なキャプション評価を地域ごとの事実チェックに変換する、フルシーンの高密度QAベンチマークである。
346のイメージ、1,868のリージョン、25,650の質問からなる。
言語判断者はキャプションだけで答える; 不確実なオプションと有効精度は、未回答のプローブと不正に解決されたプローブを区別するための判断依存のプロキシを提供する。
論文 参考訳(メタデータ) (2026-08-11T15:36:10Z) - Knowledge Dependency Estimation for Reliable Question Answering [11.800158247203312]
我々はemphknowledge依存性の推定について研究する
構造化されたランク認識型知識依存度推定器である textbfKnot を提案する。
論文 参考訳(メタデータ) (2026-05-27T06:48:57Z) - MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs [15.278241998033822]
大規模言語モデル(LLM)の能力を評価する上で,QA(Open-ended Question answering)が重要な課題である。
オープンな質問をまず識別し,候補回答をランク付けする新しい評価手法である textbfMinosEval を提案する。
論文 参考訳(メタデータ) (2025-06-18T07:49:13Z) - CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering [9.50840225852638]
Conditional Ambiguous Question-Answering (CondAmbigQA) は2000の曖昧なクエリと条件対応評価指標からなるベンチマークである。
実験により、回答前の条件を考慮したモデルでは解答精度が11.75%向上し、条件が明示された場合にさらに7.15%向上することが示されている。
論文 参考訳(メタデータ) (2025-02-03T17:01:51Z) - LINKAGE: Listwise Ranking among Varied-Quality References for Non-Factoid QA Evaluation via LLMs [61.57691505683534]
非F (Non-Factoid) Question Answering (QA) は多種多様な潜在的回答と客観的基準により評価が困難である。
大規模言語モデル (LLM) は、様々なNLPタスクにおいて魅力的な性能を持つため、NFQAの評価に利用されてきた。
提案手法は,LLMを用いて基準回答のランク付けを行う新しい評価手法であるNFQAの評価手法を提案する。
論文 参考訳(メタデータ) (2024-09-23T06:42:21Z) - QUDSELECT: Selective Decoding for Questions Under Discussion Parsing [90.92351108691014]
Question Under Examination (QUD) は、暗黙の質問を用いて文間の会話関係を明らかにするための談話フレームワークである。
本稿では,QUD基準を考慮したQUD依存構造を選択的に復号する共同学習フレームワークであるQUDSELECTを紹介する。
提案手法は,人的評価において9%,自動評価において4%,最先端のベースラインモデルよりも優れていた。
論文 参考訳(メタデータ) (2024-08-02T06:46:08Z) - Controllable Decontextualization of Yes/No Question and Answers into
Factual Statements [28.02936811004903]
本稿では,極性質問に対する回答の制御可能な書き直しの問題に対処する。
本稿では,ソフト制約を利用して制御可能な書き換えを実現するトランスフォーマーシーケンス to シーケンスモデルを提案する。
論文 参考訳(メタデータ) (2024-01-18T07:52:12Z) - SQUARE: Automatic Question Answering Evaluation using Multiple Positive
and Negative References [73.67707138779245]
SQuArE (Sentence-level QUestion AnsweRing Evaluation) という新しい評価指標を提案する。
文レベルの抽出(回答選択)と生成(GenQA)の両方のQAシステムでSQuArEを評価する。
論文 参考訳(メタデータ) (2023-09-21T16:51:30Z) - Benchmarking Answer Verification Methods for Question Answering-Based
Summarization Evaluation Metrics [74.28810048824519]
質問応答に基づく要約評価メトリクスは、QAモデルの予測が正しいかどうかを自動的に判断する必要がある。
筆者らは,現在QAベースのメトリクスで使用されている語彙的回答検証手法と,より洗練された2つのテキスト比較手法をベンチマークした。
論文 参考訳(メタデータ) (2022-04-21T15:43:45Z) - KPQA: A Metric for Generative Question Answering Using Keyphrase Weights [64.54593491919248]
KPQA-metricは生成的質問応答システムの正当性を評価するための新しい指標である。
我々の新しい計量は、キーフレーズ予測を通じて各トークンに異なる重みを割り当てる。
提案手法は,既存の指標よりも人的判断との相関が有意に高いことを示す。
論文 参考訳(メタデータ) (2020-05-01T03:24:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。