論文の概要: ResearchQA: Benchmarking Citation-Grounded Question-Answering on Scientific Papers
- arxiv url: http://arxiv.org/abs/2607.11074v1
- Date: Mon, 13 Jul 2026 04:26:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.328619
- Title: ResearchQA: Benchmarking Citation-Grounded Question-Answering on Scientific Papers
- Title(参考訳): ResearchQA:Citation-Grounded Question- Answering on Scientific Papers
- Authors: Saba Imran, Debanjum Singh Solanky,
- Abstract要約: ResearchQAは、494のオープンアクセス論文から6,211のシングルペーパー質問応答ペアのベンチマークである。
ResearchQAは引用地上評価のために設計されている。
提案手法は,8つの先行したクローズドウェイトモデルとオープンウェイトモデルについて,引用グラウンド・チャット・ウィズ・ペーパー・セッティングで評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly used to assist scientific reading, but existing evaluation methods often fail to detect whether answers are supported by verifiable citations. We introduce ResearchQA, a benchmark of 6,211 single-paper question-answer pairs from 494 open-access papers spanning eight domains and four question types: lookup, comprehension, multi-hop, and adversarial. ResearchQA is designed for citation-grounded evaluation: it permits multiple valid supporting passages for a claim and rewards grounded refusal when the source paper does not support an answer. We evaluate eight leading closed- and open-weight models in a citation-grounded chat-with-paper setting using a deterministic citation matcher and an LLM-based rubric evaluator. Citation-based metrics separate systems more clearly than LLM-evaluator scores: section coverage and citation accuracy vary substantially across models, while evaluator scores remain tightly compressed. We further find that open-weight models approach the best closed-model citation accuracy while achieving 3 to 6 times lower per-example latency. We release the benchmark, evaluation harness, and evaluator prompt.
- Abstract(参考訳): 大規模な言語モデルは、科学的な読解を支援するためにますます使われているが、既存の評価手法は、検証可能な引用によって回答が支持されるかどうかを検知できないことが多い。
本研究では、8つのドメインと4つの質問タイプ(ルックアップ、理解、マルチホップ、敵)にまたがる494のオープンアクセス論文から、6,211のシングルペーパー質問応答ペアのベンチマークであるResearchQAを紹介する。
ResearchQAは引用接地評価のために設計されており、複数の有効なクレーム支援パスを許可し、ソースペーパーが回答をサポートしていない場合、グラウンドド拒否を許す。
提案手法は,8つの先行するクローズド・アンド・オープンウェイトモデルについて,定性的な引用整合器とLLMに基づくルーリック評価器を用いて評価する。
セクションカバレッジと引用精度はモデルによって大きく異なり、評価器のスコアは厳密に圧縮されている。
さらに,オープンウェイトモデルは,最大クローズドモデル励振精度に近づき,サンプル毎の3倍から6倍のレイテンシを実現する。
ベンチマーク、評価ハーネス、評価プロンプトをリリースします。
関連論文リスト
- How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation [3.4562767039451674]
ファクトイドの質問に答えながらインライン・引用を付加するかを,大規模言語モデルがどう判断するかを示す。
以上より,PopQAでは,これらの臨界頭部のみを増幅または減衰させ,解答精度を損なうことなく69%の急激な頭部を除去できることが示唆された。
結果は、モデルが明らかな推論と内部の計算経路を切断する可能性を明らかにした。
論文 参考訳(メタデータ) (2026-06-09T07:06:13Z) - Verified Misguidance: Measuring Structural Citation Failures in Search-Augmented LLMs [8.721564756242431]
CITETRACEは、ユーザクエリから取得したソースから生成された回答まで、完全な引用チェーンをトレースするデータセットである。
我々は,意図的アライメント,ソース適合性,回答ソースの忠実度に基づいて各引用をスコアする3次元評価フレームワークを設計する。
プールの向こう側では、引用の30.6%がソースを歪めており、27.1%はドメイン不適切なソースから来ている。
論文 参考訳(メタデータ) (2026-05-27T14:54:05Z) - CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence [35.06938031991452]
CiteVQAは要素レベルのバウンディングボックスの引用を各回答と一緒に返さなければならないベンチマークである。
CiteVQAは7つのドメインと2つの言語にまたがる711のPDFに1,897の質問があり、1ドキュメントあたり平均40.6ページである。
Strict Attributed Accuracy (SAA) は、回答と引用された領域の両方が正しい場合にのみ、予測を信用する。
論文 参考訳(メタデータ) (2026-05-13T01:54:42Z) - Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents [0.18762753243053634]
大規模言語モデル(LLM)は、数百のWebソースから情報を引用したレポートに合成するディープリサーチエージェントをパワーアップする。
現在のアプローチでは、信頼モデルが正確な自己引用、バイアスのリスク、あるいはソースアクセシビリティ、関連性、事実整合性を検証しない検索強化世代(RAG)を採用する。
本稿では,再現可能なASTルーブリックを用いてインライン引用を大規模に抽出し,評価する最初の情報源属性評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T17:46:45Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - Multimodal Fact-Level Attribution for Verifiable Reasoning [80.60864342985748]
マルチモーダル大言語モデル(MLLM)は、多段階推論と長文生成を含む実世界のタスクにますます利用されている。
既存のマルチモーダルグラウンドベンチマークと評価手法は、複雑なマルチモーダル推論における属性評価に失敗する。
我々は、直接観察以上の推論を必要とする設定において、ファクトレベルのマルチモーダル属性を評価するためのベンチマークであるMuRGAtを紹介する。
論文 参考訳(メタデータ) (2026-02-12T03:10:02Z) - Citation Failure: Definition, Analysis and Efficient Mitigation [56.09968229868067]
LLMベースのRAGシステムからの引用は、応答検証の簡略化を目的としている。
これは、モデルが有効な応答を生成するとき、引用失敗には当てはまらないが、完全な証拠を引用することができない。
応答自体に欠陥があり、完全な証拠を引用することは不可能である。
論文 参考訳(メタデータ) (2025-10-23T07:47:22Z) - Generation-Time vs. Post-hoc Citation: A Holistic Evaluation of LLM Attribution [8.691344810384114]
大規模言語モデル (LLMs) は、医療、法律、アカデミア、金融といった高度な領域において、人間の検証可能な情報源を引用しなければならない。
本稿では,一つのパスで応答と引用を生成する生成時間Citation(G-Cite)と,起草後の引用を付加または検証するポストホックCitation(P-Cite)という2つのパラダイムを紹介する。
両パラダイムにおける帰属品質の主要因は検索であり,適用範囲と引用精度の相反するトレードオフを示した。
論文 参考訳(メタデータ) (2025-09-25T20:39:26Z) - SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models [51.90867482317985]
SelfCiteは、生成されたレスポンスの文に対して、きめ細かい文レベルの引用を生成する、自己教師型アプローチである。
SelfCiteの有効性は、LongBench-Citeベンチマークにおいて、引用F1を5.3ポイントまで増やすことによって示される。
論文 参考訳(メタデータ) (2025-02-13T18:55:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。