論文の概要: LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports
- arxiv url: http://arxiv.org/abs/2607.20872v1
- Date: Thu, 23 Jul 2026 02:50:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.267071
- Title: LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports
- Title(参考訳): 法定CiteTrust:中国の長期法調査報告書におけるCitation Trustworthinessのベンチマーク
- Authors: Yunhan Li, Mingjie Xie, Zeyang Shi, Gengshen Wu, Min Yang,
- Abstract要約: LegalCiteTrustは、中国の長期法調査レポートにおける引用信頼度を評価するためのベンチマークである。
72のレポートレベルタスクが含まれており、カバレッジ、サポート、Citation Trustworthinessの3つの側面に沿ってレポートを評価している。
E/F/Aベースのリビジョンは、存在のみのフィルタリングよりも、信頼とファイナルスコアをより明確に改善する。
- 参考スコア(独自算出の注目度): 10.617230636467339
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-form legal research reports increasingly rely on LLMs and agentic research systems, but their reliability depends not only on answering the task, but also on whether cited legal authorities are trustworthy. A citation can be risky even when it points to a real source: the report may omit limiting conditions, misdescribe the authority, or use it to support a stronger claim than the source allows. We introduce LegalCiteTrust, a benchmark for evaluating citation trustworthiness in Chinese long-form legal research reports. It contains 72 densely annotated report-level tasks and evaluates reports along three dimensions: Coverage, Support, and Citation Trustworthiness. Citation Trustworthiness is operationalized through citation-level Existence, Fidelity, and Applicability (E/F/A). Experiments on general-purpose LLMs, deep-research systems, and legal-specific systems show that task completion, evidence richness, citation density, and citation reliability expose different system behaviors. Retrieval tools can improve evidence support without reliably improving the Trust score, while E/F/A-based revision improves Trust and Final score more clearly than existence-only filtering. These results suggest that trustworthy legal research generation requires citation-aware evidence governance after retrieval: systems must not only retrieve legal authorities, but also select, describe, and apply them reliably.
- Abstract(参考訳): 長期にわたる法的調査報告は、LSMやエージェント研究システムにますます依存しているが、その信頼性は、その課題に答えるだけでなく、引用された法当局が信頼できるかどうかにも依存している。
報告書は、制限条件を省略したり、権限を誤って記述したり、あるいはソースが許しているよりも強力なクレームをサポートするために使用することができる。
中国の長期法調査報告において、引用信頼度を評価するためのベンチマークであるLegalCiteTrustを紹介する。
72のレポートレベルタスクが含まれており、カバレッジ、サポート、Citation Trustworthinessの3つの側面に沿ってレポートを評価している。
引用レベルの存在、忠実性、適用可能性(E/F/A)を通じて、引用信頼度が運用される。
汎用LLM、ディープリサーチシステム、および法定システムに関する実験は、タスク完了、エビデンスリッチネス、励磁密度、および励磁信頼性が異なるシステムの挙動を表わしていることを示している。
検索ツールは、信頼スコアを確実に改善することなくエビデンスサポートを改善することができるが、E/F/Aベースのリビジョンは、存在のみのフィルタリングよりも信頼とファイナルスコアをより明確に改善する。
これらの結果は、信頼できる法研究生成には、検索後に引用を意識したエビデンスガバナンスが必要であることを示唆している:システムは、法当局を回収するだけでなく、それらを確実に選択、記述、適用する必要がある。
関連論文リスト
- Explicit Evidence Grounding via Structured Inline Citation Generation [22.27784103991804]
FullCiteは、各クレームをソースドキュメントとリンクし、エビデンスをサポートする構造化インライン引用を生成するフレームワークである。
文献レベルの正しさ,証拠の特定範囲,クレームレベルの忠実さの3つの側面に沿って,引用品質と忠実度を評価する。
論文 参考訳(メタデータ) (2026-06-05T10:42:10Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents [0.18762753243053634]
大規模言語モデル(LLM)は、数百のWebソースから情報を引用したレポートに合成するディープリサーチエージェントをパワーアップする。
現在のアプローチでは、信頼モデルが正確な自己引用、バイアスのリスク、あるいはソースアクセシビリティ、関連性、事実整合性を検証しない検索強化世代(RAG)を採用する。
本稿では,再現可能なASTルーブリックを用いてインライン引用を大規模に抽出し,評価する最初の情報源属性評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T17:46:45Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence [50.97612134791782]
生成検索エンジンと深層研究のLLMエージェントは、信頼できるソース・グラウンドの合成を約束するが、ユーザーは常に過剰な自信、弱いソーシング、紛らわしい引用の慣行に遭遇する。
DeepTRACEは、社会技術的に基礎をおく新しい監査フレームワークで、コミュニティが特定した失敗事例を、回答テキスト、情報源、引用にまたがる8つの測定可能な次元に変換する。
論文 参考訳(メタデータ) (2025-09-02T00:32:38Z) - The Noisy Path from Source to Citation: Measuring How Scholars Engage with Past Research [20.649638393774048]
本稿では,大規模な引用忠実度を定量化する計算パイプラインを提案する。
論文の全文を用いて、パイプラインは引用論文における引用と引用論文における対応するクレームを識別する。
準実験を用いて「電話効果」を確立する - 引用論文が原主張に忠実度が低い場合、引用論文と原文を引用する将来の論文は原文に忠実度が低い。
論文 参考訳(メタデータ) (2025-02-27T22:47:03Z) - ALiiCE: Evaluating Positional Fine-grained Citation Generation [54.19617927314975]
本稿では,微細な引用生成のための最初の自動評価フレームワークであるALiiCEを提案する。
我々のフレームワークはまず、文のクレームを依存性分析によって原子クレームに解析し、次に原子クレームレベルでの引用品質を計算する。
複数大言語モデルの2つの長文QAデータセット上での位置的きめ細かな引用生成性能を評価する。
論文 参考訳(メタデータ) (2024-06-19T09:16:14Z) - Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data [48.409306245463]
事前学習データにおいて,信頼された情報源から動詞句を引用するモデルを構築した。
Quote-Tuningの中核は、信頼されたコーパスに対するテキストを効率的に検証する高速なメンバシップ推論機能である。
実験により、Quote-Tuningは、ベースモデルと比較して高品質なドキュメントからの動詞の引用を最大130%増加させることが示された。
論文 参考訳(メタデータ) (2024-04-05T02:27:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。