論文の概要: ClaimFlow: Tracing the Evolution of Scientific Claims in NLP
- arxiv url: http://arxiv.org/abs/2603.16073v1
- Date: Tue, 17 Mar 2026 02:43:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-18 17:42:07.076753
- Title: ClaimFlow: Tracing the Evolution of Scientific Claims in NLP
- Title(参考訳): ClaimFlow:NLPにおける科学的主張の進化の追跡
- Abstract要約: NLP文献のクレーム中心のビューである$texttClaimFlow$を紹介します。
新しいタスク $-$$textitClaim Relation Classification$$-$を定義する。
我々の分析によると、63.5$%の請求は決して再利用されない。
- 参考スコア(独自算出の注目度): 67.23189226608389
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Scientific papers do more than report results $-$ they advance $\textit{claims}$ that later work supports, extends, or sometimes refutes. Yet existing methods for citation and claim analysis capture only fragments of this dialogue. In this work, we make these interactions explicit at the level of individual scientific claims. We introduce $\texttt{ClaimFlow}$, a claim-centric view of the NLP literature, built from $304$ ACL Anthology papers (1979$-$2025) that are manually annotated with $1{,}084$ claims and $832$ cross-paper claim relations, indicating whether a citing paper $\textit{supports}$, $\textit{extends}$, $\textit{qualifies}$, $\textit{refutes}$, or references a claim as $\textit{background}$. Using $\texttt{ClaimFlow}$, we define a new task $-$ $\textit{Claim Relation Classification}$ $-$ which requires models to infer the scientific stance toward a cited claim from the text and citation context. Evaluating strong neural models and large language models on this task, we report baseline performance of $0.78$ macro-F1, highlighting that claim-relation classification is feasible but challenging. We further apply our model to $\sim$$13k$ NLP papers to analyze how claims evolve across decades of NLP research. Our analysis reveals that $63.5$% claims are never reused; only $11.1$% are ever challenged; meanwhile, widely propagated claims are more often $\textit{reshaped}$ through qualification and extension than directly confirmed or refuted. Overall, $\texttt{ClaimFlow}$ offers a lens for examining how ideas shift and mature within NLP, and a foundation for assessing whether models can interpret scientific argumentation.
- Abstract(参考訳): 科学論文は、レポート結果以上のことをする。$-$ they advance $\textit{claims}$ 後続の作業がサポートし、拡張し、時には反証する。
しかし、既存の引用とクレーム分析の方法は、この対話の断片のみをキャプチャする。
本研究では、これらの相互作用を個々の科学的主張のレベルで明示する。
我々は、$\textit{ClaimFlow}$、$\textit{extends}$、$\textit{qualify}$、$\textit{refutes}$、$\textit{background}$を引用するか、または$\textit{background}$としてアノテートするかを示す${,}084$と832$のクロスペーパーのクレーム関係を手作業でアノテートした304$ ACLアンソロジー論文(1979$-2025)から構築されたNLP文学のクレーム中心ビューである$\texttt{ClaimFlow}$を紹介した。
$\textt{ClaimFlow}$を使用して、新しいタスク $-$\textit{Claim Relation Classification}$-$を定義する。
このタスクにおける強力なニューラルモデルと大規模言語モデルの評価を行い、0.78$ macro-F1のベースライン性能を報告した。
さらに、我々のモデルを$\sim$13k$のNLP論文に適用して、数十年にわたるNLP研究におけるクレームの進化を分析する。
私たちの分析では、63.5$%のクレームは再利用されることはなく、111.1$%しか挑戦されないが、広く普及しているクレームは、直接確認または反証するよりも、資格と拡張を通じて$\textit{reshaped}$であることが多い。
全体として、$\texttt{ClaimFlow}$は、アイデアがNLP内でどのように変化し成熟するかを調べるためのレンズと、モデルが科学的議論を解釈できるかどうかを評価するための基盤を提供する。
関連論文リスト
- MUSES: A Benchmark for Prospective Intellectual-Roots Retrieval [6.572091819435388]
textbfMUSESは、固定された2.33Mペーパーコーパス上での知的ルーツ検索のための100万インスタンスベンチマークである。
textbfCiteRootsは、局所的な引用テキスト上の修辞層と紙レベルの著者層とをペアリングする。
MUSESは、CiteNext、CiteNew、CiteNew-IsolatedにまたがるEmphfamiliarity軸と、広義の引用、修辞の根、著者が支持する根にまたがるEmphfunction軸の2つの軸に沿って困難を整理する。
論文 参考訳(メタデータ) (2026-08-31T20:05:36Z) - An Interactive Agent for Requirement-Driven Candidate Sourcing [75.63902836826038]
最初の要件駆動型候補ソーシングエージェントであるsysを提示する。
それは、あいまいな人々の要求を正当化されたスレートに導き、検証し、回収し、検証する。
広さ (100%$カバレッジ 2.5times$ the yield) を支配し、フィールドに直交する。
論文 参考訳(メタデータ) (2026-08-24T17:04:16Z) - FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models [53.68149869349268]
大規模言語モデル(LLM)は、自動理論計算機科学(TCS)研究の可能性を増大させている。
我々は、最前線のエンドツーエンドのTCS研究でLSMを評価するための専門家検証ベンチマークである ourbenchmarkを紹介した。
論文 参考訳(メタデータ) (2026-08-20T15:13:41Z) - How Does Research Evolve? Tracing Cross-Domain Trajectories in NLP, ML, and CV with Claim-Grounded Typed Citations [0.0]
本稿では,各エッジを動機づける特定のクレーム文にリンクする最初のクレームグラウンド型型引用グラフを提案する。
SciTrajにはNLP、ML、Vision (2015-2024)の32,559の論文が含まれており、6つの関係タイプで533,126本のエッジが接続されている。
コーパスには長さ$geq 3$の287Mの型付きトラジェクトリが含まれており、72.8%の論文をカバーし、時間分割型付きリンク予測ベンチマークをサポートしている。
論文 参考訳(メタデータ) (2026-06-21T05:20:02Z) - Subtle Injection for Ground-truth Inference of LLM Training Data [0.2538209532048867]
SIGILは、認識不能なEmphcanary Sequenceを保護されたテキストとコードに埋め込むフレームワークである。
SIGILは、語彙規則、語彙句、構文、意味、コードパターンの5つのカナリア戦略を定義している。
論文 参考訳(メタデータ) (2026-05-18T14:48:44Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - GENIUS: Generative Fluid Intelligence Evaluation Suite [45.98061608718251]
我々は、$textbfGENIUS$ $textbfGEN$ fluid $textbfI$ntelligence Eval$textbfU$ation $textbfS$uiteを紹介します。
例えば、$textitInducing Implicit Patterns$(例えば、パーソナライズされた視覚的嗜好を推測する)、$textitExecuting Ad-hoc Constraints$(例えば、抽象メタファを視覚化する)、そして。
論文 参考訳(メタデータ) (2026-02-11T18:55:54Z) - ConvexBench: Can LLMs Recognize Convex Functions? [70.53167848190624]
凸解析は数学の現代的な分野であり、多くの応用がある。
大規模言語モデル(LLM)が研究レベルの数学と科学を自動化し始めるにつれ、LLMが凸性を理解し、推論する能力を示すことが重要である。
我々は,LLMが深い機能的構成下での象徴的対象の凸性を識別できるかどうかを,スケーラブルで機械的に検証できるベンチマークであるcbを紹介する。
論文 参考訳(メタデータ) (2026-02-01T07:41:17Z) - Simple Convergence Proof of Adam From a Sign-like Descent Perspective [58.89890024903816]
我々は、Adamが以前の$cal O(fracln TTs14)$よりも$cal O(frac1Ts14)$の最適なレートを達成することを示す。
我々の理論分析は、収束を保証する重要な要因として運動量の役割に関する新たな洞察を提供する。
論文 参考訳(メタデータ) (2025-07-08T13:19:26Z) - HypER: Literature-grounded Hypothesis Generation and Distillation with Provenance [28.51792655478926]
大規模言語モデルは、科学的領域にわたる研究の構想において有望な性能を示した。
我々は、文学誘導推論とエビデンスベースの仮説生成のために訓練された小さな言語モデルである、$textbfE$xplanation と $textbfR$easoning を用いた $textttHypER$ $textbfHyp$othesis Generation を提示する。
論文 参考訳(メタデータ) (2025-06-15T18:41:23Z) - Language Models May Verbatim Complete Text They Were Not Explicitly Trained On [97.3414396208613]
我々は、$n$-gram ベースのメンバシップ定義を効果的にゲームできることを示す。
会員定義に対して$n$の1つの実行可能な選択を見つけることは困難であることを示す。
以上の結果から,n$-gramの会員シップが不十分であることが示唆された。
論文 参考訳(メタデータ) (2025-03-21T19:57:04Z) - HLM-Cite: Hybrid Language Model Workflow for Text-based Scientific Citation Prediction [14.731720495144112]
本稿では,表面的な言及を超越した批判的参照を識別する,コア引用という新しい概念を紹介する。
我々は、引用予測のための$textbfH$ybrid $textbfL$anguage $textbfM$odelワークフローである$textbfHLM-Citeを提案する。
我々はHLM-Citeを19分野にわたって評価し,SOTA法と比較して17.6%の性能向上を示した。
論文 参考訳(メタデータ) (2024-10-10T10:46:06Z) - Inertial Confinement Fusion Forecasting via Large Language Models [48.76222320245404]
本研究では,従来の貯水池計算パラダイムとLarge Language Models(LLM)の新たな統合である$textbfLPI-LLM$を紹介する。
我々は、$textitLLM-anchored Reservoir$, augmented with a $textitFusion-specific Prompt$を提案する。
また、最初の$textttLPI$ベンチマークである$textbfLPI4AI$も提示します。
論文 参考訳(メタデータ) (2024-07-15T05:46:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。