論文の概要: How broad is that claim? Mapping Generalisation in NLP Research
- arxiv url: http://arxiv.org/abs/2609.14770v1
- Date: Sun, 13 Sep 2026 20:06:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.96561
- Title: How broad is that claim? Mapping Generalisation in NLP Research
- Title(参考訳): NLP研究における一般化のマッピング
- Abstract要約: 我々は、科学領域における一般化の包括的分類であるNLPGenXを導入し、テキスト内の一般化とフレーミングのレベルに応じて主張をラベル付けする。
我々はこの分類を,科学論文からの文章を自動的に5つの異なる一般化クラスに分類するLPM方式のフレームワーク,NLPGenAで運用する。
我々は、NLPGensを用いて、複数の会場にわたるNLP論文における一般化の使用を分析し、引用数、ヘッジ、曖昧な記述子との関連性を調べる。
- 参考スコア(独自算出の注目度): 3.5572860881327
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Generalisations are common in scientific communication, even though they are semantically ambiguous. An automated method is needed to identify and categorise claims according to their level of generalisation, in order help detect an over-reliance on generalisations and possible misrepresentations of scientific findings. We introduce a comprehensive taxonomy of generalisations in the scientific domain, NLPGenX, which labels claims according to their level of generality and framing within the text. We operationalise this taxonomy with an LLM-powered framework, NLPGenA, that automatically classifies sentences from scientific articles into 5 different generalisation classes. We validate our framework with human annotators and use the framework to construct a large-scale dataset of NLP papers annotated according to generality, with auxiliary labels for hedging and vague descriptors (NLPGens). We use NLPGens to analyse the use of generalisations in NLP papers across multiple venues and subdomains, and to examine associations with citation counts, hedging, and vague descriptors.
- Abstract(参考訳): 一般化は、意味的に曖昧であるにもかかわらず、科学コミュニケーションにおいて一般的である。
一般化の度合いに応じてクレームを識別し分類するためには、一般化に対する過度な信頼と科学的発見の誤表現を検出するために、自動的な方法が必要である。
我々は、科学領域における一般化の包括的分類であるNLPGenXを導入し、テキスト内の一般化とフレーミングのレベルに応じて主張をラベル付けする。
我々はこの分類を,科学論文からの文章を自動的に5つの異なる一般化クラスに分類するLPM方式のフレームワーク,NLPGenAで運用する。
我々は,このフレームワークを人間のアノテータで検証し,汎用性に応じて注釈付けされたNLP論文の大規模データセットの構築に利用し,ヘッジや曖昧な記述子 (NLPGens) の補助ラベルを用いた。
我々は、NLPGensを用いて、複数の会場やサブドメインにわたるNLP論文における一般化の利用を分析し、引用数、ヘッジ、曖昧な記述子との関連性を調べる。
関連論文リスト
- GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation [74.44235943118994]
GenRubricは、ラベルのないクエリからルーブリック生成を改善する自己進化フレームワークである。
我々はこの原理を強化学習により実現し、ルーブリック間の包括性信号とグループレベルの報酬と基準レベルの報酬を組み合わせる。
人間の注釈付きルーブリックベンチマークの実験では、自己進化は生成されたルーブリックと専門家によるルーブリックによる評価の一致を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-30T15:39:39Z) - Term-Centric Hierarchy Induction from Heterogeneous Corpora [39.04226660046721]
本稿では,大規模文書コレクションにスケールする階層コーパスを誘導する用語中心のフレームワークを提案する。
提案手法は,文書を多種多様な情報源から自動用語抽出を用いて共有表現空間にマッピングする。
100万以上の文書からなる新しい英語とドイツ語のマルチソースベンチマーク実験により,我々の手法は,ソース間のコヒーレンスと階層的品質を向上することを示した。
論文 参考訳(メタデータ) (2026-06-25T12:37:33Z) - OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment [63.662126457336534]
OpenNoveltyは、透明で証拠に基づく新規性分析のためのエージェントシステムである。
回収された実論文のすべての評価を根拠にし、検証可能な判断を確実にする。
OpenNoveltyは、公正で一貫性があり、エビデンスに支えられたピアレビューを促進するスケーラブルなツールで、研究コミュニティに力を与えることを目指している。
論文 参考訳(メタデータ) (2026-01-04T15:48:51Z) - Context-Aware Hierarchical Taxonomy Generation for Scientific Papers via LLM-Guided Multi-Aspect Clustering [59.54662810933882]
既存の分類体系の構築手法は、教師なしクラスタリングや大きな言語モデルの直接的プロンプトを利用しており、コヒーレンスと粒度の欠如が多かった。
LLM誘導型マルチアスペクト符号化と動的クラスタリングを統合したコンテキスト対応階層型階層型分類生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-23T15:12:58Z) - Responsible AI in NLP: GUS-Net Span-Level Bias Detection Dataset and Benchmark for Generalizations, Unfairness, and Stereotypes [6.30817290125825]
本稿では、GUSデータセットとマルチラベルトークンレベル検出器を組み合わせたGUS-Net Frameworkを紹介し、社会バイアスのスパンレベル分析を行う。
GUSデータセットには、複数のドメインにまたがる3,739のユニークなスニペットが含まれ、69,000以上のトークンレベルのアノテーションが含まれている。
マルチラベルトークンレベルの分類としてバイアス検出を定式化し,エンコーダベースモデルとデコーダベース大規模言語モデルの両方をベンチマークする。
論文 参考訳(メタデータ) (2024-10-10T21:51:22Z) - Taxonomy Tree Generation from Citation Graph [15.188580557890942]
HiGTLは、人為的な指示や好みのトピックによってガイドされる、新しいエンドツーエンドフレームワークである。
我々は,各クラスタに中心的な概念を反復的に生成する,新しい分類ノード言語化戦略を開発した。
実験により、HiGTLはコヒーレントで高品質な概念を効果的に生成することが示された。
論文 参考訳(メタデータ) (2024-10-02T13:02:03Z) - State-of-the-art generalisation research in NLP: A taxonomy and review [87.1541712509283]
NLPにおける一般化研究の特徴付けと理解のための分類法を提案する。
我々の分類学は、一般化研究の広範な文献レビューに基づいている。
私たちは、一般化をテストする400以上の論文を分類するために分類を使います。
論文 参考訳(メタデータ) (2022-10-06T16:53:33Z) - Understanding Robust Generalization in Learning Regular Languages [85.95124524975202]
我々は、リカレントニューラルネットワークを用いて正規言語を学習する文脈における堅牢な一般化について研究する。
この問題に対処するための構成戦略を提案する。
構成戦略がエンド・ツー・エンド戦略よりもはるかに優れていることを理論的に証明する。
論文 参考訳(メタデータ) (2022-02-20T02:50:09Z) - Generalizing to Unseen Domains: A Survey on Domain Generalization [59.16754307820612]
ドメイン一般化は、1つまたは複数の異なるが関連するドメインが与えられる困難な設定を扱う。
目標は、目に見えないテストドメインに一般化できるモデルを学ぶことです。
本稿では,領域一般化の最近の進歩に対する最初のレビューを紹介する。
論文 参考訳(メタデータ) (2021-03-02T06:04:11Z) - LA-HCN: Label-based Attention for Hierarchical Multi-label
TextClassification Neural Network [16.12197413284402]
階層型Mutlti-label Text Classification Neural Network (LA-HCN) のためのラベルベースアテンションを提案する。
LA-HCNは、異なる階層レベルからラベルに基づいて、テキストから重要な情報を階層的に抽出するように設計されている。
個別の局所的およびグローバルな文書埋め込みが得られ、各局所的およびグローバルな分類を容易にするために使用される。
論文 参考訳(メタデータ) (2020-09-23T06:18:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。