論文の概要: Cross-lingual Biography Enrichment via Claim Extraction and Alignment
- arxiv url: http://arxiv.org/abs/2608.23390v2
- Date: Wed, 26 Aug 2026 09:59:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.065263
- Title: Cross-lingual Biography Enrichment via Claim Extraction and Alignment
- Title(参考訳): クレーム抽出とアライメントによる言語間バイオグラフィの強化
- Abstract要約: 本研究は,既存の英語伝記を同一人物に関する非英語伝記によって裏付けられた事実に富む,言語横断的伝記の充実について研究する。
英語の伝記をフランス語、中国語、アゼルバイジャン語とリンクする300のウィキペディアの伝記からなるベンチマークであるtextscCLAW-4Lを紹介した。
本研究では,両文献から英文主張を抽出し,非英文伝記から英文証拠を同定し,選択した主張を用いて英文文献を書き換えるクレームベース富化フレームワークを提案する。
- 参考スコア(独自算出の注目度): 16.007218062642615
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: English Wikipedia is often treated as the default encyclopedic source, yet non-English Wikipedia editions can contain richer locally grounded information for long-tail figures. We study cross-lingual biography enrichment: enriching an existing English biography with facts supported by a non-English biography about the same person. Focusing on women from non-English-speaking contexts, we introduce \textsc{CLAW-4L}, a benchmark consisting of 300 Wikipedia biography pairs linking an English biography with its French, Chinese or Azerbaijani counterpart, along with claim annotations and a fine-grained claim-pair relation corpus. We propose a claim-based enrichment framework that extracts English claims from both biographies, aligns them to identify enrichment evidence from the non-English biography, and rewrites the English biography using the selected claims. Our results show that non-English Wikipedia biographies provide valuable evidence for improving English biography coverage, while lower-resource settings remain challenging.
- Abstract(参考訳): 英語ウィキペディアは、しばしばデフォルトの百科事典として扱われるが、英語以外のウィキペディア版は、ロングテール・フィギュアのためのより豊かな現地情報を含むことができる。
本研究は,既存の英語伝記を同一人物に関する非英語伝記によって裏付けられた事実に富む,言語横断的伝記の充実について研究する。
非英語の文脈から女性に焦点を当て、300のウィキペディアの伝記をフランス語、中国語、アゼルバイジャン語と結びつけたベンチマークである「textsc{CLAW-4L}」と、クレームアノテーションときめ細かいクレームペア関係コーパスを紹介する。
本研究では,両文献から英文の主張を抽出し,非英文の伝記から英文の証拠を同定し,選択した主張を用いて英文の伝記を書き換えるクレームベースエンリッチメントフレームワークを提案する。
以上の結果から,非英語ウィキペディアのバイオグラフィーは,低リソース設定が困難であるのに対して,英語のバイオグラフィーを向上させる貴重な証拠となることが示唆された。
関連論文リスト
- WikiGap: Promoting Epistemic Equity by Surfacing Knowledge Gaps Between English Wikipedia and other Language Editions [36.242747402301575]
ウィキガップ(WikiGap)は、ウィキペディアの他のウィキペディアのインタフェースから得られる補完的な事実を抽出するシステムである。
具体的には、最近の多言語情報ギャップ発見法とユーザ中心の設計を組み合わせることで、WikiGapはフランス語、ロシア語、中国語のウィキペディアから補完的な情報にアクセスすることができる。
WikiGapは、ウィキペディアの現在のILLベースのナビゲーションシステムと比較して、ファクトフィニングの精度を大幅に改善し、タスク時間を短縮し、32ポイント高いユーザビリティスコアを得た。
論文 参考訳(メタデータ) (2025-05-30T04:14:03Z) - On the effective transfer of knowledge from English to Hindi Wikipedia [4.427603894929721]
英語とヒンディー語の間の知識の共有性を高めるための軽量な枠組みを提案する。
英語のウィキペディアページが最新でない場合、我々のフレームワークはウィキペディア特有のスタイルに適合するように適応します。
本フレームワークは,ヒンディー語ウィキペディアのセクションに対して,自動的および人的判断に基づく評価に基づいて,ヒンディー語ウィキペディア記事の65%と62%を効果的に生成する。
論文 参考訳(メタデータ) (2024-12-07T17:43:21Z) - Shared Heritage, Distinct Writing: Rethinking Resource Selection for East Asian Historical Documents [60.348103523743276]
古典中国語から漢語・漢文への言語間移動可能性の仮定を疑問視する。
実験の結果,漢文で書かれた古代朝鮮語文書の言語モデル性能に対する古典中国語データセットの影響は最小限であった。
論文 参考訳(メタデータ) (2024-11-07T15:59:54Z) - Locating Information Gaps and Narrative Inconsistencies Across Languages: A Case Study of LGBT People Portrayals on Wikipedia [49.80565462746646]
我々は,情報ギャップと矛盾を事実レベルで特定するための,効率的かつ信頼性の高い手法であるInfoGap法を紹介した。
我々は、LGBTの人々の描写を分析してInfoGapを評価し、英語、ロシア語、フランス語のウィキペディアの2.7Kの伝記ページを解析した。
論文 参考訳(メタデータ) (2024-10-05T20:40:49Z) - FRACAS: A FRench Annotated Corpus of Attribution relations in newS [0.0]
引用抽出と情報源帰属のために,フランス語で1676年のニュースワイヤテキストを手作業で注釈付けしたコーパスを提示する。
まず,データ選択時のコーパスの構成と選択について述べる。
次に、手動ラベリングに取り組んでいる8つのアノテータ間のアノテータ間合意について詳述する。
論文 参考訳(メタデータ) (2023-09-19T13:19:54Z) - Mapping Process for the Task: Wikidata Statements to Text as Wikipedia
Sentences [68.8204255655161]
本稿では,ウィキデータ文をウィキペディアのプロジェクト用自然言語テキスト(WS2T)に変換するタスクに対して,文レベルでのマッピングプロセスを提案する。
主なステップは、文を整理し、四つ組と三つ組のグループとして表現し、それらを英語のウィキペディアで対応する文にマッピングすることである。
文構造解析,ノイズフィルタリング,および単語埋め込みモデルに基づく文成分間の関係について,出力コーパスの評価を行った。
論文 参考訳(メタデータ) (2022-10-23T08:34:33Z) - Placing (Historical) Facts on a Timeline: A Classification cum Coref
Resolution Approach [4.809236881780707]
タイムラインは、ある期間に起こった重要な歴史的事実を視覚化する最も効果的な方法の1つである。
複数の(歴史的)テキスト文書からイベントタイムラインを生成するための2段階システムを提案する。
我々の結果は、歴史学者、歴史研究の進展、そして国の社会・政治の風景を理解する上で非常に役立ちます。
論文 参考訳(メタデータ) (2022-06-28T15:36:44Z) - Models and Datasets for Cross-Lingual Summarisation [78.56238251185214]
対象言語における多文要約に関連付けられたソース言語において,長い文書を含む言語間要約コーパスを提案する。
コーパスは、チェコ語、英語、フランス語、ドイツ語の4つの言語について、12の言語対と指示をカバーしている。
言語対応のウィキペディアのタイトルから、主節と記事の本体を組み合わせることで、ウィキペディアから言語横断的な文書要約インスタンスを導出する。
論文 参考訳(メタデータ) (2022-02-19T11:55:40Z) - Cross-Lingual Training with Dense Retrieval for Document Retrieval [56.319511218754414]
我々は、英語のアノテーションから複数の非英語言語への文書ランク付けのための異なる転送手法について検討する。
6つの言語(中国語、アラビア語、フランス語、ヒンディー語、ベンガル語、スペイン語)におけるテストコレクションの実験。
弱教師付きターゲット言語転送は、世代ベースターゲット言語転送に対する競合性能をもたらすことが判明した。
論文 参考訳(メタデータ) (2021-09-03T17:15:38Z) - Learning Domain-Specialised Representations for Cross-Lingual Biomedical
Entity Linking [66.76141128555099]
言語横断型バイオメディカルエンティティリンクタスク(XL-BEL)を提案する。
まず、標準単言語英語BELタスクを超えて、標準単言語および多言語LMと同様に、標準的な知識に依存しない能力について検討する。
次に、リソースに富んだ言語からリソースに乏しい言語にドメイン固有の知識を移すことの課題に対処する。
論文 参考訳(メタデータ) (2021-05-30T00:50:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。