論文の概要: Linking Hadith Narrator Identities Across Heterogeneous Arabic Biographical Databases: A Multi-Signal Entity Resolution Pipeline
- arxiv url: http://arxiv.org/abs/2607.05424v1
- Date: Tue, 30 Jun 2026 04:59:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.25646
- Title: Linking Hadith Narrator Identities Across Heterogeneous Arabic Biographical Databases: A Multi-Signal Entity Resolution Pipeline
- Title(参考訳): 異種アラビア語伝記データベースにおけるハディス・ナレーターの同一性:多信号エンティティ・レゾリューション・パイプライン
- Authors: Taufiq Wirahman,
- Abstract要約: そこで本研究では,Sanadset 650Kコーパスから2つの伝記データベースにナレーター名をリンクする2段階のエンティティ分解パイプラインを提案する。
フェーズ1は、名前のみの類似性(Sanadsetにはメタデータがない)を使用して、Sanadset名をHawramaniにマッチさせ、94,628リンク(51.1%、High 39,938 / MED 54,690)を得る。
第2相 ホーラマーニのムスリム学者に対する相互参照 名前の類似性、死亡年近性、信頼性等級極性を組み合わせた重み付き多信号関数により、95,573リンク(ホーラマーニの94.7%、高18,245 / MED 71,546 /
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The transmission chains (sanad) of Islamic Hadith literature encode relationships among tens of thousands of historical narrators whose biographical records are dispersed across independently maintained digital databases that share no common identifier. We present a two-phase entity resolution pipeline that links narrator names from the Sanadset 650K corpus - 650,986 Hadith records from 926 books containing 185,216 unique narrator name variants - to two biographical databases: Hadithtransmitters (Hawramani; 100,915 entries) and Muslimscholars (25,247 entries). Phase 1 matches Sanadset names to Hawramani using name-only similarity (Sanadset carries no metadata), yielding 94,628 links (51.1%; HIGH 39,938 / MED 54,690). Phase 2 cross-references Hawramani against Muslimscholars via a weighted multi-signal function combining name similarity, death-year proximity, and reliability grade polarity, yielding 95,573 links (94.7% of Hawramani; HIGH 18,245 / MED 71,546 / LOW 5,782). Chaining the two phases gives Sanadset narrators transitive access to Muslimscholars data. The linked data enable construction of a 185,216-node, 814,093-edge directed transmission graph enriched with cross-source biographical metadata. The annotated link corpora and enriched graph are released as open resources.
- Abstract(参考訳): イスラム・ハディース文学のトランスミッション・チェーン(サナード)は、伝記記録が共有されていない独立したデジタルデータベースに分散している数万の歴史的ナレーター間の関係を符号化している。
そこで本研究では,サナドセット650Kコーパス650,986のナレーター名と185,216のユニークなナレーター名の変種を含む926冊のHadithレコードと,2つの伝記データベースであるHadithtransmitters (Hawramani; 100,915エントリ)とMurisscholars (25,247エントリ)をリンクする2段階のエンティティ分解パイプラインを提案する。
フェーズ1は、名前のみの類似性(Sanadsetにはメタデータがない)を用いて、Sanadsetの名前とHawramaniにマッチし、94,628リンク(51.1%; High 39,938 / MED 54,690)を得る。
第2段階 ムスリム学者に対するホーラマーニの相互参照 名前の類似性、死亡年数、信頼性グレードの極性を組み合わせた重み付き多信号関数により、95,573のリンク(ホーラマーニの94.7%、ハイド18,245 / MED 71,546 / LOW 5,782)が得られる。
2つのフェーズを繋ぐことで、サナドセットのナレーターはムスリムの学者のデータに推移的にアクセスできる。
リンクされたデータは、185,216ノード、814,093エッジの送信グラフの構築を可能にする。
アノテーション付きリンクコーパスとリッチグラフは、オープンリソースとして解放される。
関連論文リスト
- Quran-MD: A Fine-Grained Multilingual Multimodal Dataset of the Quran [1.3481884955361023]
Quran MDはQuranの包括的なデータセットであり、詩や単語レベルでテキスト、言語、音声の次元を統合する。
このデータセットは自然言語処理、音声認識、音声合成、言語分析、デジタルイスラム研究など様々な応用をサポートしている。
論文 参考訳(メタデータ) (2026-01-25T15:23:37Z) - ParsTranslit: Truly Versatile Tajik-Farsi Transliteration [6.164342356356261]
ペルシア語は、アフガニスタンとイランのペルソ・アラビア語と、タジキスタンのタジク・キリル語という2つの標準を用いている。
文字の違いは、単純な1対1のマッピングを妨げ、タジキスタンとペルシャ語を話す兄弟の間で書かれたコミュニケーションと相互作用を妨げる」。
そこで本研究では,タジク・ファルシ文字翻訳のための最先端のシーケンス・ツー・シーケンスモデルを提案する。
論文 参考訳(メタデータ) (2025-10-08T20:33:50Z) - QuranMorph: Morphologically Annotated Quranic Corpus [0.0]
QuranMorphは、Quranのモルフォロジー的な注釈付きコーパスである。
補題化プロセスはアラビア語の語彙データベースであるQabasの補題を利用していた。
微粒なSAMA/Qabasタグセットを用いて音声タグ付けを行った。
論文 参考訳(メタデータ) (2025-06-22T19:34:09Z) - Tails Tell Tales: Chapter-Wide Manga Transcriptions with Character Names [53.24414727354768]
本論文は,マンガ全章の対話書き起こしを完全自動生成することを目的とする。
i) 言っていることを識別し、各ページのテキストを検出し、それらが本質的か非本質的かに分類する。
また、章を通して同じ文字が一貫した名前で呼ばれることも保証している。
論文 参考訳(メタデータ) (2024-08-01T05:47:04Z) - Quranic Audio Dataset: Crowdsourced and Labeled Recitation from Non-Arabic Speakers [1.2124551005857038]
本稿では、アラビア語以外の話者に対して、クアン語を引用する学習の課題について論じる。
我々はボランティアベースのクラウドソーシングのジャンルを用いて、オーディオ資産を集めるためにクラウドソーシングAPIを実装している。
我々は、11カ国以上にわたる1287人の参加者のプールから、約7000人のクラーニックのリサイクリングを収集しました。
論文 参考訳(メタデータ) (2024-05-04T14:29:05Z) - SemRel2024: A Collection of Semantic Textual Relatedness Datasets for 13 Languages [44.017657230247934]
textitSemRelは13言語にまたがるネイティブスピーカーによって注釈付けされた新しいセマンティック関連データセットである。
これらの言語は5つの異なる言語族の出身であり、主にアフリカとアジアで話されている。
SemRelデータセットの各インスタンスは、2つの文間の意味的テキスト関連性の度合いを表すスコアに関連付けられた文対である。
論文 参考訳(メタデータ) (2024-02-13T18:04:53Z) - WikiDes: A Wikipedia-Based Dataset for Generating Short Descriptions
from Paragraphs [66.88232442007062]
ウィキデックスはウィキペディアの記事の短い記述を生成するデータセットである。
データセットは、6987のトピックに関する80万以上の英語サンプルで構成されている。
本論文は,ウィキペディアとウィキデータに多くの記述が欠落していることから,実際的な影響を示すものである。
論文 参考訳(メタデータ) (2022-09-27T01:28:02Z) - Comprehensive Benchmark Datasets for Amharic Scene Text Detection and
Recognition [56.048783994698425]
Ethiopic/Amharicスクリプトはアフリカ最古の書記システムの一つで、東アフリカで少なくとも23の言語に対応している。
アムハラ語の表記体系である Abugida は282音節、15句の句読点、20の数字を持つ。
HUST-ART, HUST-AST, ABE, Tana という,自然界におけるアムハラ文字の検出と認識のための総合的な公開データセットを提示した。
論文 参考訳(メタデータ) (2022-03-23T03:19:35Z) - Assessing the quality of sources in Wikidata across languages: a hybrid
approach [64.05097584373979]
いくつかの言語でラベルを持つWikidataのトリプルからサンプルした参照コーパスの大規模なコーパスを評価するために,一連のマイクロタスク実験を実施している。
クラウドソースアセスメントの統合されたバージョンを使用して、いくつかの機械学習モデルをトレーニングして、Wikidata全体の分析をスケールアップしています。
この結果はWikidataにおける参照の質の確認に役立ち、ユーザ生成多言語構造化データの品質をWeb上で定義し、取得する際の共通の課題を特定するのに役立ちます。
論文 参考訳(メタデータ) (2021-09-20T10:06:46Z) - Image Collation: Matching illustrations in manuscripts [76.21388548732284]
図形照合の課題と,大規模な注釈付き公開データセットを導入して,ソリューションの評価を行う。
本研究は,本課題における美術類似度測定の実態を分析し,簡単な場合では成功したが,大規模な写本に苦慮していることを示す。
サイクル一貫性の対応を利用して,大幅な性能向上が期待できることを示す。
論文 参考訳(メタデータ) (2021-08-18T12:12:14Z) - ParsEL 1.0: Unsupervised Entity Linking in Persian Social Media Texts [6.866104126509981]
ソーシャルメディアデータの大部分は自然言語テキストである。
最近、ペルシャの知識グラフであるFarsBaseが50万近いエンティティを含む形で導入された。
本稿では,教師なしペルシャのエンティティリンクシステムを提案する。
論文 参考訳(メタデータ) (2020-04-22T19:34:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。