論文の概要: KoCHET: a Korean Cultural Heritage corpus for Entity-related Tasks
- arxiv url: http://arxiv.org/abs/2209.00367v1
- Date: Thu, 1 Sep 2022 11:23:03 GMT
- ステータス: 処理完了
- システム内更新日: 2022-09-02 13:21:19.428348
- Title: KoCHET: a Korean Cultural Heritage corpus for Entity-related Tasks
- Title(参考訳): コチェット(KoCHET):朝鮮文化遺産法人、エンティティ関連事業
- Authors: Gyeongmin Kim, Jinsung Kim, Junyoung Son, Heuiseok Lim
- Abstract要約: コチェット(KoCHET)は、韓国の文化遺産団体。
112,362、38,765、113,198のNER、RE、ETタスクからなる。
既存の公的なコーパスとは異なり、修正された再配布は国内外の研究者の両方に許される。
- 参考スコア(独自算出の注目度): 2.9439848714137447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As digitized traditional cultural heritage documents have rapidly increased,
resulting in an increased need for preservation and management, practical
recognition of entities and typification of their classes has become essential.
To achieve this, we propose KoCHET - a Korean cultural heritage corpus for the
typical entity-related tasks, i.e., named entity recognition (NER), relation
extraction (RE), and entity typing (ET). Advised by cultural heritage experts
based on the data construction guidelines of government-affiliated
organizations, KoCHET consists of respectively 112,362, 38,765, 113,198
examples for NER, RE, and ET tasks, covering all entity types related to Korean
cultural heritage. Moreover, unlike the existing public corpora, modified
redistribution can be allowed both domestic and foreign researchers. Our
experimental results make the practical usability of KoCHET more valuable in
terms of cultural heritage. We also provide practical insights of KoCHET in
terms of statistical and linguistic analysis. Our corpus is freely available at
https://github.com/Gyeongmin47/KoCHET.
- Abstract(参考訳): デジタル化された伝統文化遺産文書が急速に増加し、保存・管理の必要性が増し、実体の実践的認識と類型化が不可欠となった。
そこで我々は,韓国の文化遺産コーパスであるKoCHETを提案する。これは,エンティティ認識(NER)や関係抽出(RE),エンティティタイピング(ET)といった,典型的なエンティティ関連タスクのためのものだ。
政府系団体のデータ構築ガイドラインに基づく文化遺産専門家の助言により、韓国文化遺産に関連するすべての実体を網羅した112,362, 38,765, 113,198件のNER, RE, ETの事例からなる。
さらに、既存の公的なコーパスとは異なり、修正された再分配は国内外の研究者にも許される。
実験の結果,KoCHETの実用性は文化遺産の面でより有益であることがわかった。
また,統計的および言語学的分析の観点から,KoCHETの実践的洞察を提供する。
当社のコーパスはhttps://github.com/Gyeongmin47/KoCHET.comから無償で入手可能です。
関連論文リスト
- CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in
Korean [19.63074498876516]
韓国における1,995対のQAペアからなる文化・言語知能のベンチマークについて紹介する。
CLIcKは、公式の韓国の試験と教科書からデータを入手し、質問を言語と文化の2つの主要なカテゴリで11のカテゴリに分けている。
CLIcKを用いて、13の言語モデルを用いて、パフォーマンスを評価する。評価では、カテゴリ間でのパフォーマンスに関する洞察と、その理解に影響を与えるさまざまな要因を明らかにする。
論文 参考訳(メタデータ) (2024-03-11T03:54:33Z) - Massively Multi-Cultural Knowledge Acquisition & LM Benchmarking [48.21982147529661]
本稿では,多文化知識獲得のための新しいアプローチを提案する。
本手法は,文化トピックに関するウィキペディア文書からリンクページの広範囲なネットワークへ戦略的にナビゲートする。
私たちの仕事は、AIにおける文化的格差のギャップを深く理解し、橋渡しするための重要なステップです。
論文 参考訳(メタデータ) (2024-02-14T18:16:54Z) - HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models [0.0]
HAE-RAE Benchは韓国の文化的・文脈的深度に欠けるモデルに挑戦するためのデータセットである。
このデータセットは、語彙、歴史、一般的な知識、読み理解の4つの領域にまたがる6つの下流タスクを含んでいる。
論文 参考訳(メタデータ) (2023-09-06T04:38:16Z) - Automating the Analysis of Institutional Design in International
Agreements [52.77024349608834]
開発ツールは、法的文書の収集、機関文法による注釈付け、グラフ解析による正式な制度設計の探索などの技術を利用している。
2003年、ユネスコ無形文化財保護条約(UNESCO Convention for the Safeguarding of the Intangible Cultural Heritage)が採択された。
論文 参考訳(メタデータ) (2023-05-26T08:57:11Z) - Empowering LLM-based Machine Translation with Cultural Awareness [52.365390827200464]
伝統的なニューラルネットワーク翻訳(NMT)システムは、しばしば文化的に特定の情報を含む文の翻訳に失敗する。
最近のインコンテキスト学習では、機械翻訳を行うために、軽量なプロンプトを使用して、大規模言語モデル(LLM)をガイドしている。
我々は、文化的に関連のある並列コーパスを構築するための新しいデータキュレーションパイプラインを導入する。
論文 参考訳(メタデータ) (2023-05-23T17:56:33Z) - HUE: Pretrained Model and Dataset for Understanding Hanja Documents of
Ancient Korea [59.35609710776603]
我々は、時系列属性、トピック分類、名前付きエンティティ認識、要約検索タスクからなるハンハ理解評価データセットをリリースする。
また、本研究では、14世紀から19世紀にかけての2つの主要なコーパスについて、ヨセオン王朝のアンナスと王立事務局の日記のトレーニングを継続したBERTベースのモデルについても紹介する。
論文 参考訳(メタデータ) (2022-10-11T03:04:28Z) - Geolocation of Cultural Heritage using Multi-View Knowledge Graph
Embedding [18.822364073669583]
本稿では,有形文化財に関する知識を習得するための枠組みを提案する。
また,文化遺産間の相対的距離を推定する学習モデルを提案する。
論文 参考訳(メタデータ) (2022-09-08T08:32:34Z) - Entity Graph Extraction from Legal Acts -- a Prototype for a Use Case in
Policy Design Analysis [52.77024349608834]
本稿では,公共政策設計の定量的研究を支援するために開発されたプロトタイプについて述べる。
本システムの目的は,法律文書の収集プロセスの自動化,機関文法の注釈付け,ハイパーグラフによる重要機関間の相互関係の分析である。
論文 参考訳(メタデータ) (2022-09-02T10:57:47Z) - The "Collections as ML Data" Checklist for Machine Learning & Cultural
Heritage [0.20305676256390934]
デジタルコレクションに機械学習を適用する際に、重要な社会技術レンズを検討する努力が増えている。
マシンラーニングプロジェクトに着手する実践者のために作られたガイドラインは、まだ数多く残っています。
本稿では,機械学習プロジェクトの開発において採用可能な質問やプラクティスをガイドする詳細なチェックリストを定式化することによって,このニーズに寄与する。
論文 参考訳(メタデータ) (2022-07-06T20:35:25Z) - WHOSe Heritage: Classification of UNESCO World Heritage "Outstanding
Universal Value" Documents with Smoothed Labels [1.6440434996206623]
本研究は, 最新のnlpモデルを用いて, 公式のuv正当化文を含む新しい実世界のデータセット上に分類器を構築する。
ラベル平滑化は革新的に、タスクをマルチクラス分類とマルチラベル分類にスムーズに変換するために適応する。
この研究は、BERTとULMFiTから微調整された最良のモデルが94.3%のトップ3の精度に達することを示した。
論文 参考訳(メタデータ) (2021-04-12T15:18:41Z) - CoLAKE: Contextualized Language and Knowledge Embedding [81.90416952762803]
文脈型言語と知識埋め込み(CoLAKE)を提案する。
CoLAKEは、言語と知識の両方の文脈化された表現を、拡張された目的によって共同で学習する。
知識駆動タスク、知識探索タスク、言語理解タスクについて実験を行う。
論文 参考訳(メタデータ) (2020-10-01T11:39:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。