論文の概要: Naver-News-KO: A Korean News Summarization Dataset for Open-Source Fine-Tuning of Summarization Models
- arxiv url: http://arxiv.org/abs/2607.20442v1
- Date: Tue, 12 May 2026 12:25:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.163166
- Title: Naver-News-KO: A Korean News Summarization Dataset for Open-Source Fine-Tuning of Summarization Models
- Title(参考訳): Naver-News-KO:韓国ニュース要約データセット
- Abstract要約: このデータセットは、2022年7月の10日間の窓越しにNaver Newsから収集された27,400対(文書、要約)の韓国ニュース要約データセットである。
データセットは2023年1月からHugging Face Hubで公開されており、2026年5月現在、月間約33,000ダウンロードを受け付けている。
目標は、新しいベンチマークを提案するのではなく、すでにこのデータセットを使用しているダウンストリーム作業に対して、決定可能なリファレンスを提供することだ。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We release Naver-News-KO, a Korean news summarization dataset of 27,400 (document, summary) pairs collected from Naver News over a ten-day window in July 2022 across two categories (Economy and IT/Science; 77/23 split), with train/validation/test partitions of 22,194 / 2,466 / 2,740 and a mean per-record document-to-summary character-compression ratio of 6.03x. The dataset has been publicly hosted on the Hugging Face Hub since January 2023 and, as of May 2026, receives approximately 33,000 downloads per month; community-maintained Korean summarization models fine-tuned on it include Gemma-2B-ko and Gemma2-9B variants. This technical report (i) documents the collection protocol, the column schema, and the split construction, (ii) reports corpus-level statistics (length distributions, compression ratio, and a measured 16.8% near-duplicate title-Jaccard overlap between test and train that users should be aware of), (iii) positions the resource against other open Korean summarization corpora, (iv) provides a Lead-3 extractive reference point (ROUGE-1 55.1, ROUGE-L 50.6) and two reproducible fine-tuned baselines -- KoBART (R-1 56.6, BERTScore-F1 81.5) and Gemma-2B-ko with LoRA (R-1 55.3, BERTScore-F1 78.3) -- with release-time training scripts, and (v) clarifies the licensing and intended-use scope of the resource. The goal is to provide a citable reference for downstream work that already uses this dataset, not to propose a new benchmark.
- Abstract(参考訳): 韓国のニュース要約データセットであるNaver-News-KOは,2022年7月にNaver Newsから収集した27,400対(ドキュメント,要約)のペアを,2つのカテゴリ(経済とIT/科学,77/23分割),22,194 / 2,466 / 2,740の列車/検証/テストパーティション,平均記録毎の文字圧縮比6.03倍の2つのカテゴリに分けてリリースした。
データセットは2023年1月からHugging Face Hubで公開されており、2026年5月現在、月33,000回ダウンロードされている。
この技術報告
i) 収集プロトコル、列スキーマ、分割構成を文書化する。
(二 コーパスレベルの統計(長さ分布、圧縮比、及び利用者が気付くべきテストと列車のほぼ重複したタイトルカードの16.8%)
三 韓国の他の開放的な要約コーパスに対して資源を配置すること。
(iv) Lead-3抽出基準点(ROUGE-1 55.1, ROUGE-L 50.6)と2つの再現可能な微調整ベースライン -- KoBART (R-1 56.6, BERTScore-F1 81.5)とGemma-2B-ko with LoRA (R-1 55.3, BERTScore-F1 78.3) -- を提供する。
(v) リソースのライセンスと意図された使用範囲を明確にする。
目標は、新しいベンチマークを提案するのではなく、すでにこのデータセットを使用しているダウンストリーム作業に対して、決定可能なリファレンスを提供することだ。
関連論文リスト
- PaperGym: Rubric-Centered Evolution for Research-Plan Generation [69.5921878728483]
各研究論文を完全なトレーニング環境に変換する統合フレームワークであるPaperGymを紹介する。
PaperGymは論文の構造を利用しており、質問は研究目標と背景から合成され、基準は手法と実験から導かれる。
レシピが固定され、PaperGym-20kで訓練されたモデルが3方向比較の58.1%を獲得し、Hub Scienceの28.2%が勝利した。
論文 参考訳(メタデータ) (2026-08-31T17:31:18Z) - Annotated Surrogate Retrieval for Polish Statutory Law [0.0]
本稿では,文書代理法に基づくポーランド法典の検索方法のファミリについて述べる。
ASCRはサロゲートカスケードであり、ASCR-Hはそのカスケードに密度の高いリストを融合させ、DTFは言語モデルの両方のステージを3つの語彙と密度の高いレトリバーで置き換える。
2024年と2025年のポーランドの弁護士試験と法律顧問試験の300問に対して,これら3項目について,語彙,密集度,融解度,融解度と4つの基準値とを比較検討した。
論文 参考訳(メタデータ) (2026-08-31T15:05:00Z) - HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries [1.5965246343492343]
HIRAは、トレーニング不要でオンプレミスの検索拡張された、規制されたデプロイメントにおけるドキュメント分類のためのカスケードである。
信頼された文書は、検索によって直接分類され、不確実または視覚的に不確実な文書は、ローカルにホストされた検証者に渡される。
プライベートな80クラスのトレーディングファイナンスコーパスでは、HIRAが30,233のドキュメント生成ストリームを処理し、わずか1,945のドキュメントに対して人間の修正を要求する。
論文 参考訳(メタデータ) (2026-08-22T06:19:19Z) - A Structured Knowledge Infrastructure for Domain-Specific Data Asset Discovery [3.199771721348483]
本稿では,Xiaohongshuの商用広告データウェアハウスに展開する2層ソリューションについて紹介する。
3階層の二重目的知識ベースは、検索と生成の両方に役立っている。
Graph-Guided Retriever (GGR)は、2,859ノードのナレッジグラフを、意図的なルーティングを備えた候補ゲートとして使用して、71.6倍のトークン削減を実現している。
論文 参考訳(メタデータ) (2026-07-30T06:40:05Z) - Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS) [46.877501276559165]
GitHubは数億のパブリックリポジトリをホストしているが、リポジトリから標準化された業界セクターへのネイティブマッピングは公開していない。
NAICS-GHは、米国、欧州連合、オーストラリアをカバーするソースプールから作成した6,588のGitHubリポジトリの公開コーパスである。
ラベルは、BAAI/bge-large-en埋め込み、FAISS検索、GPT-4.1スコアを組み合わせた検索・検証パイプラインによって作成される。
論文 参考訳(メタデータ) (2026-07-07T17:06:32Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - CorPipe at CRAC 2026: Empty Nodes and Cross-Lingual Transfer in Multilingual Coreference Resolution [0.6671865055671308]
CorPipe 26はCorPipe 25の改良版で、空のノードを予測し、参照とコア参照リンクを単一のモデルで生成する。
我々のシステムは、LLMトラックの他の全ての投稿を2.8%、制約なしトラックの全ての投稿を9.5%上回っている。
論文 参考訳(メタデータ) (2026-05-28T16:01:03Z) - Benchmarking Patent Embeddings: A Multi-Task Evaluation of 22 Models Across Retrieval, Classification, and Clustering [0.0]
我々は,情報検索,分類,クラスタリングという3つのタスクに対して,事前学習した22の埋め込みモデルを評価する。
2つの結果は、一般的な知恵に疑問を投げかけている。
論文 参考訳(メタデータ) (2026-05-22T23:51:13Z) - GLAN-QnA-KR: A Seedless Taxonomy-Driven Korean Instruction Corpus [0.0]
GLAN-QnA-KRは303,581列のオープンに再配布可能な韓国の命令QAコーパスである。
コーパスは、韓国の質問/回答文と組み合わせて、1,084の英語で書かれた規律の平坦な分類にまたがっている。
論文 参考訳(メタデータ) (2026-05-12T15:23:59Z) - Delta-Based Neural Architecture Search: LLM Fine-Tuning via Code Diffs [48.83701310501069]
大規模言語モデル(LLM)は、ニューラルアーキテクチャ生成の強力な可能性を示している。
既存のアプローチは、ゼロから完全なモデル実装を生成します。
我々はデルタ符号生成法を提案し、細調整されたLLMはコンパクトな統一差分を生成する。
論文 参考訳(メタデータ) (2026-05-06T13:32:05Z) - Automated Knowledge Graph Construction using Large Language Models and Sentence Complexity Modelling [0.39089069256361736]
文レベルの知識グラフを抽出するエンドツーエンドパイプラインであるCoDe-KGを導入する。
オープンソースである15万以上のナレッジトリプルのデータセットをコントリビュートしています。
提案手法は, 文章の簡潔化において, 正解精度が99.8%まで向上することが示唆された。
論文 参考訳(メタデータ) (2025-09-22T00:01:50Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - ICDAR 2023 Competition on Structured Text Extraction from Visually-Rich
Document Images [198.35937007558078]
大会は2022年12月30日に開かれ、2023年3月24日に閉幕した。
トラック1には35人の参加者と91人の有効な応募があり、トラック2には15人の参加者と26人の応募がある。
提案手法の性能によると, 複雑なシナリオやゼロショットシナリオにおいて, 期待される情報抽出性能にはまだ大きなギャップがあると考えられる。
論文 参考訳(メタデータ) (2023-06-05T22:20:52Z) - MobIE: A German Dataset for Named Entity Recognition, Entity Linking and
Relation Extraction in the Mobility Domain [76.21775236904185]
データセットは3,232のソーシャルメディアテキストと91Kトークンによるトラフィックレポートで構成され、20.5Kアノテーション付きエンティティを含んでいる。
データセットのサブセットには,7つのモビリティ関連,n-ary関係型がアノテートされている。
私たちの知る限りでは、NER、EL、REのアノテーションを組み合わせた最初のドイツ語データセットです。
論文 参考訳(メタデータ) (2021-08-16T08:21:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。