論文の概要: GLAN-QnA-KR: A Seedless Taxonomy-Driven Korean Instruction Corpus
- arxiv url: http://arxiv.org/abs/2607.20443v1
- Date: Tue, 12 May 2026 15:23:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.163613
- Title: GLAN-QnA-KR: A Seedless Taxonomy-Driven Korean Instruction Corpus
- Title(参考訳): GLAN-QnA-KR:無作為な分類による韓国の教育法人
- Abstract要約: GLAN-QnA-KRは303,581列のオープンに再配布可能な韓国の命令QAコーパスである。
コーパスは、韓国の質問/回答文と組み合わせて、1,084の英語で書かれた規律の平坦な分類にまたがっている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We release GLAN-QnA-KR, a 303,581-row openly redistributable Korean instruction-QA corpus produced via the seedless taxonomy-driven GLAN synthesis pipeline with Microsoft's Phi-3.5-MoE-instruct as the producer model (generation: 2024-12; release: 2024-12; licence: OpenRAIL). The corpus spans a flat taxonomy of 1,084 English-labelled disciplines paired with Korean question/answer text, a 100-900 difficulty scale, and a median of 313 question characters and 1,098 answer characters per record. Two properties are atypical for synthetic instruction data at this scale: (i) exact duplicate questions number only 1 in 303,581 rows and character-trigram near-duplicate clusters at Jaccard >= 0.9 number zero in a 5,000-sample probe, and (ii) a two-layer contamination audit against KMMLU, KoBEST (five sub-tasks), and HAE-RAE-Bench shows a maximum test-vs-corpus question-level character-trigram Jaccard of 0.163 with zero test items at Jaccard >= 0.7, and a maximum multilingual-E5 cosine of 0.901 with a single test item at cosine >= 0.90 and zero at >= 0.95, across 20,000 sampled GLAN questions and seven evaluation sets. At the time of release, this is, to our knowledge, the largest single-pipeline synthetic Korean instruction corpus verifiable on the Hugging Face Hub and the only Korean >=100k-row corpus built under a seedless taxonomy-driven protocol. This note documents the generation protocol, corpus statistics, the contamination audit, and the licensing boundary in a form suitable for downstream citation.
- Abstract(参考訳): 我々は、MicrosoftのPhi-3.5-MoE-インストラクトを生産モデル(世代:2024-12;リリース:2024-12;ライセンス:OpenRAIL)として、GLAN合成パイプラインを介して、303,581行の再配布可能な韓国の命令QAコーパスであるGLAN-QnA-KRをリリースした。
コーパスは、韓国の質問/回答テキストと組み合わせた1,084の英語の学級、100-900の難易度尺度、そして1レコードあたり313の質問文字と1,098の回答文字からなる平坦な分類にまたがっている。
この規模での合成命令データには2つの特性が典型的でない。
(i)正確な重複質問数は、5,000サンプルプローブにおいて、303,581行に1個、ジャカード>=0.9番ゼロの文字-トリグラム近傍のクラスタに1個しかありません。
2) KMMLU, KoBEST (5つのサブタスク), HAE-RAE-Bench に対する2層汚染監査では, 最大テストvsコーパス質問レベル文字トリグラム Jaccard が0.163, Jaccard >= 0.7, 最大マルチリンガルE5コサインが0.901, 単一テスト項目が0.090, ゼロが0.095, GLAN が20,000, 評価セットが7であった。
リリース時点では、これはHugging Face Hubで検証可能な最大のシングルピペリン合成韓国語命令コーパスであり、シードレス分類駆動プロトコルで構築された韓国語>=100k-rowコーパスである。
このノートは、下流の引用に適した形式で、生成プロトコル、コーパス統計、汚染監査、およびライセンス境界を文書化する。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Natural Language Code Retrieval for 1C:Enterprise: An Open Benchmark and Efficient Bi-Encoder [0.0]
実世界の3,413のPIIスクラブ型クエリコードペアのオープンベンチマークを提示する。
公開コードリポジトリから Google/gemma-4-26B-A4B-it によって生成される合成三重項 784,057 を微調整する。
論文 参考訳(メタデータ) (2026-08-20T12:24:53Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Structural Pattern Mining in Inka Khipus: Unsupervised Clustering, Provenance Classification, and a Computational Validation of the Santa Valley Match [0.0]
54,403コードと110,677ノットからなる619 khipus の公開データベースである Open Khipu Repository (OKR) に適用した機械学習パイプラインを提案する。
我々は,khipu当たり27個の構造的特徴を設計し, (i) UMAPおよびHDBSCANを介して教師なしクラスタリングを適用し, 3つの構造的異なるグループを復元した。
我々は、n-gramとしてエンコードされた結び目型のシーケンス順序を再現し、集約的な特徴以外の信号を追加しないという負の結果を報告した。
論文 参考訳(メタデータ) (2026-06-30T21:06:38Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Reducing Maintenance Burden in Behaviour-Driven Development: A Paraphrase-Robust Duplicate-Step Detector with a 1.1M-Step Open Benchmark [1.9537983097153042]
振る舞い駆動開発スイートは、ドキュメント化されたメンテナンスコストとステップ重複の重複を蓄積します。
私たちはこれまでで最大の組織横断的なBDDステップコーパスをリリースします。
論文 参考訳(メタデータ) (2026-04-22T11:44:05Z) - Multilingual Multi-Label Emotion Classification at Scale with Synthetic Data [2.3424047967193826]
我々は23言語にまたがる100万以上の多ラベルサンプルからなる大規模合成学習コーパスを構築した。
DistilBERT (135Mパラメータ) から XLM-R-Large (560Mパラメータ) までの6つの多言語トランスフォーマーエンコーダを訓練・比較する。
GoEmotions (英語) とSemEval-2018 Task 1 E-c (英語,アラビア語,スペイン語) を用いて, ゼロショットの全モデルを評価する。
論文 参考訳(メタデータ) (2026-04-14T12:04:17Z) - Cross-Family Speculative Decoding for Polish Language Models on Apple~Silicon: An Empirical Evaluation of Bielik~11B with UAG-Extended MLX-LM [0.0]
MLX-LMフレームワークをUniversal Assisted Generation (UAG)で拡張し、Apple Silicon上でクロストケナイザの投機的復号を可能にする。
ポーランド語の3つのデータセット(Wikipedia、pl_alpaca、synthetic)の実験では、2, 4, 6のドラフト長kを用いて、ナイーブとコンテキスト対応のトークン翻訳を比較している。
論文 参考訳(メタデータ) (2026-03-22T19:07:41Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - Not All Errors are Equal: Learning Text Generation Metrics using
Stratified Error Synthesis [79.18261352971284]
人間のアノテーションを必要とせずに、人間の判断と高い相関関係を持つモデルベースの計量であるSESCOREを紹介する。
既存の指標に対してSESCOREを評価し,そのスコアと人間の評価との関係を比較検討した。
SESCOREは、人間による注釈付きトレーニングデータを受け取らず、最高の教師付きメトリックCOMETに匹敵するパフォーマンスを達成している。
論文 参考訳(メタデータ) (2022-10-10T22:30:26Z) - HuBERT: Self-Supervised Speech Representation Learning by Masked
Prediction of Hidden Units [81.53783563025084]
本稿では、BERTのような予測損失に対して、アライメントされたターゲットラベルを提供するオフラインクラスタリングステップを提案する。
提案手法の重要な要素は,マスク領域にのみ予測損失を適用することである。
HuBERTは、より困難なdev-otherおよびtest-other評価サブセットに対して、最大19%と13%の相対的なWER削減を示す。
論文 参考訳(メタデータ) (2021-06-14T14:14:28Z) - CoSQA: 20,000+ Web Queries for Code Search and Question Answering [63.92224685262063]
CoSQAデータセットには、自然言語クエリとコードのペア用の20,604ラベルが含まれている。
本稿では,クエリコードマッチングを強化するために,CoCLRと呼ばれる対照的な学習手法を提案する。
我々は,CodeXGLUEを同じCodeBERTモデルで評価し,CoSQAのトレーニングにより,コード質問応答の精度が5.1%向上したことを示す。
論文 参考訳(メタデータ) (2021-05-27T15:37:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。