論文の概要: Edu-QuRating: Multi-Dimensional Educational Data Curation with Distilled Pairwise Judgements
- arxiv url: http://arxiv.org/abs/2609.09425v1
- Date: Tue, 08 Sep 2026 20:24:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.811228
- Title: Edu-QuRating: Multi-Dimensional Educational Data Curation with Distilled Pairwise Judgements
- Title(参考訳): Edu-Qurating:多次元教育データキュレーション
- Abstract要約: Edu-QuRatingは多次元の教育データ収集とキュレーションのためのパイプラインである。
2つのシーケンス分類ベースモデルと6つの教育基準の中で、最高のEdu-QuRaterは平均精度0.917のGPT-4.1-miniペアの判定を回復する。
- 参考スコア(独自算出の注目度): 2.710484946663334
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Educational data filters have become a practical way to improve language-model pre-training, but most filters treat educational value as a single scalar property. This may be too broad for some applications, especially if the data set already features a high density of educational material. Useful learning material needs to be accurate, engaging, well structured, and appropriate for the intended audience and application (e.g. learner- vs teacher-facing). Following QuRating (Wettig et al. 2024), we introduce Edu-QuRating: a pipeline for multi-dimensional educational data scoring and curation. Edu-QuRating defines education-specific rubrics, uses an LLM judge to label sampled document pairs and distills those pairwise preferences into reusable Edu-QuRaters, which can score individual text chunks on a set of educational criteria. Across two sequence-classification base models and six educational criteria, the best Edu-QuRater recovers held-out GPT-4.1-mini pairwise judgements with mean accuracy 0.917. We then apply the resulting scorers in two applications. First, we investigate the potential of Edu-QuRaters for corpus filtering to improve pretraining of small language models. We scored 322.25M FineWeb-Edu-Fortified documents to obtain a filtered pre-training mixture. In matched single-run pre-training comparisons, models trained with Edu-QuRating-based mixtures reached higher observed aggregate accuracy across nine benchmarks than the FineWeb-Edu baseline, with gains concentrated in particular tasks. Second, we used Edu-QuRater scores as reward terms for GRPO post-training. In held-out pairwise judge evaluations, combining Edu-QuRater and answer-structure rewards produced responses preferred to the Qwen3-4B base model on both pedagogical quality and instruction following.
- Abstract(参考訳): 教育データフィルタは、言語モデル事前学習を改善するための実践的な方法となっているが、ほとんどのフィルタは、教育価値を単一のスカラー特性として扱う。
これは、特にデータセットが既に高密度の教育材料を特徴としている場合、一部のアプリケーションには広すぎるかもしれない。
有用な学習教材は、意図した聴衆とアプリケーション(例えば、学習者対教師対面)に正確で、魅力的で、十分に構造化され、適切である必要があります。
QuRating (Wettig et al 2024)に続いて、多次元の教育データスコアリングとキュレーションのためのパイプラインであるEdu-QuRatingを紹介した。
Edu-QuRatingは、教育固有のルーリックを定義し、LLMの判定器を使用してサンプル化された文書ペアをラベル付けし、それらのペアの好みを再利用可能なEdu-QuRatersに蒸留する。
2つのシーケンス分類ベースモデルと6つの教育基準の中で、最高のEdu-QuRaterは平均精度0.917のGPT-4.1-miniペアの判定を回復する。
次に、結果のスコアを2つのアプリケーションに適用する。
まず,小言語モデルの事前学習を改善するために,コーパスフィルタリングにおけるEdu-QuRatersの可能性を検討する。
322.25万のFineWeb-Edu-Fortified文書を抽出し,フィルタした事前学習混合物を得た。
一致した単ランプレトレーニング比較では、Edu-QuRatingをベースとした混合物で訓練したモデルは、FinWeb-Eduベースラインよりも9つのベンチマークで観察された集計精度が高く、特定のタスクに集中している。
次に,GRPOポストトレーニングの報奨語としてEdu-QuRaterスコアを用いた。
Edu-QuRaterとQwen3-4Bベースモデルに好適な応答が得られた。
関連論文リスト
- Text-Based Approaches to Item Alignment to Content Standards in Large-Scale Reading & Writing Tests [16.474453687125948]
本研究では、自動項目アライメントのための微調整小言語モデル(SLM)の性能について検討した。
学習用入力データの種類とサイズが与える影響について検討した。
その結果、微調整されたSLMは埋め込みベースの教師あり機械学習モデルよりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-09-30T15:53:22Z) - P-Aligner: Enabling Pre-Alignment of Language Models via Principled Instruction Synthesis [33.48877877146247]
大規模言語モデル(LLM)は、人間のユーザとのインタラクションにおいて、安全で有用な、誠実なコンテンツを生み出すことが期待されている。
LLMはしばしば、欠陥のある命令が与えられたとき、そのような値と一致しない。
P-Aligner(P-Aligner)は、より人間に好まれる形で表現されながら、オリジナルのインテントを保存する命令を生成する軽量モジュールである。
論文 参考訳(メタデータ) (2025-08-06T16:51:38Z) - Checklists Are Better Than Reward Models For Aligning Language Models [99.1896531064102]
チェックリストフィードバックからの強化学習(RLCF)を提案する。
指示からチェックリストを抽出し,各項目の応答がどの程度満足するかを評価する。
これらのスコアをAI判断器と特殊検証器プログラムの両方を用いて組み合わせ、RLの報酬を計算する。
論文 参考訳(メタデータ) (2025-07-24T17:58:00Z) - Language Models Improve When Pretraining Data Matches Target Tasks [8.935657480912282]
BETRは、ベンチマークトレーニングの例と類似性に基づいて、事前学習した文書を選択する方法である。
データ選択の方法は1019ドルから1022ドルのFLOPにまたがる500以上のモデルをトレーニングし、それらをスケーリング法則に適合させることで比較する。
BETRはDCLM-Baseline上で2.1倍の計算乗算を実現し,全スケールで10タスク中9タスクの性能向上を実現している。
論文 参考訳(メタデータ) (2025-07-16T17:59:45Z) - Towards Better Instruction Following Retrieval Models [30.99867106106421]
InF-IRは,Instruction-Following IRにおける検索モデルの強化に適した,大規模で高品質なトレーニングコーパスである。
InF-IRは従来のトレーニングペアを38,000以上の表現型命令、クエリ、パス>三つ子に正のサンプルとして拡張する。
命令とクエリの両方を毒殺した後、高度推論モデル(o3-mini)によって厳密に検証し、命令の不正確性を保ちながら意味的妥当性を保証する。
論文 参考訳(メタデータ) (2025-05-27T17:14:37Z) - ReFINE: A Reward-Based Framework for Interpretable and Nuanced Evaluation of Radiology Report Generation [39.542375803362965]
ReFINEは、放射線学レポート生成(R2Gen)に特化して設計された自動評価指標である。
ユーザが指定した基準に従ってレポートをスコアし、詳細なサブスコアを提供し、解釈可能性を高める。
実験では,従来の指標と比較して,人間の判断とReFINEの相関が高められ,モデル選択における優れた性能が示された。
論文 参考訳(メタデータ) (2024-11-26T10:48:55Z) - NeKo: Toward Post Recognition Generative Correction Large Language Models with Task-Oriented Experts [57.53692236201343]
提案するマルチタスク補正MOEでは,専門家が音声・テキスト・言語・テキスト・視覚・テキスト・データセットの「専門家」になるよう訓練する。
NeKoはマルチタスクモデルとして文法とポストOCR補正を競合的に実行している。
論文 参考訳(メタデータ) (2024-11-08T20:11:24Z) - DataComp-LM: In search of the next generation of training sets for language models [200.5293181577585]
DataComp for Language Models (DCLM)は、制御されたデータセット実験のためのテストベッドであり、言語モデルを改善することを目的としている。
我々は、Common Crawlから抽出された240Tトークンの標準化コーパス、OpenLMフレームワークに基づく効果的な事前学習レシピ、53の下流評価スイートを提供する。
DCLMベンチマークの参加者は、412Mから7Bパラメータのモデルスケールでの重複、フィルタリング、データ混合などのデータキュレーション戦略を実験することができる。
論文 参考訳(メタデータ) (2024-06-17T17:42:57Z) - Aligning GPTRec with Beyond-Accuracy Goals with Reinforcement Learning [67.71952251641545]
GPTRecはアイテム・バイ・イテムレコメンデーションのためのTop-Kモデルの代替品である。
GPTRecは,従来のグリーディ・リグレード手法よりも精度とセカンダリ・メトリクスのトレードオフが優れていることを示す。
2つのデータセットに対する実験により、GPTRecのNext-K生成アプローチは、古典的なグリージーな再ランク技術よりも精度と二次メトリクスのトレードオフが優れていることが示された。
論文 参考訳(メタデータ) (2024-03-07T19:47:48Z) - QuRating: Selecting High-Quality Data for Training Language Models [64.83332850645074]
データ品質に関する人間の直感をキャプチャできる事前学習データを選択するQuRatingを導入する。
本稿では,書体,専門知識,事実とトリビア,教育的価値の4つの特性について検討する。
ペアの判断からスカラー評価を学習するためにQurモデルをトレーニングし、それを4つの基準ごとに品質評価付き260Bのトレーニングコーパスにアノテートするために使用します。
論文 参考訳(メタデータ) (2024-02-15T06:36:07Z) - MinPrompt: Graph-based Minimal Prompt Data Augmentation for Few-shot Question Answering [64.6741991162092]
オープンドメイン質問応答のための最小限のデータ拡張フレームワークMinPromptを提案する。
我々は、生テキストをグラフ構造に変換し、異なる事実文間の接続を構築する。
次に、グラフアルゴリズムを適用して、原文のほとんどの情報をカバーするのに必要な最小限の文の集合を識別する。
同定された文サブセットに基づいてQAペアを生成し、選択した文に基づいてモデルをトレーニングし、最終モデルを得る。
論文 参考訳(メタデータ) (2023-10-08T04:44:36Z) - A Generative Language Model for Few-shot Aspect-Based Sentiment Analysis [90.24921443175514]
我々は、アスペクト項、カテゴリを抽出し、対応する極性を予測するアスペクトベースの感情分析に焦点を当てる。
本稿では,一方向の注意を伴う生成言語モデルを用いて,抽出タスクと予測タスクをシーケンス生成タスクに再構成することを提案する。
提案手法は,従来の最先端(BERTをベースとした)の性能を,数ショットとフルショットの設定において,大きなマージンで上回ります。
論文 参考訳(メタデータ) (2022-04-11T18:31:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。