論文の概要: ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models
- arxiv url: http://arxiv.org/abs/2608.09548v1
- Date: Mon, 10 Aug 2026 12:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.267157
- Title: ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models
- Title(参考訳): ELBench: 大規模言語モデルのための多次元ベンチマーク
- Authors: Yilin Jiang, Xiaorong Zhu, Fei Tan, Zicheng Zhang, Kaiyi Huang, Yang Yu, Zexuan Fei, Yiming Luo, Keqian Li, Hao Hao, Aimin Zhou, Guangtao Zhai,
- Abstract要約: 大規模な言語モデルは、家庭教師、教師助手、コンテンツジェネレータとして、教育にますます導入されている。
既存のベンチマークでは、これらの要件を主に分離して評価しているため、統合されたプロファイルとして教育に直面する適合性は評価されていない。
ELBenchは,共通プロトコルの下で同じモデル上での4つの要件(一般能力,安全性,信頼性,基礎教育,高レベル栽培)すべてを評価する最初のベンチマークである。
- 参考スコア(独自算出の注目度): 71.84650682660373
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly deployed in education as tutors, teaching assistants, and content generators. These roles place demands that ordinary question answering does not: a usable education-facing model is supposed to be accurate, safe under sensitive prompts, instructionally useful, and aligned with pedagogical goals at the same time. Existing benchmarks evaluate these requirements largely in isolation, so none assesses education-facing suitability as an integrated profile. We introduce ELBench, the first benchmark to evaluate all four requirements (General Capability, Safety and Trustworthiness, Basic Education, and High-Level Cultivation) on the same models under a common protocol, combining curated public sources with newly synthesized safety and cultivation data. We evaluate nine models, seven frontier general-purpose systems and two education-specialized variants, and report three findings. First, module-level profiles are more informative than a single aggregate: the top six models are statistically indistinguishable on overall score, yet their module leaders differ substantially, and safety is anti-correlated with practical teaching (r = -0.83). Second, the Chinese-developed models lead the safety module, the most discriminative in the suite; this advantage is largest on region-specific normative content and narrows, but does not vanish, on universal-harm content. Third, the two education-specialized models lead neither education module, and on High-Level Cultivation all models share a systematic blind spot: on the structured judgment task they converge on the same non-reference option, favoring pedagogical style over fit to the stated goal, so the module scores uniformly low and does not separate models. This raises, but does not resolve, whether domain post-training keeps pace with frontier systems on education tasks.
- Abstract(参考訳): 大規模な言語モデルは、家庭教師、教師助手、コンテンツジェネレータとして、教育にますます導入されている。
使用可能な教育対応モデルは正確で、センシティブなプロンプトの下で安全であり、教育的に有用であり、同時に教育的目標と整合している。
既存のベンチマークでは、これらの要件を主に分離して評価しているため、統合されたプロファイルとして教育に直面する適合性は評価されていない。
ELBenchは,共通プロトコルの下で同じモデル上での4つの要件(一般能力,安全・信頼性,基礎教育,高レベル栽培)をすべて評価し,新たに合成された安全・養殖データと組み合わせた最初のベンチマークである。
我々は,9つのモデル,7つのフロンティア汎用システム,および2つの教育特化変種を評価し,その3つの知見を報告する。
第一に、モジュールレベルのプロファイルは1つの集合よりも情報的であり、上位6つのモデルは総合スコアで統計的に区別できないが、それらのモジュールのリーダーは大きく異なり、安全性は実践的な教育(r = -0.83)と反相関している。
第二に、中国が開発したモデルは安全モジュールをリードし、このスイートにおいて最も差別的であり、この利点は地域固有の規範的コンテンツと狭義で最大であるが、普遍的ハームコンテンツでは消滅しない。
第3に、2つの教育特化モデルが教育モジュールをリードせず、すべてのモデルが体系的な盲点を共有している: 構造化判断タスクでは、それらは同じ非参照オプションに収束し、その目標に適合する教育スタイルを好む。
これは、ドメインのポストトレーニングが、教育タスクにおけるフロンティアシステムとペースを保っているかどうかを判断するものではない。
関連論文リスト
- Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model [50.29667251847595]
モデルサイズが大きく,安全性が向上しているにもかかわらず,教師と生徒の言語モデルの間にはアライメントギャップがあることが示される。
本稿では,不安全な動作を潜在空間のベースLLMに還元するBoNサンプリング手法を提案する。
特に7つの教師モデルと6つの生徒モデルが異なるクラスとサイズで、平均攻撃成功率(ASR)はDANで28.2%、WildJailbreakで31.3%、StrongREJECTベンチマークで35.4%低下した。
論文 参考訳(メタデータ) (2026-04-01T02:42:41Z) - UniG2U-Bench: Do Unified Models Advance Multimodal Understanding? [50.92401586025528]
統一マルチモーダルモデルは、最近強力な生成能力を示したが、生成が理解を改善したかどうかはまだ不明である。
提案するUniG2U-Benchは,G2U(Generation-to-understanding)評価を7つのシステマと30のサブタスクに分類する総合ベンチマークである。
論文 参考訳(メタデータ) (2026-03-03T18:36:16Z) - UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models [62.76435672183968]
UNIFORMと呼ばれる新しいフレームワークを導入し、多様なオフザシェルフモデルから1つの学生モデルへ知識を伝達する。
本稿では,ロジットレベルでも機能レベルでも知識のコンセンサスを捉えるための,専用の投票機構を提案する。
UNIFORMは、強い知識伝達ベースラインに比べて、教師なしオブジェクト認識性能を効果的に向上することを示した。
論文 参考訳(メタデータ) (2025-08-27T00:56:11Z) - PL-Guard: Benchmarking Language Model Safety for Polish [43.39208658482427]
ポーランド語における言語モデルの安全性分類のために,手動で注釈付きベンチマークデータセットを導入する。
また、モデルロバスト性に挑戦するために設計されたこれらのサンプルの逆摂動変異体も作成する。
我々は、アノテーション付きデータの異なる組み合わせを用いてこれらのモデルをトレーニングし、それらのパフォーマンスを評価し、公開されているガードモデルと比較する。
論文 参考訳(メタデータ) (2025-06-19T13:56:41Z) - An Open-Source Dual-Loss Embedding Model for Semantic Retrieval in Higher Education [0.30723404270319693]
本研究では,2つのオープンソースの埋め込みモデルについて,質問応答の微調整を行った。
手動キュレーションと大規模言語モデル(LLM)を併用して,3,197の文対の合成データセットを構築した。
1)MNRL(MultipleNegativesRankingLoss)を用いて微調整されたベースラインモデルと,2)MNRLとCosineSimilarityLossを併用して意味的ランク付けと類似度校正の両方を改善するデュアルロスモデル,の2つのトレーニング戦略が評価された。
論文 参考訳(メタデータ) (2025-05-08T03:14:14Z) - MALAMUTE: A Multilingual, Highly-granular, Template-free, Education-based Probing Dataset [0.0]
言語モデル(LM)は様々な広い領域で優れている。
彼らは特定の、きめ細かい知識の領域で習熟を証明しなければならない。
MALAMUTEは教育ベースの最初のクローゼスタイルのデータセットである。
論文 参考訳(メタデータ) (2024-12-13T12:46:33Z) - Universal Semi-supervised Model Adaptation via Collaborative Consistency
Training [92.52892510093037]
我々は、Universal Semi-supervised Model Adaptation (USMA)と呼ばれる現実的で挑戦的なドメイン適応問題を導入する。
本稿では,2つのモデル間の予測整合性を規則化する協調的整合性トレーニングフレームワークを提案する。
実験により,いくつかのベンチマークデータセットにおける本手法の有効性が示された。
論文 参考訳(メタデータ) (2023-07-07T08:19:40Z) - Large Language Models with Controllable Working Memory [64.71038763708161]
大規模言語モデル(LLM)は、自然言語処理(NLP)の一連のブレークスルーをもたらした。
これらのモデルをさらに切り離すのは、事前訓練中に内在する膨大な量の世界的知識だ。
モデルの世界知識が、文脈で提示された事実情報とどのように相互作用するかは、まだ解明されていない。
論文 参考訳(メタデータ) (2022-11-09T18:58:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。