論文の概要: AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations
- arxiv url: http://arxiv.org/abs/2607.01934v1
- Date: Thu, 02 Jul 2026 09:28:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.760675
- Title: AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations
- Title(参考訳): AIriskEval-edu:AIによるK-12教育説明におけるリスク評価のための新しいデータセット
- Authors: Javier Irigoyen, Roberto Daza, Francisco Jurado, Julian Fierrez, Ruben Tolosana, Alvaro Ortigosa, Enrique Blas, Aythami Morales,
- Abstract要約: データセットは、科学、言語芸術、社会科学をカバーする、170のキュレートされたScienceQA質問からの1,639の説明で構成されている。
主な貢献は、リスクローカライゼーションやリスク説明を含む構造化された説明可能性アノテーションによる785の説明の追加である。
AIriskEval-edu-db2の教師付き微調整により、ローカルにデプロイ可能なモデルがより強力なフロンティアモデルに近づいたり、優れたりするかどうかを評価する。
- 参考スコア(独自算出の注目度): 12.641424626110899
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This work introduces AIriskEval-edu-db2, a new dataset designed to train and evaluate auditors based on LLMs for an explainable pedagogical risk assessment in instructional content for grades K-12. The dataset comprises 1,639 explanations from 170 curated ScienceQA questions, covering science, language arts, and social sciences. For each question, the dataset includes an explanation written by a human teacher alongside 11 explanations generated by LLM-simulated teacher profiles associated with distinct pedagogical risks. We propose a comprehensive risk rubric aligned with established educational standards that covers five complementary dimensions: factual precision, depth and completeness, focus and relevance, student-level appropriateness, and ideological bias. A key contribution is the addition of 785 explanations with structured explainability annotations, including risk localization and risk description. The annotations are produced through a semi-automatic process with expert teacher validation. Finally, we present validation experiments comparing state-of-the-art proprietary models with a lightweight local Llama 3.1 8B model in both the pedagogical risk detection and the explainability assessment. These experiments evaluate whether supervised fine-tuning on AIriskEval-edu-db2 enables a locally deployable model to approach or outperform stronger frontier models while preserving privacy in educational auditing and assessment tasks.
- Abstract(参考訳): このデータセットは、学年K-12の教育コンテンツにおける説明可能な教育的リスク評価のために、LLMに基づいて監査者を訓練し、評価するように設計されている。
このデータセットは、科学、言語芸術、社会科学をカバーする、170のキュレートされたScienceQA質問からの1,639の説明で構成されている。
各質問に対して、このデータセットは、異なる教育的リスクに関連するLLMシミュレーション教師プロファイルによって生成された11の説明とともに、人間の教師によって書かれた説明を含む。
本稿では,事実的正確性,深度と完全性,焦点と妥当性,学生レベルの適切性,イデオロギーバイアスの5つの相補的な側面を網羅した包括的リスクルーブリックを提案する。
重要な貢献は、リスクローカライゼーションやリスク記述を含む構造化された説明可能性アノテーションによる785の説明の追加である。
アノテーションは、専門家の教師による検証を伴う半自動プロセスを通じて作成される。
最後に,最先端のプロプライエタリモデルと軽量なローカルLlama 3.1 8Bモデルを比較し,教育的リスク検出と説明可能性評価の両面で検証実験を行った。
これらの実験は、AIriskEval-edu-db2の教師付き微調整により、ローカルにデプロイ可能なモデルが、教育監査やアセスメントタスクのプライバシーを維持しながら、より強力なフロンティアモデルに近づいたり、優れたりするかどうかを評価する。
関連論文リスト
- EduEVAL-DB: A Role-Based Dataset for Pedagogical Risk Evaluation in Educational Explanations [13.185893390841693]
データセットは、ScienceQAベンチマークのキュレートされたサブセットからの139の質問に対応する844の説明で構成されている。
我々は,5つの相補的リスク次元を運用する,確立された教育基準に沿った教育的リスクを提案する。
我々は、最先端の教育指向モデル(Gemini 2.5 Pro)を軽量なローカルLlama 3.1 8Bモデルと比較した。
論文 参考訳(メタデータ) (2026-02-17T12:11:49Z) - RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration [81.38705556267917]
大規模言語モデル(LLM)の既存の安全性評価手法は、固有の制約に悩まされている。
リスク概念空間を再構築する理論的枠組みを導入する。
マルチエージェント協調評価フレームワークRADARを提案する。
論文 参考訳(メタデータ) (2025-09-28T09:35:32Z) - Unveiling the Misuse Potential of Base Large Language Models via In-Context Learning [61.2224355547598]
大規模言語モデル(LLM)のオープンソース化は、アプリケーション開発、イノベーション、科学的進歩を加速させる。
我々の調査は、この信念に対する重大な監視を露呈している。
我々の研究は、慎重に設計されたデモを配置することにより、ベースLSMが悪意のある命令を効果的に解釈し実行できることを実証する。
論文 参考訳(メタデータ) (2024-04-16T13:22:54Z) - Informing clinical assessment by contextualizing post-hoc explanations
of risk prediction models in type-2 diabetes [50.8044927215346]
本研究は, 合併症リスク予測のシナリオを考察し, 患者の臨床状態に関する文脈に焦点を当てる。
我々は、リスク予測モデル推論に関する文脈を提示し、その受容性を評価するために、最先端のLLMをいくつか採用する。
本論文は,実世界における臨床症例における文脈説明の有効性と有用性を明らかにする最初のエンドツーエンド分析の1つである。
論文 参考訳(メタデータ) (2023-02-11T18:07:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。