論文の概要: IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)
- arxiv url: http://arxiv.org/abs/2608.04703v1
- Date: Wed, 05 Aug 2026 11:12:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.836362
- Title: IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)
- Title(参考訳): ISTurathBench: イスラム教の学術的伝統(タース)に基づく大規模言語モデル評価のためのマルチタスク・マルチディシドリンベンチマーク
- Authors: Shahd Gaben, Heba Sbahi, Samer Rashwani, Abdessalam Bouchekif, Mutaz Al-Khatib, Emad Mohamed, Somaya Eltanbouly, Mohammed Ghaly,
- Abstract要約: IslamicTurathBench (ISTB) は、大規模言語モデル(LLM)を評価するためのマルチタスク、マルチディシドリンデータセットである。
ISTBには、3,465点の質問回答項目が含まれており、35の認定された資料から、12世紀以上の奨学金がイスラム研究の7つの重要な分野に散らばっている。
- 参考スコア(独自算出の注目度): 0.16060719742433224
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used for question answering, education, and research, including in religious and cultural domains where answers depend on specialised source traditions. Yet in Islamic Studies, key concepts, methods, and debates preserved in the authoritative scholarly tradition, known as turath, lack high-quality annotated resources. We introduce IslamicTurathBench (ISTB), a multi-task, multi-discipline dataset for evaluating LLMs on classical Islamic scholarship. Developed and reviewed by domain experts, ISTB contains 3,465 question-answer items drawn from 35 recognised source works spanning more than 12 centuries of scholarship across seven key fields of Islamic Studies. To enable comprehensive profiling of model capabilities, ISTB is structured along two axes: scholarly demand (Beginner, Intermediate, and Advanced) and task format (multiple-choice questions, passage-based comprehension, and open-ended knowledge questions). ISTB includes aggregated scores from a scholarly human reference panel and zero-shot baselines from ten systems. The dataset supports reproducible evaluation of language-model behaviour across source works, disciplines, scholarly-demand levels, and question formats in a historically layered scholarly domain.
- Abstract(参考訳): 大きな言語モデル (LLMs) は、宗教や文化の領域において、答えが特別な情報源の伝統に依存しているなど、質問応答、教育、研究にますます使われている。
しかし、イスラーム学では、重要な概念、方法、議論が権威ある学術的伝統で保存され、タースとして知られる、高品質な注釈付き資源が欠如している。
古典的イスラーム学のLLMを評価するためのマルチタスク・マルチディシプリンド・データセットであるISISTurathBench (ISTB)を紹介した。
ドメインの専門家によって開発され、レビューされ、ISTBは、イスラム研究の7つの主要な分野にまたがる12世紀以上の奨学金にまたがる35の認定資料から、3,465件の質問回答項目を含んでいる。
モデル機能の包括的なプロファイリングを可能にするため、ISTBは学術的要求(Beginner、Intermediate、Advanced)とタスクフォーマット(複数選択質問、パスベースの理解、オープンな知識質問)の2つの軸に沿って構成されている。
ISTBには、学術的な人間の基準パネルからの集計スコアと、10のシステムからのゼロショットベースラインが含まれている。
このデータセットは、歴史的に階層化された学術領域において、ソースワーク、規律、学術的要求レベル、質問形式の再現可能な言語モデル行動の評価をサポートする。
関連論文リスト
- Islamic Large Language Models: From Knowledge Acquisition to Trustworthy and Hallucination-Resistant AI [0.0]
大きな言語モデル (LLM) は知識集約的な質問応答にますます使われている。
この調査は、イスラムLLMと信頼できるイスラムAIの新興分野をレビューする。
論文 参考訳(メタデータ) (2026-06-15T12:22:36Z) - Mubeen AI: A Specialized Arabic Language Model for Heritage Preservation and User Intent Understanding [0.0]
Mubeenは、MASARAT SAによって開発されたアラビア語のプロプライエタリなモデルである。
アラビア語の言語学、イスラーム研究、文化遺産の深い理解に最適化されている。
このモデルには、言語学、法学、ハディース、クラーニック・エクセゲシスの学究的な研究が含まれている。
論文 参考訳(メタデータ) (2025-10-27T12:29:27Z) - 3LM: Bridging Arabic, STEM, and Code through Benchmarking [0.7227323884094952]
3LMはアラビア語用に特別に設計された3つのベンチマークのスイートである。
1つ目は、アラビア語の教科書と教育用ワークシートから自然に派生した、STEM関連の質問応答ペアのセットである。
2つ目は、同じソースを用いて合成されたSTEM質問である。
第3のベンチマークは、2つの広く使用されているコードベンチマークを注意深く翻訳することで構築されたコード生成に焦点を当てている。
論文 参考訳(メタデータ) (2025-07-21T17:58:27Z) - BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset [83.61028277413543]
大規模バイリンガル・マルチモーダル・マルチディシプリナ推論データセットであるBMMRを導入し,大規模マルチモーダルモデル(LMM)の開発と評価を行った。
BMMRは、UNESCOが定義した300の課題にまたがる110kの大学レベルの質問で構成されており、書籍、試験、クイズといった印刷メディアとデジタルメディアからソースされた、多種多様なフォーマット、補充されたQA、そしてオープンエンドのQAにまたがっている。
BMMR-Evalは20,458の高品質なインスタンスで構成され、LMMの知識を包括的に評価し、中国語と中国語の両方の複数の分野にわたる推論を行う。
論文 参考訳(メタデータ) (2025-07-04T11:20:09Z) - FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models [64.11333762954283]
本稿では,中国のLLMの基本知識能力を厳格に評価するための先駆的ベンチマークであるFoundaBenchを紹介する。
本稿では、従来の評価手法とCircularEvalプロトコルの両方を用いて、モデル応答の潜在的なバイアスを軽減するため、FoundaBenchを用いた12の最先端LCMの広範な評価を行う。
以上の結果から,中国のコーパスで事前学習したモデルの性能が向上し,モデル推論とメモリリコール能力の相違が明らかとなった。
論文 参考訳(メタデータ) (2024-04-29T01:49:07Z) - ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic [51.922112625469836]
アラビア語における最初のマルチタスク言語理解ベンチマークである、データセット名を提案する。
我々のデータは、現代標準アラビア語(MSA)における40のタスクと14,575のマルチチョイス質問で構成されており、地域の母語話者と協調して慎重に構築されている。
35モデルについて評価した結果,特にオープンソースモデルにおいて,改善の余地がかなり高いことが判明した。
論文 参考訳(メタデータ) (2024-02-20T09:07:41Z) - Building Domain-Specific LLMs Faithful To The Islamic Worldview: Mirage
or Technical Possibility? [0.0]
大規模言語モデル(LLM)は、多くの自然言語理解ユースケースで顕著なパフォーマンスを示している。
イスラム教とその表現の文脈において、その信仰と教えの正確かつ事実的な表現は、クルランとスンナに根ざしている。
本研究は、イスラム世界観に忠実なドメイン固有のLLMを構築することの課題に焦点を当てる。
論文 参考訳(メタデータ) (2023-12-11T18:59:09Z) - M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining
Large Language Models [76.88692952308084]
M3Examは、多言語、マルチモーダル、マルチレベルコンテキストにおける大規模言語モデル(LLM)を評価するためのベンチマークである。
M3Examには、9つの言語で12,317の質問があり、3つの教育レベルがある。
我々は,M3Exam上でのLLMの性能評価を行い,GPT-4を含む現在のモデルが多言語テキストに苦戦していることを確認した。
論文 参考訳(メタデータ) (2023-06-08T13:21:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。