論文の概要: AraDynFact: Dynamic Evaluation of Factual Knowledge in Arabic
- arxiv url: http://arxiv.org/abs/2609.35461v1
- Date: Mon, 28 Sep 2026 15:49:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 05:14:50.633501
- Title: AraDynFact: Dynamic Evaluation of Factual Knowledge in Arabic
- Title(参考訳): AraDynFact:アラビア語のファクチュアル知識の動的評価
- Abstract要約: AraDynFactは、大規模言語モデルに埋め込まれた現実のアラビア語知識を厳格に評価するために設計された、新しい動的評価フレームワークである。
静的ベンチマークとは異なり、AraDynFactは事実情報を抽出し、リッチで回答可能な質問を生成するために動的アプローチを採用している。
我々はアラビア語ウィキペディアにAraDynFactを適用し、いくつかの最先端モデルのパフォーマンスを監査する。
- 参考スコア(独自算出の注目度): 26.56201636029529
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models (LLMs) continue to scale both in size and capabilities, their proficiency in the Arabic Language has seen significant advancement. However, a critical gap remains: the extent of their factual knowledge and cultural sensitivity to the diverse Arabic-speaking world remains largely underexplored. Current evaluation metrics often focus on translation or generic reasoning, failing to capture the rich historical, social, and regional nuances inherent to Arabic culture. In addition, most benchmarks rely on heavy work, with human intervention in some steps, making the evaluation of knowledge coverage expensive and slow. To address this deficiency, we introduce AraDynFact, a novel dynamic evaluation framework designed to rigorously assess the factual Arabic knowledge embedded in LLMs. Unlike static benchmarks, AraDynFact employs a dynamic approach to extract factual information and generate rich and answerable questions in a fast and automatic way. We apply AraDynFact to Arabic Wikipedia and audit the performance of several state-of-the-art models, ranging from Arabic-centric specialized LLMs to high-resource general purpose LLMs. In addition we found a high degree of correlation with existing, hand-crafted Arabic-centric benchmarks, confirming the potential of our dynamic approach.
- Abstract(参考訳): 大型言語モデル(LLM)はサイズと能力の両方を拡大し続けており、アラビア語の習熟度は著しく向上している。
しかし、その事実的知識と多様でアラビア語を話す世界に対する文化的感受性の程度は、いまだに未発見のままである。
現在の評価指標は、しばしば翻訳や一般的な推論に焦点を当て、アラビア文化に固有の豊かな歴史的、社会的、地域的なニュアンスを捉えなかった。
加えて、ほとんどのベンチマークは重い作業に依存しており、人間の介入によって知識カバレッジの評価が高価で遅いものになっている。
この欠陥に対処するために,LLMに埋め込まれた現実のアラビア語知識を厳格に評価する新しい動的評価フレームワークであるAraDynFactを紹介した。
静的ベンチマークとは異なり、AraDynFactは事実情報を抽出し、リッチで回答可能な質問を高速かつ自動で生成する動的アプローチを採用している。
我々はアラビア語ウィキペディアにAraDynFactを適用し、アラビア語中心の特殊LLMから高リソース汎用LLMまで、いくつかの最先端のモデルのパフォーマンスを監査する。
さらに、手作りのアラビア中心の既存のベンチマークと高い相関関係を示し、我々の動的アプローチの可能性を確認した。
関連論文リスト
- Arabic Prompts with English Tools: A Benchmark [0.20524609401792393]
本稿では,アラビア語における大規模言語モデル(LLM)のツールコールとエージェント機能を評価するための最初のベンチマークを紹介する。
ツールコールの精度は、ツール記述自体がアラビア語であれ英語であれ、平均で5~10%低下する。
これらの重要な課題に光を当てることで、このベンチマークは、アラビア語話者のためのより信頼性が高く言語的に公平なAIエージェントの開発を促進することを目的としている。
論文 参考訳(メタデータ) (2026-01-08T16:47:09Z) - Developing and Validating the Arabic Version of the Attitudes Toward Large Language Models Scale [5.371954946374285]
2つの尺度であるAT-GLLMとAT-PLLMを翻訳し、249人のアラビア語話者のサンプルを用いて検証した。
結果は、アラビア語に翻訳されたこの尺度が、アラブ人や言語に使える信頼性が高く有効なツールであることを示している。
論文 参考訳(メタデータ) (2025-10-14T21:56:53Z) - Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation [0.0]
その重要性にもかかわらず、アラビア語は資金不足に直面している。
大きな注釈付きデータセットの不足は、アラビア語の主観分析のための正確なツールの開発を妨げている。
近年のディープラーニングとトランスフォーマーの進歩は、英語とフランス語のテキスト分類に非常に効果的であることが証明されている。
論文 参考訳(メタデータ) (2025-08-27T15:20:12Z) - Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary Expansion [70.23624194206171]
本稿では,アラブ世界における大規模言語モデル(LLM)の民主化の必要性に対処する。
アラビア語のLLMの実用的な目的の1つは、復号を高速化するトークン化器にアラビア語固有の語彙を使用することである。
第二言語(アラビア語)による人への獲得の間に語彙学習に触発されたAraLLaMAは、進歩的な語彙拡張を採用している。
論文 参考訳(メタデータ) (2024-12-16T19:29:06Z) - AraDiCE: Benchmarks for Dialectal and Cultural Capabilities in LLMs [22.121471902726892]
本稿ではアラビア方言と文化評価のベンチマークであるAraDiCEを紹介する。
湾岸地域、エジプト地域、レバント地域の文化意識を評価するために設計された最初のきめ細かいベンチマーク。
論文 参考訳(メタデータ) (2024-09-17T17:59:25Z) - ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models [0.0]
ArabLegalEvalは、大規模言語モデル(LLM)のアラビア語法的知識を評価するためのベンチマークデータセットである。
MMLUとLegalBenchのデータセットにインスパイアされたArabLegalEvalは、サウジアラビアの法的文書から得られた複数のタスクと、質問を合成する。
本研究の目的は、アラビア語の法的な問題を解くために必要な能力を分析し、最先端のLLMの性能をベンチマークすることである。
論文 参考訳(メタデータ) (2024-08-15T07:09:51Z) - AceGPT, Localizing Large Language Models in Arabic [73.39989503874634]
本稿では,アラビア語のテキストによる事前学習,ネイティブなアラビア語命令を利用したSFT(Supervised Fine-Tuning),アラビア語のGPT-4応答を含む総合的なソリューションを提案する。
目標は、文化的に認知され、価値に整合したアラビア語のLLMを、多様で応用特有のアラビア語コミュニティのニーズに適応させることである。
論文 参考訳(メタデータ) (2023-09-21T13:20:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。