Fugu-MT 論文翻訳(概要): Unlocking the Potential of Multiple BERT Models for Bangla Question Answering in NCTB Textbooks

論文の概要: Unlocking the Potential of Multiple BERT Models for Bangla Question Answering in NCTB Textbooks

arxiv url: http://arxiv.org/abs/2412.18440v1
Date: Tue, 24 Dec 2024 13:59:23 GMT
ステータス: 翻訳完了
システム内更新日: 2024-12-25 19:23:17.79202
Title: Unlocking the Potential of Multiple BERT Models for Bangla Question Answering in NCTB Textbooks
Title（参考訳）: NCTB教科書におけるBangla質問応答に対する複数のBERTモデルの可能性
Authors: Abdullah Khondoker, Enam Ahmed Taufik, Md Iftekhar Islam Tashik, S M Ishtiak mahmud, Antara Firoz Parsa,
Abstract要約: 教育環境におけるテキスト理解の評価は,学生のパフォーマンスの理解とカリキュラムの有効性の向上に不可欠である。本研究では,国立カリキュラム・テキストブックボード(NCTB)の授業6-10用教科書から,Bangla節に基づく質問応答を自動的に評価する,最先端の言語モデルであるRoBERTa Base,Bangla-BERT,BERT Base-inの能力について検討した。
参考スコア（独自算出の注目度）: 0.0
License: http://creativecommons.org/licenses/by-sa/4.0/
Abstract: Evaluating text comprehension in educational settings is critical for understanding student performance and improving curricular effectiveness. This study investigates the capability of state-of-the-art language models-RoBERTa Base, Bangla-BERT, and BERT Base-in automatically assessing Bangla passage-based question-answering from the National Curriculum and Textbook Board (NCTB) textbooks for classes 6-10. A dataset of approximately 3,000 Bangla passage-based question-answering instances was compiled, and the models were evaluated using F1 Score and Exact Match (EM) metrics across various hyperparameter configurations. Our findings revealed that Bangla-BERT consistently outperformed the other models, achieving the highest F1 (0.75) and EM (0.53) scores, particularly with smaller batch sizes, the inclusion of stop words, and a moderate learning rate. In contrast, RoBERTa Base demonstrated the weakest performance, with the lowest F1 (0.19) and EM (0.27) scores under certain configurations. The results underscore the importance of fine-tuning hyperparameters for optimizing model performance and highlight the potential of machine learning models in evaluating text comprehension in educational contexts. However, limitations such as dataset size, spelling inconsistencies, and computational constraints emphasize the need for further research to enhance the robustness and applicability of these models. This study lays the groundwork for the future development of automated evaluation systems in educational institutions, providing critical insights into model performance in the context of Bangla text comprehension.
Abstract（参考訳）: 教育環境におけるテキスト理解の評価は,学生のパフォーマンスの理解とカリキュラムの有効性の向上に不可欠である。本研究では,国立カリキュラム・テキストブックボード(NCTB)の授業6-10用教科書から,Bangla節に基づく質問応答を自動的に評価する,最先端の言語モデルであるRoBERTa Base,Bangla-BERT,BERT Base-inの能力について検討した。約3,000のBanglaパスに基づく質問応答インスタンスのデータセットをコンパイルし、F1スコアとエクサクタマッチ(EM)メトリクスを用いて、様々なハイパーパラメータ構成を用いてモデルの評価を行った。以上の結果から,Bangla-BERTはF1(0.75)とEM(0.53)の最高スコア,特にバッチサイズが小さく,停止単語の含み,中等度学習率で,他のモデルよりも一貫して優れていた。対照的にRoBERTa Baseは、F1 (0.19) とEM (0.27) のスコアが一定の構成で最も弱い性能を示した。その結果、モデル性能を最適化するための微調整ハイパーパラメータの重要性を強調し、教育的文脈におけるテキスト理解の評価における機械学習モデルの可能性を強調した。しかし、データセットのサイズ、スペルの不整合、計算上の制約といった制限は、これらのモデルの堅牢性と適用性を高めるためのさらなる研究の必要性を強調している。本研究は,Banglaテキスト理解の文脈におけるモデル性能に関する重要な洞察を提供する教育機関における自動評価システムの今後の展開の基盤となるものである。

関連論文リスト

EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios [41.370448581863194]
教育シナリオに適した最初の多様なベンチマークを紹介します。本稿では,教師と学生の両方に関係のある12つの重要な側面をカバーする多次元評価指標を提案する。構築したデータセット上で比較的小規模なモデルをトレーニングし、最先端の大規模モデルに匹敵するパフォーマンスを実現することを実証する。
論文参考訳（メタデータ） (2025-05-22T03:01:28Z)
Unraveling the Capabilities of Language Models in News Summarization [0.0]
この研究は、ニュース要約タスクのより小さなものに焦点を当てた、最新の20の言語モデルの包括的なベンチマークを提供する。本研究では,ゼロショットと少数ショットの学習設定に着目し,ロバストな評価手法を適用した。 GPT-3.5-Turbo と GPT-4 の優れた性能を強調した。
論文参考訳（メタデータ） (2025-01-30T04:20:16Z)
What Differentiates Educational Literature? A Multimodal Fusion Approach of Transformers and Computational Linguistics [0.7342677574855649]
英語カリキュラムへの新しい文学の統合は、様々な教室のニーズに対して、読みやすさとテキストの適応を迅速に評価するスケーラブルなツールがしばしば欠如しているため、依然として課題である。本研究は,変圧器を用いたテキスト分類と言語的特徴分析を組み合わせたマルチモーダル手法により,このギャップに対処することを提案する。提案手法は、ステークホルダーが対象とするWebアプリケーションにカプセル化され、非技術ステークホルダーが、テキストの複雑さ、読みやすさ、カリキュラムのアライメント、学習年齢範囲に関するリアルタイムな洞察にアクセスできるようにする。
論文参考訳（メタデータ） (2024-11-26T17:01:27Z)
The Surprising Effectiveness of Test-Time Training for Few-Shot Learning [59.309477460893916]
言語モデル(LM)は、トレーニングディストリビューション内のタスクにおいて印象的なパフォーマンスを示しているが、しばしば構造的に新しいタスクで苦労している。 LMの推論と少数ショット学習能力を改善するメカニズムとして,テストタイムトレーニング(TTT)の有効性を検討する。本研究は,新しいタスクにおける文脈内学習の限界を強調し,言語モデルの適応性を高めるためのテストタイムトレーニングの可能性を示した。
論文参考訳（メタデータ） (2024-11-11T18:59:45Z)
How Hard is this Test Set? NLI Characterization by Exploiting Training Dynamics [49.9329723199239]
本稿では, 実例と非実例を手作業で構築することなく, 挑戦的なテストセットを自動生成する手法を提案する。一般的なNLIデータセットのテストセットを,トレーニングダイナミクスを利用した3つの難易度に分類する。我々の評価法がトレーニングセットに適用された場合、トレーニング対象データのごく一部でトレーニングされたモデルは、フルデータセットでトレーニングされたモデルに匹敵するパフォーマンスを達成する。
論文参考訳（メタデータ） (2024-10-04T13:39:21Z)
CELA: Cost-Efficient Language Model Alignment for CTR Prediction [70.65910069412944]
CTR(Click-Through Rate)予測は、レコメンダシステムにおいて最重要位置を占める。最近の取り組みは、プレトレーニング言語モデル(PLM)を統合することでこれらの課題を緩和しようとしている。 CTR予測のためのtextbfCost-textbfEfficient textbfLanguage Model textbfAlignment (textbfCELA)を提案する。
論文参考訳（メタデータ） (2024-05-17T07:43:25Z)
ILLUMINER: Instruction-tuned Large Language Models as Few-shot Intent Classifier and Slot Filler [1.9015367254988451]
本研究では、インテント分類(IC)とスロットフィリング(SF)のための人気のあるベンチマークデータセット上で、命令調整モデル(インストラクション-LLM)を評価する。 Instruct-LLM の言語生成タスクとして IC と SF をフレーミングする ILLUMINER を導入する。 FLAN-T5 11Bモデルを用いた複数のベースラインとの総合的な比較から,本手法は最先端のジョイントIC+SF法やGPT3.5 (175B) を用いたテキスト内学習よりも優れていた。
論文参考訳（メタデータ） (2024-03-26T09:41:21Z)
Japanese-English Sentence Translation Exercises Dataset for Automatic Grading [16.564184260893946]
本稿では,文翻訳演習(STE)の自動評価タスクを提案する。日本語と英語のSTEデータセットを作成し、21の質問と合計3,498人の学生回答(平均167件)を収録する。このデータセットを用いて,テキスト内学習の少ない細調整BERTモデルやGPTモデルを含むベースラインの性能を実演する。
論文参考訳（メタデータ） (2024-03-06T01:37:03Z)
Disco-Bench: A Discourse-Aware Evaluation Benchmark for Language Modelling [70.23876429382969]
本研究では,多種多様なNLPタスクに対して,文内談話特性を評価できるベンチマークを提案する。ディスコ・ベンチは文学領域における9つの文書レベルのテストセットから構成されており、豊富な談話現象を含んでいる。また,言語分析のために,対象モデルが談話知識を学習するかどうかを検証できる診断テストスイートを設計する。
論文参考訳（メタデータ） (2023-07-16T15:18:25Z)
Pre-Training to Learn in Context [138.0745138788142]
言語モデルが文脈で学習するために明示的に訓練されていないため、コンテキスト内学習の能力は十分に活用されていない。 In-Context Learning のための PICL (Pre-training for In-Context Learning) を提案する。実験の結果,PICLはベースラインよりも効率が高く,タスクの汎用性が高く,約4倍のパラメータを持つ言語モデルよりも優れていた。
論文参考訳（メタデータ） (2023-05-16T03:38:06Z)
Context Matters: A Strategy to Pre-train Language Model for Science Education [4.053049694533914]
BERTベースの言語モデルは、様々な言語関連タスクにおいて、従来のNLPモデルよりも大きな優位性を示している。学生が使用する言語は、BERTのトレーニングソースであるジャーナルやウィキペディアの言語とは異なる。本研究は,教育領域におけるドメイン固有データに対する継続事前学習の有効性を確認した。
論文参考訳（メタデータ） (2023-01-27T23:50:16Z)
Large Language Models with Controllable Working Memory [64.71038763708161]
大規模言語モデル(LLM)は、自然言語処理(NLP)の一連のブレークスルーをもたらした。これらのモデルをさらに切り離すのは、事前訓練中に内在する膨大な量の世界的知識だ。モデルの世界知識が、文脈で提示された事実情報とどのように相互作用するかは、まだ解明されていない。
論文参考訳（メタデータ） (2022-11-09T18:58:29Z)
Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文参考訳（メタデータ） (2022-05-10T19:32:20Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。