論文の概要: Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?
- arxiv url: http://arxiv.org/abs/2608.16286v1
- Date: Mon, 17 Aug 2026 08:58:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.600172
- Title: Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?
- Title(参考訳): 第三種のクローズ・カウンセラー:LLMは言語教師を置き換えられるか?
- Authors: Kristina Šekrst, Ana Kovačić,
- Abstract要約: 本稿では,言語学習者が必要とする修正的フィードバックや方法論的説明を,最先端のLLMが提供できるかどうかを検討する。
この評価には、自動メトリクス(GLEU, BERTScore)に加えて、人間の専門家による判断も採用されている。
モデルは印象的な表面レベルの補正能力を示すが、それらの説明は効果的な言語教育に必要な用語的知識やドメイン的知識を欠いていることが多い。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While various organizations now actively encourage LLM use in classrooms, we still lack rigorous, systematic evaluations of how well these models actually perform the fundamental tasks of language pedagogy. This paper examines whether state-of-the-art LLMs can deliver the kind of corrective feedback and methodological explanations that language learners need. The study tests multiple large language models on their ability to identify, correct, and explain common learner mistakes in English, by systematically varying model parameters to investigate how these technical adjustments affect output quality, pedagogical clarity, and consistency, along with using retrieval-augmented generation to query methodological data. The evaluation employs automated metrics (GLEU, BERTScore) but also human expert judgments to capture dimensions that purely computational measures miss: linguistic nuance, cultural sensitivity, and instructional appropriateness. While models demonstrate impressive surface-level correction abilities, their explanations often lack the terminological and domain knowledge that effective language teaching requires, suggesting that current enthusiasm for AI-assisted language learning may be outpacing our understanding of these systems' actual pedagogical competence.
- Abstract(参考訳): 様々な組織が教室でのLLMの使用を積極的に奨励していますが、これらのモデルが言語教育の基本的なタスクを実際にどの程度うまく実行するかという厳密で体系的な評価はいまだに欠けています。
本稿では,言語学習者が必要とする修正的フィードバックや方法論的説明を,最先端のLLMが提供できるかどうかを検討する。
この研究は、複数の大きな言語モデルを用いて、英語における一般的な学習ミスの識別、正解、説明の能力について、これらの技術的調整が出力品質、教育的明確性、一貫性にどのように影響するかを体系的に異なるモデルパラメーターを用いて調査し、また、検索拡張生成を用いて方法論データをクエリする。
この評価には、自動メトリクス(GLEU, BERTScore)に加えて、純粋に計算された測度が損なう次元(言語的ニュアンス、文化的感度、教育的適切性)を捉えるために、人間の専門家による判断も採用されている。
モデルは見事な表面レベルの補正能力を示すが、それらの説明は効果的な言語教育に必要な用語的知識やドメイン的知識を欠くことが多く、現在のAI支援言語学習への熱意が、これらのシステムの実際の教育的能力に対する理解を上回っている可能性があることを示唆している。
関連論文リスト
- FEANEL: A Benchmark for Fine-Grained Error Analysis in K-12 English Writing [68.23874413455594]
本稿では,英語学習者のための細粒度誤り解析(FEANEL)ベンチマークを提案する。
ベンチマークは、小学生と中学生が書いた1000のエッセイから成っている。
各エラーは言語教育の専門家によって注釈付けされ、彼らが共同開発した音声に基づく分類法を用いて、タイプ、重大度、説明的フィードバックによって分類される。
論文 参考訳(メタデータ) (2025-11-28T05:17:45Z) - Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models [49.1574468325115]
本稿では,命令追従能力を評価するための評価フレームワークであるSpeech-IFevalを紹介する。
近年のSLMは,音声認識を大規模言語モデル (LLM) と統合し,音声中心の訓練によるテキスト能力の低下を招いている。
以上の結果から, SLM はテキストベースの LLM よりもはるかに高い性能を示し, 基本命令にも耐え難いことが示唆された。
論文 参考訳(メタデータ) (2025-05-25T08:37:55Z) - CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models [6.0020878662404975]
本稿では、外国語教育の文脈において、LLMの教育文法に関する知識を評価するために設計された最初のベンチマークを紹介する。
このベンチマークは、文法認識、微粒な文法的区別、分類的識別、言語的干渉に対する抵抗性を評価するために設計された5つのタスクからなる。
論文 参考訳(メタデータ) (2025-04-17T18:01:50Z) - LLM-as-a-Judge & Reward Model: What They Can and Cannot Do [2.2469442203227863]
自動評価器の総合的な分析を行い,その挙動に関するいくつかの重要な知見を報告する。
英語の評価能力は言語固有の評価能力に大きく影響し,英語で訓練された評価者が他の言語に容易にスキルを伝達できることがわかった。
我々は、現在最先端の評価者が、英語と韓国語の両方において、複雑な推論問題の評価や生成の限界について、挑戦的なプロンプトに苦しむことに気付きました。
論文 参考訳(メタデータ) (2024-09-17T14:40:02Z) - CourseAssist: Pedagogically Appropriate AI Tutor for Computer Science Education [1.052788652996288]
このポスターでは、コンピュータサイエンス教育用に作られた新しいLLMベースのチューターシステムであるCourseAssistを紹介している。
一般的なLLMシステムとは異なり、CourseAssistは検索強化生成、ユーザ意図分類、質問分解を使用して、AI応答を特定のコース材料や学習目標と整合させる。
論文 参考訳(メタデータ) (2024-05-01T20:43:06Z) - Teacher Perception of Automatically Extracted Grammar Concepts for L2
Language Learning [66.79173000135717]
本研究は、カンナダ語とマラティ語という2つのインドの言語教育に適用する。
我々は、形態素構文(単語順、一致、ケースマーキング、または単語形成の学習)と意味論(語彙の学習)に関する疑問に答える自然なテキストコーパスから記述を抽出する。
我々は,北米の学校から言語教育者の助けを借りて手作業による評価を行い,教材が授業の準備や学習者評価に利用できる可能性を見出した。
論文 参考訳(メタデータ) (2023-10-27T18:17:29Z) - Spoken Language Intelligence of Large Language Models for Language Learning [3.1964044595140217]
教育分野における大規模言語モデル(LLM)の有効性を評価することに注力する。
上記のシナリオにおけるLLMの有効性を評価するために,新しい複数選択質問データセットを提案する。
また,ゼロショット法や少数ショット法など,様々なプロンプト技術の影響についても検討する。
異なる大きさのモデルは、音韻学、音韻学、第二言語習得の概念をよく理解しているが、実世界の問題に対する推論には限界がある。
論文 参考訳(メタデータ) (2023-08-28T12:47:41Z) - Evaluating Language Models for Mathematics through Interactions [116.67206980096513]
大型言語モデル(LLM)と対話し,評価するためのプロトタイププラットフォームであるCheckMateを紹介した。
我々はCheckMateと共同で3つの言語モデル(InstructGPT, ChatGPT, GPT-4)を、学部レベルの数学の証明支援として評価する研究を行った。
我々は、人間の行動の分類を導き、概して肯定的な相関にもかかわらず、正しさと知覚的有用性の間に顕著な相違点があることを明らかにする。
論文 参考訳(メタデータ) (2023-06-02T17:12:25Z) - Shortcut Learning of Large Language Models in Natural Language
Understanding [119.45683008451698]
大規模言語モデル(LLM)は、一連の自然言語理解タスクにおいて最先端のパフォーマンスを達成した。
予測のショートカットとしてデータセットのバイアスやアーティファクトに依存するかも知れません。
これは、その一般化性と敵対的堅牢性に大きな影響を与えている。
論文 参考訳(メタデータ) (2022-08-25T03:51:39Z) - Teacher Perception of Automatically Extracted Grammar Concepts for L2
Language Learning [91.49622922938681]
本稿では,文法の異なる側面の記述を自動的に発見・可視化する自動フレームワークを提案する。
具体的には、形態素構文と意味論に関する疑問に答える自然なテキストコーパスから記述を抽出する。
この手法をインド語、カンナダ語、マラタイ語に応用するが、これは英語とは異なり、十分に発達した教育資源を持たない。
論文 参考訳(メタデータ) (2022-06-10T14:52:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。