論文の概要: Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach
- arxiv url: http://arxiv.org/abs/2607.02432v1
- Date: Thu, 02 Jul 2026 17:01:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.937748
- Title: Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach
- Title(参考訳): 大規模言語モデルを用いたLinux/bash検査の自動評価:4段階認知分類法
- Abstract要約: 本稿では,4つのフロンティア大言語モデルが,短いLinux/bashコマンド応答のグルーピングにおいて,専門家による判断を近似できるかどうかを評価する。
この研究は、認知の複雑さと運用への影響を組み合わせた4段階の認知分類を採用する。
Gemini3.0 Proは、ルックス誘導のプロンプトで、人間とAIの最高の合意を達成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scalable and reliable grading of command-line examinations remains a challenge in computing education, where rising enrolments make manual marking difficult and rule-based autograders cannot handle partial credit, equivalent solutions, or syntactic variation. This paper evaluates whether four frontier Large Language Models (GPT, Claude Opus, Gemini, and GLM) can approximate expert judgment when grading short Linux/bash command responses. The study adopts a four-level cognitive taxonomy that combines cognitive complexity and operational impact, ranging from information retrieval (L1) and basic file manipulation (L2) to structural operations (L3) and advanced system management (L4). The models were tested with two prompt variants, a minimal baseline and a rubric-enhanced version, on 1200 real responses from second-year Computer Engineering students independently graded by three expert instructors. Gemini~3.0 Pro with rubric-guided prompting achieved the highest human-AI agreement (ICC(3,1) = 0.888, MAE = 0.10, Bland-Altman bias = -0.014). Agreement declined consistently as taxonomy level increased, with the largest discrepancies at higher levels. Across all models, rubric quality had a larger effect than provider choice, with structured prompts consistently improving agreement. These results show that question complexity is a reliable predictor of the difficulty LLMs face in grading accurately, and they establish a principled, taxonomy-based framework for determining which questions are suitable for AI-assisted grading and which require human review, while also providing a transferable evaluation protocol and prompt templates.
- Abstract(参考訳): 手動マーキングが難しくなり、ルールベースのオートグレーダは、部分クレジット、同等のソリューション、あるいは構文変化を処理できない。
本稿では,4つのフロンティア大言語モデル(GPT,Claude Opus,Gemini,GLM)が,短いLinux/bashコマンド応答のグルーピングにおいて,専門家による判断を近似できるかどうかを評価する。
本研究は,情報検索(L1)と基本ファイル操作(L2)から構造操作(L3),システム管理(L4)まで,認知複雑性と操作への影響を組み合わせた4段階の認知分類を採用する。
モデルは、最低限のベースラインとルーブリック強化バージョンの2つのプロンプト変種でテストされ、2年生のコンピュータ工学の学生から1200の反応を3人の専門家のインストラクターが個別に評価した。
Gemini~3.0 Proとルーリック誘導プロンプトは、最も高い人間-AI協定(ICC(3,1) = 0.888, MAE = 0.10, Bland-Altman bias = -0.014)を達成した。
分類レベルが増加し、最大の相違が高水準にあるため、合意は一貫して下がった。
全てのモデルにおいて、ルーブリックの品質は提供者選択よりも大きな効果を示し、構造化されたプロンプトは合意を継続的に改善した。
これらの結果から,質問の複雑性はLLMが正確に評価する難易度を予測するための信頼性の高い予測因子であり,AIによる評価にどの質問が適しているかを判断し,人間によるレビューを必要とするかを決定するための,原則化された分類ベースのフレームワークを構築し,伝達可能な評価プロトコルとテンプレートのプロンプトも提供する。
関連論文リスト
- Estimating Item Difficulty with Large Language Models as Experts [0.44101646956991475]
本研究は,3つの既成言語モデルを,応答データにアクセスできることなく,新たに作成された項目のラベル付けが困難であるとして評価した。
この調査では、判断形式(絶対対対ペア)、決定型(ハードな決定対トークン確率に基づく見積もり)、そして戦略の推進という3つの要因を横断する完全な因子的設計が用いられた。
LLMをベースとした評価では, 実験項目の難易度と中程度から強い正の相関が認められた。
論文 参考訳(メタデータ) (2026-05-18T15:42:13Z) - Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams [1.6955250288861923]
STEMアセスメントにおける学生の反応は手書きで、記号表現、計算、図表を組み合わせたものが多い。
大規模言語モデル(LLM)の最近の進歩は、AIによるスコアリングに注意を向けている。
本研究は, GPT-4o を用いた学部理科構築応答のAI支援スコアリングの信頼性について検討した。
論文 参考訳(メタデータ) (2026-04-14T03:04:44Z) - From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models [3.651838585096184]
大規模言語モデルの強化学習(RL)は、スパースで結果レベルの報酬にますます依存している。
我々は2024年から2026年にかけて発行された47のCA法を調査し,それらの分類を課題別に2次元分類で整理した。
我々は,(1)分類ラベル,ベースラインファミリー,エビデンスレベルを備えた構造化機械可読紙の在庫,(2)組織的方法論的ギャップを特定するための将来のCA論文の報告チェックリスト,(3)タスクファミリ,メタデータ要件,管理された分岐タスクを備えたベンチマークプロトコル仕様の3つの再利用可能な資源をコントリビュートする。
論文 参考訳(メタデータ) (2026-04-10T16:17:44Z) - RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension [65.81339691942757]
RPC-Bench(RPC-Bench)は、高品質なコンピュータサイエンス論文のレビュー・リビューの交換から構築された大規模質問応答ベンチマークである。
我々は、科学研究の流れに沿ったきめ細かい分類を設計し、モデルがなぜ、何、どのように学術的な文脈で質問するかを理解し、答える能力を評価する。
論文 参考訳(メタデータ) (2026-01-14T11:37:00Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Curse of Knowledge: When Complex Evaluation Context Benefits yet Biases LLM Judges [72.3356133063925]
審査員としての大規模言語モデル(LLM)のパラダイムはスケーラブルなソリューションとして登場したが、以前の作業は主に単純な設定に焦点を当てていた。
我々の詳細な分析は、評価信号の精度と妥当性を向上させるための重要な洞察を提供する。
論文 参考訳(メタデータ) (2025-09-03T15:48:33Z) - Benchmarking Large Language Models for Personalized Guidance in AI-Enhanced Learning [4.990353320509215]
大規模言語モデル(LLM)は、パーソナライズされた学習のためのインテリジェントアシスタントとしてますます考えられている。
本研究では,現実的な学習環境を模擬した学習課題における3つの最先端LLMの実証的比較を行った。
論文 参考訳(メタデータ) (2025-09-02T14:21:59Z) - Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement Learning [80.27561080938747]
CANOEは、人間のアノテーションを使わずに、下流のさまざまなタスクにまたがる大きな言語モデルの忠実性の幻覚を減らすためのフレームワークである。
Dual-GRPOはルールベースの強化学習手法であり、合成された短値QAデータから得られる3つのルールベースの報酬を含む。
実験の結果、CANOEは11のタスクにまたがるLLMの忠実さを大幅に改善し、最も進歩したLLMよりも優れていた。
論文 参考訳(メタデータ) (2025-05-22T10:10:07Z) - From Correctness to Comprehension: AI Agents for Personalized Error Diagnosis in Education [24.970741456147447]
大規模言語モデル(LLM)は、GSM8Kのようなベンチマークでほぼ完璧なパフォーマンスを達成し、驚くべき数学的推論能力を示している。
しかし、誤り診断やフィードバック生成よりも正確さが過大評価されているため、パーソナライズされた教育への応用は依然として限られている。
textbfMathCCSは,システム的エラー解析と修正されたフィードバックのためのベンチマークである。
第2に、過去のデータを利用してトレンドを追跡し、診断精度を向上させるシーケンシャルなエラー解析フレームワークを開発する。
第3に、歴史的分析のための時系列エージェントと実時間のためのMLLMエージェントを組み合わせたマルチエージェント協調フレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-19T14:57:51Z) - A Systematic Examination of Preference Learning through the Lens of Instruction-Following [83.71180850955679]
新たな合成データ生成パイプラインを用いて48,000の命令追従プロンプトを生成する。
合成プロンプトでは、リジェクションサンプリング(RS)とモンテカルロ木探索(MCTS)の2つの選好データセットキュレーション手法を用いる。
実験により、MCTSが生成した選好ペアにおける共有プレフィックスは、限界はあるが一貫した改善をもたらすことが明らかになった。
高コントラストの選好ペアは一般的に低コントラストのペアよりも優れているが、両者を組み合わせることで最高のパフォーマンスが得られることが多い。
論文 参考訳(メタデータ) (2024-12-18T15:38:39Z) - Self-Discover: Large Language Models Self-Compose Reasoning Structures [136.48389510481758]
タスク固有の推論構造を自己発見するフレームワークであるSELF-DISCOVERを紹介する。
SELF-DISCOVERは、挑戦的推論ベンチマークにおいて、GPT-4とPaLM 2の性能を大幅に改善する。
自己発見推論構造は、モデルファミリー全体にわたって普遍的に適用可能であることを示す。
論文 参考訳(メタデータ) (2024-02-06T01:13:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。