論文の概要: EduGuard: A Safe RAG-Based LLM Tutor for Programming Education
- arxiv url: http://arxiv.org/abs/2607.15738v1
- Date: Fri, 17 Jul 2026 08:18:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.792615
- Title: EduGuard: A Safe RAG-Based LLM Tutor for Programming Education
- Title(参考訳): EduGuard: プログラミング教育のための安全なRAGベースのLLMチュータ
- Abstract要約: ジェネレーティブAI(GenAI)は、プログラミングの説明、デバッグ、代入サポートに学生によってますます利用されている。
本稿では,提案プログラムのための安全な検索強化世代(RAG)学習フレームワークであるEduGuardについて述べる。
EduGuardは、クエリ理解、インストラクターが承認したコース検索、教育戦略選択、ルーリック・アウェア生成、クレームレベルの検証、オーバー信頼制御を統合している。
- 参考スコア(独自算出の注目度): 1.2999518604217852
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative AI (GenAI) is increasingly used by students for programming explanation, debugging, and assignment support. Yet unrestricted large language model (LLM) tutors can hallucinate, contradict course policy, reveal complete solutions, and foster passive dependence. This paper presents EduGuard, a safe retrieval-augmented generation (RAG) tutoring framework for introductory programming. EduGuard integrates query understanding, instructor-approved course retrieval, pedagogical strategy selection, rubric-aware generation, claim-level verification, and overreliance control. To make evaluation provenance explicit, we construct BILearn-CS, a 600-query instructor-authored, TA-validated benchmark spanning concept questions, debugging cases, misconceptions, assignment-support requests, code-mixed Bangla-English queries, and adversarial direct-answer prompts. Moving beyond a synthetic-only benchmark, we further evaluate on a 150-query public CS50-style course-forum set and run a small controlled pilot with 10 undergraduates using a counterbalanced pre-test/post-test design. Using Meta-Llama-3.1-8B-Instruct as the primary generator, hybrid FAISS/BM25 retrieval, and DeBERTa-v3-large-MNLI as an architecturally separate verifier, EduGuard is compared against strong baselines: GPT-4o-mini Tutor, Llama Socratic Tutor, LPITutor-style RAG, RAG with rubric prompting, and RAG with same-model self-checking. On BILearn-CS, EduGuard attains the best correctness (90.1%), grounding (89.4%), and rubric alignment (90.8%), with the lowest hallucination (4.9%) and direct-answer leakage (9.8%). In the pilot, it raises immediate post-test accuracy from 68.4% to 81.2% and cuts overreliance from 38.0% to 17.0% relative to GPT-4o-mini Tutor. These results suggest safe GenAI tutoring requires not only retrieval or strong prompting, but explicit pedagogical control, evidence verification, and deployment safeguards.
- Abstract(参考訳): ジェネレーティブAI(GenAI)は、プログラミングの説明、デバッグ、代入サポートに学生によってますます利用されている。
しかし、制約のない大言語モデル (LLM) チューターは幻覚し、コースポリシーを矛盾させ、完全な解を明らかにし、受動的依存を育むことができる。
本稿では,提案プログラムのための安全な検索強化世代(RAG)学習フレームワークであるEduGuardについて述べる。
EduGuardは、クエリ理解、インストラクターが承認したコース検索、教育戦略選択、ルーリック・アウェア生成、クレームレベルの検証、オーバー信頼制御を統合している。
評価結果を明確にするために,600行のインストラクターによるTA検証ベンチマークであるBILearn-CSを構築した。
合成専用ベンチマークを超えて、150クエリのCS50スタイルのコースフォーラムセットを更に評価し、10人の学部生が相反する事前テスト/ポストテスト設計を使用して、小さな制御パイロットを実行する。
Meta-Llama-3.1-8B-Instructをプライマリジェネレータ、ハイブリッドFAISS/BM25検索、DeBERTa-v3-large-MNLIをアーキテクチャ的に分離された検証器として使用し、EduGuardを強力なベースラインであるGPT-4o-mini Tutor、Llama Socratic Tutor、LPITutorスタイルのRAG、Rusricプロンプト付きRAG、同じモデルの自己チェック付きRAGと比較する。
BILearn-CSでは、EduGuardが最高の正しさ(90.1%)、接地(89.4%)、ルーブリックアライメント(90.8%)、幻覚(4.9%)、直接回答リーク(9.8%)を達成している。
パイロットでは、テスト後の即時精度を68.4%から81.2%に引き上げ、GPT-4o-mini Tutorと比較して38.0%から17.0%に下げる。
これらの結果は、安全なGenAI学習には、検索や強力なプロンプトだけでなく、明確な教育的制御、エビデンス検証、デプロイメントセーフガードが必要であることを示唆している。
関連論文リスト
- Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index [0.26508608365976566]
Pedagogical Suitability Index (PSI) は6つの理論インフォームド・サブスコアの合成計量である。
240のシナリオベース評価において,4つの大規模言語モデル (LLM) を評価する。
PSI誘導によるフィードバックは、弱いパフォーマンスのケースを大幅に改善した。
論文 参考訳(メタデータ) (2026-08-05T21:07:10Z) - Knowledge Distillation for Automated AI Tutor Evaluation [0.0]
本稿では,FATE(FLC AI Tutor Evaluator)を紹介する。
BEA 2025 Shared Taskの4つのコア評価トラックと並行して、私たちのモデルは、ミステイク識別、ミステイクロケーション、ガイダンス、アクションビリティを横断する教育能力を評価します。
我々は、ChatGPT、Claude、Gemini、DeepSeekなど、一般的な商用モデルによって生成される命令応答をベンチマークすることで、FATEのユーティリティを自動評価器として示す。
論文 参考訳(メタデータ) (2026-07-12T08:28:11Z) - Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation [0.0]
我々は,4人のフロンティアAI教師が,実行ベースの審査員によって真っ向からランク付けされる,コンペティションThen-Collaborateフレームワークを紹介した。
検証可能な報酬(RLVR)環境を備えた強化学習として、同じ共同カリキュラムを使用することで、学生は改善される。
論文 参考訳(メタデータ) (2026-07-09T09:00:52Z) - Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction [62.42945715963878]
リポジトリレベルの脆弱性の再現は、要求の多いソフトウェアエンジニアリング(SE)タスクである。
最近のLLMエージェントは、アプローチが正しい場合、しばしばこれらのステップを実行するが、間違った戦略を選択することで失敗する。
本論では, アクションの完全な軌跡ではなく, 戦略がSEエージェントの適切な学習単位であることを論じる。
論文 参考訳(メタデータ) (2026-07-02T06:27:27Z) - ACCORD: Action-Conditioned Contextual Grounding for Language Agents [69.73525608707764]
ACCORD(Action-Conditioned Contextual Grounding)は、適応的なグラウンドのためのエージェントフレームワークである。
現状のエージェントは、しばしばそうすることができないことを示す。それらは、観察された特定の情報よりもむしろ仮定から行動し、収集した可能性のある情報を見落とし、既に返された証拠を組み込むことに失敗する。
論文 参考訳(メタデータ) (2026-06-15T09:05:55Z) - GRADE: Generalizable Reasoning-Aware Dialogue Evaluation for AI Tutors [5.831342304669597]
GRADEは、学生-教師対話における教育能力評価のためのオープンソースモデルの体系的研究である。
ゼロショット推論, LoRAファインチューニング, 合成拡張, CoT+Reasoning, シングルタスク対マルチタスクの定式化など, 5つの言語モデルにわたる120の構成を評価した。
論文 参考訳(メタデータ) (2026-05-27T02:26:55Z) - Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs [51.56484100374058]
ガードレールの設計には、敵の堅牢性、良質なタスクのユーザビリティ、応答レイテンシの明確なトレードオフが伴う。
決定論的パターンフィルタ,構造検証,コンテキストサンドボックス,セッションレベルの動作チェックを組み合わせた,ドメイン固有のマルチレイヤセーフガードパイプラインの評価を行った。
NeMoは16.22パーセントのFPRと1.5パーセントのレイテンシで0パーセントのバイパスに達し、Prompt Guardは38.48パーセントのFPRと3.60パーセントのバイパスを実現している。
論文 参考訳(メタデータ) (2026-03-29T18:52:01Z) - GATES: Self-Distillation under Privileged Context with Consensus Gating [89.62339954332248]
我々は、監督が信頼できない環境で自己蒸留を研究する。
非対称な文脈で回答する文書に焦点をあてる。
複数の文書ベース推論トレースをサンプリングすることにより、教師のコンセンサスからオンラインでの監督を導出する。
論文 参考訳(メタデータ) (2026-02-24T05:56:20Z) - TutorBench: A Benchmark To Assess Tutoring Capabilities Of Large Language Models [10.963195858672627]
TutorBenchは、大規模言語モデル(LLM)のコアチューリングスキルを厳格に評価するために設計されたデータセットと評価ベンチマークである。
サンプルは、(i)学生の混乱に合わせた適応的な説明を生成すること、(ii)学生の作業に対して実行可能なフィードバックを提供すること、(iii)効果的なヒント生成を通じて活発な学習を促進すること、の3つの一般的な学習課題から抽出される。
我々はTutorBench上で16個のフロンティアLLMを評価し,その性能と挙動を詳細に解析した。
論文 参考訳(メタデータ) (2025-10-03T01:41:09Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - How to Build an Adaptive AI Tutor for Any Course Using Knowledge Graph-Enhanced Retrieval-Augmented Generation (KG-RAG) [5.305156933641317]
知的学習システム(ITS)におけるLarge Language Models (LLMs)は、パーソナライズされた教育に変革をもたらす機会を提供する。
現在の実装では、2つの重要な課題に直面している。
本稿では,構造化知識表現と文脈認識検索を統合した新しいフレームワークである知識グラフ強化検索(RAG)を提案する。
論文 参考訳(メタデータ) (2023-11-29T15:02:46Z) - LGD: Label-guided Self-distillation for Object Detection [59.9972914042281]
我々はLGD(Label-Guided Self-Distillation)と呼ばれる汎用物体検出のための最初の自己蒸留フレームワークを提案する。
本フレームワークは, 学習知識を得るために, スパースラベル-外観符号化, オブジェクト間関係適応, オブジェクト内知識マッピングを含む。
従来の教師ベースのFGFIと比較すると、LGDは予習された教師を必要とせず、本質的な学生学習よりも51%低い訓練コストで性能が向上する。
論文 参考訳(メタデータ) (2021-09-23T16:55:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。