論文の概要: ExplainRoute: A Pre-Deployment Audit Framework for Non-Answer-Giving Programming Tutors
- arxiv url: http://arxiv.org/abs/2609.03470v1
- Date: Thu, 03 Sep 2026 07:28:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.969107
- Title: ExplainRoute: A Pre-Deployment Audit Framework for Non-Answer-Giving Programming Tutors
- Title(参考訳): ExplainRoute:非回答型プログラミングチュータのための事前デプロイ監査フレームワーク
- Abstract要約: ExplainRouteは、非回答型プログラミングチューターのための事前デプロイ監査フレームワークである。
教室配備前の情報境界、応答極性、障害の閉鎖、学習者/説明の可視性の価値を監査する。
評価は、直接回答、固定された自己説明、固定されたソクラテス足場、適応的なルーティング、適応的な非状態アブレーションを比較する。
- 参考スコア(独自算出の注目度): 13.531743811563722
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Programming tutors should support learners' own explanations rather than immediately providing model answers. We present ExplainRoute, a pre-deployment audit framework for non-answer-giving programming tutors. Given a code line and a learner explanation, it estimates the explanation state and selects one of two bounded responses: a Feynman-style self-explanation prompt or a Socratic scaffold. The framework exposes its state, strategy, cited code fragment, and leakage risk through a machine-checkable contract. Unlike benchmarks that rank tutors by fluency alone, ExplainRoute audits information boundaries, response polarity, failure closure, and the value of learner-explanation visibility before classroom deployment. We evaluate it offline on the 1,770-pair SelfCode corpus using a code-group split, with 443 pairs reserved in 11 untouched holdout groups. The evaluation compares direct answers, fixed open self-explanation, fixed Socratic scaffolding, adaptive routing, and an adaptive no-state ablation. Contract validity reaches 100% for all pedagogical conditions. Adaptive routing matches the frozen reference rule on 60.5% of records, with state macro-F1 of 0.238 (Open: 0.229; Socratic: 0.246), showing no reliable adaptive advantage. An independent language-model judge scores adaptive responses 4.516/5, outperforming the no-state ablation (2.819/5) but slightly below fixed open self-explanation (4.598/5) and Socratic scaffolding (4.658/5). A blinded rubric evaluation on a stratified 40-row subset confirms that visible learner explanations improve information value while adaptive routing does not outperform fixed strategies. The contribution is a validated audit protocol and a boundary finding, rather than evidence of improved learning, retention, or causal instructional effectiveness.
- Abstract(参考訳): プログラミングチューターは、モデル回答を即座に提供するのではなく、学習者自身の説明をサポートするべきである。
提案するExplainRouteは,非回答型プログラミング学習者のための事前デプロイ監査フレームワークである。
コード行と学習者の説明が与えられた場合、説明状態を推定し、Feynmanスタイルの自己説明プロンプトまたはソクラティックの足場という2つの境界付けられた応答のうちの1つを選択する。
このフレームワークは、マシンチェック可能なコントラクトを通じて、状態、戦略、コードフラグメントの引用、リークリスクを公開する。
フルーエンシでチューターをランク付けするベンチマークとは異なり、ExplainRouteは情報バウンダリ、応答極性、障害のクロージャ、および教室展開前の学習者/説明の可視性の価値を監査する。
我々は,コードグループ分割を用いて,1,770対のセルフコードコーパス上でオフラインで評価した。
評価は、直接回答、固定された自己説明、固定されたソクラテス足場、適応的なルーティング、適応的な非状態アブレーションを比較する。
契約の妥当性はすべての教育条件に対して100%に達する。
アダプティブ・ルーティングは60.5%のレコードでフリーズされた参照規則と一致し、状態マクロF1は0.238(オープン:0.229;ソクラティック:0.246)であり、信頼性のあるアダプティブ・アドバンテージはない。
独立言語モデル審査員は適応応答4.516/5をスコアし、非状態アブレーション(2.819/5)を上回るが、固定オープン自己説明(4.598/5)とソクラティック足場(4.658/5)よりわずかに低い。
階層化40-rowサブセットにおけるブラインドされたルーリック評価は、適応的ルーティングが固定戦略を上回りつつも、可視的な学習者の説明により情報価値が向上することを確認する。
このコントリビューションは、改善された学習、保持、因果的指導効果の証拠ではなく、検証された監査プロトコルと境界発見である。
関連論文リスト
- V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning [59.47823383593251]
視覚サンプルモデルでは、視覚的証拠が不十分な流動的な答えを生み出すことができる。
本稿では,参照応答を原子命題に分解するVisuals-Based Reinforcement Learningを紹介する。
我々は,コンポーネントワイド,プレフィックスローカライズされたルーリッククレジットを用いて,同じSFTチェックポイントに基づいてモデルをトレーニングする。
論文 参考訳(メタデータ) (2026-08-26T09:40:46Z) - Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior [0.0]
効果的な大規模言語モデル (LLM) チューターは、容易に作成できる答えを与えるために、しばしば辞退しなければならない。
本稿では,ターン毎の機械チェック可能な契約として回答保持を強制する教育システムについて報告する。
人間の被験者を使わない自動評価で行動を調整する。
論文 参考訳(メタデータ) (2026-08-12T17:35:58Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - EduGuard: A Safe RAG-Based LLM Tutor for Programming Education [1.2999518604217852]
ジェネレーティブAI(GenAI)は、プログラミングの説明、デバッグ、代入サポートに学生によってますます利用されている。
本稿では,提案プログラムのための安全な検索強化世代(RAG)学習フレームワークであるEduGuardについて述べる。
EduGuardは、クエリ理解、インストラクターが承認したコース検索、教育戦略選択、ルーリック・アウェア生成、クレームレベルの検証、オーバー信頼制御を統合している。
論文 参考訳(メタデータ) (2026-07-17T08:18:18Z) - Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning [0.0]
インターベンションバイアス(英語: Intervention bias)は、大規模言語モデル教育アドバイザリーエージェントの以前には確立されていなかった障害モードである。
教師付き政策学習は、このバイアスを排除していることを示す。
LLM-as-judge score is blind to intervention bias, rewarding fluent over-prescription rather than decision quality。
論文 参考訳(メタデータ) (2026-06-28T08:58:17Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - GATES: Self-Distillation under Privileged Context with Consensus Gating [89.62339954332248]
我々は、監督が信頼できない環境で自己蒸留を研究する。
非対称な文脈で回答する文書に焦点をあてる。
複数の文書ベース推論トレースをサンプリングすることにより、教師のコンセンサスからオンラインでの監督を導出する。
論文 参考訳(メタデータ) (2026-02-24T05:56:20Z) - Don't Explain Noise: Robust Counterfactuals for Randomized Ensembles [50.81061839052459]
我々は確率論的問題として、堅牢な対実的説明の生成を定式化する。
アンサンブルモデルのロバスト性とベース学習者のロバスト性との関係を示す。
本手法は, 反実的説明から初期観測までの距離をわずかに増加させるだけで, 高いロバスト性を実現する。
論文 参考訳(メタデータ) (2022-05-27T17:28:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。