論文の概要: Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models
- arxiv url: http://arxiv.org/abs/2607.28128v1
- Date: Thu, 30 Jul 2026 12:37:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.564806
- Title: Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models
- Title(参考訳): LLM-Judged Helpfulnessを教育信号として再考する: チュータモデル間の事前登録監査
- Authors: Shuyi Fan, Boyuan Deng, Mengyu Xu, Jiale Liu, Hongyang Zhang, Qiaoxin Yang, Chongyang Gao,
- Abstract要約: LLM指導は測定問題を引き起こす: 汎用的有用なルーリックは、直解法と教育指導とを区別できるか?
我々は、同じモデルでインスタンス化され、1人の弱いシミュレーション学生とペアリングされた会話と教育の方針を比較した。
- 参考スコア(独自算出の注目度): 15.860351997992042
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM tutoring poses a measurement problem: can a general-purpose helpfulness rubric distinguish direct answer-giving from pedagogical guidance? We audit this signal in a pre-registered study. Within each of three tutor bases, we compare conversational and pedagogical policies instantiated with the same underlying model and paired with one fixed weak simulated student. Deterministic detectors measure answer leakage and next-turn independent work. Claude Opus 4.8 is the frozen, condition-blind primary judge. After the Opus scores were fixed, GPT-5.6 Sol was prospectively specified for a post hoc robustness audit of the same 1,179 confirmatory answer-phase tutor turns under the frozen helpfulness and pedagogy rubrics. On the primary base under Opus, the policies do not differ significantly in helpfulness but are perfectly rank-separated under the pedagogy rubric (Cliff's $|δ|{=}0.10$ vs. $1.0$). Across the two judges, pedagogy contrasts retain their direction where detected, whereas the helpfulness ordering is judge-contingent, reversing between judges on two of three bases. In an Opus-only ablation, seven primary-base policies span $2.3$ points in mean judged pedagogy within a $0.25$-point band of mean judged helpfulness. Separately, answer-revealing turns are followed by less independent student work on every base, a result that is judge-invariant by construction. In this controlled setting, general-purpose helpfulness is not a reliable pedagogy signal. Tutor evaluation should pair pedagogy-targeted rubrics with deterministic process measures.
- Abstract(参考訳): LLM指導は測定問題を引き起こす: 汎用的有用なルーリックは、直解法と教育指導とを区別できるか?
我々はこの信号を事前登録した研究で監査する。
3つの教官ベースにおいて、同じ基礎モデルでインスタンス化され、1つの固定弱シミュレーション学生とペアリングされた会話と教育の方針を比較した。
決定論的検出器は、解答漏れと次回独立作業を測定する。
クロード・オプス4.8(Claude Opus 4.8)は、フリーズ・コンディション・ブラインド・プライマリ・ジャッジである。
オプスのスコアが固定された後、GPT-5.6 Solは、凍った補助力とペダゴギールーブリックの下で、同じ1,179人の正解期チューターターンのホック後ロバスト性監査のために前向きに特定された。
オプスの一次基底では、ポリシーは役立ちにおいて大きく異なるわけではないが、ペダゴギー・ルーリックの下で完全に区切られている(クリフの$|δ|{=}0.10$ vs.$1.0$)。
2人の裁判官の間では、教育コントラストは検出された方向を保ち、補助命令は3つのベースのうちの2つの裁判官の間で反転する。
オプスのみのアブレーションでは、7つのプライマリベースポリシーは、平均2.3ドル、平均2.5ドル、平均2.5ドル、平均2.3ドルである。
第二に、解答のターンは、各基地での独立した学生の仕事が減り、その結果は建設によって判断不変となる。
この制御された環境では、汎用的な有用性は信頼できる教育信号ではない。
チュータ評価は, ペダゴギーを対象とするルーブリックと決定論的プロセスとを組み合わせるべきである。
関連論文リスト
- OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients [89.89504265663057]
近親政策最適化ゾーン(ZPPO)は、ヴィゴツキーの近親開発ゾーンに触発されたものである。
ZPPOは1つの正しい教師の反応と1つの間違った学生の反応を、生徒が識別しなければならない匿名候補としてペアリングする。
プロンプト再生バッファは、生徒の平均ロールアウト精度が半分に達するか、FIFOが削除されるまで、各難問を再循環する。
論文 参考訳(メタデータ) (2026-06-16T17:46:02Z) - Measuring Whether LLM Tutors Teach or Solve: A Diagnostic for Educational Impact [4.6840536642016195]
本研究では,学習支援行動と単なる回答生成とを区別する公立学習ベンチマークについて検討する。
本稿では,問題解決指向と教育指向のベンチマーク性能のギャップに基づいた,軽量な診断ルーブリックを提案する。
論文 参考訳(メタデータ) (2026-06-15T04:32:18Z) - Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation [25.235899757379844]
2つの応答は同じ最終回答スコアを受信できるが、トレースが明示的にバイアスコンテンツを注入するかどうかが異なる。
本稿では,2つの軸を持つ最小限のトレースレベル診断法について紹介する: バイアスが以前に正しい答えを破るかどうか) と強調(トレースが注入されたコンテンツに対するルーリック定義の表面参照を含むかどうか)である。
論文 参考訳(メタデータ) (2026-06-13T05:41:57Z) - Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teachers and Students Using AI [1.6637373649145608]
そこで本稿では,評価基準やポストホックな結果ラベルを使わずに,注意を要する話題をランク付けする透明なメカニズムを提案する。
このアプローチは、学生の学習困難度、学習者の自己報告と観察困難との相違、未解決の教師の懸念の3つのシグナルを組み合わせたものである。
論文 参考訳(メタデータ) (2026-05-28T02:00:06Z) - RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning [0.0]
RTLC は単一のブラックボックス LLM を微調整、検索、外部ツールのないアンサンブル・オブ・シント・ジャッジにプロモートする。
RTLCがN=10の得票率(77.7%)とゼロショット第1候補(74.0%)を破る
RTLCは、ポストホックの判定スコアの校正で構成され、2つの介入が実際に乗法的に合成される。
論文 参考訳(メタデータ) (2026-05-13T15:48:16Z) - GATES: Self-Distillation under Privileged Context with Consensus Gating [89.62339954332248]
我々は、監督が信頼できない環境で自己蒸留を研究する。
非対称な文脈で回答する文書に焦点をあてる。
複数の文書ベース推論トレースをサンプリングすることにより、教師のコンセンサスからオンラインでの監督を導出する。
論文 参考訳(メタデータ) (2026-02-24T05:56:20Z) - Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision [26.922922043969958]
我々は、コンピュータ・アズ・教師(CaT)による調査を監督に転換することを提案する。
CaTは平行ロールアウトのグループから単一の参照を合成し、それに向けて最適化する。
テストタイムの手順として、CaTはGemma 3 4B、Qwen 3 4B、Llama 3.1 8Bを改善している。
論文 参考訳(メタデータ) (2025-09-17T17:59:42Z) - Self-Training with Differentiable Teacher [80.62757989797095]
自己学習は、様々な半教師付きおよび弱教師付き学習タスクで大きな成功を収める。
この手法は、教師が擬似ラベルを生成し、生徒が予測を行う教師学生の枠組みとして解釈できる。
そこで我々は,教師学生をStackelbergゲームとして扱う,差別化可能な自己学習法を提案する。
論文 参考訳(メタデータ) (2021-09-15T02:06:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。