論文の概要: Ensuring Reliability in Programming Knowledge Tracing: A Re-evaluation of Attention-augmented Models and Experimental Protocols
- arxiv url: http://arxiv.org/abs/2605.04727v1
- Date: Wed, 06 May 2026 10:22:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.768321
- Title: Ensuring Reliability in Programming Knowledge Tracing: A Re-evaluation of Attention-augmented Models and Experimental Protocols
- Title(参考訳): プログラミング知識追跡における信頼性の確保:注意力強化モデルと実験プロトコルの再評価
- Authors: Jaewook Kim, Hyeoncheol Kim,
- Abstract要約: 本研究は,代表的PKTモデルを再検討し,モデル構成とシーケンス構築の実践により,報告された利得が著しく影響を受けることを示す。
性能評価に影響を与える注意設定の問題を特定し,ServerTimestampを無視するなどの学生の試みの不適切な順序が時間的因果性に反し,過度に楽観的な結果をもたらすことを実証する。
- 参考スコア(独自算出の注目度): 0.6015898117103068
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Programming Knowledge Tracing (PKT) has recently advanced through hybrid approaches that integrate attention-based feature modeling for code representation with RNN-based sequential prediction. While these models report strong empirical performance, their reliability can be sensitive to subtle implementation and experimental design choices. This study revisits representative PKT models and shows that reported gains can be substantially influenced by model configuration and sequence construction practices. We identify issues in attention dimension settings that affect performance estimates, and demonstrate that improper ordering of student attempts, such as ignoring ServerTimestamp, can violate temporal causality and lead to overly optimistic results. To ensure consistent evaluation, hyperparameters are selected via grid search guided by a single designated fold and then fixed uniformly across all folds during cross-validation. We further analyze the role of assignment-wise characteristics and systematically explore the impact of maximum sequence length. Using this protocol, we re-evaluate PKT models on the CodeWorkout dataset. Our results show that, under controlled and consistent settings, the performance gap between attention-enhanced models and standard DKT is significantly reduced, and increased architectural complexity does not consistently translate into superior performance. Beyond individual model comparisons, this work provides practical guidance for reliable and comparable evaluation in programming knowledge tracing.
- Abstract(参考訳): プログラミング知識追跡(PKT)は、最近、コード表現のための注意ベースの特徴モデリングとRNNベースのシーケンシャル予測を統合するハイブリッドアプローチによって進歩した。
これらのモデルは強い経験的性能を報告しますが、その信頼性は微妙な実装と実験的な設計選択に敏感です。
本研究は,代表的PKTモデルを再検討し,モデル構成とシーケンス構築の実践により,報告された利得が著しく影響を受けることを示す。
本研究では,性能評価に影響を与える注意寸法設定の問題を特定し,ServerTimestampを無視するなどの学生の試みの不適切な順序が時間的因果性に反し,過度に楽観的な結果をもたらすことを実証する。
一貫した評価を確保するために、ハイパーパラメータは1つの指定された折りたたみ線で案内されたグリッドサーチを介して選択され、その後、クロスバリデーション中にすべての折りたたみ線を均一に固定する。
さらに、割り当て特性の役割を分析し、最大シーケンス長の影響を体系的に調査する。
このプロトコルを用いて、CodeWorkoutデータセット上でPKTモデルを再評価する。
その結果、制御と一貫した設定下では、注意力強化モデルと標準DKTのパフォーマンスギャップは大幅に減少し、アーキテクチャの複雑さが増大しても、常に優れた性能に変換されないことがわかった。
個別のモデル比較以外にも、この研究はプログラミング知識の追跡において信頼性と同等の評価のための実践的なガイダンスを提供する。
関連論文リスト
- Evaluating Uplift Modeling under Structural Biases: Insights into Metric Stability and Model Robustness [8.135022024189306]
パーソナライズされたマーケティングにおいて、アップリフトモデルは、代替的な治療の下で顧客行動がどのように変化するかをモデル化することによって、漸進的な効果を推定する。
実世界のデータは、選択バイアス、こぼれ効果、未観測の混ざりなど、しばしばバイアスを示す。
論文 参考訳(メタデータ) (2026-03-21T11:54:25Z) - Understanding the Implicit Biases of Design Choices for Time Series Foundation Models [90.894232610821]
時系列基礎モデル(TSFM)は、時系列予測と関連する時間的タスクのための潜在的に強力で汎用的なツールのクラスである。
彼らの行動はデザインの微妙な帰納的バイアスによって強く形作られています。
モデルやデータの性質によって、これらのバイアスが直感的であるか、非常に直感的であるかを示す。
論文 参考訳(メタデータ) (2025-10-22T04:42:35Z) - Beyond Model Ranking: Predictability-Aligned Evaluation for Time Series Forecasting [18.018179328110048]
スペクトルコヒーレンスに基づく予測可能性整合診断フレームワークを提案する。
予測可能性ドリフト(predictability drift, 予測可能性ドリフト)の最初の体系的な証拠として, タスクの予測困難度が時間とともに急激に変化することを示す。
複雑なモデルは予測可能性の低いデータより優れているのに対し、線形モデルは予測可能なタスクに非常に効果的である。
論文 参考訳(メタデータ) (2025-09-27T02:56:06Z) - The Lie of the Average: How Class Incremental Learning Evaluation Deceives You? [48.83567710215299]
クラスインクリメンタルラーニング(CIL)では、モデルが学習済みのクラスを忘れずに、新しいクラスを継続的に学習する必要がある。
我々は、ロバストなCIL評価プロトコルは、性能分布全体を正確に特徴付け、推定するべきであると論じる。
我々は,タスク間類似度を用いて,極端なクラスシーケンスを適応的に識別し,サンプリングする評価プロトコルEDGEを提案する。
論文 参考訳(メタデータ) (2025-09-26T17:00:15Z) - ProCause: Generating Counterfactual Outcomes to Evaluate Prescriptive Process Monitoring Methods [2.4010681808413397]
Prescriptive Process Monitoring (PresPM)は、イベントログデータに基づいたリアルタイム介入によるプロセスを最適化することに焦点を当てている。
PresPMメソッドの評価は、データセット内のすべての介入アクションに対して、基調的な結果が欠如しているため、難しい。
ProCauseはシーケンシャルモデルと非シーケンシャルモデルの両方をサポートするジェネレーティブアプローチである。
論文 参考訳(メタデータ) (2025-08-31T10:54:43Z) - Enhancing Training Data Attribution with Representational Optimization [57.61977909113113]
トレーニングデータ属性法は、トレーニングデータがモデルの予測にどのように影響するかを測定することを目的としている。
本稿では,タスク固有表現とモデル整合表現をTDAで明示的に学習することで,このギャップを埋める表現ベースアプローチであるAirRepを提案する。
AirRepは、属性品質に合わせて調整されたトレーニング可能なエンコーダと、グループワイドの影響を正確に見積もるアテンションベースのプール機構の2つの重要なイノベーションを紹介している。
論文 参考訳(メタデータ) (2025-05-24T05:17:53Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - Discover, Explanation, Improvement: An Automatic Slice Detection
Framework for Natural Language Processing [72.14557106085284]
スライス検出モデル(SDM)は、データポイントの低パフォーマンスなグループを自動的に識別する。
本稿では,NLPタスクの分類のための "Discover, Explain, improve (DEIM)" というベンチマークを提案する。
評価の結果,Edisaは情報的セマンティックな特徴を持つ誤り発生データポイントを正確に選択できることがわかった。
論文 参考訳(メタデータ) (2022-11-08T19:00:00Z) - Unveiling Project-Specific Bias in Neural Code Models [20.131797671630963]
大規模言語モデル(LLM)ベースのニューラルネットワークモデルは、実際のプロジェクト間アウトオブディストリビューション(OOD)データに効果的に一般化するのに苦労することが多い。
この現象は, 地中真実の証拠ではなく, プロジェクト固有のショートカットによる予測に大きく依存していることが示唆された。
サンプル間の潜在論理関係を利用してモデルの学習行動を規則化する新しいバイアス緩和機構を提案する。
論文 参考訳(メタデータ) (2022-01-19T02:09:48Z) - Models, Pixels, and Rewards: Evaluating Design Trade-offs in Visual
Model-Based Reinforcement Learning [109.74041512359476]
視覚的MBRLアルゴリズムにおける予測モデルの設計決定について検討する。
潜在空間の使用など、しばしば重要と見なされる設計上の決定は、タスクのパフォーマンスにはほとんど影響しないことが分かりました。
我々は,この現象が探索とどのように関係しているか,および標準ベンチマークにおける下位スコーリングモデルのいくつかが,同じトレーニングデータでトレーニングされた場合のベストパフォーマンスモデルと同等の性能を発揮するかを示す。
論文 参考訳(メタデータ) (2020-12-08T18:03:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。