論文の概要: Revision-Aware Success Prediction from Multi-Attempt Programming Trajectories
- arxiv url: http://arxiv.org/abs/2608.26169v1
- Date: Tue, 21 Jul 2026 01:06:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.377592
- Title: Revision-Aware Success Prediction from Multi-Attempt Programming Trajectories
- Title(参考訳): 多段階プログラミング軌道からの修正型成功予測
- Abstract要約: 本研究では, 統一的な定式化の下での3つの予測課題について検討した。
各タスクは、現在の専用、ペアワイド、マルチステップの入力レシスタンスで評価される。
MLモデルは、特にTasks1と3において、最も強く、最も安定している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Programming outcome prediction plays a central role in data-driven programming education, supporting learner modeling, timely intervention, and adaptive assistance. Yet predicting submission success is difficult due to heterogeneous error states, short-term revisions, and uneven future-horizon availability in programming trajectories. This study examines three prediction tasks under a unified formulation: whether the current attempt is accepted (Task~1), whether the next attempt is accepted (Task~2), and whether acceptance is reached within a three-attempt recovery window (Task~3). Each task is evaluated across current-only, pairwise, and multi-step input regimes using ML, DL, and transformer-based pretrained models (PTM), represented by LinearSVM, XGBoost, BiGRU, BiLSTM, GraphCodeBERT, and CodeT5+. Results show a consistent pattern: the current-only regime is the most reliable, while pairwise and multi-step history provide no consistent gain. ML models are the strongest and most stable overall, particularly in Tasks~1 and~3, and Task~2 is the hardest across all model families. DL and PTMs perform well on Task~3 but are more task-dependent. In the Task~3 current-only setting, XGBoost achieves AP/PR-AUC of 99.09% and MCC of 0.6325, while GraphCodeBERT and CodeT5+ reach F1 scores of 80.00% and 73.68%, respectively. A sensitivity analysis confirms that Task~3 conclusions hold most robustly for ML models under stricter future-horizon control. Across all settings, ML models remain highly effective for programming success prediction, while complex models offer value in specific settings. This work provides a systematic comparison across predictive formulations and offers robust modeling guidance for submission-aware analytics in programming education, where near-future success prediction can inform timely intervention in online judge platforms and adaptive programming support systems.
- Abstract(参考訳): プログラミング結果予測は、データ駆動型プログラミング教育において中心的な役割を担い、学習者モデリング、タイムリーな介入、適応支援をサポートする。
しかし、不均一なエラー状態、短期的な修正、およびプログラミング軌跡における不均一な将来の水平可利用性のために、応募の成功を予測することは困難である。
本研究では,現在の試みが受理されるかどうか(Task~1),次の試みが受理されるか(Task~2),三段階回復ウィンドウ内で受理されるか(Task~3),という3つの予測課題について検討する。
各タスクは、LinearSVM、XGBoost、BiGRU、BiLSTM、GraphCodeBERT、CodeT5+で表されるML、DL、およびTransformer-based Pretrained Model (PTM)を使用して、現在の専用、ペアワイズ、マルチステップの入力レジームで評価される。
結果は一貫したパターンを示しており、現在のみのレギュレーションが最も信頼性が高く、ペアワイズとマルチステップの履歴は一貫した利得を提供しない。
MLモデルは、特に Tasks~1 と Tasks~3 において、最も強く、最も安定している。
DLとPTMはTask~3ではうまく機能するが、よりタスク依存である。
タスク~3の現在の設定では、XGBoostは、AP/PR-AUCが99.09%、MCCが0.6325、GraphCodeBERTとCodeT5+が80.00%、73.68%に達している。
感度分析により、タスク~3の結論がより厳密な将来の水平制御の下でMLモデルに対して最も堅牢に保持されることを確認した。
すべての設定において、MLモデルはプログラムの成功予測に非常に効果的であり、複雑なモデルは特定の設定で価値を提供する。
この研究は、予測定式化を体系的に比較し、オンラインの審査プラットフォームや適応型プログラミング支援システムへのタイムリーな介入を予測できるプログラミング教育において、提案を意識した分析のための堅牢なモデリングガイダンスを提供する。
関連論文リスト
- A Dataset for Modeling Iterative Problem-Solving [26.98102675986399]
パラメトリック、シーケンシャル、生成の伝統にまたがるモデルを評価するベンチマークを構築します。
この設定では,モデルの符号化能力は,予測性能と逆関係であることがわかった。
論文 参考訳(メタデータ) (2026-09-01T09:00:55Z) - FinStressTS: A Parametric Synthetic Benchmark for Time-Series Forecasting in Finance [3.5492452247462185]
FinStressTSは、モデル動作と制御された構造的原因をリンクするメカニズム対応のベンチマークである。
信号対雑音比の低さ、潜伏要因、重尾、政権交代、跳躍など、財務予測は困難である。
論文 参考訳(メタデータ) (2026-06-02T05:41:50Z) - NCL-BU at SemEval-2026 Task 3: Fine-tuning XLM-RoBERTa for Multilingual Dimensional Sentiment Regression [5.8096845806519335]
本稿では,トラックA-サブタスク1(次元アスペクト知覚回帰)のために開発されたシステムについて述べる。
テキスト中の各アスペクトの[1, 9]範囲で、実値のVAスコアを予測することを目的としている。
論文 参考訳(メタデータ) (2026-04-10T03:38:53Z) - MagicAgent: Towards Generalized Agent Planning [73.21129030631421]
汎用エージェント計画に特化して設計された基盤モデルである textbfMagicAgent について述べる。
多様な計画タスクにまたがる高品質なトラジェクトリを生成する軽量でスケーラブルな合成データフレームワークを提案する。
MagicAgent-32B と MagicAgent-30B-A3B は様々なオープンソースベンチマークにおいて優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-02-22T01:39:16Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z) - Test-Time Consistency in Vision Language Models [26.475993408532304]
VLM(Vision-Language Models)は、様々なマルチモーダルタスクにおいて優れたパフォーマンスを実現している。
MM-R3のような最近のベンチマークでは、最先端のVLMでさえ意味論的に等価な入力にまたがって分岐予測をもたらすことが強調されている。
教師付き再学習なしにセマンティックな一貫性を高める,シンプルで効果的なテスト時間一貫性フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-27T17:09:44Z) - Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training [68.94373533768501]
我々は、知識保持をモデル化し、そのコーパスから事実情報を記憶するための事前学習言語モデルの能力を示し、学習前にそれを推定する原則的手法を導入する。
本稿では,知識周波数,知識特異度,モデルサイズを統合し,クローズドブック質問応答(QA)の精度を予測する情報理論予測器である,サイズ依存型相互情報(SMI)を提案する。
論文 参考訳(メタデータ) (2025-02-06T13:23:53Z) - Meta-Learned Confidence for Few-shot Learning [60.6086305523402]
数ショットのメトリックベースのアプローチのための一般的なトランスダクティブ推論手法は、最も確実なクエリ例の平均で、各クラスのプロトタイプを更新することである。
本稿では,各クエリの信頼度をメタラーニングして,ラベルのないクエリに最適な重みを割り当てる手法を提案する。
4つのベンチマークデータセットに対してメタ学習の信頼度で、少数ショットの学習モデルを検証した。
論文 参考訳(メタデータ) (2020-02-27T10:22:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。