論文の概要: From Discussion to Execution: Replicating Buggy and Correct Data Science Code
- arxiv url: http://arxiv.org/abs/2607.16569v1
- Date: Sat, 18 Jul 2026 00:48:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.189218
- Title: From Discussion to Execution: Replicating Buggy and Correct Data Science Code
- Title(参考訳): 議論から実行へ:バギーと正しいデータサイエンスコードのリプリケート
- Abstract要約: 我々は、Q&Aフォーラムの投稿から実行可能なバグギーとパッチされたデータサイエンスプログラムを複製するフレームワークであるReprodgenを紹介した。
質問とそれに対応する回答が与えられた後、Reprodgenは質問に記述されたバギーな振る舞いと回答に記述された意図された修正を再構築する。
私たちは7つのデータサイエンスライブラリで、Stack Overflow(SO)とGitHub Issues(GI)上でReprodgenを評価します。
- 参考スコア(独自算出の注目度): 3.2371089062298317
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reproducing reliable data science code from informal sources is challenging due to ambiguous problem specifications, missing dependencies, and performance bottlenecks. Although developer Q&A forums provide rich discussions on diagnosing and fixing real-world issues, the information is often incomplete and unstructured, limiting its use for automated debugging and verification. In this paper, we introduce Reprodgen, a large language model (LLM) based framework for automatically replicating executable buggy and patched data science programs from Q&A forum posts. Given a question and its corresponding answer, Reprodgen reconstructs the buggy behavior described in the question and the intended fix described in the answer, producing executable buggy and patched code pairs that reflect the original discussion. The framework builds structured representations of code intent (CI), functional requirements (FR), and Structured Chain of Thought (SCoT), and iteratively refines code using an LLM-based reviewer until it is executable and semantically consistent. We evaluate Reprodgen on Stack Overflow (SO) and GitHub Issues (GI) across seven data science libraries, including pandas, numpy, and scikit-learn, and construct a benchmark of runnable buggy and patched programs validated by human experts. Our pipeline uses LLMs for semantic assessment, while executability is verified through actual execution. Results show reliable replication with clear differences in model performance.
- Abstract(参考訳): 非公式なソースから信頼できるデータサイエンスコードを再現することは、曖昧な問題仕様、依存関係の欠如、パフォーマンスボトルネックのために困難である。
開発者のQ&Aフォーラムは、現実世界の問題の診断と修正に関する豊富な議論を提供しているが、情報はしばしば不完全であり、構造化されていないため、自動デバッグと検証の使用が制限されている。
本稿では,大規模言語モデル(LLM)ベースのフレームワークであるReprodgenを紹介する。
Reprodgenは質問とそれに対応する回答を与えられ、質問に記載されたバグの振る舞いと回答に記載された意図された修正を再構築し、元の議論を反映した実行可能なバグとパッチ付きのコードペアを生成する。
このフレームワークは、コードインテント(CI)、機能要件(FR)、思考の構造化連鎖(SCoT)の構造化表現を構築し、LCMベースのレビュアーを使用してコードを実行可能かつセマンティックに一貫性のあるものにするまで反復的に洗練する。
私たちは、パンダ、numpy、Scikit-learnを含む7つのデータサイエンスライブラリを対象に、Stack Overflow(SO)とGitHub Issues(GI)上でReprodgenを評価し、人間の専門家が検証した実行可能なバグとパッチプログラムのベンチマークを構築しました。
我々のパイプラインは意味評価にLLMを使用し、実行性は実際の実行を通じて検証される。
その結果,信頼性の高い再現性を示し,モデル性能に明確な違いが認められた。
関連論文リスト
- RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists [12.810164698494281]
RepoProbeは、リポジトリレベルのコード理解を評価するための新しいベンチマークである。
本稿では,回答をアトミックで検証可能な事実に分解するチェックリストベースの検証プロトコルを提案する。
論文 参考訳(メタデータ) (2026-08-05T12:49:36Z) - RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - VERITAS: Towards a General-Purpose Replication Tool for Scientific Research [19.45546798679836]
CLIコーディングエージェントを中心に構築されたドメインに依存しないレプリケーションフレームワークであるVERITASを提案する。
論文、コードリポジトリ、またはその両方が与えられた場合、VERITASは論文の主張を抽出し、それらが生じる問題を解決しながら方法論を実行し、実験の実行から証拠に対して各主張を判断する。
パイプラインは重要度重み付けされたレプリケーションスコアを返します。
コンピュータ科学,社会科学,医学,天体物理学を対象とする65の論文, CORE-Bench と ReplicationBench について VERITAS の評価を行った。
論文 参考訳(メタデータ) (2026-07-03T03:55:59Z) - ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues [54.98461672730087]
ReproRepoは、人為的なGitHub問題を活用するスケーラブルな評価フレームワークで、現実的な再現ブロッカーを自然に監視する。
ReproRepoは、大規模なカンファレンスから1,149件の機械学習論文をインスタンス化し、4つのフロンティアモデルエージェント構成を評価します。
その結果, LLMエージェントは, コードを実行せずにも, 紙とリポジトリのペアから多くの実世界の問題を識別できることがわかった。
論文 参考訳(メタデータ) (2026-06-16T17:58:05Z) - Retrieval is Cheap, Show Me the Code: Executable Multi-Hop Reasoning for Retrieval-Augmented Generation [26.17880287280065]
pyragは、プログラムの合成と実行としてマルチホップRAGを再構成するフレームワークである。
pyragはトレーニング不要設定とRLトレーニング設定の両方で、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-13T04:14:13Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - RAGVUE: A Diagnostic View for Explainable and Automated Evaluation of Retrieval-Augmented Generation [1.564663326217051]
RAGVUEはRetrieval-Augmented Generation (RAG)システムを評価するためのフレームワークである。
RAGの振る舞いを検索品質、回答の妥当性と完全性、厳格なクレームレベルの忠実さ、および判断の校正に分解する。
RAGVUEは手動のメートル法選択と完全に自動化されたエージェント評価の両方をサポートしている。
論文 参考訳(メタデータ) (2025-12-03T07:42:49Z) - Repeton: Structured Bug Repair with ReAct-Guided Patch-and-Test Cycles [1.387448620257867]
大規模言語モデル(LLM)は、コード生成と理解において強力な能力を示しているが、複雑なソフトウェアエンジニアリングタスクへの応用は、しばしば低い精度と限定的な解釈可能性に悩まされている。
実世界のGitの正確かつ自動化されたコード操作にLLMを活用する、完全にオープンソースなフレームワークであるRepetonを紹介します。
論文 参考訳(メタデータ) (2025-06-09T19:36:40Z) - SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving [90.32201622392137]
We present SwingArena, a competitive evaluation framework for Large Language Models (LLMs)。
従来の静的ベンチマークとは異なり、SwingArenaはLLMをイテレーションとして組み合わせて、テストケースを作成し、継続的インテグレーション(CI)パイプラインを通じてパッチを検証するパッチとレビュアーを生成することで、ソフトウェアのコラボレーションプロセスをモデル化する。
論文 参考訳(メタデータ) (2025-05-29T18:28:02Z) - Fact-Checking Complex Claims with Program-Guided Reasoning [99.7212240712869]
Program-Guided Fact-Checking (ProgramFC)は、複雑なクレームを単純なサブタスクに分解する新しいファクトチェックモデルである。
まず,大規模言語モデルの文脈内学習能力を活用して推論プログラムを生成する。
我々は,各サブタスクを対応するサブタスクハンドラに委譲することでプログラムを実行する。
論文 参考訳(メタデータ) (2023-05-22T06:11:15Z) - RepoCoder: Repository-Level Code Completion Through Iterative Retrieval
and Generation [96.75695811963242]
RepoCoderはリポジトリレベルのコード補完プロセスを合理化するフレームワークである。
類似性ベースのレトリバーと、事前訓練されたコード言語モデルが組み込まれている。
バニラ検索で拡張されたコード補完アプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2023-03-22T13:54:46Z) - FixEval: Execution-based Evaluation of Program Fixes for Programming
Problems [23.987104440395576]
FixEvalは、競合するプログラミング問題とそれに対応する修正に対して、バグの多いコードを提出するベンチマークです。
FixEvalは、モデル生成プログラム修正の正確性を評価するために、ユニットテストの広範なコレクションを提供する。
実験の結果,マッチングに基づくメトリクスは,モデル生成プログラムの修正を正確に反映しないことがわかった。
論文 参考訳(メタデータ) (2022-06-15T20:18:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。