論文の概要: A Study of Scientific Computational Notebook Quality
- arxiv url: http://arxiv.org/abs/2603.22726v1
- Date: Tue, 24 Mar 2026 02:44:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.257037
- Title: A Study of Scientific Computational Notebook Quality
- Title(参考訳): 科学計算ノートの品質に関する研究
- Authors: Shun Kashiwa, Ayla Kurdak, Savitha Ravi, Ridhi Srikanth, Angel Thakur, Sonia Chandra, Jonathan Truong, Michael Coblenz,
- Abstract要約: あまり書かれていないコードは誤った発見をもたらし、科学的進歩が遅くなる可能性がある。
我々は,レポジトリ,可読性,再利用性という3次元の科学的コード品質を評価した。
その結果、科学的コード品質に大きな課題が浮かび上がっている。
- 参考スコア(独自算出の注目度): 1.4853037403155838
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The quality of scientific code is a critical concern for the research community. Poorly written code can result in irreproducible results, incorrect findings, and slower scientific progress. In this study, we evaluate scientific code quality across three dimensions: reproducibility, readability, and reusability. We curated a corpus of 518 code repositories by analyzing Code Availability statements from all 1239 Nature publications in 2024. To assess code quality, we employed multiple methods, including manual attempts to reproduce Jupyter notebooks, documentation reviews, and analyses of code clones and mutation patterns. Our results reveal major challenges in scientific code quality. Of the 19 notebooks we attempted to execute, only two were reproducible, primarily due to missing data files and dependency issues. Code duplication was also common, with 326 clone classes of at least 10 lines and three instances found among 637 of the 1510 notebooks in our corpus. These duplications frequently involved tasks such as visualization, data processing, and statistical analysis. Moreover, our mutation analysis showed that scientific notebooks often exhibit tangled state changes, complicating comprehension and reasoning. The prevalence of these issues -- unreproducible code, widespread duplication, and tangled state management -- underscores the need for improved tools and abstractions to help science build reproducible, readable and reusable software.
- Abstract(参考訳): 科学的コードの品質は、研究コミュニティにとって重要な関心事である。
あまり書かれていないコードは、予測不可能な結果、誤った発見、科学的進歩の遅さをもたらす可能性がある。
本研究では,再現性,可読性,再利用性という3次元の科学的コード品質を評価する。
2024年のNatureの出版物1239件のコードアベイラビリティーステートメントを分析して,518のコードリポジトリのコーパスをキュレートした。
コード品質を評価するために、Jupyterノートブックを手動で再現する試み、ドキュメントレビュー、コードクローンと突然変異パターンの分析など、複数の方法を採用しました。
私たちの結果は、科学的コード品質における大きな課題を明らかにします。
私たちが実行しようとした19のノートブックのうち、2つだけが再現可能でした。
コード重複も一般的で,少なくとも10行のクローンクラスが326個,コーパス内の1510のノートブックが637個あった。
これらの重複は、可視化、データ処理、統計解析といったタスクを頻繁に含んでいた。
さらに, 変異解析の結果, 科学的ノートは, しばしば絡み合った状態変化を示し, 理解と推論を複雑にしていることがわかった。
これらの問題 -- 再現不可能なコード、広範囲の重複、そして絡み合った状態管理 -- は、科学が再現可能で読みやすく再利用可能なソフトウェアを構築するのに役立つツールや抽象化の改善の必要性を浮き彫りにしている。
関連論文リスト
- SciCoQA: Quality Assurance for Scientific Paper--Code Alignment [53.70401063640645]
SciCoQAは,学術出版物と論文の相違を検出するためのデータセットである。
我々のデータセットは611の紙コード不一致(81のリアル、530の合成)で構成されており、様々な計算科学分野にまたがっている。
評価における最高の性能モデルである GPT-5 は、実世界の紙コード差の45.7%しか検出できない。
論文 参考訳(メタデータ) (2026-01-19T10:04:33Z) - A Dataset For Computational Reproducibility [2.147712260420443]
本稿では、幅広い分野の科学分野をカバーする計算実験のデータセットを紹介する。
ソフトウェア依存関係、実行手順、正確な再現に必要な設定の詳細が組み込まれている。
ツールの有効性を客観的に評価し比較するための標準化データセットを確立することで、普遍的なベンチマークを提供する。
論文 参考訳(メタデータ) (2025-04-11T16:45:10Z) - CodeScientist: End-to-End Semi-Automated Scientific Discovery with Code-based Experimentation [48.12054700748627]
CodeScientistは、遺伝的検索の形式として、アイデアと実験を共同で行う新しいASDシステムである。
我々はこのパラダイムを用いて、エージェントと仮想環境の領域において、機械生成のアイデアを幅広く数百もの自動実験する。
論文 参考訳(メタデータ) (2025-03-20T22:37:17Z) - Exploring Code Comprehension in Scientific Programming: Preliminary Insights from Research Scientists [6.2329239454115415]
本研究では、さまざまな分野の57人の科学者を対象に、コード可読性に関して直面するプログラミングの背景、実践、課題について調査する。
科学者は主にPythonとRを使用し、可読性に関するドキュメントに依存している。
以上の結果から,コード品質ツールの採用率の低下と,コード品質を改善するために大規模言語モデルを活用する傾向が示唆された。
論文 参考訳(メタデータ) (2025-01-17T08:47:29Z) - Understanding Code Understandability Improvements in Code Reviews [79.16476505761582]
GitHub上のJavaオープンソースプロジェクトからの2,401のコードレビューコメントを分析した。
改善提案の83.9%が承認され、統合され、1%未満が後に復活した。
論文 参考訳(メタデータ) (2024-10-29T12:21:23Z) - SciCode: A Research Coding Benchmark Curated by Scientists [37.900374175754465]
言語モデル(LM)は、多くの挑戦的なタスクにおいて平均的な人間よりも優れており、挑戦的で高品質で現実的な評価を開発することはますます困難になっている。
このベンチマークには数学、物理学、化学、生物学、材料科学といった問題が含まれています。
クロード3.5-ソネット(Claude3.5-Sonnet)は、最も現実的な環境では、問題の4.6%しか解決できない。
論文 参考訳(メタデータ) (2024-07-18T05:15:24Z) - What's Wrong with Your Code Generated by Large Language Models? An Extensive Study [92.62952504133926]
本研究は,3つの一般的なベンチマーク上で,3つの主要なクローズドソースLLMと6つの人気のあるオープンソースLLMの性能評価を行った。
間違ったコードに対するバグの分類を開発し、一般的なバグタイプに対する根本原因を分析した。
本稿では,自己批判を導入し,LLMが生成したコードに対する批判と修正を可能にする,新たな学習自由反復手法を提案する。
論文 参考訳(メタデータ) (2024-07-08T17:27:17Z) - Investigating Reproducibility in Deep Learning-Based Software Fault
Prediction [16.25827159504845]
ますます複雑な機械学習モデルが急速に採用されるようになると、学者が文献で報告される結果を再現することがますます困難になる。
特に、適用されたディープラーニングモデルと評価方法論が適切に文書化されていない場合と、コードとデータが共有されていない場合である。
我々は,2019年から2022年にかけて,トップレベルのソフトウェアエンジニアリングカンファレンスにおいて,現在の文献を体系的にレビューし,56件の研究論文のレベルを検討した。
論文 参考訳(メタデータ) (2024-02-08T13:00:18Z) - What's New? Summarizing Contributions in Scientific Literature [85.95906677964815]
本稿では,論文のコントリビューションと作業状況について,個別の要約を生成するために,論文要約のアンタングル化という新たなタスクを導入する。
本稿では,学術論文のS2ORCコーパスを拡張し,コントリビューション・コントリビューション・コントリビューション・レファレンス・ラベルを付加する。
本稿では, 生成した出力の関連性, 新規性, 絡み合いを報告する総合的自動評価プロトコルを提案する。
論文 参考訳(メタデータ) (2020-11-06T02:23:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。