論文の概要: JupOtter: Cell-Level Bug Detection in Jupyter Notebooks
- arxiv url: http://arxiv.org/abs/2606.23877v1
- Date: Mon, 22 Jun 2026 19:23:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.641876
- Title: JupOtter: Cell-Level Bug Detection in Jupyter Notebooks
- Title(参考訳): JupOtter:Jupyterノートブックのセルレベルバグ検出
- Authors: Lukas Ottenhof, Thibaud Lutellier,
- Abstract要約: We present JupOtter, a bug detection system designed for Jupyter Notebooks。
JupOtter は,(1) 細胞構造を保存するノートブック固有のトークン化戦略,(2) 細胞レベルのバグ予測手法,(3) ラベル付きデータセット OtterDataset の3つの新しいコントリビューションを特徴としている。
- 参考スコア(独自算出の注目度): 2.041585741962914
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Jupyter Notebooks are an increasingly popular coding environment used across many domains, especially in Python-based data science and scientific computing. Originally used for prototyping and interactive exploration, notebooks are increasingly used to develop more complex programs, leading to a rapid rise in buggy notebooks on platforms like GitHub. To address this trend, we present JupOtter, a bug detection system designed specifically for Jupyter Notebooks. JupOtter features three novel contributions: (1) a notebook-specific tokenization strategy that preserves cell structure, (2) a cell-level bug prediction technique, and (3) a new labeled dataset, OtterDataset, containing over 21,000 notebooks annotated for fine-grained cell-level bug detection. JupOtter achieves cell-level bug detection F1 scores that surpass static analyzers and large language models in two out of three evaluation datasets.
- Abstract(参考訳): Jupyter Notebooksは、Pythonベースのデータサイエンスと科学計算において、多くのドメインで広く使われているコーディング環境である。
元々はプロトタイピングとインタラクティブな探索に使用されていたが、ノートブックはますます複雑なプログラムの開発に使われており、GitHubのようなプラットフォーム上ではバグの多いノートブックが急速に増えている。
この傾向に対応するために、Jupyter Notebooks用に特別に設計されたバグ検出システムであるJupOtterを紹介する。
JupOtter は,(1) 細胞構造を保存するノートブック固有のトークン化戦略,(2) 細胞レベルのバグ予測手法,(3) ラベル付きデータセット OtterDataset の3つの新しいコントリビューションを特徴としている。
JupOtterは静的アナライザと大規模言語モデルを超えるセルレベルのバグ検出F1スコアを、3つの評価データセットのうち2つで達成している。
関連論文リスト
- Exploring the Jupyter Ecosystem: An Empirical Study of Bugs and Vulnerabilities [3.4769545753909608]
本研究の目的は,Notebookエコシステムのバグと脆弱性に関する大規模な実証研究を提供することである。
我々は2つの主要なプラットフォームからノートブックの大規模なデータセットを収集し分析した。
論文 参考訳(メタデータ) (2025-07-24T22:09:21Z) - Observing Fine-Grained Changes in Jupyter Notebooks During Development Time [12.75622665542759]
開発期間中にJupyterノートブックのコード変更を収集するためのツールセットを紹介します。
次に、データ分析タスクと機械学習タスクに関連する100時間以上の作業を収集します。
収集したデータの解析では,実行間のセルへの変更を分類し,コード修正による変更のかなりの数を確認した。
論文 参考訳(メタデータ) (2025-07-21T17:41:51Z) - Rethinking End-to-End 2D to 3D Scene Segmentation in Gaussian Splatting [86.15347226865826]
We design an new end-to-end object-aware lifting approach, called Unified-Lift。
コントラスト損失を用いて学習したガウスレベルの機能を各ガウス点に拡張し、インスタンス情報をエンコードする。
LERF-Masked、Replica、Messy Roomsの3つのベンチマークで実験を行った。
論文 参考訳(メタデータ) (2025-03-18T08:42:23Z) - Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models [3.2433570328895196]
GitHub上の792の機械学習リポジトリの20,095のリビジョンから得られた48,398のJupyterノートブック編集の最初のデータセットを提示する。
我々のデータセットは、セルレベルとラインレベルの修正の詳細な詳細をキャプチャし、機械学習における現実のメンテナンスパターンを理解する基盤を提供する。
論文 参考訳(メタデータ) (2025-01-16T18:55:38Z) - DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection [111.68263493302499]
DetCLIPv3は、オープンボキャブラリオブジェクト検出と階層ラベルの両方で優れた高性能検出器である。
DetCLIPv3は,1)Versatileモデルアーキテクチャ,2)高情報密度データ,3)効率的なトレーニング戦略の3つのコア設計によって特徴付けられる。
DetCLIPv3は、GLIPv2, GroundingDINO, DetCLIPv2をそれぞれ18.0/19.6/6 APで上回り、優れたオープン語彙検出性能を示す。
論文 参考訳(メタデータ) (2024-04-14T11:01:44Z) - Multi-Label Meta Weighting for Long-Tailed Dynamic Scene Graph
Generation [55.429541407920304]
対象と対象のペア間の述語認識は、本質的に不均衡であり、複数ラベルである。
最近の最先端の手法は、主に最も頻繁に発生する述語クラスに焦点を当てている。
偏りのある述語分布を扱うために,多言語メタラーニングフレームワークを導入する。
論文 参考訳(メタデータ) (2023-06-16T18:14:23Z) - Mining the Characteristics of Jupyter Notebooks in Data Science Projects [1.655246222110267]
計算ノートブック (Jupyter Notebook) は、実際はよく知られたデータサイエンスツールである。
本研究の目的は,Kaggle上のJupyter Notebooksと,GitHub上のデータサイエンスプロジェクトで人気の高いJupyter Notebooksの特徴を理解することである。
論文 参考訳(メタデータ) (2023-04-11T16:30:53Z) - Deep learning for table detection and structure recognition: A survey [49.09628624903334]
本調査の目的は,テーブル検出の分野での大きな進展を深く理解することである。
この分野における古典的アプリケーションと新しいアプリケーションの両方について分析する。
既存のモデルのデータセットとソースコードは、読者にこの膨大な文献のコンパスを提供するために組織されている。
論文 参考訳(メタデータ) (2022-11-15T19:42:27Z) - HAConvGNN: Hierarchical Attention Based Convolutional Graph Neural
Network for Code Documentation Generation in Jupyter Notebooks [33.37494243822309]
Seq2Seqネットワークを強化するための階層型注意ベースのConvGNNコンポーネントを提案する。
Kaggleノートブックでデータセットを構築し、モデル(HAConvGNN)をベースラインモデルに対して評価します。
論文 参考訳(メタデータ) (2021-03-31T22:36:41Z) - S3M: Siamese Stack (Trace) Similarity Measure [55.58269472099399]
本稿では、深層学習に基づくスタックトレースの類似性を計算する最初のアプローチであるS3Mを紹介します。
BiLSTMエンコーダと、類似性を計算するための完全接続型分類器をベースとしている。
私たちの実験は、オープンソースデータとプライベートなJetBrainsデータセットの両方において、最先端のアプローチの優位性を示しています。
論文 参考訳(メタデータ) (2021-03-18T21:10:41Z) - Superiority of Simplicity: A Lightweight Model for Network Device
Workload Prediction [58.98112070128482]
本稿では,歴史観測に基づく時系列予測のための軽量な解を提案する。
ニューラルネットワークと平均予測器という2つのモデルからなる異種アンサンブル法で構成されている。
利用可能なFedCSIS 2020チャレンジデータセットの総合的なR2$スコア0.10を達成している。
論文 参考訳(メタデータ) (2020-07-07T15:44:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。