論文の概要: Plainbook: Data Science, in Plain Language
- arxiv url: http://arxiv.org/abs/2607.05717v1
- Date: Tue, 07 Jul 2026 01:00:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.358066
- Title: Plainbook: Data Science, in Plain Language
- Title(参考訳): プレーンブック:データサイエンス、プレーン言語
- Authors: Luca de Alfaro, Mathis Aubert, Ranjit Jhala, Eliana Pastor, Elena Baralis,
- Abstract要約: プレーンブックは、自然言語記述の促進と価値の検証という2つの原則に基づいている。
コードを理解しないユーザによる計算の正確性検証を可能にするため,我々は,値と値検査を中心としたPlainbook検証機構を構築した。
- 参考スコア(独自算出の注目度): 17.93681670028594
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Jupyter Notebooks have become widely adopted in data science, as they allow the sharing of reproducible computational analysis. They are, however, accessible only to people who understand computer code. To reach the broader audience of scientists interested in data analysis and computation, but unfamiliar with code, we introduce Plainbook, notebooks centered on natural language rather than code. Plainbook is based on two principles: promote the natural language descriptions, and verify the values. In plainbook, the natural language descriptions are preserved, rather than the resulting code; the code is generated automatically from the cell descriptions. As natural language is read top to bottom, Plainbook adopts a linear execution semantics, in which cells are guaranteed to be executed in the order in which they appear; there is no "hidden state" or out-of-order execution as in Jupyter. To allow users who may not understand code to verify the correctness of the computation, we have built into Plainbook verification mechanisms centered on values and value inspection. These include mechanisms that focus on individual cells, akin to unit tests, as well as global mechanisms. Both the linear execution semantics, and the verification mechanisms, are underpinned by a snapshot kernel that caches execution states and makes execution and verification efficient.
- Abstract(参考訳): Jupyter Notebooksは、再現可能な計算分析の共有を可能にするため、データサイエンスにおいて広く採用されている。
しかし、それらはコンピュータコードを理解する人しかアクセスできない。
データ分析と計算に関心を持つ科学者の幅広い読者にリーチするために、コードになじみのないPlainbookを紹介します。
プレーンブックは、自然言語記述の促進と価値の検証という2つの原則に基づいている。
プレーンブックでは、自然言語記述は結果のコードではなく保存され、コードはセル記述から自動的に生成される。
自然言語が上から下まで読み込まれるため、Plainbookはリニアな実行セマンティクスを採用しており、セルが現れる順序で実行されることが保証されている。
コードを理解しないユーザが計算の正確性を検証できるように,我々は,値と値検査を中心としたPlainbook検証機構を構築した。
これには、個々の細胞に焦点を当てるメカニズム、単体テストに似たメカニズム、そしてグローバルなメカニズムが含まれる。
線形実行セマンティクスと検証メカニズムは、実行状態をキャッシュし、実行と検証を効率的にするスナップショットカーネルによって支えられている。
関連論文リスト
- CRABS: A syntactic-semantic pincer strategy for bounding LLM interpretation of Python notebooks [8.967739950302407]
再実行によるノートブックの調査は、データとソフトウェアの曖昧さを解決する上での課題のため、現実的ではないことが多い。
我々は,Pythonノートブックの完全な理解を支援するために,限定構文解析を用いた戦略を開発する。
提案手法の有効性を,50個の代表的,高精細なKaggleノートの注釈付きデータセットを用いて評価し,実証した。
論文 参考訳(メタデータ) (2025-07-15T21:14:08Z) - Is Compression Really Linear with Code Intelligence? [60.123628177110206]
textitFormat Annealingは、事前訓練されたモデルの本質的な能力を同等に評価するために設計された、軽量で透明なトレーニング手法である。
我々の経験的結果は、測定されたコードインテリジェンスとビット・パー・キャラクタ(BPC)の基本的な対数関係を明らかにする。
私たちの研究は、コードインテリジェンスの開発における圧縮の役割をより微妙に理解し、コードドメインにおける堅牢な評価フレームワークに貢献します。
論文 参考訳(メタデータ) (2025-05-16T16:59:14Z) - Predicting the Understandability of Computational Notebooks through Code Metrics Analysis [0.5277756703318045]
本稿では,Jupyterノートブックの理解可能性を評価するために,ソフトウェアリポジトリからのユーザ意見を活用する新しいアプローチを提案する。
コード理解性に関連するユーザコメントを識別するために、微調整のDistilBERT変換器を使用しました。
次に、関連するコメントの数、アップボート、ノートブックビューに基づいて、UOCU(User Opinion Code Understandability)という新しいメトリクスを導入しました。
この改善されたメトリクスを使用して、132,723の最終ノートから34のノートレベルのメトリクスを収集し、機械学習モデルをトレーニングして、理解可能性を予測する。
論文 参考訳(メタデータ) (2024-06-16T15:58:40Z) - InterCode: Standardizing and Benchmarking Interactive Coding with
Execution Feedback [50.725076393314964]
標準的な強化学習環境として,インタラクティブコーディングの軽量でフレキシブルで使いやすいフレームワークであるInterCodeを紹介した。
私たちのフレームワークは、言語とプラットフォームに依存しない、自己完結型のDocker環境を使用して、安全で再現可能な実行を提供します。
我々は、異なるプロンプト戦略で構成された複数の最先端LLMを評価することにより、InterCodeの生存性をテストベッドとして示す。
論文 参考訳(メタデータ) (2023-06-26T17:59:50Z) - Code Execution with Pre-trained Language Models [88.04688617516827]
コードインテリジェンスのトレーニング済みモデルのほとんどは実行トレースを無視しており、ソースコードと構文構造のみに依存している。
我々は,大規模かつ現実的なPythonデータセットとコード実行タスクを作成するために,突然変異に基づくデータ拡張手法を開発した。
次に、コード実行事前学習とカリキュラム学習を活用して意味理解を強化するトランスフォーマーモデルであるCodeExecutorを提案する。
論文 参考訳(メタデータ) (2023-05-08T10:00:05Z) - Natural Language to Code Generation in Interactive Data Science
Notebooks [35.621936471322385]
データサイエンスノートブックのパンダスデータ分析フレームワークを用いて1082のコード生成問題のベンチマークであるARCADEを構築した。
我々は,Python 計算ノートブック用の 62B コード言語モデル PaChiNCo を開発した。
論文 参考訳(メタデータ) (2022-12-19T05:06:00Z) - A Paradigm Change for Formal Syntax: Computational Algorithms in the
Grammar of English [0.0]
私たちは、プログラム言語を、プロセスベースの英語構文のモデルにします。
機能語と内容語の組み合わせをモデリングのトピックとして選んだ。
モデルの適合性は、アルゴリズムに不可欠な3つの機能特性を導出し、英語文法におけるそれらの存在を確認することによって検証された。
論文 参考訳(メタデータ) (2022-05-24T07:28:47Z) - StickyLand: Breaking the Linear Presentation of Computational Notebooks [5.1175396458764855]
StickyLandはノートブックの拡張機能で、ユーザは自由にコードをリニアな方法で整理できる。
常に画面に表示される粘着性のあるセルを使えば、ユーザーはノートに素早くアクセスでき、実験結果をすぐに観察でき、インタラクティブなダッシュボードを簡単に構築できる。
論文 参考訳(メタデータ) (2022-02-22T18:25:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。