論文の概要: Pandas for Reproducible Data Analysis: From Spreadsheets to Research-Grade Python Workflows
- arxiv url: http://arxiv.org/abs/2606.14924v1
- Date: Fri, 12 Jun 2026 20:00:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:32.459691
- Title: Pandas for Reproducible Data Analysis: From Spreadsheets to Research-Grade Python Workflows
- Title(参考訳): 再現可能なデータ分析のためのパンダ:スプレッドシートからリサーチグレードPythonワークフローへ
- Authors: Sidney Shapiro, Daniel Pearson, Emiliano Sebastian Gonzalez Venegas,
- Abstract要約: 公式、手動編集、コピー・ペースト・リフレッシュを通じて成長するシートは、大規模な監査、再生、管理が困難である。
本稿では,Pythonのパンダライブラリをそのレイヤとして扱う。スプレッドシートの実践と研究グレードの間の実践的な橋渡しであり,Excelの全面的な置き換えではない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spreadsheet-heavy analytical work remains common in business analytics, operations reporting, and applied research, yet workbooks that grow through formulas, manual edits, and copy-paste refresh are difficult to audit, reproduce, and govern at scale. When tabular work requires repeatability, validation, version control, automated refresh, or integration with statistics and machine learning, analysts need a transformation layer that preserves familiar table concepts while making assumptions explicit. This paper treats the Python pandas library as that layer: a practical bridge between spreadsheet practice and research-grade workflows, not a wholesale replacement for Excel. The paper contributes an Excel-to-pandas migration mapping, a taxonomy of nine workflow categories, seven end-to-end examples drawn from business analytics and applied research, a failure-mode catalog, and reusable code recipes for governed tabular work. pandas is most useful when tabular analysis must be repeatable, auditable, and defensible, while Excel can remain a familiar input and output interface for stakeholders who need workbooks.
- Abstract(参考訳): スプレッドシートを多用する分析作業は、ビジネス分析、運用報告、応用研究において依然として一般的であるが、公式、手作業による編集、コピー・ペースト・リフレッシュを通じて成長するワークブックは、大規模な監査、再生、管理が困難である。
反復可能性、検証、バージョン管理、自動リフレッシュ、統計と機械学習の統合を必要とする場合、アナリストは、仮定を明確にしながら、よく知られたテーブル概念を保存する変換層が必要である。
本稿では,Pythonのパンダライブラリをそのレイヤとして扱う。スプレッドシートの実践と研究グレードのワークフローの実践的なブリッジであり,Excelの全面的な置き換えではない。
本論文は,Excel-to-pandasマイグレーションマッピング,9つのワークフローカテゴリの分類,ビジネス分析と応用研究から引き出されたエンドツーエンドの7つの例,障害モードカタログ,テーブルワーク管理のための再利用可能なコードレシピをコントリビュートする。
pandasは、表分析が反復可能で、監査可能で、かつ、防御可能でなければならない場合に最も有用であり、Excelは、ワークブックを必要とするステークホルダーにとって、馴染みのある入力および出力インターフェースのままである。
関連論文リスト
- TabClaw: An Interactive and Self-Evolving Agent for Spreadsheet Manipulation and Table Reasoning [10.691111633638734]
本稿では,スプレッドシート操作とテーブル推論のためのオープンソースの対話型AIエージェントTabClawを提案する。
TabClawは曖昧な意図を明確にし、編集可能な実行計画を公開するとともに、ReActスタイルのツール使用分析ループをストリームし、並列マルチテーブル推論のためのスペシャリストをディスパッチする。
論文 参考訳(メタデータ) (2026-06-09T02:11:16Z) - Sheet as Token: A Graph-Enhanced Representation for Multi-Sheet Spreadsheet Understanding [14.27017655999633]
Sheet as Tokenはグラフで強化されたフレームワークで、各ワークシートをマルチシートのスプレッドシート検索のための統一セマンティックユニットとして扱う。
Graph Retrieverは、セマンティック、クエリ条件付き、スキーマ一貫性、形状適合性関係を使って、シートトークン上のクエリ固有の候補グラフを構築する。
構成したマルチシートスプレッドシートコーパスの実験により、シートレベルのトークン化が安定した表現を学習することを示す。
論文 参考訳(メタデータ) (2026-05-07T07:47:43Z) - Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning [43.91509663025854]
スプレッドシートは、企業報告、監査、科学データ管理といった現実世界のアプリケーションの中心である。
既存の大きな言語モデルベースのアプローチでは、テーブルを平易なテキストとして扱い、重要なレイアウトキューや視覚的意味論を見渡すのが一般的である。
本稿では,ステップバイステップの読み出しと推論のパラダイムを取り入れた,スプレッドシート理解のための2段階のマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-14T04:47:21Z) - SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks [8.306042091008957]
大規模言語モデル (LLM) は、構造化されたアーティファクトの生成と操作のタスクが増えている。
タスク上でモデルのパフォーマンスを評価するプラットフォームであるSpreadsheetArenaを紹介する。
好みのスプレッドシートのスタイラス的,構造的,機能的特徴はユースケースによって大きく異なる。
論文 参考訳(メタデータ) (2026-02-16T14:24:36Z) - SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation [34.8332394229927]
SpreadsheetBenchは,現在の大規模言語モデル(LLM)を,スプレッドシートユーザのワークフローにマージするように設計されている。
合成クエリと単純化されたスプレッドシートファイルに依存する既存のベンチマークとは異なり、SpreadsheetBenchはオンラインExcelフォーラムから収集された912の質問から作られている。
単一ラウンドおよび複数ラウンドの推論条件下での各種LLMの総合評価は,最先端モデル(SOTA)と人為的性能との間に大きなギャップがあることを示唆している。
論文 参考訳(メタデータ) (2024-06-21T09:06:45Z) - DSI++: Updating Transformer Memory with New Documents [95.70264288158766]
DSI++は、DSIが新たなドキュメントをインクリメンタルにインデクシングするための継続的な学習課題である。
新たな文書の連続的な索引付けは,それまでの索引付け文書をかなり忘れてしまうことを示す。
文書の擬似クエリをサンプルとして生成メモリを導入し、連続的なインデックス付け中に補足することで、検索タスクの忘れを防止する。
論文 参考訳(メタデータ) (2022-12-19T18:59:34Z) - Does Recommend-Revise Produce Reliable Annotations? An Analysis on
Missing Instances in DocRED [60.39125850987604]
テキスト修正方式は, 偽陰性サンプルと, 人気エンティティや関係性に対する明らかな偏見をもたらすことを示す。
より信頼性の高いドキュメントREモデルのテストセットとして機能するように、relabeledデータセットがリリースされている。
論文 参考訳(メタデータ) (2022-04-17T11:29:01Z) - SpreadsheetCoder: Formula Prediction from Semi-structured Context [70.41579328458116]
行ベースと列ベースの両方のフォーマットで表されるコンテキストを表現するために,BERTベースのモデルアーキテクチャを提案する。
我々はスプレッドシートの大きなデータセットでモデルをトレーニングし、SpreadsheetCoderが42.51%の予測精度でトップ1の予測を達成できることを実証した。
ルールベースのシステムと比較すると、SpreadsheetCoder 82%は、Google Sheetsで公式を作成する上で、より多くのユーザを支援する。
論文 参考訳(メタデータ) (2021-06-26T11:26:27Z) - A Graph Representation of Semi-structured Data for Web Question
Answering [96.46484690047491]
本稿では、半構造化データとそれらの関係の構成要素の体系的分類に基づいて、Webテーブルとリストのグラフ表現を提案する。
本手法は,最先端のベースラインに対してF1スコアを3.90ポイント向上させる。
論文 参考訳(メタデータ) (2020-10-14T04:01:54Z) - Pre-training Tasks for Embedding-based Large-scale Retrieval [68.01167604281578]
本稿では,大規模クエリ文書検索問題について考察する。
クエリ(例えば質問)が与えられたら、関連するドキュメントのセットを大きなドキュメントコーパスから返します。
本稿では, 組込み型トランスフォーマーモデルの学習の鍵となる要素が, 事前学習作業のセットであることを示す。
論文 参考訳(メタデータ) (2020-02-10T16:44:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。