論文の概要: StatsClaw: An AI-Collaborative Workflow for Statistical Software Development
- arxiv url: http://arxiv.org/abs/2604.04871v1
- Date: Mon, 06 Apr 2026 17:18:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.304738
- Title: StatsClaw: An AI-Collaborative Workflow for Statistical Software Development
- Title(参考訳): StatsClaw: 統計的ソフトウェア開発のためのAI共同ワークフロー
- Abstract要約: 既存のAIコード生成ツールは、迅速にコードを生成するが、忠実な実装を保証することはできない。
コード生成とバリデーションの間の情報バリアを強制するClude Code用のマルチエージェントアーキテクチャであるStatsClawを紹介します。
その結果,StatsClawはソフトウェアライフサイクルの工学的オーバーヘッドを吸収し,研究者が実質的な方法論的決定を全てコントロールできることが示唆された。
- 参考スコア(独自算出の注目度): 1.8686116192307898
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Translating statistical methods into reliable software is a persistent bottleneck in quantitative research. Existing AI code-generation tools produce code quickly but cannot guarantee faithful implementation -- a critical requirement for statistical software. We introduce StatsClaw, a multi-agent architecture for Claude Code that enforces information barriers between code generation and validation. A planning agent produces independent specifications for implementation, simulation, and testing, dispatching them to separate agents that cannot see each other's instructions: the builder implements without knowing the ground-truth parameters, the simulator generates data without knowing the algorithm, and the tester validates using deterministic criteria. We describe the approach, demonstrate it end-to-end on a probit estimation package, and evaluate it across three applications to the authors' own R and Python packages. The results show that structured AI-assisted workflows can absorb the engineering overhead of the software lifecycle while preserving researcher control over every substantive methodological decision.
- Abstract(参考訳): 統計的手法を信頼できるソフトウェアに翻訳することは、定量的研究において永続的なボトルネックである。
既存のAIコード生成ツールは、すぐにコードを生成するが、忠実な実装を保証することはできない。
コード生成とバリデーションの間の情報バリアを強制するClude Code用のマルチエージェントアーキテクチャであるStatsClawを紹介します。
プランニングエージェントは、実装、シミュレーション、テストのための独立した仕様を作成し、それらを相互の指示が見えない別々のエージェントにディスパッチする。ビルダーは、地平線パラメータを知らずに実装し、シミュレータはアルゴリズムを知らずにデータを生成し、テスタは決定論的基準を用いて検証する。
提案手法を解説し,プロビット推定パッケージ上でエンドツーエンドに検証し,著者自身のRおよびPythonパッケージに対して3つのアプリケーションにわたって評価する。
その結果、構造化されたAI支援ワークフローがソフトウェアライフサイクルの工学的オーバーヘッドを吸収し、研究者があらゆる実体的方法論的決定を制御できることが示唆された。
関連論文リスト
- AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems [82.01232437066487]
AgentXはプロダクションデプロイされたマルチエージェントシステムで、このプロダクション機能を再構築する。
自律的に生成し、実装し、評価し、レコメンデーション実験から学ぶ。
AgentXは4つの密結合したステージをクローズドループでオーケストレーションする。
論文 参考訳(メタデータ) (2026-06-25T10:42:28Z) - Towards Evaluation of Implicit Software World Models in Coding LLMs [3.4011650749358786]
観測可能な軸を実行リソースにシフトすることで、より広範な評価に向けて一歩踏み出します。
私たちはSWE-bench Verifiedをデータソースとして使用し、実際のソフトウェアエンジニアリングタスクに近いテストを保持します。
論文 参考訳(メタデータ) (2026-06-25T08:02:32Z) - You Don't Need Public Tests to Generate Correct Code [0.9668407688201359]
大規模言語モデルには,有効な入力を自律的に構築し,自己補正のための実行フローをシミュレートする能力があることを示す。
我々は,LLMが反復的に計画し,独自のテスト入力を合成し,シミュレートされた実行を行うことで,地平データの必要性を解消するフレームワークであるDryRUNを紹介した。
論文 参考訳(メタデータ) (2026-04-23T12:21:03Z) - Co-Refine: AI-Powered Tool Supporting Qualitative Analysis [6.199710730080277]
私たちはCo-RefineというAIで強化された定性的なコーディングプラットフォームを紹介します。
ステージ1は、数学的一貫性のための決定論的埋め込みベースのメトリクスを計算し、ステージ2は、決定論的スコアのpm0.15ドル以内でLCMの判定を下し、ステージ3は、以前のパターンからコード定義を生成し、より深いフィードバックループを作成する。
論文 参考訳(メタデータ) (2026-04-21T10:16:13Z) - Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution [5.10403054516716]
既存のデータセットは、分離された単一のプルリクエスト(PR)タスクのパフォーマンスをステートレスな方法で評価する。
本稿では,SWE-STEPSのデータセット生成を支援する自動コーディングタスク生成フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-03T13:44:40Z) - MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration [0.0]
我々は、Pythonを直接書き、実行するためのコードファーストエージェントであるMatchClawを提示する。
MatClawはコード生成を確実に扱うが、暗黙のドメイン知識に苦慮している。
その結果、ガイド付きと完全に自律的な計算材料研究のギャップはこれまで以上に狭くなっていることが明らかとなった。
論文 参考訳(メタデータ) (2026-04-03T03:32:15Z) - Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining [66.89012795621349]
大規模言語モデル(LLM)は、複雑なソフトウェア工学に必要な、深く、長期にわたる推論に苦しむことが多い。
本稿では,再構築による理解という,新しいパラダイムを提案する。
マルチエージェントシミュレーションを用いて潜在エージェント軌道を合成するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T09:23:20Z) - AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework [4.782965804438204]
大規模言語モデル(LLM)は、科学的コード生成を自動化する可能性を示しているが、信頼性、エラーの伝播、評価において課題に直面している。
我々は,AI for Science(AI4S)タスクを低符号プラットフォーム(LCP)の形で特別に設計したベイズ対向型マルチエージェントフレームワークを提案する。
ユーザ入力を実行可能な計画と適応テストケースに構造化するタスクマネージャ、候補ソリューションを生成するコードジェネレータ、包括的なフィードバックを提供する評価器である。
論文 参考訳(メタデータ) (2026-03-03T18:25:00Z) - From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence [150.3696990310269]
大規模言語モデル(LLM)は、自然言語記述を直接関数コードに変換することによって、自動ソフトウェア開発を変革した。
コードLLMに関する総合的な合成と実践的ガイド(一連の解析および探索実験)を提供する。
一般LLM(GPT-4, Claude, LLaMA)とコード特殊化LLM(StarCoder, Code LLaMA, DeepSeek-Coder, QwenCoder)のコード機能の解析を行う。
論文 参考訳(メタデータ) (2025-11-23T17:09:34Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - AIRepr: An Analyst-Inspector Framework for Evaluating Reproducibility of LLMs in Data Science [8.281093505963158]
大規模言語モデル(LLM)は、実行可能なコード生成を通じてデータ分析を自動化するために、ますます使われるようになっている。
本稿では,LLM生成データ分析の自動評価と改善のための分析・検査フレームワークであるAIReprについて述べる。
論文 参考訳(メタデータ) (2025-02-23T01:15:50Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。