論文の概要: Towards Evaluation of Implicit Software World Models in Coding LLMs
- arxiv url: http://arxiv.org/abs/2606.27406v1
- Date: Thu, 25 Jun 2026 08:02:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.276253
- Title: Towards Evaluation of Implicit Software World Models in Coding LLMs
- Title(参考訳): LLMにおけるインシシシト・ソフトウェア・ワールド・モデルの評価に向けて
- Authors: Egor Bogomolov, Yaroslav Zharov,
- Abstract要約: 観測可能な軸を実行リソースにシフトすることで、より広範な評価に向けて一歩踏み出します。
私たちはSWE-bench Verifiedをデータソースとして使用し、実際のソフトウェアエンジニアリングタスクに近いテストを保持します。
- 参考スコア(独自算出の注目度): 3.4011650749358786
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Software engineering, whether performed by humans or by AI agents, requires reasoning about how software behaves. We call the internal model that supports such reasoning the software world model, and view current code-execution benchmarks as covering one well-studied slice of it -- control flow. In this paper, we take a step toward a broader evaluation by shifting the observable axis to execution resources: alongside test outcome and exception class, we predict peak memory, wall-clock time, and ranked profiler outputs at method and line granularity. We use SWE-bench Verified as the source of data to hold the test close to real-world software engineering tasks. All tested models, frontier ones included, show modest performance and brittle behaviour, suggesting a notable lack of understanding of how software is executed, as opposed to how its source code is written.
- Abstract(参考訳): 人間でもAIエージェントでも、ソフトウェアエンジニアリングはソフトウェアがどのように振る舞うかを推論する必要がある。
私たちは、このようなソフトウェアの世界モデル推論をサポートする内部モデルを呼び出し、現在のコード実行ベンチマークを、よく研究された1つのスライス - 制御フロー - をカバーするものとして見ている。
本稿では、テスト結果と例外クラスとともに、ピークメモリ、ウォールクロック時間、メソッドおよびラインの粒度でランキングされたプロファイラ出力を予測し、観測可能な軸を実行リソースにシフトすることで、より広範な評価を行う。
私たちはSWE-bench Verifiedをデータソースとして使用し、実際のソフトウェアエンジニアリングタスクに近いテストを保持します。
テストされたすべてのモデル、フロンティアは、パフォーマンスと不安定な振る舞いを示し、ソースコードの書き方とは対照的に、ソフトウェアがどのように実行されるかに関する顕著な理解の欠如を示唆している。
関連論文リスト
- LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - You Don't Need Public Tests to Generate Correct Code [0.9668407688201359]
大規模言語モデルには,有効な入力を自律的に構築し,自己補正のための実行フローをシミュレートする能力があることを示す。
我々は,LLMが反復的に計画し,独自のテスト入力を合成し,シミュレートされた実行を行うことで,地平データの必要性を解消するフレームワークであるDryRUNを紹介した。
論文 参考訳(メタデータ) (2026-04-23T12:21:03Z) - StatsClaw: An AI-Collaborative Workflow for Statistical Software Development [1.8686116192307898]
既存のAIコード生成ツールは、迅速にコードを生成するが、忠実な実装を保証することはできない。
コード生成とバリデーションの間の情報バリアを強制するClude Code用のマルチエージェントアーキテクチャであるStatsClawを紹介します。
その結果,StatsClawはソフトウェアライフサイクルの工学的オーバーヘッドを吸収し,研究者が実質的な方法論的決定を全てコントロールできることが示唆された。
論文 参考訳(メタデータ) (2026-04-06T17:18:53Z) - From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence [150.3696990310269]
大規模言語モデル(LLM)は、自然言語記述を直接関数コードに変換することによって、自動ソフトウェア開発を変革した。
コードLLMに関する総合的な合成と実践的ガイド(一連の解析および探索実験)を提供する。
一般LLM(GPT-4, Claude, LLaMA)とコード特殊化LLM(StarCoder, Code LLaMA, DeepSeek-Coder, QwenCoder)のコード機能の解析を行う。
論文 参考訳(メタデータ) (2025-11-23T17:09:34Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors [7.210032327838313]
大規模言語モデル(LLM)がコード実行予測の代理モデルとして機能するかどうかを検討する。
オープンソースおよびプロプライエタリ LLM の広範な分析を通じて,スケーリング法則,データ効率,予測精度について検討する。
計算機処理における効率的なサロゲートとしてのLCMの実現可能性に関する重要な知見を明らかにした。
論文 参考訳(メタデータ) (2025-02-16T15:38:19Z) - Fault-Aware Neural Code Rankers [64.41888054066861]
サンプルプログラムの正しさを予測できる故障認識型ニューラルネットワークローダを提案する。
我々のフォールト・アウェア・ローダは、様々なコード生成モデルのpass@1精度を大幅に向上させることができる。
論文 参考訳(メタデータ) (2022-06-04T22:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。