論文の概要: Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms
- arxiv url: http://arxiv.org/abs/2607.26083v1
- Date: Sun, 26 Jul 2026 19:31:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.420827
- Title: Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms
- Title(参考訳): クロスモデルクロスランゲージAI符号化エージェントの性能:並列CLRSアルゴリズムの精度と速度
- Abstract要約: 本稿では,Cursor's Composer 2.0, GPT 5.4, Claude Sonnet 4.6の3つのAI符号化エージェントの言語間評価について述べる。
符号化エージェントにシリアルベースラインからの並列実装を指示し、機能的正当性と性能改善の両方を達成するために必要なプロンプトをトラックし、スピードアップを計測する。
Sonnet 4.6は全体的なパフォーマンス向上が最も優れており、GPT 5.4は一貫した正確性にもかかわらず測定可能なスピードアップを発生しない。
- 参考スコア(独自算出の注目度): 1.0382948833881696
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: AI coding agents have quickly become omnipresent in software engineering. Their serial performance, both in terms of accuracy and speed, has been extensively covered. However, recent initial results suggest their parallel programming capabilities lag behind serial programming capabilities. This paper presents a cross-language evaluation of three coding agents -- Cursor's Composer 2.0, GPT 5.4, and Claude Sonnet 4.6 -- on parallel code generation across three algorithm categories -- sorting, graph traversal, and search -- in C++, Python, and Julia. For each algorithm and language pair, we prompt a coding agent to produce a parallel implementation from a serial baseline, track the prompting effort required to achieve both functional correctness and performance improvements, and measure speedup against both custom serial baselines and third-party library implementations. We find that coding agents can produce correct parallel implementations with modest prompting effort, but that achieving meaningful speedup is heavily algorithm- and language-dependent. Sonnet 4.6 delivers the strongest overall performance gains, whereas GPT 5.4 produces no measurable speedups despite consistent correctness. C++ is most consistently parallelizable for graph algorithms, while Python and Julia achieve the largest speedups on search algorithms: no single language dominates across all categories. Python and Julia each achieve speedup on some graph algorithms but regress on others. These findings underscore the impact of including runtime performance efficiency as a main LLM performance metric, in addition to accuracy, particularly for parallel implementations.
- Abstract(参考訳): AIコーディングエージェントは、ソフトウェアエンジニアリングにおいて急速に存在感を増している。
精度と速度の両面でのシリアルパフォーマンスは広範囲にわたってカバーされている。
しかし、最近の最初の結果は、並列プログラミング能力がシリアルプログラミング能力に遅れていることを示唆している。
本稿では,C++,Python,Juliaの3つのアルゴリズムカテゴリ(ソート,グラフトラバーサル,サーチ)にわたる並列コード生成において,CursorのComposer 2.0,GPT 5.4,Claude Sonnet 4.6の3つの符号化エージェントの言語間評価を行う。
各アルゴリズムと言語ペアに対して、符号化エージェントにシリアルベースラインから並列実装を作成し、機能的正当性と性能改善の両方を達成するために必要なプロンプトをトラックし、カスタムシリアルベースラインとサードパーティライブラリ実装の両方に対してスピードアップを測定する。
符号化エージェントは、適度な速さで正しい並列実装を実現できるが、有意義なスピードアップを実現するには、アルゴリズムと言語に依存している。
Sonnet 4.6は全体的なパフォーマンス向上が最も優れており、GPT 5.4は一貫した正確性にもかかわらず測定可能なスピードアップを発生しない。
C++はグラフアルゴリズムに対して最も一貫して並列化可能である一方、PythonとJuliaは検索アルゴリズム上で最大のスピードアップを実現している。
PythonとJuliaはそれぞれ、いくつかのグラフアルゴリズムでスピードアップを達成するが、他のアルゴリズムでは後退する。
これらの結果は、特に並列実装の精度に加えて、実行時のパフォーマンス効率を主要なLLMパフォーマンス指標として含めることの影響を浮き彫りにしている。
関連論文リスト
- CHEHAB RL: Learning to Optimize Fully Homomorphic Encryption Computations [4.35834398077163]
ホモモルフィック暗号化(FHE)は、暗号化されたデータに直接計算を行うことができるが、その高い計算コストは依然として大きな障壁である。
本稿では、深部強化学習(RL)を利用してFHEコードの最適化を自動化する新しいフレームワークであるCHEHAB RLを提案する。
その結果、我々の手法は実行時に5.3times$のコードを生成し、2.54times$低いノイズを蓄積し、コンパイルプロセス自体はCoyoteよりも27.9times$のコードを生成することがわかった。
論文 参考訳(メタデータ) (2026-01-27T08:49:09Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z) - Parallel Algorithms Align with Neural Execution [7.535219325248997]
しかし並列アルゴリズムは計算能力を最大限に活用できるため、実行すべきレイヤは少ない。
このことは、CLRSフレームワーク上のシーケンシャルなコンポーネントに対して、検索、ソート、および強力な接続されたコンポーネントの並列実装を比較する際に観察されるように、トレーニング時間を劇的に短縮します。
論文 参考訳(メタデータ) (2023-07-08T21:28:20Z) - PARTIME: Scalable and Parallel Processing Over Time with Deep Neural
Networks [68.96484488899901]
PartIMEは、データが継続的にストリーミングされるたびにニューラルネットワークを高速化するように設計されたライブラリです。
PartIMEは、ストリームから利用可能になった時点で、各データサンプルの処理を開始する。
オンライン学習において、PartialIMEと古典的な非並列ニューラル計算を経験的に比較するために実験が行われる。
論文 参考訳(メタデータ) (2022-10-17T14:49:14Z) - Rapid Person Re-Identification via Sub-space Consistency Regularization [51.76876061721556]
Person Re-Identification (ReID) は、歩行者を分離したカメラで識別する。
実値特徴記述子を用いた既存のReID法は精度が高いが、ユークリッド距離計算が遅いため効率が低い。
本稿では,ReID 処理を 0.25 倍高速化するサブスペース一貫性規則化 (SCR) アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-07-13T02:44:05Z) - Accelerated Quality-Diversity for Robotics through Massive Parallelism [4.260312058817663]
政策評価はすでにQDアルゴリズムの高速化に並行して行われているが、単一のマシンでしか機能しない。
最近のアクセラレーター上で動作するシミュレータの進歩により、単一のGPU/TPU上で数千の評価を並列に行うことができる。
QDアルゴリズムは理想的な候補であり,対話型時間スケールで大規模並列処理を実行できることを示す。
論文 参考訳(メタデータ) (2022-02-02T19:44:17Z) - PolyDL: Polyhedral Optimizations for Creation of High Performance DL
primitives [55.79741270235602]
本稿では,Deep Learningプリミティブの高性能実装を自動的に生成するコンパイラアルゴリズムを提案する。
我々は多面体モデルを用いた新しいデータ再利用分析アルゴリズムを開発した。
また、このようなハイブリッドコンパイラとライブラリ使用の最小限のアプローチが、最先端のパフォーマンスをもたらすことを示す。
論文 参考訳(メタデータ) (2020-06-02T06:44:09Z) - Accelerating Feedforward Computation via Parallel Nonlinear Equation
Solving [106.63673243937492]
ニューラルネットワークの評価や自己回帰モデルからのサンプリングなどのフィードフォワード計算は、機械学習においてユビキタスである。
本稿では,非線形方程式の解法としてフィードフォワード計算の課題を定式化し,ジャコビ・ガウス・シーデル固定点法とハイブリッド法を用いて解を求める。
提案手法は, 並列化可能な繰り返し回数の削減(あるいは等値化)により, 元のフィードフォワード計算と全く同じ値が与えられることを保証し, 十分な並列化計算能力を付与する。
論文 参考訳(メタデータ) (2020-02-10T10:11:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。