論文の概要: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
- arxiv url: http://arxiv.org/abs/2610.02438v1
- Date: Thu, 01 Oct 2026 20:04:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.074226
- Title: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
- Title(参考訳): 合成かリコールか?アルゴリズムコード検索におけるLLMの評価
- Abstract要約: AlgoREvalは14のドメインにまたがる古典的な77のアルゴリズム,7つのプログラミング言語,4つのグラフインプット表現にまたがる599の問題を別々に評価するためのベンチマークである。
広範に文書化されているアルゴリズムであっても、言語や入力表現の検索精度はかなりのばらつきがある。
この結果から,パラメトリックコード検索は,AI生成したアルゴリズムコードのシステム的検証を行なわずに,明瞭で測定可能な機能として確立された。
- 参考スコア(独自算出の注目度): 36.41073880422337
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have demonstrated strong performance in code generation, where success depends on both recalling relevant algorithmic knowledge and reasoning about how to apply it. However, existing LLM pipelines are opaque, with no explicit separation between these two components. We argue that for well-known algorithms whose canonical implementations are widely accessible in pretraining corpora, code generation is better measured as \textit{parametric code retrieval}: reproducing a named algorithm from internalised knowledge rather than synthesizing a novel one. We introduce AlgoREval, a benchmark of 599 problems spanning classical 77 algorithms across 14 domains, 7 programming languages, and 4 graph-input representations to evaluate this capability in isolation, and assess 15 models (7B--34B parameters) in a zero-shot setting. We find substantial variation in retrieval accuracy across languages and input representations, even for widely documented algorithms and show that prompt augmentation with retrieved code snippets or structured algorithmic hints improve accuracy on complex algorithms, while SFT achieves broader language gains and GRPO achieves larger per-language gains on specific languages. Together, our results establish parametric code retrieval as a distinct, measurable capability and caution against deploying AI-generated algorithmic code without systematic validation.\footnote{Code and dataset are available at https://github.com/Nickil21/AlgoREval
- Abstract(参考訳): 大規模言語モデル(LLM)は、関連するアルゴリズム知識のリコールと、それを適用する方法の推論の両方によって、コード生成において強力なパフォーマンスを示している。
しかし、既存のLLMパイプラインは不透明であり、これらの2つのコンポーネントの間に明確な分離はない。
コーパスの事前学習において、正規実装が広くアクセス可能なよく知られたアルゴリズムでは、コード生成は「textit{parametric code search}」として、新しいコーパスを合成するよりも、内部知識から名前付きアルゴリズムを再現する方がよいと論じる。
AlgoREvalは、14のドメイン、7のプログラミング言語、4のグラフインプット表現にまたがる古典的な77のアルゴリズムにまたがる599の問題をベンチマークし、これを独立して評価し、ゼロショット設定で15のモデル(7B-34Bパラメータ)を評価する。
言語や入力表現の検索精度は,広く文書化されたアルゴリズムであっても大きく変化しており,検索したコードスニペットや構造化されたアルゴリズムヒントによる迅速な拡張により,複雑なアルゴリズムの精度が向上し,SFTはより広い言語ゲインを実現し,GRPOは特定の言語での言語毎のゲインを大きく向上することを示す。
この結果から,パラメトリックコード検索は,AI生成したアルゴリズムコードのシステム的検証を行なわずに,個別かつ測定可能な機能として確立された。
\footnote{Code and dataset are available at https://github.com/Nickil21/AlgoREval
関連論文リスト
- Exploring the Effectiveness of Abstract Syntax Tree Patterns for Algorithm Recognition [0.41998444721319217]
本稿では,プログラムの抽象構文木に基づく手法が,アルゴリズムの自動認識にどの程度有効かを検討する。
アルゴリズムの重要な特徴をキャプチャし、抽象構文木上で検索パターンを表現するように設計されたドメイン固有言語。
プロトタイプを、Fibonacci、Bubble Sort、Binary Searchといったアルゴリズムを含むBigCloneEvalベンチマークのサブセットで評価する。
論文 参考訳(メタデータ) (2026-05-07T12:16:16Z) - Evaluating Efficiency and Novelty of LLM-Generated Code for Graph Analysis [0.1274452325287335]
大規模言語モデル(LLM)は、ソフトウェア開発の自動化にますます使われています。
本稿では、グラフ解析ルーチンの効率的なC実装を生成するLLMの能力について包括的に研究する。
これらのモデルがトランスフォーメーションアルゴリズムテクニックを発明する可能性は、将来の研究にとって魅力的なフロンティアである。
論文 参考訳(メタデータ) (2025-07-09T00:46:30Z) - Training Neural Networks as Recognizers of Formal Languages [87.06906286950438]
ニューラルネットワークを文字列のバイナリ分類器として直接訓練し評価する。
3つのニューラルアーキテクチャに対して、チョムスキー階層の様々な言語について結果を提供する。
我々の貢献は、将来の研究において、言語認識の主張を理論的に健全に検証するのに役立つだろう。
論文 参考訳(メタデータ) (2024-11-11T16:33:25Z) - From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models [63.188607839223046]
この調査は、推論中に計算をスケールするメリットに焦点を当てている。
我々はトークンレベルの生成アルゴリズム、メタジェネレーションアルゴリズム、効率的な生成という3つの領域を統一的な数学的定式化の下で探索する。
論文 参考訳(メタデータ) (2024-06-24T17:45:59Z) - Leveraging Generative AI: Improving Software Metadata Classification
with Generated Code-Comment Pairs [0.0]
ソフトウェア開発では、コードの理解とコラボレーションを強化する上で、コードコメントが重要な役割を果たす。
本研究では,コードコメントを「有用」あるいは「有用でない」と客観的に分類する課題について論じる。
本稿では,この分類プロセスを自動化するために,コンテキスト化された埋め込み,特にBERTを利用する新しいソリューションを提案する。
論文 参考訳(メタデータ) (2023-10-14T12:09:43Z) - Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models [17.059322033670124]
本稿では,アルゴリズム的推論経路を通じて大規模言語モデルを促進する新しい手法を提案する。
この結果から,LLMをアルゴリズムを用いて指導すると,アルゴリズム自体よりも性能が向上する可能性が示唆された。
論文 参考訳(メタデータ) (2023-08-20T22:36:23Z) - ALGO: Synthesizing Algorithmic Programs with LLM-Generated Oracle
Verifiers [60.6418431624873]
大きな言語モデル(LLM)は、機能記述からコードを実装するのに優れているが、アルゴリズムの問題に悩まされている。
我々は,アルゴリズムプログラムを LLM 生成 Oracle で合成するフレームワーク ALGO を提案し,その生成をガイドし,その正確性を検証する。
実験の結果,ALGOを装着すると,Codexモデルよりも8倍,CodeTよりも2.6倍の1サブミッションパス率が得られることがわかった。
論文 参考訳(メタデータ) (2023-05-24T00:10:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。