論文の概要: LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models
- arxiv url: http://arxiv.org/abs/2606.25402v1
- Date: Wed, 24 Jun 2026 04:58:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.227711
- Title: LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models
- Title(参考訳): LibEvoBench: コード生成モデルにおける時間的知識階層化の提案
- Authors: Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen,
- Abstract要約: 大規模なソフトウェアプロジェクトは、リリース全体にわたってAPIが進化し続けるにもかかわらず、古いバージョンのライブラリに依存することが多い。
最新のものや最も一般的なものではなく、複数のAPIバージョンに関する知識を維持する必要がある。
我々は、複数のバージョンのPythonライブラリにまたがるベンチマークであるLibEvoBenchと、新しいメトリクスであるSoftware Evolution Understanding Score(SEUS)を紹介し、進化するAPIを扱う際のモデルの一貫性を測定する。
- 参考スコア(独自算出の注目度): 12.441288958152931
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large software projects often depend on older versions of libraries, even as APIs continue to evolve across releases. This creates a challenge for LLMs: they must maintain knowledge of multiple API versions, not merely the latest or most common one. However, current LLMs are trained on temporally mixed corpora and lack explicit mechanisms for such version-specific reasoning, leading to anachronistic errors - calling APIs as they exist in a different library version. To systematically evaluate this phenomenon, we introduce LibEvoBench, a multi-task benchmark spanning multiple versions of widely used Python libraries, along with a new metric, the Software Evolution Understanding Score (SEUS), to measure models' consistency when working with evolving APIs. Our results show that state-of-the-art models are largely version-oblivious: performance degrades for evolving APIs, while for stable APIs it remains the same across versions. Moreover, simply specifying the target version provides no benefit, while relevant documentation significantly boosts models' accuracy. These findings highlight a systematic limitation of current training paradigms and motivate new approaches for temporally grounded knowledge in code generation.
- Abstract(参考訳): 大規模なソフトウェアプロジェクトは、リリースを通じてAPIが進化し続けるにもかかわらず、古いバージョンのライブラリに依存することが多い。
最新のものや最も一般的なものではなく、複数のAPIバージョンに関する知識を維持する必要がある。
しかしながら、現在のLLMは、時間的に混合されたコーパスでトレーニングされており、このようなバージョン固有の推論の明確なメカニズムが欠如しており、異なるライブラリバージョンに存在するようにAPIを呼び出すという、アクロニスティックなエラーを引き起こしている。
この現象を体系的に評価するために,広く使用されているPythonライブラリの複数バージョンにまたがるマルチタスクベンチマークであるLibEvoBenchと,新たなメトリクスであるSoftware Evolution Understanding Score(SEUS)を導入して,APIの進化に伴うモデルの一貫性を測定する。
進化するAPIのパフォーマンスが低下する一方、安定したAPIについては、バージョン間で同じままです。
さらに、単にターゲットバージョンを指定するだけではメリットがなく、関連するドキュメントはモデルの正確性を大幅に向上させる。
これらの知見は、現在のトレーニングパラダイムの体系的な制限を強調し、コード生成における時間的基盤を持つ知識に対する新しいアプローチを動機付けている。
関連論文リスト
- Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition [2.392878902712915]
NovelAPIBenchは、任意のベースモデルとターゲットライブラリの動的ベンチマークである。
探索によって注入された知識とパラメトリック適応によって内部化された知識を比較した。
Retrievalは揮発性のAPIコンテンツを提供し、チューニングは手続き統合を改善する。
論文 参考訳(メタデータ) (2026-06-02T13:46:04Z) - When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation [12.67668690329239]
コンテキスト・メモリ・コンフリクト(context-Memory conflict)は、モデルの内部パラメトリック知識と矛盾する場合に発生する。
本稿では8つのPythonライブラリから270のリアルタイム更新のベンチマークを示す。
論文 参考訳(メタデータ) (2026-04-10T17:37:26Z) - KCoEvo: A Knowledge Graph Augmented Framework for Evolutionary Code Generation [25.38402999279553]
本稿では,マイグレーションタスクを2つの相乗的段階(進化経路探索と経路情報生成)に分解する知識グラフ拡張フレームワークを提案する。
提案手法は,静的かつ動的なAPIグラフを構築して,API進化に対する構造的推論を可能にする。
論文 参考訳(メタデータ) (2026-03-08T10:39:48Z) - Lightweight Model Editing for LLMs to Correct Deprecated API Recommendations [15.586818028794942]
事前訓練された大規模言語モデル(LLM)は、コード補完タスクにおいて強力なパフォーマンスを示している。
LLMは、将来のサードパーティライブラリではサポートされない非推奨のAPIを頻繁に生成する。
本稿では,AdaLoRA-Lを提案する。AdaLoRA-Lは"共通APIレイヤ"(すべてのAPIで高い重要性を持ち,一般的な知識を保存し,編集から除外されたレイヤ)を定義し,編集を"特定APIレイヤ"に限定する。
実験の結果、AdaLoRA-Lは他の評価指標と同等の性能を維持しながら、比例性を大幅に改善することが示された。
論文 参考訳(メタデータ) (2025-11-26T03:36:34Z) - Your Fix Is My Exploit: Enabling Comprehensive DL Library API Fuzzing with Large Language Models [49.214291813478695]
AIアプリケーションで広く使用されているディープラーニング(DL)ライブラリは、オーバーフローやバッファフリーエラーなどの脆弱性を含むことが多い。
従来のファジィングはDLライブラリの複雑さとAPIの多様性に悩まされている。
DLライブラリのためのLLM駆動ファジィ手法であるDFUZZを提案する。
論文 参考訳(メタデータ) (2025-01-08T07:07:22Z) - ExploraCoder: Advancing code generation for multiple unseen APIs via planning and chained exploration [70.26807758443675]
ExploraCoderはトレーニング不要のフレームワークで、大規模な言語モデルにコードソリューションで見えないAPIを呼び出す権限を与える。
実験の結果、ExploreaCoderは、事前のAPI知識に欠けるモデルのパフォーマンスを大幅に改善することが示された。
論文 参考訳(メタデータ) (2024-12-06T19:00:15Z) - LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation [40.87656746406113]
LibEvolutionEvalは,インラインコード補完を正確に行うために,ライブラリ進化の理解を必要とする研究である。
パブリック・モデルの評価を行い、パブリック・ライブラリの進化がモデルの性能に大きく影響することを発見した。
本稿では,検索したバージョン固有のライブラリの文書化と,高速に進化するパッケージを扱う際のモデルの能力向上について検討する。
論文 参考訳(メタデータ) (2024-11-19T21:52:23Z) - VersiCode: Towards Version-controllable Code Generation [58.82709231906735]
大規模言語モデル(LLM)は、コード生成において大きな進歩を遂げていますが、既存の研究は、ソフトウェア開発の動的な性質を説明できません。
バージョン別コード補完(VSCC)とバージョン別コードマイグレーション(VACM)の2つの新しいタスクを提案する。
VersiCodeについて広範な評価を行い、バージョン管理可能なコード生成が確かに重要な課題であることを示した。
論文 参考訳(メタデータ) (2024-06-11T16:15:06Z) - Private-Library-Oriented Code Generation with Large Language Models [52.73999698194344]
本稿では,大規模言語モデル(LLM)をプライベートライブラリのコード生成に活用することに焦点を当てる。
プログラマがプライベートコードを書く過程をエミュレートする新しいフレームワークを提案する。
TorchDataEval、TorchDataComplexEval、MonkeyEval、BeatNumEvalの4つのプライベートライブラリベンチマークを作成しました。
論文 参考訳(メタデータ) (2023-07-28T07:43:13Z) - SequeL: A Continual Learning Library in PyTorch and JAX [50.33956216274694]
SequeLは継続学習のためのライブラリで、PyTorchとJAXフレームワークの両方をサポートする。
それは、正規化ベースのアプローチ、リプレイベースのアプローチ、ハイブリッドアプローチを含む、幅広い連続学習アルゴリズムのための統一インターフェースを提供する。
私たちはSequeLをオープンソースライブラリとしてリリースし、研究者や開発者が自身の目的で簡単にライブラリを実験し拡張することができます。
論文 参考訳(メタデータ) (2023-04-21T10:00:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。