論文の概要: LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution
- arxiv url: http://arxiv.org/abs/2607.00700v1
- Date: Wed, 01 Jul 2026 09:50:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.836736
- Title: LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution
- Title(参考訳): LLVM-Bench:LLVMコンパイラ問題解決のための大規模言語モデルのベンチマークと改善
- Authors: Zhao Tian, Yingquan Zhao, Chenyao Suo, Meng Wang, Junjie Chen,
- Abstract要約: LLVMイシュー解決のための最初の大規模ベンチマークであるLLVM-Benchを紹介する。
問題再現、パッチアプリケーション、コンパイラ構築、テスト実行を自動化するスケーラブルな評価プラットフォームであるLLVM-Gymも開発しています。
以上の結果から,LLVM-Ensは最大21.99%の解像度を実現し,LLVMの問題解決をさらに改善した。
- 参考スコア(独自算出の注目度): 14.546026043461476
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLVM is a widely used compiler infrastructure whose scale and complexity make issue resolution labor-intensive and challenging. Although large language models (LLMs) have recently achieved remarkable success in issue resolution, their effectiveness on complex system-level LLVM compiler remains largely unexplored. To address this gap, we introduce LLVM-Bench, the first large-scale benchmark for LLVM issue resolution, containing 423 real-world, validated tasks collected from the LLVM project. We further develop LLVM-Gym, a scalable evaluation platform that automates issue reproduction, patch application, compiler building, and test execution. Using LLVM-Bench and LLVM-Gym, we conduct a comprehensive study of four representative LLMs, six retrieval configurations, and three agents. Our results show that current LLM-based issue resolution techniques remain limited on LLVM-Bench, with patch invalidity and build failures as the dominant failure modes. We further reveal a strong complementarity among different LLMs and agents, motivating LLVM-Ens, a lightweight ensemble approach that expands the patch space through integrating the patches generated by diverse techniques, filters incorrect and redundant candidates, and identifies the most promising solution. Our results show that LLVM-Ens achieves a resolution rate of up to 21.99%, further improving LLVM issue resolution.
- Abstract(参考訳): LLVMは広く使われているコンパイラのインフラであり、スケールと複雑さにより、課題解決は労働集約的で困難である。
大規模言語モデル (LLM) は近年、問題解決において顕著な成功を収めているが、複雑なシステムレベルのLLVMコンパイラにおけるその効果は、まだ明らかにされていない。
このギャップに対処するため、LLVMプロジェクトから収集された423の実際のタスクを含むLLVMイシュー解決のための最初の大規模ベンチマークであるLLVM-Benchを紹介します。
さらに,問題再現,パッチアプリケーション,コンパイラ構築,テスト実行を自動化するスケーラブルな評価プラットフォームであるLLVM-Gymを開発した。
LLVM-Bench と LLVM-Gym を用いて,4つの代表的なLCM,6つの検索構成,3つのエージェントの総合的な研究を行う。
以上の結果から,現在のLLVM-Benchでは,パッチの無効性とビルド失敗が主流の障害モードであることがわかった。
LLVM-Ensは、様々な技術によって生成されたパッチを統合することで、パッチ空間を拡張する軽量なアンサンブルアプローチであり、不正かつ冗長な候補をフィルタし、最も有望な解決策を特定する。
以上の結果から,LLVM-Ensは最大21.99%の解像度を実現し,LLVMの問題解決をさらに改善した。
関連論文リスト
- LLM-MemCluster: Empowering Large Language Models with Dynamic Memory for Text Clustering [52.41664454251679]
大規模言語モデル(LLM)は、テキストクラスタリングを行う前例のない能力を提供することで、教師なしの学習を再構築している。
既存のメソッドは、しばしば外部モジュールを持つ複雑なパイプラインに依存し、真にエンドツーエンドのアプローチを犠牲にする。
LLM-MemClusterは,クラスタリングをLLMネイティブタスクとして再認識する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-11-19T13:22:08Z) - GenRecal: Generation after Recalibration from Large to Small Vision-Language Models [63.27511432647797]
視覚言語モデル(VLM)は、GPT-4Vのようなクローズドソースシステムと同等の性能を達成するために、大きな言語モデル(LLM)を活用している。
視覚言語モデル(VLM)の最近の進歩は、GPT-4Vのようなクローズドソースシステムと同等の性能を達成するために、大きな言語モデル(LLM)を活用している。
論文 参考訳(メタデータ) (2025-06-18T17:59:49Z) - What's Wrong with Your Code Generated by Large Language Models? An Extensive Study [92.62952504133926]
本研究は,3つの一般的なベンチマーク上で,3つの主要なクローズドソースLLMと6つの人気のあるオープンソースLLMの性能評価を行った。
間違ったコードに対するバグの分類を開発し、一般的なバグタイプに対する根本原因を分析した。
本稿では,自己批判を導入し,LLMが生成したコードに対する批判と修正を可能にする,新たな学習自由反復手法を提案する。
論文 参考訳(メタデータ) (2024-07-08T17:27:17Z) - TroL: Traversal of Layers for Large Language and Vision Models [39.31786216877119]
大言語とビジョンモデル(LLVM)は、大言語モデル(LLM)の一般化力によって駆動されている。
GPT-4VのようなクローズドソースLLVMと互換性のある既存のオープンソースLLVMは、大きすぎると考えられていることが多い。
1.8B, 3.8B, 7B LLMモデルサイズ, Traversal of Layers (TroL) を持つLLVMファミリーを新たに提案する。
我々は、TroLが単純な層トラバースアプローチを採用しているが、より大きなモデルサイズを持つオープンソースのLLVMよりも効率的に性能を向上することを示した。
論文 参考訳(メタデータ) (2024-06-18T03:42:00Z) - IRFuzzer: Specialized Fuzzing for LLVM Backend Code Generation [3.4764546186868452]
IRFuzzerを実装し,LLVMコンパイラバックエンドのファジィ化の有効性について検討する。
IRFuzzerのミューテータは、構造化制御フロー、ベクトルタイプ、関数定義を含む幅広いLLVM IR入力を生成することができる。
IRFuzzer は 29 の成熟した LLVM バックエンドターゲットにファジィをファジィ化することで,既存のファジィよりも有効であることを示す。
論文 参考訳(メタデータ) (2024-02-07T21:02:33Z) - ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code [76.84199699772903]
ML-Benchは、既存のコードリポジトリを利用してタスクを実行する現実世界のプログラミングアプリケーションに根ざしたベンチマークである。
LLM(Large Language Model)とAIエージェントの両方を評価するために、事前に定義されたデプロイメント環境でLLMのテキスト-コード変換を評価するML-LLM-Benchと、Linuxサンドボックス環境でエンドツーエンドのタスク実行で自律エージェントをテストするML-Agent-Benchの2つの設定が採用されている。
論文 参考訳(メタデータ) (2023-11-16T12:03:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。