論文の概要: Agentic Harness for Real-World Compilers
- arxiv url: http://arxiv.org/abs/2603.20075v1
- Date: Fri, 20 Mar 2026 15:56:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.219317
- Title: Agentic Harness for Real-World Compilers
- Title(参考訳): 実世界のコンパイラにおけるエージェントハーネス
- Abstract要約: 我々は,コンパイラのバグの理解と修正において,大規模なコンパイラエージェントを支援するために設計されたエージェントハーネスを紹介する。
LLVMは最も広く使用されているコンパイラインフラストラクチャのひとつです。中央のto-autofixはエージェントフレンドリなLLVMツールで、LLVMバグを修正するための最小限のエージェント-autofix-miniです。
- 参考スコア(独自算出の注目度): 22.07908620753322
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Compilers are critical to modern computing, yet fixing compiler bugs is difficult. While recent large language model (LLM) advancements enable automated bug repair, compiler bugs pose unique challenges due to their complexity, deep cross-domain expertise requirements, and sparse, non-descriptive bug reports, necessitating compiler-specific tools. To bridge the gap, we introduce llvm-autofix, the first agentic harness designed to assist LLM agents in understanding and fixing compiler bugs. Our focus is on LLVM, one of the most widely used compiler infrastructures. Central to llvm-autofix are agent-friendly LLVM tools, a benchmark llvm-bench of reproducible LLVM bugs, and a tailored minimal agent llvm-autofix-mini for fixing LLVM bugs. Our evaluation demonstrates a performance decline of 60% in frontier models when tackling compiler bugs compared with common software bugs. Our minimal agent llvm-autofix-mini also outperforms the state-of-the-art by approximately 22%. This emphasizes the necessity for specialized harnesses like ours to close the loop between LLMs and compiler engineering. We believe this work establishes a foundation for advancing LLM capabilities in complex systems like compilers. GitHub: https://github.com/dtcxzyw/llvm-autofix
- Abstract(参考訳): コンパイラは現代のコンピューティングには不可欠だが、コンパイラのバグの修正は難しい。
最近の大規模言語モデル(LLM)の進歩により自動バグ修正が可能になったが、コンパイラのバグは、その複雑さ、深いクロスドメインの専門知識要件、疎結合で非記述的なバグレポート、コンパイラ固有のツールの必要性など、ユニークな課題を生んでいる。
このギャップを埋めるために,LLMエージェントのコンパイラバグの理解と修正を支援するエージェントハーネスであるllvm-autofixを導入する。
LLVMは最も広く使われているコンパイラインフラストラクチャの1つです。
llvm-autofixの中心は、エージェントフレンドリなLLVMツール、再現可能なLLVMバグのベンチマークであるllvm-bench、LLVMバグを修正するための最小限のエージェントであるllvm-autofix-miniである。
我々の評価では、一般的なソフトウェアバグと比較すると、コンパイラバグに対処する際、フロンティアモデルのパフォーマンスが60%低下していることが示されている。
我々の最小限のエージェント llvm-autofix-mini も最先端を約22%上回っている。
これは、LLMとコンパイラエンジニアリングの間のループを閉じるために、私たちのような特殊なハーネスの必要性を強調します。
この研究は、コンパイラのような複雑なシステムにおけるLLM機能向上の基盤を確立していると信じています。
GitHub: https://github.com/dtcxzyw/llvm-autofix
関連論文リスト
- Anchored Self-Play for Code Repair [68.0728003844994]
コード修復は言語モデル(LM)の重要な機能である
本稿では,1つのモデルを強化学習で訓練し,バグを生成して修正する__generator--fixer self-play__を提案する。
BugSourceBenchでは、セルフプレイは難しいが非現実的なバグへと向かっている。
本稿では,参照バグの生成と混合のためのコード埋め込み型類似性報酬をフィクスチャトレーニングに付加することにより,小さな参照セットでセルフプレイをアンロックするAnchored Self-Play (ASP)を提案する。
論文 参考訳(メタデータ) (2026-07-03T17:51:52Z) - Archer: Towards Agentic Review for Compiler Optimizations [2.4796712345498015]
Archerはコンパイラ最適化のための最初の自動エージェントコードレビューツールである。
過去2ヶ月で,70のオープンPRと328のクローズドPRをLLVMで評価した。
論文 参考訳(メタデータ) (2026-07-02T07:22:40Z) - LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution [14.546026043461476]
LLVMイシュー解決のための最初の大規模ベンチマークであるLLVM-Benchを紹介する。
問題再現、パッチアプリケーション、コンパイラ構築、テスト実行を自動化するスケーラブルな評価プラットフォームであるLLVM-Gymも開発しています。
以上の結果から,LLVM-Ensは最大21.99%の解像度を実現し,LLVMの問題解決をさらに改善した。
論文 参考訳(メタデータ) (2026-07-01T09:50:26Z) - SelfHeal: Empirical Fix Pattern Analysis and Bug Repair in LLM Agents [3.8743350688734988]
Stack Overflow、GitHub、HuggingFaceフォーラムからバギーなポストとコードスニペットを研究します。
我々は、LLMエージェントのバグに対する最初のベンチマークデータセットであるAgentDefectを紹介する。
LLMエージェントのバグ修正を目的としたマルチエージェントシステムであるSelfHealを提案する。
論文 参考訳(メタデータ) (2026-04-20T01:28:15Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - Interleaving Large Language Models for Compiler Testing [2.4796712345498015]
AIモデルでコンパイラをテストすることは非常に有望だが、現在のアプローチでは2つの重要な問題に悩まされている。
テストプロセスを2つの異なるフェーズに分離する新しいコンパイラテストフレームワークを提案する。
オンラインフェーズでは、これらのコード片を戦略的に組み合わせて高品質で有効なテストプログラムを構築することで再利用します。
論文 参考訳(メタデータ) (2025-08-26T11:49:58Z) - Do AI models help produce verified bug fixes? [62.985237003585674]
大規模言語モデルは、ソフトウェアバグの修正に使用される。
本稿では,プログラマが大規模言語モデルを用いて,自身のスキルを補完する方法について検討する。
その結果は、プログラムバグに対する保証された修正を提供するAIとLLMの適切な役割への第一歩となる。
論文 参考訳(メタデータ) (2025-07-21T17:30:16Z) - CrashFixer: A crash resolution agent for the Linux kernel [58.152358195983155]
この作業は、システムレベルのLinuxカーネルバグのベンチマークと、Linuxカーネルで実験を実行するプラットフォームを共有するkGymの上に構築されている。
CrashFixerはLinuxカーネルのバグに適応する最初のLCMベースのソフトウェア修復エージェントである。
論文 参考訳(メタデータ) (2025-04-29T04:18:51Z) - Finding Missed Code Size Optimizations in Compilers using LLMs [1.90019787465083]
我々は,大規模言語モデルと一連の差分テスト戦略を組み合わせた新しいテスト手法を開発した。
当社のアプローチでは,実装に150行未満のコードが必要です。
現在までに、本番コンパイラの24のバグが報告されている。
論文 参考訳(メタデータ) (2024-12-31T21:47:46Z) - KGym: A Platform and Dataset to Benchmark Large Language Models on Linux Kernel Crash Resolution [59.20933707301566]
大規模言語モデル(LLM)は、ますます現実的なソフトウェア工学(SE)タスクにおいて一貫して改善されている。
現実世界のソフトウェアスタックでは、Linuxカーネルのような基本的なシステムソフトウェアの開発にSEの取り組みが費やされています。
このような大規模システムレベルのソフトウェアを開発する際にMLモデルが有用かどうかを評価するため、kGymとkBenchを紹介する。
論文 参考訳(メタデータ) (2024-07-02T21:44:22Z) - IRFuzzer: Specialized Fuzzing for LLVM Backend Code Generation [3.4764546186868452]
IRFuzzerを実装し,LLVMコンパイラバックエンドのファジィ化の有効性について検討する。
IRFuzzerのミューテータは、構造化制御フロー、ベクトルタイプ、関数定義を含む幅広いLLVM IR入力を生成することができる。
IRFuzzer は 29 の成熟した LLVM バックエンドターゲットにファジィをファジィ化することで,既存のファジィよりも有効であることを示す。
論文 参考訳(メタデータ) (2024-02-07T21:02:33Z) - DebugBench: Evaluating Debugging Capability of Large Language Models [80.73121177868357]
DebugBench - LLM(Large Language Models)のベンチマーク。
C++、Java、Pythonの4つの主要なバグカテゴリと18のマイナータイプをカバーする。
ゼロショットシナリオで2つの商用および4つのオープンソースモデルを評価する。
論文 参考訳(メタデータ) (2024-01-09T15:46:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。