論文の概要: Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators
- arxiv url: http://arxiv.org/abs/2608.02712v1
- Date: Mon, 03 Aug 2026 17:59:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.906868
- Title: Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators
- Title(参考訳): 回復しないで、デバッグ: ニアミスハードウェアオペレータを修復するためのドメイン特有なエージェント
- Abstract要約: 私たちは、再生、デバッグではなく、パラダイムシフトを主張します。
本稿では,自律的修復における3つの課題に対処する,ドメイン固有のデバッグエージェントを提案する。
Pass@16.7%は66.7%、Regenerate Avg Pass@1's 25.9%、Regenerate Pass@3's 40.7%、Regenerate Pass@3's 40.7%である。
- 参考スコア(独自算出の注目度): 19.87699788583019
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Kernel generation for hardware accelerators such as GPUs and NPUs has become a proving ground for large language models (LLMs), and state-of-the-art systems raise correctness through pipelines that couple LLMs with agentic reinforcement learning and evolutionary search. Such pipelines generate, compile, and execute large numbers of candidate kernels, discarding most of them and forgoing the opportunity to distill failures into reusable knowledge. Many discarded candidates are near-miss operators that compile and run but fail numerical validation; each embodies genuine domain knowledge and a nontrivial investment in LLM inference, cross-compilation, and hardware execution. We argue for a paradigm shift: rather than regenerate, debug. Debugging is far more constrained than generating from scratch: the search space is small and feedback is dense. We present a domain-specific debug agent that addresses three core challenges in autonomous repair: mitigating knowledge scarcity through retrieved patterns and diagnostic instrumentation, ensuring integrity through anti-cheat detection and full-coverage evaluation, and controlling cost via convergence guards and bounded iteration. Debugging serves two complementary roles: it extends the capability frontier by recovering operators that repeated regeneration fails to produce, and it lowers cost per deliverable operator. Debug Pass@1 achieves 66.7% versus Regenerate Avg Pass@1's 25.9% and Regenerate Pass@3's 40.7%, while consuming 92.8% fewer tokens per success than three-trial regeneration. Component ablations show that the knowledge base drives recovery, while integrity gates reject 12.5-33.3% of the successes the workflow itself accepted.
- Abstract(参考訳): GPUやNPUなどのハードウェアアクセラレーターのカーネル生成は、大規模言語モデル(LLM)の証明基盤となっている。
このようなパイプラインは多数の候補カーネルを生成し、コンパイルし、実行します。
破棄された候補の多くは、コンパイルと実行を行うが数値検証に失敗するニアミス演算子であり、それぞれが真のドメイン知識とLLM推論、クロスコンパイル、ハードウェア実行への非自明な投資を具現化している。
私たちは、再生、デバッグではなく、パラダイムシフトを主張します。
デバッグはスクラッチから生成するよりもはるかに制約があり、検索スペースは小さく、フィードバックは密集している。
本稿では,自己修復における3つの課題に対処するドメイン固有のデバッグエージェントを提案する。検索したパターンと診断機器による知識不足の軽減,アンチチート検出とフルカバー評価による整合性の確保,収束ガードと境界反復によるコストの制御。
繰り返し再生する演算子の生成に失敗する演算子をリカバリすることで、機能フロンティアを拡張し、デリバリ可能な演算子当たりのコストを低減します。
Debug Pass@1 は Avg Pass@1 の 25.9% と Regenerate Pass@3 の 40.7% に対して 66.7% を達成している。
コンポーネントの短縮は、知識ベースが回復を促進することを示しているが、整合性ゲートはワークフロー自体が受け入れた成功の12.5-33.3%を拒絶する。
関連論文リスト
- FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents [5.604484678527336]
CLOSER-Bench (CLOSER-Bench) は、予算付きクロスステージ設計クロージャのための制御された評価プロトコルである。
Spec-to-RTL、RTL-to-GDS、Spec-to-GDSタスクを組み合わせ、すべてのシミュレータ、合成、STA、プレース・アンド・ルートの呼び出しを記録する。
最終品質、任意の進捗状況、ツールコスト、ステージ間のリカバリを測定します。
論文 参考訳(メタデータ) (2026-07-18T04:28:47Z) - Failure as a Process: An Anatomy of CLI Coding Agent Trajectories [21.513740407266354]
大規模言語モデル(LLM)コーディングエージェントは、端末ベースの環境でソフトウェアエンジニアリングタスクを自律的に実行するために、ますます多くデプロイされている。
既存の実証研究は、なぜコーディングエージェントが失敗するのかを調査するが、失敗を一時的なプロセスではなく最終的な結果として扱う。
本稿では、CLIコーディングエージェント障害軌跡に関する大規模な実証的研究を行い、プロセス指向のフレームワークを導入し、実行軌跡をまたいだ障害の開始、進化、回復を解析した。
論文 参考訳(メタデータ) (2026-07-10T15:25:56Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - BLAgent: Agentic RAG for File-Level Bug Localization [2.2917707112773593]
BLAgentはファイルレベルのバグローカライゼーションのための新しいエージェントRAGフレームワークである。
BLAgentは、オープンソースモデルで78%以上のTop-1精度を達成した。
BLAgentは、エンドツーエンドの修復の成功を20%以上改善する。
論文 参考訳(メタデータ) (2026-05-18T07:20:13Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - TraceCoder: A Trace-Driven Multi-Agent Framework for Automated Debugging of LLM-Generated Code [11.207330722400764]
人間の観察・分析・修復過程をエミュレートするフレームワークであるTraceCoderを提案する。
このフレームワークはまずコードを診断プローブで測定し、粒度の細かいランタイムトレースをキャプチャする。
その後、これらのトレースについて因果解析を行い、失敗の根本原因を正確に特定する。
論文 参考訳(メタデータ) (2026-02-06T16:59:48Z) - CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning [4.765206163164323]
CLEANERは本質的な自己訂正機能を利用して、データ収集中にエラーに汚染されたコンテキストを除去する。
類似性を考慮した適応ロールバック機構は、クリーンで清浄な軌道を自律的に構築する。
その結果, 平均精度は6%, 3%, 5%であった。
論文 参考訳(メタデータ) (2026-01-21T16:14:30Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。