論文の概要: ExplainBench: Evaluating Code Explanations from Agents
- arxiv url: http://arxiv.org/abs/2607.26451v1
- Date: Wed, 29 Jul 2026 04:04:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.535065
- Title: ExplainBench: Evaluating Code Explanations from Agents
- Title(参考訳): ExplainBench:エージェントからのコード説明の評価
- Authors: Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury,
- Abstract要約: 大規模言語モデル(LLM)エージェントは、ソフトウェア工学に急速に採用されている。
それにもかかわらず、エージェント生成の説明の信頼性を評価するベンチマークは存在しない。
本稿では,コードエージェントからの説明を自動的に評価するベンチマークであるExplainBenchを提案する。
- 参考スコア(独自算出の注目度): 12.953179605394418
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large Language Model (LLM) agents have seen rapid adoption in software engineering. As agents take a greater role in the actual generation of code, they are making larger changes, spanning tens to hundreds of lines. This makes manual review of agent results increasingly infeasible, leading developers to turn to explanations to understand enacted changes. Despite this, there are no benchmarks that evaluate the trustworthiness of agent-generated explanations. To bridge this gap, we propose ExplainBench, a benchmark to automatically evaluate explanations from coding agents. ExplainBench is based on the intuition that informative explanations should enable an LLM to correctly answer questions, allowing quantitative comparison of explanation quality between agents. With this observation, we construct a suite of questions that evaluates whether explanations accurately describe (1) the intended behavior of buggy code and (2) the effect of applying the agent patch itself. Experiments first reveal that explanation quality is a distinct axis of agent evaluation: ExplainBench ranks agents differently from the widely-used SWE-bench Verified benchmark. A deeper breakdown of explanation quality in agents shows frequent problems in explanations, such that explanations often claim that a patch is correct when it is not. Based on this insight, we implement and evaluate an explanation audit agent which runs additional tests to validate and refine explanations. This agent improved the explanations of all evaluated agents, demonstrating agent explanations can be automatically made more trustworthy.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、ソフトウェア工学に急速に採用されている。
エージェントは実際のコード生成においてより大きな役割を果たすため、数千行から数百行に及ぶ大きな変更を行っています。
これにより、エージェントの結果を手動でレビューすることは、ますます不可能になり、開発者は、実行された変更を理解するために説明に切り替えることになる。
それにもかかわらず、エージェント生成の説明の信頼性を評価するベンチマークは存在しない。
このギャップを埋めるために、コーディングエージェントからの説明を自動的に評価するベンチマークであるExplainBenchを提案する。
ExplainBenchは、情報的説明によってLLMが正しい質問に答えることができ、エージェント間の説明品質を定量的に比較できるという直感に基づいている。
本研究では,(1)バギーコードの意図した振る舞いを正確に記述するか否か,(2)エージェントパッチ自体の適用効果を評価するための質問スイートを構築した。
ExplainBenchは、広く使われているSWE-bench Verifiedベンチマークとは異なるエージェントをランク付けします。
エージェントにおける説明品質のより深い説明は、説明において頻繁な問題を示し、説明は、パッチが正しくないとしばしば主張する。
この知見に基づいて,説明を検証・精査するための追加テストを実行する説明監査エージェントを実装し,評価する。
このエージェントは、すべての評価されたエージェントの説明を改善し、エージェントの説明が自動的により信頼できるものにできることを示す。
関連論文リスト
- Explainability Framework for Policy-Aware Autonomous Agents [1.2891210250935148]
政策対応エージェントの理解可能な説明の仕方を概説する枠組みを提案する。
この枠組みは、社会科学の優れた説明の作り方に関する洞察を用いて設計されている。
Answer Set Programming言語で実装され、Pythonを使って情報抽出と自然言語翻訳を支援する。
論文 参考訳(メタデータ) (2026-07-23T11:22:25Z) - AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation [0.18567307896771823]
AgentLensはインタラクティブなコードエージェントのための実運用評価ベンチマークである。
LLMで書かれた軌道レビューとサイド・バイ・サイド比較との形式的検証を組み合わせている。
モデル行動の診断、エージェントの連続したバージョンの比較、夜間評価パイプラインでの製品回帰の取得に使用しています。
論文 参考訳(メタデータ) (2026-07-07T11:27:43Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Towards Verified Code Reasoning by LLMs [6.973151264926856]
本稿では,コード推論エージェントの回答を自動的に検証する手法について述べる。
本手法は, エージェントの応答の形式的表現を抽出し, その後, 形式的検証とプログラム解析ツールを用いて構成する。
論文 参考訳(メタデータ) (2025-09-30T17:17:51Z) - GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments [56.007498767771075]
GSM-Agentは複雑な環境でエージェント推論を評価するための新しいベンチマークである。
我々は,環境文書の埋め込みをノードにクラスタ化することでエージェント推論パターンを分析し,各ツールコールを最も近いノードにマッピングする。
本稿では,LLMのエージェント推論性能を向上させるためのツール拡張テストタイムスケーリング手法を提案する。
論文 参考訳(メタデータ) (2025-09-26T07:24:37Z) - Evaluating Evidence Attribution in Generated Fact Checking Explanations [48.776087871960584]
我々は、新しい評価プロトコル、引用マスキングとリカバリを導入する。
我々は,自動アノテータとヒューマンアノテータの両方を用いてプロトコルを実装した。
実験により、最高の性能を持つLSMは、不正確な属性を持つ説明を生成することが明らかとなった。
論文 参考訳(メタデータ) (2024-06-18T14:13:13Z) - BET: Explaining Deep Reinforcement Learning through The Error-Prone
Decisions [7.139669387895207]
エージェントの振る舞いをよりよく説明するために,バックボーン抽出木(Backbone Extract Tree, BET)と呼ばれる新しい自己解釈構造を提案する。
高いレベルでは、BETはエージェントが一貫して一様決定を行う状態はエラーの妥当性を低下させるという仮説を立てている。
説明忠実度の観点から,既存の自己解釈モデルよりもBETの方が優れていることを示す。
論文 参考訳(メタデータ) (2024-01-14T11:45:05Z) - Explanation Selection Using Unlabeled Data for Chain-of-Thought
Prompting [80.9896041501715]
非専門家によって書かれたオフ・ザ・シェルフの説明のように、タスクのために"チューニング"されていない説明は、中途半端なパフォーマンスをもたらす可能性がある。
本稿では,ブラックボックス方式で説明拡散プロンプトを最適化する方法の課題に対処する。
論文 参考訳(メタデータ) (2023-02-09T18:02:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。