論文の概要: Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories
- arxiv url: http://arxiv.org/abs/2607.27250v1
- Date: Tue, 28 Jul 2026 11:07:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.268276
- Title: Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories
- Title(参考訳): コンテキストファイルはコーディングエージェントに役立つか? : 実リポジトリにおける2段階のアブレーション研究
- Authors: Prakhar Khatri,
- Abstract要約: 永続コンテキストファイル(AGENTS.md, CLAUDE.md)は、AIコーディングエージェントを誘導する標準的な慣行であるが、それらの効果の証拠は矛盾している。
我々は2つのフロンティアエージェント(Claude Code と Codex)間のコンテキスト注入戦略の制御されたアブレーションを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Persistent context files (AGENTS.md, CLAUDE.md) are standard practice for guiding AI coding agents, yet evidence for their effectiveness is contradictory. We present a controlled ablation of context-injection strategy across two frontier agents (Claude Code and Codex), 17 real tasks from 3 repositories (15 shared + 2 Codex-only), and 288 evaluated runs with gold-test evaluation. Context strategy does not measurably move correctness on either agent (bounded to <=10-15pp via equivalence testing). A failure-mode triage reveals why: agents fail on implementation skill---feature design, pattern selection, exact wiring---not missing repository knowledge that a context file could supply; a manipulation probe confirms the real AGENTS.md never converts a near-miss to a pass on either agent. We further show that borderline task difficulty is agent-specific (Spearman rho=0.75), offering a candidate explanation for prior contradictions: single-agent studies draw tasks from different agents' informative bands. We release all code, data, and analysis.
- Abstract(参考訳): 永続コンテキストファイル(AGENTS.md, CLAUDE.md)は、AIコーディングエージェントを誘導する標準的な慣行であるが、それらの効果の証拠は矛盾している。
本稿では,2つのフロンティアエージェント(Claude Code と Codex),3つのリポジトリから17個の実タスク(共有+2コーデックスのみ),および288個の評価実行をゴールドテスト評価で比較した。
コンテクスト戦略は、どちらのエージェントにも正確性(同値テストにより<=10-15ppにバウンドする)を測ることができない。
エラーモードのトリアージは、実装スキルに失敗するエージェント - 機能設計、パターンの選択、正確な配線 - コンテキストファイルが提供可能なリポジトリ知識の欠如; エクスプロイトプローブが実際の AgentS.md を認証する。
さらに、境界線課題の難易度がエージェント固有であることを示す(Spearman rho=0.75)。
すべてのコード、データ、分析をリリースします。
関連論文リスト
- Mining Workflow Graphs for Black-Box Boundary Testing of Conversational LLM Agents [2.9512821350868754]
我々は、ステートフル境界を発見し、強調するブラックボックステスティングフレームワークであるAgentEvalを提案する。
盲目的にプロンプトする代わりに、AgentEvalはこのグラフの構造を使って特定のガードと前提条件をテストターゲットとして列挙する。
我々はAgentEvalを、エージェントの基盤となるソースコードにアクセス可能な特権付きホワイトボックス監査者に対してベンチマークします。
論文 参考訳(メタデータ) (2026-07-08T00:11:41Z) - AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation [0.18567307896771823]
AgentLensはインタラクティブなコードエージェントのための実運用評価ベンチマークである。
LLMで書かれた軌道レビューとサイド・バイ・サイド比較との形式的検証を組み合わせている。
モデル行動の診断、エージェントの連続したバージョンの比較、夜間評価パイプラインでの製品回帰の取得に使用しています。
論文 参考訳(メタデータ) (2026-07-07T11:27:43Z) - ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures [1.0742675209112622]
障害モードは、不特定性、能力エラー、エージェントハーネスエラーの3つのメカニズムから派生したものとして研究する。
我々はClayBuddyを提案する。ClayBuddyはユーザの好みを形作るハーネスで、モデルのインセッションで修正してこれらのエラーを軽減できる。
論文 参考訳(メタデータ) (2026-06-13T18:29:53Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications [0.0]
テスト駆動型AIエージェント定義(TDAD)は、エージェントプロンプトをコンパイルされたアーティファクトとして扱う方法論である。
SpecSuite-CoreのTDADは、ポリシーコンプライアンス、グラウンドド・アナリティクス、ランブックの遵守、決定論的強制にまたがる4つのエージェントのベンチマークである。
論文 参考訳(メタデータ) (2026-03-09T18:04:54Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents [58.79302663733703]
大規模言語モデルに基づくマルチエージェントシステムは、専門家エージェントの協力により、様々なタスクにまたがる優れた能力を示している。
不器用なエージェントや悪意のあるエージェントが与える影響 - システム全体のパフォーマンスにおいて、頻繁にタスクでエラーを犯すものは、いまだに過小評価されていない。
本稿では,下流タスクにおける障害要因下での各種システム構造のレジリエンスについて検討する。
論文 参考訳(メタデータ) (2024-08-02T03:25:20Z) - Explaining Reinforcement Learning Policies through Counterfactual
Trajectories [147.7246109100945]
人間の開発者は、RLエージェントがテスト時にうまく機能することを検証しなければならない。
本手法では, エージェントの挙動をより広い軌道分布で示すことにより, エージェントの挙動を分布変化下で表現する。
本研究では,2つのエージェント検証タスクのうちの1つに対して,ベースライン法よりも優れたスコアを得られることを示す。
論文 参考訳(メタデータ) (2022-01-29T00:52:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。