論文の概要: From Agent Behaviour to Agent-Friendly Documentation: An Empirical Study of How Coding Agents Discover, Read, and Write Technical Documentation
- arxiv url: http://arxiv.org/abs/2608.20195v1
- Date: Thu, 20 Aug 2026 15:51:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.62956
- Title: From Agent Behaviour to Agent-Friendly Documentation: An Empirical Study of How Coding Agents Discover, Read, and Write Technical Documentation
- Title(参考訳): エージェント・ビヘイビアからエージェント・フレンドリー・ドキュメンテーションへ:コーディング・エージェントがいかにして技術的ドキュメンテーションを発見し、読み、書きたかに関する実証的研究
- Abstract要約: 技術ドキュメントは人間開発者のために書かれています。
ソフトウェア変更のシェアの増大は、今や自律的なコーディングエージェントによって引き継がれている。
本研究では,2つの公開データセット間でのエージェント・ドキュメント間相互作用に関する行動基礎研究を行う。
- 参考スコア(独自算出の注目度): 3.807723380039104
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Technical documentation is written for human developers, but an increasing share of software changes is now authored by autonomous coding agents. Which documents they consult, when, and what follows remain unknown. We conduct a behaviour-grounded study of agent-documentation interaction across two public datasets: 557 agentic coding sessions from SWE-chat, yielding 94,813 development events including 3,033 documentation interactions; and 33,097 agentic pull requests from AIDev, with 690,260 classified file-level change records. Four findings challenge current documentation practice. First, agents' documentation work is dominated by agent-facing artefacts: instruction files and working notes account for 60.5% of all documentation interactions, versus 10.6% for classical technical documentation and 1.3% for API references. Second, the link between consultation and code editing is unresolved: the adjacent transition probability is 0.002 and the unadjusted three-event lift 1.05, whereas a stage-adjusted model places it above unity (OR 1.33 [1.09, 1.62]); documentation creation is elevated unadjusted (lift 1.67) but its adjusted interval includes unity. Third, no explicit documentation-based validation sequence was observed, and consultation is associated with less immediate testing (lift 0.23, cluster CI 0.08-0.45; adjusted OR 0.39 [0.25, 0.60]). Fourth, consultation is self-initiated (70.2%) far more often than failure-driven (7.5%), and documentation trails code: among multi-commit pull requests changing both, code is touched first 4.7x more often. From these traces we derive a descriptive model of agent-documentation interaction as a two-lobed cycle rather than a linear journey, and show that two widely assumed properties of "agent-friendly" documentation - actionability and verifiability - lack consistent behavioural support. We release our pipeline, coding scheme, and event-level data.
- Abstract(参考訳): 技術ドキュメントは人間の開発者向けに書かれているが、ソフトウェア変更のシェアは、今や自律的なコーディングエージェントによって作成されている。
どの文書を相談し、いつ、どのような文書を提出するかは未定である。
我々は、SWE-chatから557件のエージェントコーディングセッションを行い、3,033件のドキュメントインタラクションを含む94,813件の開発イベントと、AIDevから33,097件のエージェントプルリクエストを行い、690,260件のファイルレベルの変更記録を作成した。
4つの発見が現在のドキュメンテーションの実践に挑戦する。
命令ファイルと作業ノートはすべてのドキュメントインタラクションの60.5%を占めており、古典的な技術ドキュメントは10.6%、API参照は1.3%である。
第二に、コンサルテーションとコード編集のリンクは未解決であり、隣接する遷移確率は0.002であり、調整されていない3点リフト1.05であるのに対し、ステージ調整されたモデルでは、単体(OR 1.33[1.09, 1.62])の上に位置する。
第3に、明確なドキュメントベースの検証シーケンスが観察されず、コンサルテーションは即時テストの少ない(リフト0.23、クラスタCI 0.08-0.45、調整されたOR 0.39 [0.25, 0.60])。
第4に、コンサルティングが自己開始(70.2%)される頻度は、障害駆動(7.5%)よりもはるかに多い。
これらのトレースから、エージェント-ドキュメント間相互作用の記述的モデルが、線形な旅ではなく、2ロブドサイクルとして導き出され、"エージェントフレンドリ"なドキュメントの2つの広く想定されている特性(動作可能性と検証可能性)が、一貫した行動的サポートを欠いていることを示す。
パイプライン、コーディングスキーム、イベントレベルのデータをリリースしています。
関連論文リスト
- GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings [0.0]
GUIDEは、スキーマ検証されたエージェント間契約を備えた共有バージョン管理ルールストア上に構築された、管理されたマルチエージェントフレームワークである。
専門的な6つのエージェントは、解析、VLM駆動抽出、一貫性チェック、評価、Human-in-the-loop(HITL)エスカレーション、ペルソナ調整されたアーティファクト合成を扱う。
120の実世界のエンタープライズガイドラインドキュメントで評価され、GUIDEは96%のドキュメント成功、71.4%の自動承認による3,896のルールの抽出、812のデプロイメント対応アーティファクトの生成、ドキュメント毎の40~125分へのターンアラウンドの削減を実現している。
論文 参考訳(メタデータ) (2026-08-12T14:52:33Z) - DocAtlas: Long-Document Understanding as Mutable-State Interaction [67.90400271544678]
本稿では,長期文書理解を可変状態情報探索プロセスとして扱うDocAtlasを提案する。
ドキュメントと質問が与えられた後、DocAtlasは検索、読み取り、メモ取り、レビューツールを公開し、階層的なツリーとノートストアを維持し、エージェントが証拠を記録するように更新する。
GPT-5.4では、DocAtlasはMMLongBench-Docで71.4%に達し、65.8%という人間の専門的基準を超えた。
論文 参考訳(メタデータ) (2026-07-21T09:45:34Z) - LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents [2.3651168422805027]
エージェントはこれまでに収集された証拠を観察し、検査のために次の文書の断片を選び、証拠が十分であれば停止する。
このエージェントは、閲覧、読み、検索ツールを使用してベクトルレス文書ツリー上で動作し、動的知識グラフ(KG)を状態として保持する。
NuScale Final Safety Analysis Report (FSAR) の文書に対する200クエストベンチマークでは、システムは81.5%の精度で0.93の忠実さを達成している。
論文 参考訳(メタデータ) (2026-06-28T13:45:59Z) - AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning [52.23991730630292]
大規模言語モデルは、パラメトリックな知識から答えるのではなく、文書を推論するエージェントとして、ますます多くデプロイされている。
大規模な、散らかった職場ファイルの集合にスパース証拠を配置し、一貫性のない用語、単位、時間規則を調整し、答えを計算する。
私たちは、362の質問と9,664の認証ドキュメントと372Mのトークンの8つのドメインコレクションをペアリングするベンチマークであるAgoraを紹介します。
論文 参考訳(メタデータ) (2026-06-23T12:57:18Z) - Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work [0.0]
以前の作業では、タスク、権限、返却された作業パッケージ、受け入れコンテキストを、委譲されたコーディング作業の分析単位として記述するソフトウェア委譲契約を提案したが、その効果は測定しなかった。
本稿では,符号化エージェントの明示的デリゲート契約に関する制御されたパイロット研究について報告する。
論文 参考訳(メタデータ) (2026-06-14T05:53:27Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - Spec Kit Agents: Context-Grounded Agentic Workflows [0.0]
Spec Kit AgentsはPMと開発者の役割を持つマルチエージェントSDDパイプラインである。
読み取り専用の調査フックは,各ステージにリポジトリのエビデンスを格納する。
検証フックは環境に対する中間成果物をチェックする。
論文 参考訳(メタデータ) (2026-04-07T00:26:49Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance [4.424336158797069]
この記事では、AIを利用した一般的な5つのコーディングアシスタント(OpenAI Codex、GitHub Copilot、Devin、Cursor、Claude Code)を比較します。
デビンは受容率において唯一一貫した正の傾向を示す(32週間で週0.77%以上)。
分析の結果,PRタスクタイプが受入率に影響を及ぼす主要な要因であることが示唆された。
論文 参考訳(メタデータ) (2026-02-09T17:14:46Z) - ABCD-LINK: Annotation Bootstrapping for Cross-Document Fine-Grained Links [57.514511353084565]
我々は、最高のパフォーマンスのアプローチを選択し、文書間リンクに注釈を付けるための新しいドメインに依存しないフレームワークを提案する。
当社のフレームワークを2つの異なるドメイン – ピアレビューとニュース – に適用しています。
結果として得られた新しいデータセットは、メディアフレーミングやピアレビューなど、数多くのクロスドキュメントタスクの基礎を築いた。
論文 参考訳(メタデータ) (2025-09-01T11:32:24Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。