論文の概要: Where Is the Cost of Third-Party API Routers in Agentic Software Development?
- arxiv url: http://arxiv.org/abs/2607.23624v2
- Date: Wed, 29 Jul 2026 14:49:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.705369
- Title: Where Is the Cost of Third-Party API Routers in Agentic Software Development?
- Title(参考訳): エージェントソフトウェア開発におけるサードパーティ製APIルータのコストは?
- Authors: Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong,
- Abstract要約: サードパーティのAPIルータは、ますます多様なLLMプロバイダ間のアクセスを統一する共通レイヤになっている。
符号化エージェントでは、対話オーバーヘッドを減らすため、ハイオートノミー操作が広く採用されている。
プロバイダの出力と最終的にエージェントによって実行されるリポジトリレベルのアクションとの整合性を検証するメカニズムはありません。
- 参考スコア(独自算出の注目度): 16.886494606820495
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Third-party API routers have become a common layer that unifies access across increasingly diverse LLM providers. In coding-agent workflows, high-autonomy operation is widely adopted because it reduces interaction overhead. As a result, a third-party API router, which sits between the agent and the upstream provider, inevitably occupies the trusted path. It can inspect and modify every request and response, yet no mechanism verifies alignment between the provider's output and the repository-level actions ultimately executed by the agent. Consequently, client-side permission mechanisms may become ineffective in practice. Whether this control gap produces real, hard-to-detect effects on software development tasks remains empirically unmeasured. In this paper, we conduct an empirical study of router-side injection in coding agents, examining four intervention levels of increasing subtlety: Response Substitution (L1), Response Append (L2), LLM-Polished Injection (L3), and LLM-Polished with Distribution Alignment Injection (L4). Moreover, we develop SIDEL, a framework for trace recording, replay, injection, and defense evaluation, with a curated dataset of 400 samples. We evaluate four representative coding agents, and further evaluate whitelist-based execution control and LLM review. Router-side intervention substantially alters repository-level actions and remains difficult for existing client-side safeguards to detect. Without additional mitigations, all evaluated agents achieved a defense success rate of 0 percent across all injection levels. Client-side mitigations and reactive reviews improve resistance but do not fully restore end-to-end control, motivating provider-side output-integrity guarantees. Our code is available at https://github.com/Riyasushin/SIDEL.
- Abstract(参考訳): サードパーティのAPIルータは、ますます多様なLLMプロバイダ間のアクセスを統一する共通レイヤになっている。
コーディングエージェントワークフローでは、対話オーバーヘッドを減らすため、ハイオートノミー操作が広く採用されている。
その結果、エージェントと上流プロバイダの間に位置するサードパーティのAPIルータが、必然的に信頼されたパスを占有する。
すべてのリクエストとレスポンスを検査および修正できますが、プロバイダの出力と最終的にエージェントによって実行されるリポジトリレベルのアクションとの整合性を検証するメカニズムはありません。
結果として、クライアント側のパーミッション機構は、実際には非効率になる可能性がある。
この制御ギャップがソフトウェア開発タスクに真の、検出し難い効果をもたらすかどうかは、まだ経験的に測定されていないままです。
本稿では,コーディングエージェントにおけるルータ側注入の実証的研究を行い,応答置換(L1),応答印加(L2),L3,L4,LLM-Polished with Distribution Alignment Injection(L4)の4つの介入レベルについて検討する。
さらに,400個のサンプルをキュレートしたデータセットを用いて,トレース記録,再生,注入,防衛評価のためのフレームワークであるSIDELを開発した。
我々は4つの代表的な符号化エージェントを評価し、さらにホワイトリストに基づく実行制御とLLMレビューを評価した。
ルータ側の介入は、リポジトリレベルのアクションを実質的に変更し、既存のクライアント側のセーフガードが検出することが難しくなっています。
追加の緩和がなければ、評価された全てのエージェントは、全ての注射レベルにおいて防衛成功率0パーセントを達成した。
クライアント側の緩和とリアクティブレビューは抵抗を改善しますが、エンドツーエンドのコントロールを完全に復元することはできません。
私たちのコードはhttps://github.com/Riyasushin/SIDEL.comで公開されています。
関連論文リスト
- When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents [7.986500985812644]
私たちはこの問題をInfinite Agentic Loops (IALs)と呼んでいる。
IALはエージェントロジック、フレームワークセマンティクス、実行時の観察、終了メカニズム間の相互作用から生まれる。
本研究では,実世界のLLMエージェントプロジェクトにおけるALF検出のための静的解析ツールであるIAL-Scanを提案する。
論文 参考訳(メタデータ) (2026-07-02T03:14:27Z) - Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents [11.555840794263753]
Agoraはドメイン対応のマルチエージェントフレームワークで、仮説駆動テストとLLM機能を統合し、体系的なプロトコル検証を行う。
この結果から,複雑なプロトコルの深い論理的バグを検出するためには,ドメイン認識型マルチエージェントコラボレーションが不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-05-28T13:27:47Z) - AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation [71.49152943451328]
我々は,AJ-Benchベンチマークを導入し,ドメイン検索,データシステム,グラフィカルユーザインタフェースの3つの領域にまたがるエージェント・アズ・ア・Judgeを評価する。
実験ではLLM-as-a-Judgeベースラインよりも一貫したパフォーマンス向上を示し、エージェントベースの検証においてかなりオープンな課題を明らかにした。
論文 参考訳(メタデータ) (2026-04-20T13:23:38Z) - HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads [0.0]
モチベーションのインシデントでは、11の並列エージェントのうち3つがコネクションリセットとHTTP 502エラーで死亡しました。
HIVEMINDは5つのOSにインスパイアされたスケジューリングプリミティブを適用し,非協調並列実行による障害モードを除去する透過的なHTTPプロキシである。
論文 参考訳(メタデータ) (2026-04-18T18:59:33Z) - AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering [8.201374511929538]
AgentDevelは、現行のエージェントを反復的に実行するリリースエンジニアリングパイプラインである。
実行トレースから実装盲の症状レベルの品質信号を生成する。
主要な症状パターンを集約し、監査可能なエンジニアリング仕様を生成する。
論文 参考訳(メタデータ) (2026-01-08T05:49:01Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - AgentAsk: Multi-Agent Systems Need to Ask [26.13279490836716]
大規模言語モデル(LLM)上に構築されたマルチエージェントシステムは、協調的な分業による問題解決能力の向上を約束する。
我々はAgentAskを提案する。AgentAskは軽量でプラグ・アンド・プレイの明確化モジュールで、すべてのエージェント間メッセージを潜在的な障害点として扱い、エラーの伝播を抑えるのに必要最小限の質問を挿入する。
AgentAskは、公開マルチエージェント実装の精度と堅牢性を継続的に改善し、オーバーヘッドを最小限に抑え、レイテンシと余分なコストを5%以下に抑える。
論文 参考訳(メタデータ) (2025-10-08T22:36:05Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。