論文の概要: Passes Alone, Fails Together: Benchmarking Semantic Coordination in Parallel LLM-Agent Development
- arxiv url: http://arxiv.org/abs/2609.25396v1
- Date: Mon, 21 Sep 2026 20:38:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.100567
- Title: Passes Alone, Fails Together: Benchmarking Semantic Coordination in Parallel LLM-Agent Development
- Title(参考訳): 単独で失敗する:並列LLM-Agent開発におけるセマンティックコーディネーションのベンチマーク
- Abstract要約: 並列コーディングエージェントは、単独で動作するパッチを生成することができるが、マージ時に失敗する。
これは、あるエージェントが別のエージェントがまだ依存しているインターフェイスやルールを変更したときに発生する。
コントロールされたインターフェース変更を伴う合成タスク、マージされたプルリクエストのペア、実際のDjangoヘルパーを使用する構成タスクの3層を使用します。
- 参考スコア(独自算出の注目度): 10.396557252252316
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parallel coding agents can produce patches that work alone but fail when merged. This happens when one agent changes an interface or rule that another agent still relies on. We study these failures with stale, a benchmark for semantic coordination. Our evaluation runs the same tests on each patch alone and on their combination, counting only failures introduced by combining the patches. We use three tiers: synthetic tasks with controlled interface changes, pairs of merged pull requests, and constructed tasks that use real Django helpers. Among 834 runs on 417 mined Django pairs, only one showed interference after correcting the grading procedure. On constructed tasks using 12 Django helpers, interference occurred in 97% of runs. A message describing the completed concurrent change recovered 82% of runs. Reviewed pull requests may contain few unresolved parallel changes, even when agents fail on controlled tasks using real code. The constructed failure rates do not estimate how often these problems occur in practice.
- Abstract(参考訳): 並列コーディングエージェントは、単独で動作するパッチを生成することができるが、マージ時に失敗する。
これは、あるエージェントが別のエージェントがまだ依存しているインターフェイスやルールを変更したときに発生する。
セマンティックコーディネートのためのベンチマークであるstaleを用いて,これらの障害について検討する。
評価では、各パッチと組み合わせて同じテストを実行し、パッチを組み合わせることで導入された障害のみをカウントします。
コントロールされたインターフェース変更を伴う合成タスク、マージされたプルリクエストのペア、実際のDjangoヘルパーを使用する構成タスクの3層を使用します。
834回のうち417回が採掘されたジャンゴペアで実行され、グラデーション手順の修正後に1回だけ干渉が見られた。
12機のジャンゴ・ヘルパーを使用して構築された作業において、干渉は97%のランで発生した。
完了した同時変更を示すメッセージは82%を回復した。
レビューされたプルリクエストには、エージェントが実際のコードを使用して制御されたタスクで失敗しても、未解決の並列変更がほとんど含まれない可能性がある。
構築された失敗率は、これらの問題が実際に発生する頻度を見積もるものではない。
関連論文リスト
- AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace [2.650689617442372]
AgentRoomは、並列コーディングエージェントのためのリアルタイム協調編集プロトコルである。
ファイルレベルのクレーム、ステータス、およびCRDTマージされたレイヤ上でMPPツールとしてブロードキャストされる。
CLI-stableモデルの場合、2つのエージェントを持つAgentRoomは、Soloよりも少ないタスクを放棄し、実行時のバリエーションを少なくする。
論文 参考訳(メタデータ) (2026-08-24T18:28:33Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers [0.0]
固定データセットではなく再利用可能なフレームワークであるDynamicMCPBenchを紹介する。
現実的な目標を生成し、それぞれの目標を追求し、成功軌道を記録し、その軌跡をパスに依存しない効果チェックポイントに蒸留し、最終的な答えにはない、それらの効果を再現するかどうかをエージェントにスコアする。
最強のエージェントでさえタスクの約半分しか解決せず、タスクの31%はモデル無しで解決され、必要なツールチェーンが長くなるにつれて精度が低下する。
論文 参考訳(メタデータ) (2026-07-10T12:25:57Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns [45.43677974796221]
コーディングエージェントのスタミナを測定するベンチマークであるStaminaBenchを紹介する。
一般的な分数タスクのメトリクスとは異なり、これはセッションが数十回、数百回実行される実際のバイブコーディングと一致します。
論文 参考訳(メタデータ) (2026-06-17T21:36:09Z) - The Best-Laid SCHEMEs: Coordinated Sabotage and Monitoring in Multi-Agent Systems [0.0]
SCHEMEは7つの設定と8つの実際のオープンソースライブラリにわたる17のタスクインスタンスのベンチマークである。
各設定は、エージェントの適切なサブセットが単独で成功しないように設計されている。
GPT 5.1 Codex と Gemini 3.1 Pro ですでに協調サボタージュが実用化されていることを示す。
論文 参考訳(メタデータ) (2026-05-27T23:30:21Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - Exposing and Addressing Cross-Task Inconsistency in Unified
Vision-Language Models [80.23791222509644]
一貫性のないAIモデルは、人間のユーザーによって不安定で信頼できないと見なされている。
最先端のビジョン言語モデルは、タスク間の驚くほど高い一貫性のない振る舞いに悩まされている。
本稿では,大規模で自動生成されるクロスタスクコントラスト集合上で計算されたランク相関に基づく補助訓練目標を提案する。
論文 参考訳(メタデータ) (2023-03-28T16:57:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。