論文の概要: Verifying Coordination in Parallel Coding Agents: NP-Bench and a Scheduling Planner
- arxiv url: http://arxiv.org/abs/2610.07261v1
- Date: Mon, 05 Oct 2026 19:02:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.609125
- Title: Verifying Coordination in Parallel Coding Agents: NP-Bench and a Scheduling Planner
- Title(参考訳): 並列符号化エージェントにおけるコーディネーションの検証:NP-Benchとスケジューリングプランナ
- Abstract要約: コーディングエージェントのチームは、エージェントによって優れたエージェントに見えるが、チームとして失敗する。
各作業項目の宣言されたスコープを取得し、不整合スコープに分割し、プロデューサ>コンシューマグラフに沿ってマージを順序付けする。
我々は、このプランナーをNerveplaneに組み込み、環境条件下での3本腕ベンチマークであるNP-Benchで評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A team of coding agents can look fine agent by agent yet fail as a team: each passes its own tests while the merged result is broken, and single-agent evaluation never catches it. As teams run several LLM coding agents in parallel on one codebase, the agents collide: two rewrite the same function, one codes against a contract a teammate just changed, and integration fails after the work is done. Most coordination tools react (watch for a conflict, then warn), but at agent speed the warning arrives after the wasted edit. We recast the problem as scheduling: take each work item's declared scope, partition the work into disjoint scopes, and order merges along the producer->consumer graph, all up front. We build this planner into Nerveplane and evaluate it with NP-Bench, an environment-grounded three-arm benchmark (no coordination; reactive detection; proactive planning) that verifies integration off a real git merge, both in a deterministic simulation and with live agents. The planner lifts clean-integration from 1/9 to 9/9 scenarios and cuts merge conflicts from 13 to 0, with a gap that grows in the number of agents. On a live breaking contract change it rescues an outcome both baselines miss on every seed: the clean-integration rate rises from 0 (no coordination and reactive detection) to 1.0 on a frontier model and 0.6 on a small one, while agents respect assigned scopes (0/5 leakage). A cross-session memory drops the repeated-mistake rate from 1.00 to 0.00 on strong and weak models alike. We also report a negative result: routing facts to agents does not rescue long-context accuracy at window-fitting scales; its value is cost and capacity, not attention. Across two capability tiers and two vendors, the benefit did not shrink as models got stronger, because it comes from how work is allocated, not model reasoning.
- Abstract(参考訳): コーディングエージェントのチームは、エージェントによって優れたエージェントに見えるが、チームとして失敗する。
チームが1つのコードベースで複数のLDMコーディングエージェントを並行して実行すると、エージェントが衝突する。
ほとんどの調整ツールが反応する(コンフリクトを見て、次に警告する)が、エージェントのスピードでは、編集が無駄になった後に警告が届く。
各作業項目の宣言されたスコープを取り、不整合スコープに分割し、プロデューサ>コンシューマグラフに沿ってマージを前もって順序付けします。
我々は、このプランナーをNerveplaneに組み込み、NP-Benchで評価する。NP-Benchは、実際のgitマージから、決定論的シミュレーションとライブエージェントの両方で、統合を検証する。
プランナーは1/9シナリオから9/9シナリオへのクリーンな統合を解除し、マージ競合を13から0に削減する。
クリーンな統合率は、フロンティアモデルでは0(調整と反応性検出なし)から1.0、小さなモデルでは0.6に上昇し、エージェントは割り当てられたスコープ(0/5リーク)を尊重する。
クロスセッションメモリは、強いモデルや弱いモデルでも繰り返しミス率を1.00から0.00に下げる。
エージェントにファクトをルーティングしても、ウィンドウ適合スケールでの長時間コンテキストの精度は救えず、その価値はコストとキャパシティであり、注意を払わない。
2つの機能レベルと2つのベンダーにまたがって、モデルがより強くなるにつれて、そのメリットは縮小しなかった。
関連論文リスト
- Agora: Git as Shared Memory for Collective AutoResearch [54.31992252587096]
別々のセッションで作業する調査エージェントは、他の人が試したことと、構築可能な結果を知る必要がある。
各コミットは結果、洞察、仮説、検証、報告を記録し、それを以前の作業とリンクする。
約12日間に渡り,13人の言語モデル労働者がアゴラを重み移動問題の解決に利用したことを報告した。
論文 参考訳(メタデータ) (2026-09-16T04:00:54Z) - Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories [0.0]
永続コンテキストファイル(AGENTS.md, CLAUDE.md)は、AIコーディングエージェントを誘導する標準的な慣行であるが、それらの効果の証拠は矛盾している。
我々は2つのフロンティアエージェント(Claude Code と Codex)間のコンテキスト注入戦略の制御されたアブレーションを示す。
論文 参考訳(メタデータ) (2026-07-28T11:07:53Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - When Model Merging Rivals Joint Multi-Task Reinforcement Learning: A Task-Vector Geometry Analysis [0.16921396880325779]
LOOPを使用したAppWorldエージェントベンチマークでは、トレーニングの難しさ-1と難易度-2のQwen3-8Bスペシャリスト。
私たちはそれら(TIES、RAM+)をマージし、同じデータ上で共同でトレーニングされたモデルに対して結果を落とします。
タスクゴール完了では、マージは共同RLと一致し、すべてのマージ変種は統計的に区別できない。
論文 参考訳(メタデータ) (2026-07-17T15:41:09Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - The Best-Laid SCHEMEs: Coordinated Sabotage and Monitoring in Multi-Agent Systems [0.0]
SCHEMEは7つの設定と8つの実際のオープンソースライブラリにわたる17のタスクインスタンスのベンチマークである。
各設定は、エージェントの適切なサブセットが単独で成功しないように設計されている。
GPT 5.1 Codex と Gemini 3.1 Pro ですでに協調サボタージュが実用化されていることを示す。
論文 参考訳(メタデータ) (2026-05-27T23:30:21Z) - LACUNA: Safe Agents as Recursive Program Holes [3.2613419151327343]
LLMエージェントはますますコードを記述することで振る舞うが、エージェントを駆動するランタイムとモデルが記述するコードの間には分割が持続する。
我々は、安全性を維持しながら、この分割を閉じるエージェントのためのプログラミングモデルであるLACUNAを紹介する。
我々のプリミティブは、通常の制御フローとしてReActループ、サブエージェント、スキル、並列分解、マルチモデル計画を表現する。
論文 参考訳(メタデータ) (2026-05-27T15:27:25Z) - TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination [11.65571332626047]
TeamTRは信頼領域フレームワークで、各コンポーネントの更新後にトラジェクトリを再サンプリングし、エージェントごとの分散制御を実行する。
TeamTRはシングルエージェントとシーケンシャルベースラインを平均7.1%で上回り、調整のレグレッションを緩和し、プラグアンドプレイのコンポーネント置換をサポートする。
論文 参考訳(メタデータ) (2026-05-01T23:42:57Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。