論文の概要: Asymmetric Repository Lineage Modeling and Verifier-Guided Coordination in Concurrent AI Coding Agents
- arxiv url: http://arxiv.org/abs/2610.04779v1
- Date: Sat, 03 Oct 2026 21:37:15 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:12:23.335254
- Title: Asymmetric Repository Lineage Modeling and Verifier-Guided Coordination in Concurrent AI Coding Agents
- Title(参考訳): 並行AI符号化エージェントにおける非対称レポジトリ線形モデリングと検証誘導コーディネーション
- Abstract要約: 並行AIコーディングエージェントは、安価な信号が作業の優先順位を決定する可能性がある調整問題を生成するが、実行可能チェッカーのみが要求されるプロパティを確立することができる。
プロパティスコープによる検証契約と,オープンタイムのスコープ予測,リプレイ条件付きコンフリクト解決,スケジューリングのための3トラックベンチマークであるMERGEGYMを用いて,この分離について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: Concurrent AI coding agents create a coordination problem in which cheap signals may prioritize work, but only an executable checker can establish the property being claimed. We study this separation through a property-scoped verification contract and MERGEGYM, a three-track benchmark for open-time scope forecasting, replay- conditioned conflict resolution, and scheduling. On a stratified 715-pair lineage set (167 textual conflicts), 79 conflicts (47.3%) occur despite disjoint authored file sets. This is an operationally important proxy mismatch expected from three-way merge: authored PR diffs are measured against PR-specific bases, whereas the checker compares both heads to their common merge base. A standalone lineage-union rule reaches held-out AUROC 0.877; a 12-feature logistic model reaches 0.882 [0.845, 0.917] with PR-AUC 0.661, and an untuned random forest on the same decision-time features reaches 0.902 [0.875, 0.928] with PR-AUC 0.701. At a 33.3% held-out replay budget, the logistic and random-forest models recover 81.2% and 82.9% of conflicts, respectively. Patch reconstruction succeeds for 48/79 zero- overlap conflicts and all 48 become clean; the other 31 cases are inconclusive, so this check validates the expected three-way-merge explanation rather than claiming a new Git mechanism. In T1, a zero-shot LLM reaches AUC 0.704 and LLM-plus- metadata fusion 0.740. In T3, a decision-time gate de-overlaps a median 91.7% of labeled scope collisions at 65.0% makespan inflation under frozen-label replay. Because local git merge-tree replay is already cheap in our logs (median 0.02 s), we do not claim that lineage triage saves this checker alone: when exact replay is cheap, verify everything. All empirical guarantees in this paper remain limited to textual mergeability or the explicitly stated frozen-label scheduling target.
- Abstract(参考訳): 並行AIコーディングエージェントは、安価な信号が作業の優先順位を決定する可能性がある調整問題を生成するが、実行可能チェッカーのみが要求されるプロパティを確立することができる。
プロパティスコープによる検証契約と,オープンタイムのスコープ予測,リプレイ条件付きコンフリクト解決,スケジューリングのための3トラックベンチマークであるMERGEGYMを用いて,この分離について検討する。
階層化された715対の系統集合(167のテキストの衝突)では、79の競合 (47.3%) が、ファイル集合の不一致にもかかわらず発生している。
著者によるPR差分はPR固有のベースに対して測定され、チェッカーは両方のヘッドを共通のマージベースと比較する。
12機能ロジスティックモデルは、PR-AUC 0.661で0.882[0.845, 0.917]に達し、同じ決定時間の特徴を持つ未修正のランダム林は、PR-AUC 0.701で0.902[0.875, 0.928]に達する。
33.3%のリプレイ予算で、ロジスティックモデルとランダムフォレストモデルはそれぞれ81.2%と82.9%の紛争を回復した。
パッチ再構築は48/79ゼロオーバーラップコンフリクトで成功し、48がすべてクリーンになる。残りの31ケースは決定的ではないため、このチェックでは、新しいGitメカニズムを主張するのではなく、期待される3方向のマージ説明を検証する。
T1では、ゼロショットLDMがAUC 0.704に到達し、LSM+メタデータ融合0.740となる。
T3では、決定時間ゲートは、凍結ラベルリプレイの下で65.0%のスパンインフレーションでラベル付きスコープ衝突の中央値91.7%をオーバーラップする。
ローカルのgit merge-treeリプレイは、ログ(中間0.02秒)ですでに安くなっています。
本論文における実証的な保証は,テキストのマージ可能性や,明示的に記述された凍結ラベルスケジューリングターゲットに限られる。
関連論文リスト
- Auditing Action Settlement in LLM Agent Environments: Order, Progress, and Replay [6.507333399003372]
大規模言語モデル(LLM)エージェント環境における並行アクションは、各提案が個別に有効であっても仲裁を必要とする。
タイプ付きスナップショット決済契約を実装し、注文感度、有用な進捗、再生一貫性という3つの異なる特性を監査します。
論文 参考訳(メタデータ) (2026-10-01T06:17:52Z) - ContractRL: Shielded Group-Relative Policy Optimization for Auditable Tool-Call Repair [21.792889952064527]
本稿では,契約制約付き逐次修復プロトコルであるContractRLを紹介し,検証者誘導修復を0.9決定プロセスとしてモデル化する。
我々は,契約制約付きグループ相対的グループ相対的客観的決定を規定し,標準的目標とセマンティックラベルは凍結までオンライン状態外に保持する。
論文 参考訳(メタデータ) (2026-09-29T08:38:26Z) - Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [69.06648810271712]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - AI Agent Pull Requests on GitHub: Frequency, Structure, and Merge Conflict Rates [0.0]
本稿では, AIDev-pop データセット (33,596 PR, 2,807 リポジトリ) を用いて,エージェントが作成する PR を用いた並列送信の実証的研究を行った。
共活性PRペアの大多数(ほとんどはエージェント内で作成されている)では、どちらのPRも同一のエージェントで作成されている。
論文 参考訳(メタデータ) (2026-07-06T05:58:12Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy [7.1976264551575895]
メートル法アグリゲーション分散(英: Metric aggregate divergence、MAD)は、エージェントベースのモデルにおいて、異なるパイプラインステージで発生するサイレント不整合である。
私たちは、ディスパッチ時に実施される単一の呼び出し可能なランタイムであるメトリックコントラクトを、対策として紹介します。
論文 参考訳(メタデータ) (2026-06-27T18:17:33Z) - Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories [0.0]
LLMベースのコーディングエージェントは、時には自身の推論で問題を認識し、いずれにせよ前進する。
我々はClaude Sonnet 4.6のジャッジを構築し、完全なトラジェクトリとフラグがパターンの発生する場所にまたがる。
Qwen3.5-35B-A3Bのバックボーンを用いて44個の終端ベンチ2軌道上で評価を行った。
論文 参考訳(メタデータ) (2026-06-05T22:52:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。