論文の概要: How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval
- arxiv url: http://arxiv.org/abs/2606.00308v1
- Date: Fri, 29 May 2026 19:34:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.272535
- Title: How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval
- Title(参考訳): マルチエージェントLLMシステムにおける生成アーキテクチャのコードの複雑度形成方法:人間価値に関するペアスタディ
- Abstract要約: 我々は、HumanEvalタスクで広く使われている6つのマルチエージェント構成を比較した。
私たちは、最もリーンなアーキテクチャが、正確さで最も重いアーキテクチャと一致しているか、または打ち負かしていることに気付きました。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large-language-model code generation has shifted from single-shot prompting to multi-agent orchestrations - analyst, coder, tester, and debugger pipelines - and is evaluated almost exclusively on functional correctness. Whether these architectures also affect the structural complexity of the code they produce, and which orchestration layers carry the cost, remains largely unexamined: prior work has documented prompt-level effects on code complexity, but the architecture-level question is open. We compare six widely-used multi-agent configurations (Basic, AC, ACT, Debugger, AC+Debugger, ACT+Debugger) under two models from the GPT-4o family across all 164 HumanEval tasks - 1,968 paired observations - using the five RADON complexity metrics (SLOC, cyclomatic complexity, and Halstead Volume, Difficulty, and Effort). We apply a paired non-parametric statistical pipeline (Friedman omnibus, Wilcoxon signed-rank post-hoc with Holm correction, Kendall's $W$ and matched-pairs rank-biserial effect sizes) in both all-completions and passing-only conditions. The six architectures collapse into two indistinguishable complexity clusters separated by a 50-130% gap, the same partition in both models and under both conditions; among the architectural layers, the analyst-coder split inflates complexity, the runtime debugger does not - and on the analyst-coder background actively deflates it - and the tester re-inflates it. The heavy cluster's additional complexity buys no pass@1 advantage: the leanest architectures match or beat the heaviest on accuracy. Architectural elaboration in LLM code generation should therefore be justified by measured benefit on the dimensions that matter, not assumed.
- Abstract(参考訳): 大規模な言語モデルコード生成は、シングルショットプロンプトから、アナリスト、コーダ、テスタ、デバッガパイプラインといったマルチエージェントオーケストレーションに移行した。
これらのアーキテクチャが生成するコードの構造的複雑さにも影響するのか、どのオーケストレーションレイヤがコストを担っているのかは、まだ明らかになっていない。
我々は,5つのRADON複雑性メトリクス(SLOC,シクロマティック複雑性,Halstead Volume,Difficulty,Effort)を用いて,GPT-4oファミリーから164のHumanEvalタスクの2つのモデル(Basic, AC, ACT, Debugger, AC+Debugger, ACT+Debugger)を比較した。
非パラメトリックな統計パイプライン(Friedman omnibus, Wilcoxon signed-rank post-hoc with Holm correct, Kendall's $W$ and matched-pairs rank-biserial effect sizes)を全補完条件と通過条件の両方に適用する。
6つのアーキテクチャは、50-130%のギャップで分離された2つの区別できない複雑性クラスタに分解され、両方のモデルと両方の条件でパーティションが同じである。
重いクラスタの複雑さが増すと、pass@1のメリットは得られない。
したがって、LLMのコード生成におけるアーキテクチャのエラボレートは、想定されていない範囲で測定された利益によって正当化されるべきである。
関連論文リスト
- Low-Interaction-Rank Learning: Unifying Multiplicative Dual-Encoder Heads [5.703301837612397]
乗算二重エンコーダネットワークは、それぞれのエンコーダの内部積として、一対の入力に対して実数値出力を算出する。
統一理論は基本的な設計決定を導くものではない。
正規化はゲージ固定であり、ホワイトニングは置換と符号まで相互作用モードをピン留めすることを示す。
論文 参考訳(メタデータ) (2026-08-12T05:09:44Z) - Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis [64.2820121997882]
エージェントワークフロー設計を自動化する,トレーニング不要でテスト時の階層型検索アーキテクチャであるHierFlowを紹介した。
HierFlowはインテリジェントなゲーティングモジュールを通じて効率を最大化し、コンテキスト要求に基づいて実行レベル検索を選択的にトリガーする。
質問応答、数学的推論、コード生成ベンチマークにわたる包括的なテストは、HierFlowが一貫して強力なベースラインを上回っていることを確認する。
論文 参考訳(メタデータ) (2026-05-20T01:56:11Z) - From I/O to Code with Discovery Agent [103.88427301265669]
IO2Codeの発見エージェントであるDIO-Agentを提案する。
本手法は,プログラム空間上の進化的探索としてIO2Codeをフレーム化する。
大規模な実験により、DIO-Agentは従来のプログラムバイサンプル法とSOTA進化エージェントベースラインの両方を一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-05-14T18:57:32Z) - Retrieval-Conditioned Topology Selection with Provable Budget Conservation for Multi-Agent Code Generation [0.0]
Retrieval-Guided Adaptive Orchestration (RGAO) は階層コードインデックスから構造複雑性ベクトルを抽出してループを閉じるアーキテクチャである。
RGAOは、サブエージェントが6次元の予算ベクトルによる正式な契約によって管理されるマルチエージェントフレームワークであるCode-Agent内で動作する。
論文 参考訳(メタデータ) (2026-05-07T04:18:53Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - Theory of Code Space: Do Code Agents Understand Software Architecture? [0.0]
コードエージェントは、分離されたタスクで優れているが、アーキテクチャの理解を必要とするマルチファイルソフトウェアエンジニアリングと苦労する。
エージェントがAI探索中に一貫性のあるアーキテクチャの信念を構築し、維持し、更新できるかどうかを評価するベンチマークである、コード空間の理論(ToCS)を紹介する。
論文 参考訳(メタデータ) (2026-02-28T11:40:17Z) - Open Data Synthesis For Deep Research [17.22470203913576]
我々は、階層的制約満足度問題として検証可能な回答でDeep Researchタスクを定式化する。
既存のベンチマーク(Natural Questions、HotpotQAなど)は、この複雑さを捉えていない。
スケーラブルでスケーラブルな複雑なDeep ResearchタスクであるInfoSeekを紹介します。
論文 参考訳(メタデータ) (2025-08-30T06:02:56Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Multi-Agent Collaboration via Evolving Orchestration [55.574417128944226]
大規模言語モデル(LLM)は、様々な下流タスクで顕著な成果を上げているが、そのモノリシックな性質は複雑な問題解決におけるスケーラビリティと効率を制限している。
LLMに基づくマルチエージェントコラボレーションのためのパウチスタイルのパラダイムを提案し,タスク状態の進化に応じて,中央集権的なオーケストレータ("puppeteer")がエージェント("puppets")を動的に指示する。
クローズドドメインおよびオープンドメインシナリオの実験により,この手法は計算コストを低減し,優れた性能が得られることが示された。
論文 参考訳(メタデータ) (2025-05-26T07:02:17Z) - EpiCoder: Encompassing Diversity and Complexity in Code Generation [66.43738008739555]
既存のコード生成方法はシードデータとしてコードスニペットを使用する。
階層的なコード機能を中心に展開する,新しい機能ツリーベースの合成フレームワークを提案する。
我々のフレームワークは、生成されたコードの複雑さを正確に制御し、関数レベルの操作からマルチファイルのシナリオまで幅広い機能を実現する。
論文 参考訳(メタデータ) (2025-01-08T18:58:15Z) - Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity [59.57065228857247]
Retrieval-augmented Large Language Models (LLMs) は、質問回答(QA)のようなタスクにおける応答精度を高めるための有望なアプローチとして登場した。
本稿では,クエリの複雑さに基づいて,LLMの最適戦略を動的に選択できる適応型QAフレームワークを提案する。
オープンドメインのQAデータセットを用いて、複数のクエリの複雑さを網羅し、QAシステムの全体的な効率性と精度を高めることを示す。
論文 参考訳(メタデータ) (2024-03-21T13:52:30Z) - Factorizers for Distributed Sparse Block Codes [45.29870215671697]
分散ブロック符号(SBC)を高速かつ高精度に分解する手法を提案する。
我々の反復分解器は、しきい値に基づく非線形活性化、条件付きランダムサンプリング、および $ell_infty$-based similarity metricを導入している。
CIFAR-100, ImageNet-1K, RAVENデータセット上での4つの深層CNNアーキテクチャの実現可能性を示す。
論文 参考訳(メタデータ) (2023-03-24T12:31:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。