論文の概要: UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development
- arxiv url: http://arxiv.org/abs/2607.02186v1
- Date: Thu, 02 Jul 2026 13:56:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.862145
- Title: UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development
- Title(参考訳): UA-ChatDev: 信頼性の高いソフトウェア開発のための不確実性を意識したマルチエージェントコラボレーション
- Abstract要約: UA-ChatDevは不確実性を認識したマルチエージェントソフトウェア開発フレームワークである。
不確実な定量化をエージェント相互作用に統合する。
既存の単一エージェントとマルチエージェントのソフトウェア開発フレームワークを一貫して上回ります。
- 参考スコア(独自算出の注目度): 0.3670422696827525
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Software development is a complex task that demands cooperation among agents with diverse roles. Large language models (LLMs) have enabled autonomous multi-agent software development frameworks that leverage role-based collaboration to automate requirements analysis, coding, testing, and refinement. However, existing approaches typically assume that intermediate agent outputs are equally reliable, leaving them vulnerable to hallucination propagation, where incorrect decisions generated in early development phases are transferred to downstream agents and negatively impact final software quality. To address this challenge, we propose UA-ChatDev, an uncertainty-aware multi-agent software development framework that integrates uncertainty quantification into agent interactions. It introduces a lightweight uncertainty estimation mechanism based on token-level log probabilities to assess the confidence of agent responses and employs phase-aware threshold calibration to selectively trigger retrieval-based verification when uncertainty exceeds acceptable levels. Extensive experiments on the SRDD benchmark demonstrate that UA-ChatDev consistently outperforms existing single-agent and multi-agent software development frameworks across completeness, executability, consistency, and overall quality metrics. Further ablation studies and communication analyses verify that uncertainty-aware interactions enhance code execution reliability.
- Abstract(参考訳): ソフトウェア開発は、様々な役割を持つエージェント間の協力を要求する複雑なタスクです。
大きな言語モデル(LLM)は、ロールベースのコラボレーションを活用して要求分析、コーディング、テスト、改善を自動化する、自律的なマルチエージェントソフトウェア開発フレームワークを可能にした。
しかし、既存のアプローチでは、中間エージェントの出力は同様に信頼性が高く、初期開発段階で発生した誤った決定が下流エージェントに転送され、最終的なソフトウェア品質に悪影響を及ぼす幻覚伝播に弱いと仮定している。
この課題に対処するために,不確実性定量化をエージェントインタラクションに統合する不確実性対応マルチエージェントソフトウェア開発フレームワークであるUA-ChatDevを提案する。
トークンレベルのログ確率に基づく軽量な不確実性推定機構を導入し、エージェント応答の信頼性を評価し、不確実性が許容レベルを超えた場合に検索ベース検証を選択的にトリガーするために位相認識しきい値校正を用いる。
SRDDベンチマークの大規模な実験によると、UA-ChatDevは、完全性、実行可能性、一貫性、全体的な品質指標で、既存の単一エージェントとマルチエージェントのソフトウェア開発フレームワークを一貫して上回っている。
さらなるアブレーション研究と通信分析により、不確実性と認識された相互作用がコード実行の信頼性を高めることが確認される。
関連論文リスト
- From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems [11.562923882714095]
本稿では,意味的不確実性を考慮したオーケストレーション手法HASSUMを提案する。
セマンティックエントロピーとセマンティック密度を用いて不確実性を推定し、これは出力確率ではなく、回答セマンティクスのレベルで信頼を測定する。
このアプローチは特定のエージェントアーキテクチャとは独立して動作するため、広範囲の階層的および協調的なマルチエージェントシステムに統合することができる。
論文 参考訳(メタデータ) (2026-08-11T03:55:53Z) - Trust-Aware Multi-Agent Traceability: Confidence-Calibrated Knowledge Graphs for Consistent Software Artifact Management [0.7329200485567826]
ソフトウェアエンジニアリングでは、要求分析、アーキテクチャ設計、テスト生成、トレーサビリティリンクを自動化するために、マルチエージェントAIシステムがますます使われています。
本稿では,共有知識グラフを集中型セマンティックメモリと協調曲面の両方として機能する信頼対応協調フレームワークを提案する。
我々は,リンク予測キャリブレーション,プロトコルの有効性,しきい値感度,トレーサビリティシードの影響を自動車ソフトウェア工学のケーススタディで評価した。
論文 参考訳(メタデータ) (2026-06-15T18:41:50Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security [57.35851886874902]
エージェントAIシステムは、複雑なタスクを自律的に実行するが、その多段階の軌道には、信頼性に挑戦する新たな障害モードが導入されている。
この調査では、リスクの高いデプロイメントに不可欠な2つのコアディメンションを通じて、信頼できるエージェントAIを精査する。
各次元について、重要な概念を明確にし、エージェントワークフローに沿ってリスクが発生する場所を特定し、ステージ目標の緩和戦略を要約する。
論文 参考訳(メタデータ) (2026-05-17T10:26:37Z) - Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems [65.90791804095561]
マルチエージェントシステムは、特殊エージェント間の構造化された協調を通じてこの問題に対処するが、より厳密な調整は、あまり検討されていないリスクを増幅する。
既存の調査では、個々のエージェント能力、マルチエージェントのコラボレーション、エージェントの自己進化を別々にカバーしている。
この調査は4つの因果関係のあるステージを中心にまとめられた統一されたレビューを提供する。これはLIFEの進展(Lay the capabilities foundation)、協力によるエージェントの統合、帰属による障害の発見、自律的な自己改善によるEvolveである。
論文 参考訳(メタデータ) (2026-05-14T14:36:13Z) - A Self-Healing Framework for Reliable LLM-Based Autonomous Agents [0.0]
本稿では,LSMベースのソフトウェアエージェントのための信頼性を考慮した自己修復フレームワークを提案する。
提案フレームワークはマルチエージェントのワークフロー環境に実装され,実世界のタスクシナリオを用いて評価される。
論文 参考訳(メタデータ) (2026-05-07T13:10:41Z) - Agentic Confidence Calibration [67.50096917021521]
Holistic Trajectory (HTC)はAIエージェントの新しい診断フレームワークである。
HTCはキャリブレーションと差別の両方において、強力なベースラインを一貫して超えている。
HTCは、障害の背後にあるシグナルを明らかにすることによって、解釈可能性を提供する。
論文 参考訳(メタデータ) (2026-01-22T09:08:25Z) - The Rise of Agentic Testing: Multi-Agent Systems for Robust Software Quality Assurance [0.0]
現在のAIベースのテストジェネレータは、実行意識のフィードバックがないため、無効、冗長、あるいは実行不可能なテストを生成する。
本稿では,テスト生成エージェント,実行・分析エージェント,レビュー・最適化エージェントが協調してテストの生成,実行,解析,精査を行う,クローズドループの自己修正システムを提案する。
論文 参考訳(メタデータ) (2026-01-05T18:20:14Z) - Co-Investigator AI: The Rise of Agentic AI for Smarter, Trustworthy AML Compliance Narratives [2.7295959384567356]
Co-Investigator AIは、SAR(Suspicious Activity Reports)の作成に最適化されたエージェントフレームワークであり、従来の方法よりも大幅に高速で精度が高い。
我々は、SARの草案作成を効率化し、物語を規制上の期待と一致させ、コンプライアンスチームが高次の分析作業に集中できるようにする能力を示します。
論文 参考訳(メタデータ) (2025-09-10T08:16:04Z) - Agent-Driven Automatic Software Improvement [55.2480439325792]
本提案は,Large Language Models (LLMs) を利用したエージェントの展開に着目して,革新的なソリューションの探求を目的とする。
継続的学習と適応を可能にするエージェントの反復的性質は、コード生成における一般的な課題を克服するのに役立ちます。
我々は,これらのシステムにおける反復的なフィードバックを用いて,エージェントの基盤となるLLMをさらに微調整し,自動化されたソフトウェア改善のタスクに整合性を持たせることを目指している。
論文 参考訳(メタデータ) (2024-06-24T15:45:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。