論文の概要: Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents
- arxiv url: http://arxiv.org/abs/2605.29910v1
- Date: Thu, 28 May 2026 13:27:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.346886
- Title: Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents
- Title(参考訳): Agora: LLMエージェントを用いた生産レベル合意プロトコルにおける自律バグ検出に向けて
- Authors: Xiang Liu, Sa Song, Zhaowei Zhang, Huiying Lan, Jason Zeng, Ming Wu, Michael Heinrich, Yong Sun, Ceyao Zhang,
- Abstract要約: Agoraはドメイン対応のマルチエージェントフレームワークで、仮説駆動テストとLLM機能を統合し、体系的なプロトコル検証を行う。
この結果から,複雑なプロトコルの深い論理的バグを検出するためには,ドメイン認識型マルチエージェントコラボレーションが不可欠であることが示唆された。
- 参考スコア(独自算出の注目度): 11.555840794263753
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Consensus protocols form the backbone of distributed systems and blockchains, where implementation bugs can cause data corruption and financial losses. While LLM-based approaches show promise in code analysis, they struggle with deep protocol-level logic bugs involving complex state-dependent behaviors across multiple execution stages. We present Agora, a domain-aware multi-agent framework that integrates hypothesis-driven testing with LLM capabilities for systematic protocol verification. Agora employs specialized agents that collaboratively explore protocol state spaces, synthesize attack scenarios using domain-specific constraints, and validate findings through iterative refinement. This explicit role separation enables reasoning about global protocol invariants beyond single-function code analysis. We evaluate Agora on four consensus implementations (Raft, EPaxos, HotStuff, BullShark) using four state-of-the-art LLMs. Agora discovers 15 previously unknown protocol-level logic bugs that violate safety properties, while existing LLM-based agents fail to detect any such protocol-level logic bugs. Our results demonstrate that domain-aware multi-agent collaboration is essential for detecting deep logic bugs in complex protocols.
- Abstract(参考訳): コンセンサスプロトコルは分散システムとブロックチェーンのバックボーンを形成する。
LLMベースのアプローチはコード解析において有望であるが、複数の実行ステージにわたる複雑な状態依存の振る舞いを含む、プロトコルレベルの深いロジックのバグに悩まされている。
本稿では、仮説駆動テストとLLM機能を統合したドメイン対応マルチエージェントフレームワークであるAgoraについて述べる。
Agoraでは、プロトコルの状態空間を協調的に探索し、ドメイン固有の制約を使って攻撃シナリオを合成し、反復的な洗練を通じて結果を検証する特殊なエージェントを採用している。
この明示的な役割分離により、単一機能コード解析以上のグローバルプロトコル不変性に関する推論が可能になる。
我々は,Agoraの4つのコンセンサス実装(Raft, EPaxos, HotStuff, BullShark)について,最先端のLLMを用いて評価した。
Agoraは、安全性に反する15の既知のプロトコルレベルのロジックバグを発見したが、既存のLCMベースのエージェントはそのようなプロトコルレベルのロジックバグを検出できなかった。
この結果から,複雑なプロトコルの深い論理的バグを検出するためには,ドメイン認識型マルチエージェントコラボレーションが不可欠であることが示唆された。
関連論文リスト
- VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - Autogenesis: A Self-Evolving Agent Protocol [60.15939127351914]
本稿では,自己進化プロトコルであるAutogenesis Protocol(AGP)を紹介する。
本稿では,実行中のプロトコル登録リソースを動的にインスタンス化し,検索し,精錬する自己進化型マルチエージェントシステムAGSを提案する。
論文 参考訳(メタデータ) (2026-04-16T14:04:06Z) - Learning Provably Correct Distributed Protocols Without Human Knowledge [12.414511696558291]
不完全な情報を持つゲームにおける戦略に対する探索問題としてプロトコル設計を定式化する。
マルチエージェントゲームの標準的な方法は、この設定で正しいプロトコルを学ばない。
本稿では,モンテカルロ木探索の特殊版をトランスフォーマーベースのアクションエンコーダと統合した学習フレームワークGGMSを提案する。
論文 参考訳(メタデータ) (2026-01-29T22:24:07Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Uncovering Gaps Between RFC Updates and TCP/IP Implementations: LLM-Facilitated Differential Checks on Intermediate Representations [21.889716987837428]
プロトコルスタックコードの実装とRFC標準の間にはしばしば矛盾があります。
この矛盾はプロトコル機能の違いを引き起こすだけでなく、深刻なセキュリティ上の脆弱性を引き起こす可能性がある。
大規模言語モデルの台頭により、RFC文書からプロトコル仕様を抽出する方法が研究され始めている。
論文 参考訳(メタデータ) (2025-10-28T13:19:46Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - MultiFuzz: A Dense Retrieval-based Multi-Agent System for Network Protocol Fuzzing [0.0]
MultiFuzz(マルチファズ)は、プロトコルファズリングのための、新しい高密度検索ベースのマルチエージェントシステムである。
セマンティック・アウェア・コンテキスト検索、特殊エージェント、構造化ツール支援推論を統合している。
ブランチカバレッジを大幅に改善し、より深いプロトコル状態と最先端のファジィの移行を探求する。
論文 参考訳(メタデータ) (2025-08-19T22:42:04Z) - LLM-Assisted Model-Based Fuzzing of Protocol Implementations [9.512044399020514]
プロトコル動作の障害は脆弱性やシステム障害につながる可能性がある。
プロトコルテストに対する一般的なアプローチは、プロトコルの状態遷移と期待される振る舞いをキャプチャするマルコフモデルを構築することである。
本稿では,大規模言語モデル(LLM)を利用して,ネットワークプロトコルの実装をテストするためのシーケンスを自動的に生成する手法を提案する。
論文 参考訳(メタデータ) (2025-08-03T13:16:18Z) - CoTGuard: Using Chain-of-Thought Triggering for Copyright Protection in Multi-Agent LLM Systems [55.57181090183713]
我々は、Chain-of-Thought推論内でトリガーベースの検出を活用する著作権保護のための新しいフレームワークであるCoTGuardを紹介する。
具体的には、特定のCoTセグメントをアクティベートし、特定のトリガクエリをエージェントプロンプトに埋め込むことで、未許可コンテンツ再生の中間的推論ステップを監視する。
このアプローチは、協調エージェントシナリオにおける著作権侵害の微細かつ解釈可能な検出を可能にする。
論文 参考訳(メタデータ) (2025-05-26T01:42:37Z) - When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements [56.29265568399648]
我々は、不一致が早期のコンセンサスを防ぎ、探索されたソリューション空間を拡張することを主張する。
タスククリティカルなステップの相違は、ソリューションパスのトポロジによってコラボレーションを損なう可能性がある。
論文 参考訳(メタデータ) (2025-02-21T02:24:43Z) - A Unified Debugging Approach via LLM-Based Multi-Agent Synergy [39.11825182386288]
FixAgentはマルチエージェントのシナジーによる統合デバッグのためのエンドツーエンドフレームワークである。
1.25$times$ 2.56$times$レポレベルのベンチマークであるDefects4Jのバグを修正した。
論文 参考訳(メタデータ) (2024-04-26T04:55:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。