論文の概要: EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision
- arxiv url: http://arxiv.org/abs/2608.07196v1
- Date: Fri, 07 Aug 2026 13:11:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.501698
- Title: EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision
- Title(参考訳): EMAS:Evidence-Guided Revisionによるマルチエージェントシステム進化の安定化
- Authors: Chao Fei, Qingyi Si, Kaihua Liang, Yanghua Xiao, Panos Kalnis, Hongcheng Guo,
- Abstract要約: EMAS (Evolving Multi-Agent System) を導入し, LLMパラメータを更新せずにMASトポロジとプロンプトを更新する。
4つのベンチマークと2つのLSMで、EMASは両方のバックボーンに対してタスク重み付き全体の精度が最も高い。
EMASは新しいサンプルからMASトポロジとプロンプトの更新を再利用できる。
- 参考スコア(独自算出の注目度): 49.07453709918038
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many methods for automated multi-agent system design optimize prompts and topologies during an initial design stage and then deploy the resulting system unchanged on subsequent samples. Experience from these samples is rarely consolidated into reusable system updates, while accuracy-oriented designs may incur high token costs. We introduce EMAS (Evolving Multi-Agent System), which uses this experience to revise MAS topology and prompts without updating LLM parameters, either to improve accuracy or to reduce cost. EMAS converts traces into structured diagnoses that specify a revision operation and target. It generates a candidate revision only when the same diagnosis recurs across samples and applies it only if paired validation against the current MAS meets the corresponding acceptance criterion. Across four benchmarks and two LLMs, EMAS attains the highest task-weighted overall accuracy for both backbones and is best or tied in six of eight model--benchmark settings. Within two evolution epochs, EMAS achieves relative gains of 6.30% and 20.10% in task-weighted accuracy on Kimi-K2-6 and Qwen3.6-27B, respectively. On MBPP with Qwen3.6-27B, EMAS raises accuracy from 55.09% to 89.12% while reducing token use per task by 62.2%. These results show that EMAS can turn experience from new samples into reusable updates to MAS topology and prompts.
- Abstract(参考訳): 自動マルチエージェントシステム設計のための多くの手法は、初期設計段階でプロンプトとトポロジを最適化し、その結果のシステムをその後のサンプルで変更せずにデプロイする。
これらのサンプルからの経験が再利用可能なシステム更新に統合されることはめったにないが、精度指向の設計は高いトークンコストを発生させる可能性がある。
EMAS(Evolving Multi-Agent System)を導入し,MASトポロジを改訂し,LCMパラメータを更新することなく,精度の向上やコスト削減を図る。
EMASは、トレースをリビジョン操作とターゲットを指定する構造化診断に変換する。
同一診断がサンプル間で再帰した場合のみ候補修正を生成し、現在のMASに対するペア検証が対応する受け入れ基準を満たす場合にのみ適用する。
4つのベンチマークと2つのLLMで、EMASは両方のバックボーンでタスク重み付けされた全体的な精度を最高に達成し、8つのモデルのうち6つで最良または関連付けられている。
2つの進化期の中で、EMASは、それぞれKim-K2-6とQwen3.6-27Bのタスク重み付け精度が6.30%、20.10%向上した。
Qwen3.6-27BのMBPPでは、EMASは55.09%から89.12%に精度を上げ、タスク当たりのトークン使用量を62.2%削減した。
これらの結果は、EMASが新しいサンプルからMASトポロジとプロンプトの更新を再利用できることを示している。
関連論文リスト
- LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - FDM: A Framework for Decision-making to build ML-based Malware detection systems [3.552368449344917]
本稿では,MLベースのマルウェア検出システムを構築するためのFDMフレームワークを提案する。
FDMは、9つの設定範囲にまたがる推奨事項に5つの運用パラメータをランク付けしている。
フレームワークを検証するために、3つのデータセットで4つの実験を行った。
論文 参考訳(メタデータ) (2026-06-05T04:21:22Z) - EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design [0.4499833362998488]
3つの評価次元を持つベンチマークスイートを導入する。
本稿では,LangGraph上に構築されたマルチエージェントシステム(MAS)の実装であるEngiAIを紹介する。
論文 参考訳(メタデータ) (2026-05-19T12:12:09Z) - PersonalAI 2.0: Enhancing knowledge graph traversal/retrieval with planning mechanism for Personalized LLM Agents [53.369140518949656]
外部知識グラフ(KG)の統合により,大規模言語モデル(LLM)ベースのシステムを強化する新しいフレームワークであるPersonalAI 2.0(PAI-2)を紹介する。
提案手法は,動的でマルチステージなクエリ処理パイプラインを組み込むことにより,既存のGraphRAG(Retrieval-Augmented Generation)メソッドの重要な制限に対処する。
グラフアルゴリズム(例えば、BeamSearch、WaterCircles)は、平均6%の標準フラットテンレトリバーよりも優れた結果が得られる一方で、検索計画強化機構は、6つのデータセットにわたるLLM-as-a-Judgeによる障害アルゴリズムに比べて18%向上することを示す。
論文 参考訳(メタデータ) (2026-05-13T13:06:30Z) - Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations [2.7946918847372277]
大規模言語モデルは、数学的推論ベンチマークにおいて強い性能を示すが、意味を保存する表面摂動に対して驚くほど脆弱である。
我々は677 GSM8K問題に対して,3つのオープンウェイトLLM(Mistral-7B,Llama-3-8B,Qwen2.5-7B)を意味論的に等価な変種と組み合わせて評価した。
3つのモデルはいずれも相当な解答フリップ率(28.8%-45.1%)を示し、数字のパラフレーズは名前スワップよりも一貫して破壊的である。
論文 参考訳(メタデータ) (2026-04-02T05:30:20Z) - Evolutionary Multi-Objective Fusion of Deepfake Speech Detectors [0.17398560678845076]
本稿では,検出誤差とシステム複雑性を両立させる多目的スコア融合フレームワークを提案する。
36個のSSLベースの検出器を用いたASVspoof 5データセットの実験では、得られたフロントは単純な平均値とロジスティック回帰基準よりも優れていた。
提案手法は多様なトレードオフソリューションも提供し,精度と計算コストのバランスをとるデプロイメントの選択を可能にする。
論文 参考訳(メタデータ) (2026-04-01T19:17:59Z) - LLM2: Let Large Language Models Harness System 2 Reasoning [65.89293674479907]
大規模言語モデル(LLM)は、無数のタスクにまたがって印象的な機能を示してきたが、時には望ましくない出力が得られる。
本稿では LLM とプロセスベースの検証器を組み合わせた新しいフレームワーク LLM2 を紹介する。
LLMs2は妥当な候補を生成するのに責任を持ち、検証者は望ましい出力と望ましくない出力を区別するためにタイムリーなプロセスベースのフィードバックを提供する。
論文 参考訳(メタデータ) (2024-12-29T06:32:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。