論文の概要: AgentPSO: Evolving Agent Reasoning Skill via Multi-agent Particle Swarm Optimization
- arxiv url: http://arxiv.org/abs/2605.08704v1
- Date: Sat, 09 May 2026 05:38:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.826763
- Title: AgentPSO: Evolving Agent Reasoning Skill via Multi-agent Particle Swarm Optimization
- Title(参考訳): AgentPSO:マルチエージェント粒子群最適化によるエージェント推論スキルの進化
- Authors: Hyunmin Hwang, Jaemin Kim, Choonghan Kim, Hangeol Chang, Jong Chul Ye,
- Abstract要約: 我々はマルチエージェント推論スキルを進化させるフレームワークであるAgentPSOを紹介する。
エージェントPSOは、各エージェントを自然言語技術である粒子のような推論器として扱う。
エージェントをより強いスキル状態へと繰り返し移動させ、個人的および集団的推論のパフォーマンスを改善する。
- 参考スコア(独自算出の注目度): 46.78426363253909
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent reasoning has shown promise for improving the problem-solving ability of large language models by allowing multiple agents to explore diverse reasoning paths. However, most existing multi-agent methods rely on inference-time debate or aggregation, which can be vulnerable to incorrect peer influence and biased consensus. Moreover, the agents themselves remain static, as their underlying reasoning skills do not evolve across tasks. In this paper, we introduce AgentPSO, a particle-swarm-inspired framework for evolving multi-agent reasoning skills. AgentPSO treats each agent as a particle-like reasoner whose state is a natural-language skill and whose velocity is a semantic update direction, iteratively moving agents toward stronger skill states to improve both individual and collective reasoning performance. Across training iterations, each agent updates its skill by combining its previous velocity, personal-best skill, global-best skill, and a self-reflective direction derived from peer reasoning trajectories. This enables agents to learn reusable reasoning behaviors from both their own experiences and the strongest skills discovered by the population, without updating the parameters of the backbone language model. Experiments on mathematical and general reasoning benchmarks show that AgentPSO improves over static single-agent skills and test-time-only multi-agent reasoning baselines. The evolved skills further transfer across benchmarks and to another backbone model, suggesting that AgentPSO captures reusable reasoning procedures rather than merely optimizing benchmark-specific prompts. Code is open-sourced at https://github.com/HYUNMIN-HWANG/AgentPSO/.
- Abstract(参考訳): マルチエージェント推論は、複数のエージェントが多様な推論経路を探索できるようにすることで、大規模言語モデルの問題解決能力を向上させることを約束している。
しかし、既存のほとんどのマルチエージェント手法は推論時の議論や集約に依存しており、これは誤ったピアの影響やバイアスのあるコンセンサスに対して脆弱である。
さらに、エージェント自体は静的であり、その根底にある推論スキルはタスク全体にわたって進化しない。
本稿では,多エージェント推論スキルを進化させるための粒子スワムにインスパイアされたフレームワークであるAgentPSOを紹介する。
エージェントPSOは、各エージェントを、自然言語のスキルであり、ベロシティが意味的な更新方向である粒子のような推論として扱う。
トレーニングの繰り返しを通じて、各エージェントは、以前のベロシティ、個人ベストスキル、グローバルベストスキル、およびピア推論軌道から派生した自己反射方向を組み合わせることで、スキルを更新する。
これにより、エージェントは、バックボーン言語モデルのパラメータを更新することなく、自身の経験から再利用可能な推論行動と、人口が発見する最も強力なスキルの両方から学習することができる。
数学的および一般的な推論ベンチマークの実験では、AgentPSOは静的単エージェントスキルとテスト時間のみのマルチエージェント推論ベースラインよりも改善されている。
進化したスキルは、単にベンチマーク固有のプロンプトを最適化するのではなく、再利用可能な推論手順をキャプチャする、とAgentPSOは示唆している。
コードはhttps://github.com/HYUNMIN-HWANG/AgentPSO/で公開されている。
関連論文リスト
- AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent [57.10083973844841]
AgentArkは、マルチエージェントダイナミクスを単一のモデルの重みに蒸留する新しいフレームワークである。
各種モデル,タスク,スケーリング,シナリオの3つの階層的蒸留戦略について検討する。
シミュレーションからトレーニングへ計算の負担をシフトさせることで、蒸留されたモデルは、複数のエージェントの強い推論と自己補正性能を示しながら、一つのエージェントの効率を保ちます。
論文 参考訳(メタデータ) (2026-02-03T19:18:28Z) - OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning [14.105640933123325]
大規模言語モデル(LLM)は、数学的および科学的タスクにおいて顕著な推論能力を示している。
複雑な推論を強化するため、LLMエージェントの集合的知性を活用するためにマルチエージェントシステムが提案されている。
複数エージェントの協調構造を動的に構築・洗練する多エージェント言語強化学習アルゴリズムである$ours$を提案する。
論文 参考訳(メタデータ) (2025-10-20T19:07:51Z) - Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution [34.66260172204154]
人間の学習過程を反映したボトムアップエージェントパラダイムを導入する。
エージェントは、試行錯誤メカニズムを探索し、成果を反映し、時間とともにスキルを抽象化することで能力を獲得する。
Slay the Spire and Civilization Vでは、エージェントが生の視覚的入力を通じて知覚し、マウスのアウトプットを介して行動する。
論文 参考訳(メタデータ) (2025-05-23T09:38:55Z) - Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement [112.04307762405669]
G"odel AgentはG"odelマシンにインスパイアされた自己進化型フレームワークである。
G"odel Agentは、パフォーマンス、効率、一般化性において手作業によるエージェントを上回る、継続的な自己改善を実現することができる。
論文 参考訳(メタデータ) (2024-10-06T10:49:40Z) - AgentGym: Evolving Large Language Model-based Agents across Diverse Environments [116.97648507802926]
大規模言語モデル(LLM)はそのようなエージェントを構築するための有望な基盤と考えられている。
我々は、自己進化能力を備えた一般機能 LLM ベースのエージェントを構築するための第一歩を踏み出す。
我々はAgentGymを提案する。AgentGymは、幅広い、リアルタイム、ユニフォーマット、並行エージェント探索のための様々な環境とタスクを特徴とする新しいフレームワークである。
論文 参考訳(メタデータ) (2024-06-06T15:15:41Z) - Skill Discovery of Coordination in Multi-agent Reinforcement Learning [41.67943127631515]
本稿では,複数のエージェントの協調パターンを識別する手法であるMASD(Multi-agent Skill Discovery)を提案する。
一般粒子マルチエージェント環境における協調のレベルにおける様々なスキルの出現を示す。
また,この「ボトルネック」は,一つのエージェントにスキルが崩壊するのを防ぎ,学習スキルの多様性を高めることも明らかにした。
論文 参考訳(メタデータ) (2020-06-07T02:04:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。