論文の概要: Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models
- arxiv url: http://arxiv.org/abs/2606.31404v1
- Date: Tue, 30 Jun 2026 09:30:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.165824
- Title: Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models
- Title(参考訳): 人工知能集団のWisdom of the(AI):大規模言語モデルにおける人工知能の研究
- Authors: Justin Brenne, Christian Meske,
- Abstract要約: 大規模言語モデル (LLM) が人工群による群知能効果を近似できるかどうかを検討する。
960個のプロンプトを3つのプロプライエタリモデルで手動で実行し,制御実験を行った。
その結果, モデル内およびモデル間アグリゲーションによる一貫した誤差低減が得られ, 最大37ポイントの誤差低減が得られた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human swarm intelligence demonstrates remarkable collective accuracy but faces scalability constraints in cost, coordination, and time. We investigate whether large language models (LLMs) can approximate swarm intelligence effects through artificial swarms, addressing a critical gap in understanding AI-based aggregation mechanisms. We conducted a controlled experiment with 960 manually executed prompts across three proprietary models (GPT-5, Gemini 2.5 Pro, Claude Sonnet 4.5), testing intra-model sampling and inter-model aggregation on eight estimation tasks. Results reveal consistent error reduction through intra- and inter-model aggregation, with significant error reductions up to 37 percentage points in MAPE across different aggregation strategies. We observed small to large effect sizes for positive correlations (Spearman's $ρ=0.242-0.568$, all $p<0.001$) between relative confidence interval widths and relative estimation errors, suggesting LLMs possess metacognitive awareness when assessing uncertainty. We discuss implications for research and practice, providing actionable insights for deploying LLM swarms in organizational decision-making.
- Abstract(参考訳): 人間のSwarmインテリジェンスは、驚くべき集合的正確さを示しているが、コスト、調整、時間におけるスケーラビリティの制約に直面している。
大規模言語モデル(LLM)が人工スワムを通して群知能効果を近似できるかどうかを考察し,AIに基づくアグリゲーション機構の理解において重要なギャップに対処する。
我々は,3種類のプロプライエタリモデル(GPT-5,Gemini 2.5 Pro,Claude Sonnet 4.5)を手動で実行し,モデル内サンプリングとモデル間アグリゲーションを8つの推定タスクで実験した。
その結果, モデル内およびモデル間アグリゲーションによる一貫した誤差低減が得られ, 異なるアグリゲーション戦略におけるMAPEの最大37ポイントの誤差低減が得られた。
我々は, 相対信頼区間幅と相対推定誤差の間の正の相関関係(Spearman's $ρ=0.242-0.568$, all $p<0.001$)に対する小さな, あるいは大きな効果サイズを観察した。
研究と実践の意義を論じ,組織的意思決定にLLMスワムを配置するための実用的な洞察を提供する。
関連論文リスト
- ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation [8.82034003345674]
大規模言語モデル(LLM)は、明示的な自己報告でペルソナを確実にシミュレートするが、暗黙の行動決定においてしばしば逸脱する。
既存のベンチマークは、構成の妥当性の制限、多次元の絡み合い、分布バイアスのために、この非対称性を測定するのに苦労している。
本稿では,LLMの人格整合性を評価するための人為的評価フレームワークである ActTraitBench を提案する。
論文 参考訳(メタデータ) (2026-05-28T11:40:35Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles [5.647839536820347]
著者間の不一致構造を抽出し活用し,信頼度を良好に推定するフレームワークであるDiscoUQを紹介する。
DiscoUQ-LLM の平均 AUROC は 0.802 であり、最高のベースラインを上回っている。
学習した機能は、ほぼゼロに近いパフォーマンス劣化を伴うベンチマークで一般化される。
論文 参考訳(メタデータ) (2026-03-21T23:24:12Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Adversarial Question Answering Robustness: A Multi-Level Error Analysis and Mitigation Study [0.0]
質問応答(QA)システムは、SQuADのような標準ベンチマークで印象的なパフォーマンスを達成するが、敵の例には弱いままである。
本研究は,AddSent逆数データセット上での変圧器モデルの逆数ロバスト性について検討する。
論文 参考訳(メタデータ) (2026-01-06T04:20:33Z) - MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling [115.74855199827596]
MiroThinkerは、ツール拡張推論と情報検索機能を向上させるために設計されたオープンソースの研究エージェントである。
モデルサイズやコンテキスト長のみをスケールアップする以前のエージェントとは異なり、MiroThinker氏はモデルレベルでのインタラクションスケーリングについて検討している。
論文 参考訳(メタデータ) (2025-11-14T18:52:07Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z) - Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning [71.3533541927459]
アクティベーション推論ポテンシャル(RAP)と呼ばれる新しいデータ選択パラダイムを提案する。
RAPは、真のマルチモーダル推論を刺激する各サンプルのポテンシャルを推定することで、認知サンプルを識別する。
我々のRAP法は、トレーニングデータの9.3%しか使用せず、計算コストを43%以上削減しながら、常に優れた性能を実現している。
論文 参考訳(メタデータ) (2025-06-05T08:40:24Z) - LLM Robustness Against Misinformation in Biomedical Question Answering [50.98256373698759]
探索拡張生成(RAG)アプローチは,質問応答のための大規模言語モデル(LLM)の折り畳みを低減するために用いられる。
バイオメディカル質問に対する誤報に対する4つのLDMの有効性とロバスト性を評価した。
論文 参考訳(メタデータ) (2024-10-27T16:23:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。