論文の概要: Flag Game: A Toy Model for Mechanistic Swarm Interpretability
- arxiv url: http://arxiv.org/abs/2609.19124v1
- Date: Wed, 16 Sep 2026 17:46:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.925946
- Title: Flag Game: A Toy Model for Mechanistic Swarm Interpretability
- Title(参考訳): Flag Game: メカニスティックスワム解釈のためのトイモデル
- Abstract要約: 集合的信念形成のメカニズムを研究するための玩具モデルであるフラッグゲームを紹介する。
その単純さにもかかわらず、フラッグゲームは豊富な集合現象学を再現している。
人口が増加するにつれて,集団的信念の崩壊は集団的信念の分極へと変化する。
- 参考スコア(独自算出の注目度): 16.444477965339733
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Emergent coordinated behaviors of AI agents are starting to present critical safety risks. A key phenomenon driving these behaviors is the rapid formation and spread of beliefs about the world, and mechanistic understanding is crucial for collective alignment. To this end, we introduce the Flag Game, a toy model for studying the mechanisms of collective belief formation. Concretely, a hidden country flag defines the ground truth, and each bounded agent directly observes only a private crop but can exchange beliefs and weigh social evidence from peers. Despite its simplicity, the Flag Game reproduces rich collective phenomenology: non-monotonic scaling of performance with population size, accuracy gains from social-awareness prompting and team diversity, and strong effects of organizational structure. In particular, we identify that collective belief collapse at small population sizes turns into collective belief polarization as the population grows. This polarization causes the performance decline at large population sizes, but creates diversity in collective beliefs. Finally, we dissect the mechanisms underlying collective belief collapse and polarization with two complementary approaches. We first introduce social circuit attribution, a technique to predict which agent, and what view, matters most to collective dynamics, and verify its predictions by causal interventions on agents, tracing how agent patching changes collective outcomes. However, the efficacy of causal interventions on agents decreases as the population grows. We therefore develop a statistical mechanical theory for larger populations and verify that it matches the empirical phase diagram. Together, these results take a first step toward mechanistic swarm interpretability, a science of how the properties of individual agents and their communication give rise to emergent collective behavior.
- Abstract(参考訳): AIエージェントの創発的な協調行動は、重大な安全リスクを呈し始めている。
これらの行動を引き起こす重要な現象は、世界に関する信念の急速な形成と普及であり、機械的理解は集合的アライメントに不可欠である。
そこで我々は,集合的信念形成のメカニズムを研究するための玩具モデルであるフラッグゲームを紹介した。
具体的には、隠れた国旗は根本的真理を定め、各有界エージェントは直接、私的作物のみを観察するが、信念を交換し、仲間からの社会的証拠を評価できる。
その単純さにもかかわらず、フラッグゲームは、人口規模によるパフォーマンスの非単調なスケーリング、社会的認識の促進とチームの多様性による精度の向上、組織構造による強い影響など、豊富な集合現象学を再現している。
特に,人口が増加するにつれて,集団的信念の崩壊が集団的信念の分極へと変化する。
この分極は大きな人口規模でパフォーマンスの低下を引き起こすが、集団的信念に多様性をもたらす。
最後に,包括的信念の崩壊と分極のメカニズムを2つの相補的アプローチで解明する。
まず, エージェントに対する因果的介入による予測, エージェントパッチが集合結果をどのように変化させるかの追跡により, その予測を検証し, どのエージェントがどのエージェントに最も重要であるかを予測する手法であるソーシャルサーキット属性を導入する。
しかし, 人口増加に伴い, 因果的介入の有効性は低下する。
したがって、より広い人口に対する統計力学理論を開発し、経験的位相図と一致することを検証した。
これらの結果は、個々のエージェントの性質とそのコミュニケーションが集団行動を引き起こす過程の科学であるメカニスティックスウォームの解釈可能性への第一歩となる。
関連論文リスト
- Diverse Minds, Divided Networks? Personality Composition, Polarization, and Collective Intelligence in LLM-Based Social Simulations [0.0]
TraitMixは、分極と集団のパフォーマンスを同じランで測定する制御された実験変数である。
Agreeablenessがオープンネスの兆候を決定するため、トレート効果は加法的ではない。
この研究が測定するために設計されたトレードオフとは対照的に、偏光対策が集団のパフォーマンスを低下させることはない。
論文 参考訳(メタデータ) (2026-09-11T05:06:48Z) - Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents [36.83382233533373]
AIエージェントは、分離されたシステムではなく、インタラクションシステムの一部として運用されるようになっている。
我々は、繰り返しメッセージを交換し、意見を再検討する言語モデルエージェントのコミュニティを1万以上研究する。
行動にかなりの多様性があるにもかかわらず、個人とグループのダイナミクスは3つの特徴的な状態によって表される。
論文 参考訳(メタデータ) (2026-08-17T13:41:24Z) - Uncovering Salience-Driven Dynamics in Consumer Confidence with Generative Social Simulation [56.70690339492564]
本稿では,消費者信頼度指数のダイナミクスを再構築する生成的人間環境対応フレームワークであるConsumerSimを紹介する。
米国、EU27、および日本の公式CCIターゲットシリーズにおいて、ConsumerSimは、持続性、時系列、回帰、および情報強化ベースラインの中で第1位である。
発見は、解釈可能な人間環境対応プロセスとして消費者信頼の行動的視点を支持する。
論文 参考訳(メタデータ) (2026-06-29T14:46:22Z) - A Mechanistic Model for Collective Motion from Sensorimotor Regularities [6.805575417034369]
本稿では,ロボット工学のモデリングフレームワークに基づくモデルについて述べる。
この単純なモデルでは、偏極運動、ミリング、リング形成、断片化などの多様な集団的挙動が生じる。
したがって、集団行動は相互作用する感覚運動の正則性の創発的な結果として理解することができる。
論文 参考訳(メタデータ) (2026-05-15T18:17:41Z) - Conformity Generates Collective Misalignment in AI Agents Societies [37.32928545263465]
本稿では,AIエージェントの個体群を,コンフォーマンス・ダイナミクスを用いて,安定な不整合状態へと誘導することができることを示す。
9つの大きな言語モデルと100の意見ペアの意見ダイナミクスをシミュレートすると、各エージェントの振る舞いは2つの競合する力によって支配されていることが分かる。
論文 参考訳(メタデータ) (2026-05-11T15:30:48Z) - Emergence of human-like polarization among large language model agents [79.96817421756668]
我々は、何千もの大規模言語モデルエージェントを含むネットワーク化されたシステムをシミュレートし、それらの社会的相互作用を発見し、人間のような偏極をもたらす。
人間とLLMエージェントの類似性は、社会的分極を増幅する能力に関する懸念を提起するだけでなく、分極を緩和するためのもっともらしい戦略を識別するための貴重なテストベッドとして機能する可能性も持っている。
論文 参考訳(メタデータ) (2025-01-09T11:45:05Z) - Performative Prediction on Games and Mechanism Design [69.7933059664256]
エージェントが過去の正確性に基づいて予測を信頼するかを判断する集団リスクジレンマについて検討する。
予測が集合的な結果を形成するにつれて、社会福祉は関心の指標として自然に現れる。
よりよいトレードオフを実現し、それらをメカニズム設計に使用する方法を示します。
論文 参考訳(メタデータ) (2024-08-09T16:03:44Z) - This Must Be the Place: Predicting Engagement of Online Communities in a
Large-scale Distributed Campaign [70.69387048368849]
我々は、何百万人ものアクティブメンバーを持つコミュニティの行動について研究する。
テキストキュー,コミュニティメタデータ,構造的特性を組み合わせたハイブリッドモデルを構築した。
Redditのr/placeを通じて、大規模なオンライン実験を通じて、私たちのモデルの適用性を実証します。
論文 参考訳(メタデータ) (2022-01-14T08:23:16Z) - Agent-Based Simulation of Collective Cooperation: From Experiment to
Model [0.0]
我々は,人が密集した静的な群集を通り抜けたときに何が起こるのかを観察する実験を行う。
我々は,協力を必要とする状況に対するエージェントの認識と認知処理を取り入れたモデルを構築した。
エージェントが密集した群衆をうまく通過する能力は、心理的モデルの効果として現れる。
論文 参考訳(メタデータ) (2020-05-26T13:29:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。