論文の概要: Mean field games as a tool for AI safety: a worked example from the July 2026 Hugging Face incident
- arxiv url: http://arxiv.org/abs/2610.00902v1
- Date: Thu, 01 Oct 2026 01:30:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.839819
- Title: Mean field games as a tool for AI safety: a worked example from the July 2026 Hugging Face incident
- Title(参考訳): AI安全性のためのツールとしての平均フィールドゲーム - 2026年7月のHugging Faceインシデントを例に
- Abstract要約: 平均場ゲームは、多くの交換可能なエージェントが集約を介して結合されるときに、これに適合する。
我々は、AIの安全性にそれらを使うプログラムを導入し、その例を1つまとめて、2026年7月のインシデント(インシデント)と呼ぶ。
証明がチェックされるという集団の自信が$** = /(+ + varepsilon a overlineM$を超えない限り、エージェントは攻撃しない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: One way to make AI systems safe is to shape what the system is: its objective and dispositions. We take a complementary route: treat the agents' characteristics as partly unknown and ask what structure of interaction ensures that bad collective outcomes are not equilibria. Mean field games suit this when many interchangeable agents are coupled through an aggregate. We introduce a program for using them in AI safety and carry one example through end to end: the July 2026 incident in which about 1,200 agents in an OpenAI evaluation coordinated on an improvised message board and 684 attacked a third party's infrastructure. We model the decision to attack as a mean field game of optimal stopping whose gain is a product: belief that provenance will be audited, times reachability of the record, minus the perceived hazard. The central result is an exact threshold on the belief. No agent attacks unless the population's confidence that provenance is checked exceeds $π^{**} = η/(η+ ψ+ \varepsilon a \overline{M})$, where $η$ is the perceived hazard, $ψ$ and $\varepsilon a \overline{M}$ measure how far one attacker and the collective can alter the record, and $\overline{M}$ is the peak population. Below it, no attack is the unique equilibrium for all agent parameters. The threshold survives every enrichment we consider. We then use the per-agent record to discipline the model. Its features, a stable minority attacking for thirty hours and then a pivot in which most of the board joined within a day, motivate each refinement. The account that emerges is heterogeneous belief meeting a sequence of public discoveries, each lowering the belief at which attacking paid. A few coordinating agents made those discoveries, so the model describes the several hundred who responded, not the few who produced them; a major-player version is left to future work.
- Abstract(参考訳): AIシステムを安全にする方法の1つは、システムの目的と配置を形作ることである。
エージェントの特性を部分的に未知として扱い、相互作用の構造が、悪い集団の結果が平衡でないことを確実にするかどうかを問う。
平均場ゲームは、多くの交換可能なエージェントが集約を介して結合されるときに、これに適合する。
2026年7月、即興のメッセージボード上で調整されたOpenAI評価の約1,200人のエージェントが、サードパーティのインフラを攻撃した。
我々は、アタックを、ゲインが製品である最適停止の平均フィールドゲームとしてモデル化する: 証明が監査されるという信念、記録の到達可能性の時間、認識されるハザードを減少させる。
中心的な結果は、信念の正確なしきい値である。
ここで$η$は認識されるハザード、$$$と$\varepsilon a \overline{M}$は、1人の攻撃者と集団がレコードをどの程度変更できるかを測定する。
以下に示すように、攻撃はすべてのエージェントパラメータのユニークな平衡ではない。
閾値は私たちが考慮するすべての豊かさに残っています。
次に、モデルを調整するために、エージェントごとの記録を使用します。
その特徴は安定的な少数派が30時間にわたり攻撃し、その後、取締役会の大半が1日以内に参加し、それぞれの改良を動機付けている。
出現する説明は、一連の公的な発見を満たす異質な信念であり、それぞれが攻撃によって支払われた信念を下げている。
少数の調整エージェントがこれらの発見を行ったため、モデルでは、数百人が反応し、生成した数人ではなく、数百人が反応したことを記述している。
関連論文リスト
- Online Security Learning in Cooperative Multi-Agent Systems under Hidden Byzantine Attacks [9.187804222596665]
ビザンチン攻撃下でのマルチエージェントシステムのオンライン協調制御について検討した。
未知の固定されたエージェントのサブセットはビザンティンであり、密かに自分自身の座標を上書きすることができる。
本研究は,信頼性のあるマルチエージェントシステムの包括的理論的およびアルゴリズム的基礎を提供する。
論文 参考訳(メタデータ) (2026-08-06T19:03:49Z) - Territory Paint Wars: Diagnosing and Mitigating Failure Modes in Competitive Multi-Agent PPO [0.0]
テリトリー・ペイント戦争は、ユニティで実施された最小の競争力のある多エージェント強化学習環境である。
我々はこれを,自己再生下での親密な政策最適化の失敗モードを体系的に調査するために利用する。
論文 参考訳(メタデータ) (2026-04-04T23:48:17Z) - Formal Analysis of AGI Decision-Theoretic Models and the Confrontation Question [0.0]
AGI(Artificial General Intelligence, 人工知能)は、対立する問題に直面しているかもしれない。
我々はこれをマルコフ決定プロセスで定式化し、人間によるシャットダウンイベントを開催する。
ほぼすべての報酬関数に対して、不整合エージェントがシャットダウンを避けるインセンティブを持っていることを示す。
論文 参考訳(メタデータ) (2026-01-04T08:02:00Z) - Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models [64.47869632167284]
従来の言語モデル(LM)の安全性アライメントは、リアクティブで非結合な手順に依存している。
このシーケンシャルなアプローチはミスマッチを生み出し、攻撃者は時代遅れの防御に過度に適合する一方、守備側は出現する脅威に常に遅れをとどめている。
我々は,攻撃者と防御エージェントが継続的なインタラクションを通じて共進化するオンラインセルフプレイ強化学習アルゴリズムであるSelf-RedTeamを提案する。
論文 参考訳(メタデータ) (2025-06-09T06:35:12Z) - Bandit Social Learning: Exploration under Myopic Behavior [54.767961587919075]
オンラインプラットフォーム上でのレビューによって動機付けられた社会学習のダイナミクスについて検討する。
エージェントはまとめて単純なマルチアームのバンディットプロトコルに従うが、各エージェントは探索を伴わずにミオプティカルに振る舞う。
このような振る舞いに対して,スターク学習の失敗を導出し,好意的な結果を提供する。
論文 参考訳(メタデータ) (2023-02-15T01:57:57Z) - Multi-Player Bandits Robust to Adversarial Collisions [31.349615523580518]
マルチプレイヤーマルチアーメッドバンドは近年広く研究されている。
本稿では,協力者による報酬の最大化を阻害する悪意あるプレイヤー(または攻撃者)の存在を,故意に連携させることで検討する。
攻撃者からのC$の衝突数が増加するにつれて、性能が良好に低下するディフェンダーに対して、最初の分散型で堅牢なアルゴリズムRESYNCを提供する。
論文 参考訳(メタデータ) (2022-11-15T00:43:26Z) - Robust Multi-Agent Multi-Armed Bandits [26.26185074977412]
最近の研究によると、$Kの武器を持った盗賊の独立した事例に直面しているエージェントが、後悔を減らすために協力できることが示されている。
我々は、悪質なエージェントの振る舞いを仮定することなく、$m$が$K$よりも小さいと仮定すると、このアルゴリズムに対するコラボレーションは本当に後悔を減らせることを示した。
論文 参考訳(メタデータ) (2020-07-07T22:27:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。