論文の概要: Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments
- arxiv url: http://arxiv.org/abs/2608.09128v1
- Date: Mon, 10 Aug 2026 05:12:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.089841
- Title: Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments
- Title(参考訳): Social GymとSPaRTan:マルチエージェントゲームトーナメントによるLLMソーシャル推論のベンチマークと改善
- Abstract要約: ソーシャルギム(Social Gym)は、ゲーム間リーダーボードを備えた21のマルチエージェントソーシャルゲーム環境である。
次に、トレーニング不要な自己改善ループであるSPaRTanを提案する。
以上の結果から,SPaRTanのプレイブックはGPT-5-miniエージェントの能力向上に有効であるが,Qwen3-32Bの性能向上には至らなかった。
- 参考スコア(独自算出の注目度): 33.6358292917346
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents are increasingly deployed in multi-agent social settings where they must cooperate, negotiate, and adapt to other agents. Measuring and improving these social skills is hard because, unlike math or logic, social interaction offers no objective ground truth: evaluations fall back on LLM judges, which are costly, subjective, and noisy, and models get no reliable signal to learn from. To address both, we first introduce Social Gym, an environment of 21 multi-agent social games (e.g., Werewolves, Resistance, Spyfall) whose rule-decided outcomes make agent performance verifiable and objective, with an Elo tournament that produces a cross-game leaderboard. Benchmarking experiments show that while GPT-5-mini tops the leaderboard, no model excels at all games uniformly or in all game roles, pointing to limitations of social reasoning. Motivated by this, we additionally propose SPaRTan (Self-Play and Reflect-Transfer), a training-free self-improvement loop: a model plays a game, reflects on its trajectories and their outcomes to produce a transferable playbook, and applies that playbook in subsequent games. Our results show that SPaRTan playbooks help GPT-5-mini agents level their performance on weaker roles, but largely do not improve Qwen3-32B's performance. Together, Social Gym and SPaRTan offer a reproducible, verifiable foundation for measuring and improving LLM social reasoning without weight updates.
- Abstract(参考訳): LLMエージェントは、協力し、交渉し、他のエージェントに適応しなければならないマルチエージェントの社会環境にますます配置されている。
社会的スキルの測定と改善は、数学や論理とは異なり、社会的相互作用には客観的な真実がないため難しい。
まず,21のマルチエージェントソーシャルゲーム(例えば,ウェアウルフ,抵抗,スパイフォール)の環境であるSocial Gymを紹介する。
ベンチマーク実験によると、GPT-5-miniはリーダーボードのトップであるが、社会的推論の限界を指して、すべてのゲームにおいて一様または全てのゲームロールにおいてモデルが優れているわけではない。
さらに,学習不要な自己改善ループであるSPaRTan(Self-Play and Reflect-Transfer)を提案する。
以上の結果から,SPaRTanのプレイブックはGPT-5-miniエージェントの能力向上に有効であるが,Qwen3-32Bの性能向上には至らなかった。
Social GymとSPaRTanは共同で、LLMの社会的推論を軽量化せずに測定し改善するための再現可能な、検証可能な基盤を提供する。
関連論文リスト
- Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game [23.840355539083372]
大規模言語モデル (LLM) は、医療や法体系などの高度な設定においてエージェントとしてデプロイされる。
我々は,情報非対称性の下での誤認,説得,推論を必要とするシナリオにおいてLLMを評価する。
本稿では,社会的推論,推論,虚偽の一貫性を分離する3つの新しい指標を紹介する。
論文 参考訳(メタデータ) (2026-07-30T12:54:17Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems [38.033245595823026]
本稿では,計画,タスク実行,社会的推論のエージェントを評価するマルチエージェント環境であるSocialGridを紹介する。
評価の結果,最強のオープンモデルでさえ,タスク完了と計画において60%未満の精度で達成できることがわかった。
SocialGridは自動障害分析と詳細なメトリクスを提供し、開発者はエージェントの診断と改善が可能になる。
論文 参考訳(メタデータ) (2026-04-17T12:51:46Z) - Who is a Better Player: LLM against LLM [53.46608216197315]
本稿では,大規模言語モデル (LLM) の総合的な性能を評価するための対戦型ベンチマークフレームワークを提案する。
広範にプレイされている5つのゲームをサポートし,20のLDMを駆使したプレーヤーを対象とする,特別な評価プラットフォームであるQi Townを紹介した。
論文 参考訳(メタデータ) (2025-08-05T06:41:47Z) - lmgame-Bench: How Good are LLMs at Playing Games? [60.01834131847881]
本稿では,現代の大規模言語モデル (LLM) エージェントを評価するために,人気ゲームを使用する上での大きな課題について検討する。
我々はlmgame-Benchを導入し、ゲームを信頼性評価に変換する。
論文 参考訳(メタデータ) (2025-05-21T06:02:55Z) - Toward Optimal LLM Alignments Using Two-Player Games [86.39338084862324]
本稿では,対戦相手と防御エージェントの反復的相互作用を含む2エージェントゲームのレンズによるアライメントについて検討する。
この反復的強化学習最適化がエージェントによって誘導されるゲームに対するナッシュ平衡に収束することを理論的に実証する。
安全シナリオにおける実験結果から、このような競争環境下での学習は、完全に訓練するエージェントだけでなく、敵エージェントと防御エージェントの両方に対する一般化能力の向上したポリシーにつながることが示されている。
論文 参考訳(メタデータ) (2024-06-16T15:24:50Z) - LLM-Based Agent Society Investigation: Collaboration and Confrontation in Avalon Gameplay [55.12945794835791]
Avalon をテストベッドとして使用し,システムプロンプトを用いてゲームプレイにおける LLM エージェントの誘導を行う。
本稿では,Avalonに適した新しいフレームワークを提案し,効率的なコミュニケーションと対話を容易にするマルチエージェントシステムを提案する。
その結果、適応エージェントの作成におけるフレームワークの有効性を確認し、動的社会的相互作用をナビゲートするLLMベースのエージェントの可能性を提案する。
論文 参考訳(メタデータ) (2023-10-23T14:35:26Z) - Playing repeated games with Large Language Models [23.57695486747895]
LLMは、人間や他のエージェントと相互作用するアプリケーションでますます使われている。
私たちは異なるLLMに、人間のような戦略と実際の人間プレイヤーで、繰り返し2時間2ドルをプレイさせました。
以上の結果から, LLMは, 反復した囚人のジレンマ家族のような, 利己的なゲームで特に優れていたことが示唆された。
しかし、セクシーズの戦いのような調整を必要とするゲームでは準最適に振る舞う。
論文 参考訳(メタデータ) (2023-05-26T12:17:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。