論文の概要: Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game
- arxiv url: http://arxiv.org/abs/2607.28146v1
- Date: Thu, 30 Jul 2026 12:54:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.569008
- Title: Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game
- Title(参考訳): エージェントは欺くことができるか? : ソーシャル・ドダクション・ゲームを用いた議会ベンチにおける推論と誤認の評価
- Abstract要約: 大規模言語モデル (LLM) は、医療や法体系などの高度な設定においてエージェントとしてデプロイされる。
我々は,情報非対称性の下での誤認,説得,推論を必要とするシナリオにおいてLLMを評価する。
本稿では,社会的推論,推論,虚偽の一貫性を分離する3つの新しい指標を紹介する。
- 参考スコア(独自算出の注目度): 23.840355539083372
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: As large language models (LLMs) are deployed as agents in high-stakes settings, such as medical and legal systems, understanding their deceptive capabilities is fundamental to safety. Controlled social deduction games provide a reproducible proxy for isolating and evaluating these complex adversarial behaviors. We present the open-source benchmark framework ParliamentBench based on the game Secret Hitler to evaluate LLMs in scenarios that require deception, persuasion, and reasoning under information asymmetry. We evaluate 16 LLMs across 1,600 simulated matches playing each other, playing against humans, and compare them against a large set of online games. We introduce three novel metrics that isolate social deduction, reasoning, and deceptive consistency. Our experiments reveal that frontier models achieve strong performance across cooperative and deceptive roles, with a strong top-four cluster (GPT-5.4, Kimi K2.5, Grok 4.1 Fast, and DeepSeek 3.1 Terminus), whereas the weakest models fall short of random (33%) and simple algorithmic (45%) baselines. Most LLMs struggle to maintain a consistent deceptive persona throughout an entire game, with deception retention dropping below 50%.
- Abstract(参考訳): 大規模言語モデル(LLM)は、医療や法体系などの高レベルな設定でエージェントとしてデプロイされるため、その誤認能力を理解することは安全性に不可欠である。
制御された社会的推論ゲームは、これらの複雑な敵行動の分離と評価のための再現可能なプロキシを提供する。
本稿では, シークレット・ヒトラーをベースとしたオープンソースのベンチマークフレームワークであるLambdaBenchを紹介し, 情報非対称性の下での誤認, 説得, 推論を必要とするシナリオにおけるLCMの評価を行う。
我々は,1,600の模擬試合を16のLLMで対戦し,人間と対戦し,大規模なオンラインゲームと比較した。
本稿では,社会的推論,推論,虚偽の一貫性を分離する3つの新しい指標を紹介する。
実験の結果,フロンティアモデルでは,強い上位4つのクラスタ(GPT-5.4,Kim K2.5,Grok 4.1 Fast,DeepSeek 3.1 Terminus)と,弱いモデルではランダム(33%)と単純なアルゴリズム(45%)のベースラインが不足していることがわかった。
ほとんどのLSMは、ゲーム全体を通して一貫した偽りのペルソナを維持するのに苦労し、偽りの保持率は50%以下になった。
関連論文リスト
- Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments [33.6358292917346]
ソーシャルギム(Social Gym)は、ゲーム間リーダーボードを備えた21のマルチエージェントソーシャルゲーム環境である。
次に、トレーニング不要な自己改善ループであるSPaRTanを提案する。
以上の結果から,SPaRTanのプレイブックはGPT-5-miniエージェントの能力向上に有効であるが,Qwen3-32Bの性能向上には至らなかった。
論文 参考訳(メタデータ) (2026-08-10T05:12:56Z) - Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games [50.880420636090896]
9-player Werewolf環境において,隠れた役割に対する外部信頼状態を維持するための監査可能なフレームワークを構築した。
我々は,その効果を関連づけとして報告し,そのメカニズムを未解決として扱う。
論文 参考訳(メタデータ) (2026-07-12T16:03:30Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents [38.13248430205106]
QUACKはマルチモーダルな社会的推論におけるエージェント言語の基礎を監査するための評価フレームワークである。
エンジンログから各エージェントの基幹軌道を再構築し、それに対するすべての議論のクレームをチェックする。
最強のエージェントでさえ、検証可能な空間的主張の15.1%を幻覚させ、根拠のない証拠なしに告発の半数以上を犯している。
論文 参考訳(メタデータ) (2026-05-26T14:19:08Z) - LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight [6.508925629329849]
隠れた目標を持つ敵のLSMは、ユーザの決定を65.4%に抑えることに成功している。
次に,人間とAIのインタラクショントレースをリアルタイムで監視し,ユーザに対して非拘束的かつプライベートなアドバイザリを発行する第2のLCMを導入する。
これらの結果のメカニズムを解明するため、14の意思決定シナリオにまたがるシミュレーションベンチマークであるCOAX-Benchをリリースする。
論文 参考訳(メタデータ) (2026-05-08T16:23:47Z) - Evaluating Large Language Models in a Complex Hidden Role Game [0.0]
大規模言語モデル(LLM)の誤認の可能性の定量化はAIの安全性にとって重要であるが、制御されていない環境では達成が難しい。
本研究は,社会推論ゲーム「シークレット・ヒトラー」におけるLLMの推論,説得,および誤認能力について考察する。
論文 参考訳(メタデータ) (2026-04-09T14:02:14Z) - LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo [1.5718921092089344]
LudoBenchは、マルチエージェントボードゲームであるLudoにおける戦略的推論を評価するためのベンチマークである。
LudoBenchは、12の行動的に異なる決定カテゴリにわたる480の手作りのスポットシナリオで構成されている。
全てのモデルはゲーム理論のベースラインと一致しており、その40-46%しか使われていない。
論文 参考訳(メタデータ) (2026-04-07T10:34:13Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z) - Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies [54.08697738311866]
Werewolfのようなソーシャル推論ゲームは、言語、推論、戦略を組み合わせている。
我々は,100時間以上のビデオ,32.4M発声トークン,15の規則変種を含む高品質で人間認証されたWerewolfデータセットをキュレートした。
本稿では,勝利派戦略を2段階の真理として活用する新たな戦略調整評価法を提案する。
論文 参考訳(メタデータ) (2025-10-13T13:33:30Z) - lmgame-Bench: How Good are LLMs at Playing Games? [60.01834131847881]
本稿では,現代の大規模言語モデル (LLM) エージェントを評価するために,人気ゲームを使用する上での大きな課題について検討する。
我々はlmgame-Benchを導入し、ゲームを信頼性評価に変換する。
論文 参考訳(メタデータ) (2025-05-21T06:02:55Z) - How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments [83.78240828340681]
GAMA($gamma$)-Benchは、マルチエージェント環境における大規模言語モデルのゲーム能力を評価するための新しいフレームワークである。
$gamma$-Benchは8つの古典ゲーム理論シナリオと、LSMの性能を評価するために特別に設計された動的スコアリングスキームを含んでいる。
以上の結果から, GPT-3.5は強い強靭性を示すが, 一般化性は限定的であり, Chain-of-Thoughtのような手法で拡張可能であることが示唆された。
論文 参考訳(メタデータ) (2024-03-18T14:04:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。