論文の概要: Position: AI Is Not Ready for Strategic Conflicts
- arxiv url: http://arxiv.org/abs/2609.16189v1
- Date: Fri, 31 Jul 2026 03:30:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.53525
- Title: Position: AI Is Not Ready for Strategic Conflicts
- Title(参考訳): AIは戦略的な対立に準備ができていない
- Abstract要約: 本論文は、LM対応のウォーゲームは、監査可能な安全ケースなしで、計画、原則、方針、危機対応を通知すべきではないと主張している。
意思決定の洗浄、不透明感、役割の崩壊、エスカレーション・スルー・アジュディテーション、戦略的想像力の失敗の5つの失敗モードを特定します。
- 参考スコア(独自算出の注目度): 1.4225348200714467
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Open-ended strategic wargames are high-stakes LM-based social simulations: they model adversaries, institutions, escalation, plan brittleness, doctrine, and crisis response. Language models (LMs) are attractive because they can play agents, generate scenario branches, adjudicate ambiguous actions, and summarize lessons, but the same affordances make open-ended roles dangerous: model language determines both what an actor attempts and what becomes simulated reality. This position paper argues that no LM-enabled wargame should inform planning, doctrine, policy, or crisis response without an auditable safety case, and that the proper use of open-ended wargames today is to stress-test decision-influencing LM agents. We identify five failure modes: decision laundering, adjudication opacity, role collapse, escalation-through-adjudication, and failure of strategic imagination. Ordinary benchmarks cannot establish safety for these settings. Wargames can expose failures as stress tests; they are not themselves safety cases for consequential use.
- Abstract(参考訳): オープンエンド戦略戦争ゲームは、敵、機関、エスカレーション、計画の脆さ、教義、危機対応をモデル化する、高度なLMベースの社会シミュレーションである。
言語モデル(LM)は、エージェントをプレイし、シナリオブランチを生成し、曖昧なアクションを判断し、レッスンを要約できるため魅力的だが、同じ余裕でオープンエンドの役割を危険にしている。
このポジションペーパーでは、LM対応のウォーゲームは、監査可能な安全ケースなしで計画、ドクトリン、ポリシー、危機対応を通知すべきではなく、今日のオープンエンドのウォーゲームは、LMエージェントにストレス-テストによる決定の影響があると主張している。
意思決定の洗浄、不透明感、役割の崩壊、エスカレーション・スルー・アジュディテーション、戦略的想像力の失敗の5つの失敗モードを特定します。
通常のベンチマークでは、これらの設定の安全性は確立できない。
戦争ゲームは、障害をストレステストとして公開することができる。
関連論文リスト
- To Nuke or Not to Nuke: LLMs' (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation [0.8673752869253052]
大規模言語モデル (LLM) は、意思決定能力を持つ長距離エージェントとして、ますます多くデプロイされている。
我々は、経済、外交、技術、軍事戦略を含む複雑な意思決定環境を持つマルチプレイヤーゲームであるCivilization Vにおけるこのギャップについて研究する。
論文 参考訳(メタデータ) (2026-06-06T19:43:53Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models [22.928188725128138]
大きな言語モデル(LLM)は、優れた汎用能力を示すと同時に、深刻な安全性のリスクももたらします。
LLM偽造を計測するための新しい評価フレームワークであるLieCraftとサンドボックスについて紹介する。
論文 参考訳(メタデータ) (2026-03-06T20:49:48Z) - ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs [48.50397204177239]
大きな言語モデル(LLM)が進化するにつれて、その行動の安全性を評価することが重要になる。
現実的な人為的な管理シナリオにおけるLCM意思決定を評価するベンチマークである ManagerBench を紹介する。
潜在的な害が無生物にのみ向けられる並列制御セットは、モデルのプラグマティズムを測定し、過度に安全である傾向を特定する。
論文 参考訳(メタデータ) (2025-10-01T13:08:33Z) - Shall We Play a Game? Language Models for Open-ended Wargames [1.8240882160775522]
我々は、言語モデル(LM)のような人工知能システムが、戦略的計画のための人間の専門能力に急速に近づいているという立場を取る。
我々は、AIシステムが大規模な意思決定に影響を与える能力は、オープンエンドの戦争ゲームにおけるAIの安全性、解釈可能性、説明可能性に関するさらなる研究を動機付けていると主張している。
論文 参考訳(メタデータ) (2025-09-21T18:37:17Z) - Can LLMs effectively provide game-theoretic-based scenarios for cybersecurity? [51.96049148869987]
大規模言語モデル(LLM)は、コンピュータシステムのセキュリティに新しいツールと課題を提供する。
従来のゲーム理論フレームワークが,LLM駆動型アクターやボットの動作を効果的に捉えることができるかどうかを検討する。
論文 参考訳(メタデータ) (2025-08-04T08:57:14Z) - View From Above: A Framework for Evaluating Distribution Shifts in Model Behavior [0.9043709769827437]
大規模言語モデル(LLM)は特定のタスクを実行するよう要求される。
彼らの学習した表現が現実とどのように一致しているか。
分散シフトを体系的に評価するためのドメインに依存しないフレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-01T04:07:49Z) - Human vs. Machine: Behavioral Differences Between Expert Humans and Language Models in Wargame Simulations [1.6108153271585284]
大規模言語モデル(LLM)は、高い軍事的意思決定シナリオにおいて、人間と異なる振る舞いを示す。
当社の結果は、自律性を認める前に政策立案者が慎重であること、あるいはAIベースの戦略レコメンデーションに従うことを動機付けています。
論文 参考訳(メタデータ) (2024-03-06T02:23:32Z) - GTBench: Uncovering the Strategic Reasoning Limitations of LLMs via Game-Theoretic Evaluations [87.99872683336395]
大規模言語モデル(LLM)は、重要な現実世界のアプリケーションに統合される。
本稿では,LLMの競合環境における推論能力について検討する。
まず,広く認識されている10のタスクを構成する言語駆動型環境であるGTBenchを提案する。
論文 参考訳(メタデータ) (2024-02-19T18:23:36Z) - K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic Reasoning [76.3114831562989]
マルチエージェント環境で戦略を動的に適応させるためには、LLM(Large Language Model)エージェントが必要である。
我々は,「K-Level Reasoning with Large Language Models (K-R)」という新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-02T16:07:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。