論文の概要: ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts
- arxiv url: http://arxiv.org/abs/2605.00245v1
- Date: Thu, 30 Apr 2026 21:27:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 17:43:28.762886
- Title: ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts
- Title(参考訳): ARMOR 2025: 民間の文脈を超えた大規模言語モデルの安全性を評価するための軍用ベンチマーク
- Authors: Sydney Johns, Heng Jin, Chaoyu Zhang, Y. Thomas Hou, Wenjing Lou,
- Abstract要約: 大規模言語モデル(LLM)は、信頼性と法的に準拠した意思決定支援を必要とする防衛アプリケーションのために研究されている。
既存の安全ベンチマークは一般的な社会的リスクに焦点を当てており、モデルが実際の軍事行動を管理する法的および倫理的規則に従うかどうかを検証していない。
ARMOR 2025は、軍法、包括規則、合同倫理規則の3つの中核的軍事教義に根ざした軍事的整合安全ベンチマークである。
- 参考スコア(独自算出の注目度): 12.143340960229098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are now being explored for defense applications that require reliable and legally compliant decision support. They also hold significant potential to enhance decision making, coordination, and operational efficiency in military contexts. These uses demand evaluation methods that reflect the doctrinal standards that guide real military operations. Existing safety benchmarks focus on general social risks and do not test whether models follow the legal and ethical rules that govern real military operations. To address this gap, we introduce ARMOR 2025, a military aligned safety benchmark grounded in three core military doctrines the Law of War, the Rules of Engagement, and the Joint Ethics Regulation. We extract doctrinal text from these sources and generate multiple choice questions that preserve the intended meaning of each rule. The benchmark is organized through a taxonomy informed by the Observe Orient Decide Act (OODA) decision making framework. This structure enables systematic testing of accuracy and refusal across military relevant decision types. This benchmark features a structured 12-category taxonomy, 519 doctrinally grounded prompts, and rigorous evaluation procedures applied to 21 commercial LLMs. Evaluation results reveal critical gaps in safety alignment for military applications.
- Abstract(参考訳): 大規模言語モデル(LLM)は現在、信頼性と法的に準拠した決定サポートを必要とする防衛アプリケーションのために検討されている。
また、軍事的文脈における意思決定、調整、運用効率を高める大きな可能性を秘めている。
これらは、実際の軍事作戦を導く教義的な基準を反映した需要評価手法を使用する。
既存の安全ベンチマークは一般的な社会的リスクに焦点を当てており、モデルが実際の軍事行動を管理する法的および倫理的規則に従うかどうかを検証していない。
このギャップに対処するため、兵法、包括規則、合同倫理規則の3つの中核的軍事教義に根ざした軍事的整合安全ベンチマークであるARMOR 2025を導入する。
これらの資料から教義テキストを抽出し,ルールの意図した意味を保存するための複数の選択質問を生成する。
このベンチマークは、OODA(Observe Orient Decide Act)意思決定フレームワークによって通知される分類によって編成される。
この構造は、軍事関係の意思決定タイプにまたがって、正確さの体系的なテストと拒絶を可能にする。
このベンチマークでは、構造化された12カテゴリーの分類、519の教義的な接地プロンプト、21の商業LSMに適用された厳密な評価手順が特徴である。
評価結果から、軍事用途における安全アライメントの重大なギャップが明らかになった。
関連論文リスト
- WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making [14.561500413856642]
大規模言語モデルは、安全クリティカルな軍事アプリケーションへの展開のために、ますます検討されている。
既存のフレームワークは通常、国際人道法(IHL)に基づく厳格な法的制約を無視し、エッジコンピューティングの制限を省略し、明確な推論を不十分に評価する。
本稿では,4つの異なるストレス試験次元とともに基礎的戦術的ベースラインを確立する総合的な評価フレームワークであるWARBENCHについて述べる。
論文 参考訳(メタデータ) (2026-03-22T15:13:29Z) - PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice [67.71760070255425]
本稿では,大規模言語モデル (LLM) を評価するための実践的ベンチマークであるPLawBenchを紹介する。
PLawBenchは、13の実践的な法的シナリオにわたる850の質問で構成され、各質問には専門家が設計した評価ルーブが伴っている。
人間の専門的判断に合わせたLLMに基づく評価器を用いて,10種類の最先端のLLMを評価した。
論文 参考訳(メタデータ) (2026-01-23T11:36:10Z) - COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs [19.742967013586927]
本稿では,大規模言語モデルが組織的な許容範囲と否定範囲のポリシーに準拠しているかどうかを評価するための最初の体系的枠組みを提案する。
モデルは正当な要求を確実に処理するが、破滅的に禁止を強制することに失敗し、敵の否定主義違反の13-40%しか否定しないことを示す。
論文 参考訳(メタデータ) (2026-01-05T06:57:45Z) - Red Lines and Grey Zones in the Fog of War: Benchmarking Legal Risk, Moral Harm, and Regional Bias in Large Language Model Military Decision-Making [0.0]
本研究では,ターゲット行動における法的・道徳的リスクの側面を評価するためのベンチマークフレームワークを開発する。
我々は国際人道法(IHL)と軍事教義に基づく4つの指標を紹介する。
GPT-4o, Gemini-2.5, LLaMA-3.1の3つのフロンティアモデルを90個のマルチエージェント・マルチターン危機シミュレーションにより評価した。
論文 参考訳(メタデータ) (2025-10-03T20:55:04Z) - The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment [0.0]
ローフォローAI(Law-Following AI)」は、先進的なAIエージェントのための超越的な設計目標として、法的コンプライアンスを組み込むことを目的としている。
エージェントの不正調整に関する最近の研究は、詐欺、脅迫、有害な行為に携わる有能なAIエージェントが、偏見的指示を欠いていることを示している。
コンプライアンスと欠陥検出のための"Lex-TruthfulQA"ベンチマーク,(ii)モデル自己概念に合法的な行為を埋め込むアイデンティティ形成介入,(iii)デプロイ後監視のための制御理論尺度を提案する。
論文 参考訳(メタデータ) (2025-09-08T16:00:55Z) - Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning [53.92712851223158]
安全とプライバシの問題を文脈整合性(CI)理論に従って文脈整合性問題に定式化する。
CIフレームワークの下では、当社のモデルを3つの重要な規制基準 – EU AI ActとHIPAA – に整合させています。
我々は、安全・プライバシー基準の遵守を高めつつ、文脈推論能力を高めるためにルールベースの報酬を持つ強化学習(RL)を採用している。
論文 参考訳(メタデータ) (2025-05-20T16:40:09Z) - The GPT Dilemma: Foundation Models and the Shadow of Dual-Use [0.0]
本稿では、基礎モデルの二重利用課題と、国際安全保障に影響を及ぼすリスクについて検討する。
本稿では,基礎モデルの開発サイクルにおいて,モデル入力,機能,システム利用事例,システム展開の4つの重要な要因を分析した。
本稿では、中距離原子力軍(INF)条約をケーススタディとして、関連するリスクを軽減するためのいくつかの戦略を提案する。
論文 参考訳(メタデータ) (2024-07-29T22:36:27Z) - ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming [64.86326523181553]
ALERTは、新しいきめ細かいリスク分類に基づいて安全性を評価するための大規模なベンチマークである。
脆弱性を特定し、改善を通知し、言語モデルの全体的な安全性を高めることを目的としている。
論文 参考訳(メタデータ) (2024-04-06T15:01:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。