論文の概要: Evaluating the Reliability of Multiple Large Language Models in Risk Assessment: A CIS Controls Based Approach
- arxiv url: http://arxiv.org/abs/2605.05424v1
- Date: Wed, 06 May 2026 20:33:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.408819
- Title: Evaluating the Reliability of Multiple Large Language Models in Risk Assessment: A CIS Controls Based Approach
- Title(参考訳): リスク評価における複数大言語モデルの信頼性の評価:CIS制御に基づくアプローチ
- Abstract要約: 本研究は、技術・行政管理の適切な実施を確実にするための重要なステップとして、人間専門家を検証プロセスに統合することを提案する。
我々は、サイバーセキュリティリスクアセスメントに大規模言語モデルのみを使用することが可能であるかどうかを、50人の人間専門家の回答から分析した。
その結果、大規模な言語モデルは、人間の専門家と比べてサイバーセキュリティのリスクを常に過小評価していることが明らかとなった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Proper implementation of technical and administrative controls reinforces an organization's cybersecurity posture and business resilience, reduces risks, and enhances governance, ultimately elevating business maturity. The dynamics of the technological landscape and emerging threats negatively affect the most diverse companies, regardless of their size. This, associated with a global gap in the cybersecurity workforce, imposes enormous challenges and the need for a profound change in how companies respond to threats. Generative Artificial Intelligence from large language models has become an influential tool across various companies, emerging as a viable option to help address those challenges while partially addressing the shortage of skilled labor. Although large language models can help in this scenario, there may be risks, such as generating unreliable or 'hallucinated' content, which could lead people and companies to make bad decisions. Our study proposes integrating human experts into the validation process as a crucial step toward ensuring the proper implementation of technical and administrative controls. Furthermore, we sought to identify how large language models perform in assessing cybersecurity risk scenarios compared to human experts, highlighting the importance of integrating humans and machines in the cybersecurity risk assessment process. Using a questionnaire with risk scenarios, we analyzed responses from 50 human experts. We compared their responses with those of five popular large language models to determine whether it is possible to use only large language models for cybersecurity risk assessment. The results reveal that the large language models consistently underestimated cybersecurity risks compared to human experts, reinforcing the need for human oversight and suggesting that LLMs should be used as complementary tools rather than standalone assessors.
- Abstract(参考訳): 技術および管理管理の適切な実施は、組織のサイバーセキュリティ姿勢とビジネスのレジリエンスを強化し、リスクを減らし、ガバナンスを強化し、最終的にビジネスの成熟度を高める。
技術的景観と新興の脅威のダイナミクスは、その規模に関わらず、最も多様な企業に悪影響を及ぼす。
これは、サイバーセキュリティの労働力のグローバルなギャップと結びつき、巨大な課題を課し、企業が脅威にどう対処するかに大きな変化を起こす必要がある。
大規模言語モデルから生成する人工知能は、様々な企業において影響力のあるツールとなり、熟練した労働力の不足に部分的に対処しながら、これらの課題に対処するための有効な選択肢として浮上している。
大規模な言語モデルは、このシナリオに役立ちますが、信頼できないコンテンツや"ハロゲン化"コンテンツを生成するようなリスクがあり、それによって人々や企業が悪い決断を下す可能性があるのです。
本研究は,技術・行政管理の適切な実施を確実にするための重要なステップとして,人間専門家を検証プロセスに統合することを提案する。
さらに,人間の専門家と比較して,大規模言語モデルがサイバーセキュリティリスクのシナリオを評価する上でどのような効果があるかを見極め,サイバーセキュリティリスク評価プロセスにおける人間と機械の統合の重要性を強調した。
リスクシナリオを用いた質問紙調査を行い,50名の人間専門家の回答を分析した。
サイバーセキュリティリスクアセスメントに大規模言語モデルのみを使用することが可能であるかどうかを判断するため、これらの回答を5つの一般的な大規模言語モデルと比較した。
その結果、大規模な言語モデルは、人間の専門家と比べてサイバーセキュリティのリスクを常に過小評価し、人間の監視の必要性を強化し、LCMを独立したアセスメントではなく補完的なツールとして使うべきであることが示唆された。
関連論文リスト
- Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5 [61.787178868669265]
この技術レポートは、サイバー犯罪、説得と操作、戦略上の詐欺、制御されていないAIR&D、自己複製の5つの重要な側面について、更新されきめ細かな評価を提示する。
この作業は、現在のAIフロンティアのリスクに対する理解を反映し、これらの課題を軽減するための集団行動を促します。
論文 参考訳(メタデータ) (2026-02-16T04:30:06Z) - Toward Quantitative Modeling of Cybersecurity Risks Due to AI Misuse [50.87630846876635]
我々は9つの詳細なサイバーリスクモデルを開発する。
各モデルはMITRE ATT&CKフレームワークを使用して攻撃をステップに分解する。
個々の見積もりはモンテカルロシミュレーションによって集約される。
論文 参考訳(メタデータ) (2025-12-09T17:54:17Z) - PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach [49.14349403242654]
我々は、リスクを伴う行動に関わるモデルの確率を評価する新しいベンチマークフレームワークであるtextbfPropensityBench$を提示する。
私たちのフレームワークには,サイバーセキュリティ,自己増殖,バイオセキュリティ,化学セキュリティという,リスクの高い4つのドメインにまたがる6,648のツールを備えた,5,874のシナリオが含まれています。
オープンソースとプロプライエタリなフロンティアモデル全体で、私たちは9つの不確実性の兆候を発見しました。
論文 参考訳(メタデータ) (2025-11-24T18:46:44Z) - Leveraging Large Language Models for Cybersecurity Risk Assessment -- A Case from Forestry Cyber-Physical Systems [2.767743577831705]
安全クリティカルなソフトウェアシステムでは、サイバーセキュリティ活動が不可欠になる。
多くのソフトウェアチームでは、サイバーセキュリティの専門家は完全に欠席しているか、少数の専門家しか代表していない。
これにより、脆弱性や脅威を評価する上で、サイバーセキュリティの専門家やエンジニアをサポートするツールの必要性が生じる。
論文 参考訳(メタデータ) (2025-10-07T18:07:16Z) - A Proposal for Evaluating the Operational Risk for ChatBots based on Large Language Models [39.58317527488534]
3つの主要なステークホルダーに対する潜在的な脅威を同時に評価する新しいリスク評価指標を提案する。
メトリクスを検証するために、脆弱性テスト用のオープンソースのフレームワークであるGarakを活用しています。
その結果、セキュアで信頼性の高いAI駆動会話システムの運用における多次元リスクアセスメントの重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-05-07T20:26:45Z) - Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety [296.5392512998251]
我々は、敵攻撃、データ中毒、バックドア攻撃、ジェイルブレイクとプロンプトインジェクション攻撃、エネルギー遅延攻撃、データとモデル抽出攻撃、出現するエージェント固有の脅威を含む、大規模なモデルに対する安全脅威の包括的分類を提示する。
我々は、大規模なモデル安全性におけるオープンな課題を特定し、議論し、包括的な安全性評価、スケーラブルで効果的な防御機構、持続可能なデータプラクティスの必要性を強調します。
論文 参考訳(メタデータ) (2025-02-02T05:14:22Z) - LLM Cyber Evaluations Don't Capture Real-World Risk [0.0]
大規模言語モデル(LLMs)は、サイバーセキュリティアプリケーションにおける進歩を誇示している。
これらの能力によって引き起こされるリスクを評価するための現在の取り組みは、現実のインパクトを理解するという目標と不一致である、と我々は主張する。
論文 参考訳(メタデータ) (2025-01-31T05:33:48Z) - Adversarial Negotiation Dynamics in Generative Language Models [1.307537039737708]
生成言語モデルは、契約の起草と拡張にますます使われています。
これは、競合する当事者が異なる言語モデルを相互にデプロイするシナリオを生み出します。
我々は,主要なオープンソース言語モデルの性能と脆弱性を正面競争で評価する。
論文 参考訳(メタデータ) (2024-12-29T18:17:55Z) - Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey [63.4581186135101]
大規模言語モデル(LLM)は自然言語処理において顕著な進歩を遂げた。
プライバシーとセキュリティの問題は、そのライフサイクルを通じて明らかになっている。
この調査は、潜在的な対策の概要と分析である。
論文 参考訳(メタデータ) (2024-06-12T07:55:32Z) - Mapping LLM Security Landscapes: A Comprehensive Stakeholder Risk Assessment Proposal [0.0]
本稿では,従来のシステムにおけるリスク評価手法のようなツールを用いたリスク評価プロセスを提案する。
我々は、潜在的な脅威要因を特定し、脆弱性要因に対して依存するシステムコンポーネントをマッピングするためのシナリオ分析を行う。
3つの主要株主グループに対する脅威もマップ化しています。
論文 参考訳(メタデータ) (2024-03-20T05:17:22Z) - Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy [65.77763092833348]
この視点は、AI科学者の脆弱性を調べ、その誤用に関連する潜在的なリスクに光を当てる。
我々は、ユーザ意図、特定の科学的領域、およびそれらが外部環境に与える影響を考慮に入れている。
本稿では,人間規制,エージェントアライメント,環境フィードバックの理解を含む三段階的枠組みを提案する。
論文 参考訳(メタデータ) (2024-02-06T18:54:07Z) - Model evaluation for extreme risks [46.53170857607407]
AI開発のさらなる進歩は、攻撃的なサイバー能力や強力な操作スキルのような極端なリスクを引き起こす能力につながる可能性がある。
モデル評価が極端なリスクに対処するために重要である理由を説明します。
論文 参考訳(メタデータ) (2023-05-24T16:38:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。