論文の概要: Towards an Automated Test of LLM Security Knowledge
- arxiv url: http://arxiv.org/abs/2607.18496v3
- Date: Wed, 29 Jul 2026 16:59:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 16:47:49.708039
- Title: Towards an Automated Test of LLM Security Knowledge
- Title(参考訳): LLMセキュリティ知識の自動テストに向けて
- Authors: Shufan Chai, Liangliang Sun, Jessica Staddon,
- Abstract要約: 大規模言語モデル(LLM)は、ソフトウェア、ハードウェア、人間中心のセキュリティタスクにますます使われている。
セキュリティ領域のLLM知識を部分的に自動評価する手法を提案する。
- 参考スコア(独自算出の注目度): 2.2257399538053817
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) are increasingly used for a range of software, hardware and human-centered security tasks. Consequently, LLM performance on security tasks is an active area of measurement and research, often with a focus on identifying areas in which LLM security "knowledge" may be insufficient. Popular strategies for identifying LLM security knowledge gaps include building corpora of challenge questions or task benchmarks, strategies that require substantial manual work and security expertise to design and execute. We introduce a partially-automated method for assessing LLM knowledge of a security area. The method uses authoritative information from Consumer Protection Agencies (CPAs) to identify instability in LLM responses that can be indicative of knowledge gaps. We demonstrate the method for 2 security topics, identity theft and impostor scams, and 5 LLMs in 2 leading LLM families, Gemini and GPT, using publicly available information about identity theft and impostor scams from 6 CPAs. The method distinguishes between models that have and don't have sufficient knowledge to accurately identify the security topics in text narratives.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ソフトウェア、ハードウェア、人間中心のセキュリティタスクにますます使われている。
したがって、セキュリティタスクにおけるLLMのパフォーマンスは計測と研究の活発な領域であり、しばしばLLMセキュリティの"知識"が不十分な領域を特定することに重点を置いている。
LLMのセキュリティ知識ギャップを特定するための一般的な戦略には、課題やタスクベンチマークのコーパスの構築、大規模な手作業を必要とする戦略、設計と実行のためのセキュリティ専門知識などがある。
セキュリティ領域のLLM知識を部分的に自動評価する手法を提案する。
この方法は、消費者保護機関(CPA)からの権威情報を用いて、知識ギャップを示すことができるLCM応答の不安定性を特定する。
本稿では,2つのセキュリティトピック,ID盗難とインポスタ詐欺,および2つの主要なLLMファミリーであるGeminiとGPTにおける5つのLLMについて,ID盗難と6つのCPAからのインポスタ詐欺に関する公開情報を用いて実証する。
この方法は、テキスト物語におけるセキュリティトピックを正確に識別するのに十分な知識を持っていないモデルを区別する。
関連論文リスト
- AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents [48.925168866726814]
AgentAuditorは、トレーニングなし、メモリ拡張推論フレームワークである。
ASSEBenchは、LLMベースの評価器が安全リスクとセキュリティ上の脅威の両方を見つけることができるかを確認するために設計された最初のベンチマークである。
論文 参考訳(メタデータ) (2025-05-31T17:10:23Z) - Do LLMs Consider Security? An Empirical Study on Responses to Programming Questions [10.69738882390809]
ChatGPTは、開発者にコンテキスト固有の情報をボランティアして、安全なコーディングプラクティスを促進する。
我々は,3つのLLM(Claude 3, GPT-4, Llama 3)が示すセキュリティ意識の程度を評価する。
私たちの調査によると、3つのモデルすべてが、脆弱性を正確に検知し、ユーザに警告するのに苦労しており、データセット全体の検出率は12.6%から40%に過ぎません。
論文 参考訳(メタデータ) (2025-02-20T02:20:06Z) - Emerging Security Challenges of Large Language Models [6.151633954305939]
大規模言語モデル(LLM)は、多くの異なる分野において短期間で記録的な普及を遂げた。
これらは、特定の下流タスクに合わせて調整されることなく、多様なデータでトレーニングされたオープンエンドモデルである。
従来の機械学習(ML)モデルは、敵の攻撃に対して脆弱である。
論文 参考訳(メタデータ) (2024-12-23T14:36:37Z) - Global Challenge for Safe and Secure LLMs Track 1 [57.08717321907755]
LLM(Global Challenge for Safe and Secure Large Language Models)は、AI Singapore(AISG)とCyberSG R&D Programme Office(CRPO)が主催する先駆的イニシアチブである。
本稿では,AI Singapore(AISG)とCyberSG R&D Programme Office(CRPO)が組織した先駆的イニシアチブであるLLM(Global Challenge for Safe and Secure Large Language Models)を紹介する。
論文 参考訳(メタデータ) (2024-11-21T08:20:31Z) - Large Language Model Supply Chain: Open Problems From the Security Perspective [25.320736806895976]
大規模言語モデル(LLM)はソフトウェア開発パラダイムを変えつつあり、学術と産業の両方から大きな注目を集めています。
各コンポーネントの潜在的なセキュリティリスクとLCM SCのコンポーネント間の統合について議論する第一歩を踏み出します。
論文 参考訳(メタデータ) (2024-11-03T15:20:21Z) - SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types [21.683010095703832]
本研究では,大規模言語モデル(LLM)の安全性を様々なタスクやプロンプトタイプにまたがる一般化を評価するための新しいベンチマークを開発する。
このベンチマークは、生成的および識別的評価タスクを統合し、LLMの安全性に対する迅速なエンジニアリングとジェイルブレイクの影響を調べるための拡張データを含む。
評価の結果,ほとんどのLDMは生成的タスクよりも差別的タスクが悪く,プロンプトに非常に敏感であり,安全アライメントの一般化が不十分であることが示唆された。
論文 参考訳(メタデータ) (2024-10-29T11:47:01Z) - The Emerged Security and Privacy of LLM Agent: A Survey with Case Studies [58.94148083602662]
大規模言語モデル(LLM)エージェントは複雑なタスクを実行するために進化してきた。
LLMエージェントの幅広い応用は、その商業的価値を示している。
しかし、セキュリティとプライバシの脆弱性も公開している。
この調査は、LLMエージェントが直面しているプライバシーとセキュリティの問題を包括的に概観することを目的としている。
論文 参考訳(メタデータ) (2024-07-28T00:26:24Z) - CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language Models [60.59638232596912]
大規模言語モデル(LLM)を評価するベンチマークであるCLAMBERを紹介する。
分類を基盤として12Kの高品質なデータを構築し, 市販のLCMの強度, 弱点, 潜在的なリスクを評価する。
本研究は, あいまいなユーザクエリの特定と明確化において, 現在のLCMの実用性に限界があることを示唆する。
論文 参考訳(メタデータ) (2024-05-20T14:34:01Z) - Safety Assessment of Chinese Large Language Models [51.83369778259149]
大規模言語モデル(LLM)は、侮辱や差別的なコンテンツを生成し、誤った社会的価値を反映し、悪意のある目的のために使用されることがある。
安全で責任があり倫理的なAIの展開を促進するため、LLMによる100万の強化プロンプトとレスポンスを含むセーフティプロンプトをリリースする。
論文 参考訳(メタデータ) (2023-04-20T16:27:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。