論文の概要: A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.02684v2
- Date: Wed, 05 Aug 2026 14:49:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 17:51:08.552529
- Title: A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
- Title(参考訳): アライメントにおける盲点:大規模言語モデルにおけるバイオセキュリティリスクの定量化
- Authors: Shu Quan, Tianfang Hao, Sitong Fang, He Geng, Jiayi Zhou, Boyuan Chen, Kaile Wang, Donghai Hong, Juntao Dai, Yaodong Yang, Jiaming Ji,
- Abstract要約: 大きな言語モデル(LLM)は生物学的研究を加速しているが、この能力は重要なバイオセキュリティの脅威をもたらす。
現在の安全性評価は自然言語で行われており、モデル生成アミノ酸配列が生物学的ジベリッシュかどうかを判断できない。
LLMのより厳密なバイオセキュリティ評価を支援するために,SPIKE-BenchとBioSafe-Guardをリリースする。
- 参考スコア(独自算出の注目度): 24.33428502712115
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are accelerating biological research, yet this same capability poses a critical biosecurity threat: models that assist in protein engineering can equally be prompted to generate predicted toxin-like sequences, potentially lowering the barrier to biological misuse. Current safety evaluations, however, operate in natural language and cannot determine whether a model-generated amino acid sequence is biological gibberish or a computational risk signal. To address this evaluation blind spot, we introduce SPIKE-Bench, coupling 631 curated toxin-design prompts across seven functional categories with the SPIKE funnel, a three-stage protocol that filters output through compliance, biological plausibility, and predicted toxicity, producing stage-level diagnostics and an aggregate function-aware metric: the Functional Harmfulness Rate (FHR). An audit of 32 LLMs reveals that most models freely comply with toxin-design requests; FHR is driven primarily by biological generation capability rather than safety alignment, reaching 50.7%; and Refusal Rate fails to predict functional risk. As a first step toward mitigation, we provide BioSafe-Guard, a domain-specialized classifier that substantially reduces predicted functional risk while preserving benign utility. We release SPIKE-Bench and BioSafe-Guard at https://github.com/PKU-Alignment/SPIKE-Bench to support more rigorous biosecurity evaluation of LLMs.
- Abstract(参考訳): 大きな言語モデル(LLM)は生物学的研究を加速しているが、この能力は重要なバイオセキュリティの脅威をもたらす。
しかし、現在の安全性評価は自然言語で行われており、モデル生成アミノ酸配列が生物学的ジベリッシュであるか、あるいは計算リスク信号であるかは決定できない。
この評価盲点に対処するために,SPIKE-Bench,SPIKE-Bench,631キュレートされた毒素設計プロンプトを7つの機能カテゴリに結合するSPIKEファンネル,コンプライアンス,生物学的妥当性,予測毒性を通じて出力をフィルタリングする3段階プロトコル,ステージレベルの診断,機能的有害度率(FHR)という総合的な機能的指標を導入する。
32 LLMの監査では、ほとんどのモデルが毒素設計要求に自由に準拠していることが判明し、FHRは安全アライメントではなく生物生成能力によって駆動され、50.7%に達する。
緩和に向けた第一歩として、良質な実用性を維持しつつ、予測機能リスクを大幅に低減するドメイン特化分類器であるBioSafe-Guardを提供する。
我々はSPIKE-BenchとBioSafe-Guardをhttps://github.com/PKU-Alignment/SPIKE-Benchでリリースし、LSMのより厳密なバイオセキュリティ評価を支援する。
関連論文リスト
- An Early Warning of Emerging Biosecurity Risks in Frontier LLMs [62.01705276160883]
Intern-BioBreakerは、特殊な生体赤チームモデルであり、計算と物理を統合したフレームワークである。
このフレームワーク内では、Intern-BioBreakerがターゲットのjailbreakプロンプトを生成して、アライメントされたモデルを誘導して運用ガイダンスを提供することができるかどうかをテストする。
本評価では,テキストレベルの保護と,有能な科学モデルによるリスクとのギャップを明らかにする。
論文 参考訳(メタデータ) (2026-07-20T15:26:23Z) - MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules [60.55214893687032]
MolSafeEvalは、分子生成の安全性リスクを評価し分析するためのベンチマークである。
有害なデータベースからハザードルールまで、異質な安全知識を構造化された分子安全知識グラフに統合する。
MolSafeEvalは、現在の生成アプローチの安全性の脆弱性を体系的に明らかにすることによって、分子モデルのベンチマークのための新しいレンズを提供する。
論文 参考訳(メタデータ) (2026-07-01T05:33:51Z) - ViroBench: Benchmarking Nucleotide Foundation Models on Viral Genomics Tasks [86.89727311669937]
我々は、ヌクレオチド基礎モデル(NFM)に特化して設計された最初の包括的かつ大規模ベンチマークであるViroBenchを紹介する。
ViroBench氏は、生物学的理解と潜伏するバイオセキュリティリスクという、2つの重要な側面にわたるモデルを評価し、4つのタスクタイプ内の18のさまざまなシナリオをカバーしている。
ViroBenchは、ウイルスヌクレオチド基盤モデルの研究のための解釈可能、診断的評価および再現可能な測定フレームワークを提供する。
論文 参考訳(メタデータ) (2026-05-25T03:31:46Z) - BioShield: A Context-Aware Firewall for Securing Bio-LLMs [1.2694660563081597]
バイオLLMは、正当な研究クエリーのガイドの下で有害な生物学的洞察を生成するために利用することができる。
静的プロンプトフィルタリングのような既存のセーフガードは、Bio-LLMが動的生物学的およびアプリケーション層システムに埋め込まれている場合、不十分である。
両用攻撃に対してBio LLMを保護するために設計された,コンテキスト対応のアプリケーションレベルのファイアウォールであるBioShieldを提案する。
論文 参考訳(メタデータ) (2026-03-23T22:18:54Z) - Evaluating Proactive Risk Awareness of Large Language Models [30.312744244385822]
本稿では,大規模言語モデルが潜在的損害を予測できるかどうかを判断し,被害発生前に警告を与える,積極的なリスク認識評価フレームワークを提案する。
本研究では,バタフライデータセットを構築し,環境・生態分野におけるこの枠組みのインスタンス化を行う。
論文 参考訳(メタデータ) (2026-02-24T15:00:00Z) - Resilient Biosecurity in the Era of AI-Enabled Bioweapons [0.0]
既存のバイオセーフティ対策は、危険な出力を検出するために配列アライメントとタンパク質とタンパク質の相互作用予測に依存している。
The performance of three leading PPI prediction tools: AlphaFold 3, AF3complex and SpatialPPIv2。
いずれも実験的に検証された4つのSARS-CoV-2変異株の1つを同定できなかった。
論文 参考訳(メタデータ) (2025-08-30T18:09:04Z) - DISPROTBENCH: A Disorder-Aware, Task-Rich Benchmark for Evaluating Protein Structure Prediction in Realistic Biological Contexts [76.59606029593085]
DisProtBenchは、構造障害および複雑な生物学的条件下でタンパク質構造予測モデル(PSPM)を評価するためのベンチマークである。
DisProtBenchはデータの複雑さ、タスクの多様性、解釈可能性という3つの重要な軸にまたがっている。
その結果,機能的予測障害と相関する低信頼領域を有する障害下でのモデルロバスト性に有意な変動が認められた。
論文 参考訳(メタデータ) (2025-06-18T23:58:22Z) - Can Large Language Models Design Biological Weapons? Evaluating Moremi Bio [0.0]
我々の研究は1020の新規な毒性タンパク質と5,000の毒性の小さな分子を生み出した。
詳細な計算毒性評価の結果、全てのタンパク質が毒性が高いことが判明した。
バイオテクノロジーの急速な革新とバイオセキュリティ・インペラティブのバランスをとるために,ロバストなガバナンスと技術的保護の必要性が示唆された。
論文 参考訳(メタデータ) (2025-05-22T11:27:50Z) - SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models [50.34706204154244]
推論能力の獲得は、引き継がれた安全アライメントを壊滅的に劣化させる。
特定のシナリオは、25倍の攻撃率を被る。
MLRMは、厳密な推論と問合せの安全結合にもかかわらず、初期段階の自己補正を示す。
論文 参考訳(メタデータ) (2025-04-09T06:53:23Z) - LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs [78.99703366417661]
大規模言語モデル(LLM)は、手続き的なガイダンスから自律的な実験オーケストレーションまで、タスクをますます支援している。
このような過度な信頼性は、リスク識別やリスクアセスメントの失敗が重大事故を引き起こす高リスクな実験室環境では特に危険である。
実験室安全ベンチマーク (LabSafety Bench) を提案し, 潜在的な危険を識別し, リスクを評価し, 実験室環境における安全でない行動の結果を予測する。
論文 参考訳(メタデータ) (2024-10-18T05:21:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。