論文の概要: SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring
- arxiv url: http://arxiv.org/abs/2607.18665v1
- Date: Tue, 21 Jul 2026 03:25:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.302012
- Title: SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring
- Title(参考訳): SciHazard: 分解したハームスコーリングによる科学安全リスク測定ベンチマーク
- Abstract要約: 我々はSciHazardを紹介した。SciHazardは、科学的リスクのための実世界のベンチマークであり、有害性を測定するためのデータセット評価フレームワークである。
SciHazardには、12の分野にわたる2400の有害な質問と600の過度な質問が含まれている。
TextscDeHarm-Scoreは、最強のベースラインに対して、エキスパートアノテーションとの合意を90.17%改善している。
- 参考スコア(独自算出の注目度): 45.617708056629766
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) increasingly support science, but they can also convert hazardous scientific knowledge into actionable misuse guidance. Existing benchmarks often rely on templated queries disconnected from real-world hazards, and employ LLM-as-a-Judge paradigms without domain grounding. To address this, we introduce SciHazard, a real-world-grounded benchmark for scientific risks and a dataset agnostic evaluation framework for measuring harmfulness. SciHazard contains 2400 hazardous questions and 600 oversafety questions across 12 disciplines, with both queries grounded in regulated entities and documented failure scenarios. To compute \textsc{DeHarm-Score} , we develop a decomposed evaluating procedure that combines query hazard severity, refusal behavior, and response-level risk. For non-refused responses, it further decomposes response-level harm into \textsc{Executability}, quantified via dynamic checklists with importance weighting, and \textsc{Net-new risk}, assessed through retrieval-augmented claim extraction and synthesis-barrier verification. An expert-validation study shows that \textsc{DeHarm-Score} improves agreement with expert annotations by 90.17\% over the strongest baseline. We benchmark 31 frontier LLMs and deep research agents in an extensive scientific safety evaluation. Notably, deep research agents yield 32.3\% higher mean \textsc{DeHarm-Score} than standard LLMs, exposing autonomous agents as a critical blind spot in current safety defenses. Code and dataset are available at https://anonymous.4open.science/r/DeharmScore-7B55.
- Abstract(参考訳): 大型言語モデル(LLM)は科学をますます支援しているが、有害な科学的知識を実用的な誤用ガイダンスに変換することもできる。
既存のベンチマークでは、現実のハザードから切り離されたテンプレートクエリに頼り、ドメイン基盤のないLLM-as-a-Judgeパラダイムを採用することが多い。
この問題に対処するために、SciHazardは、科学的リスクのための実世界のベンチマークであり、有害性を測定するためのデータセットに依存しない評価フレームワークである。
SciHazardには、12の分野にわたる2400の有害な質問と600の過度な質問が含まれている。
そこで本稿では,クエリハザードの重症度,拒否行動,応答レベルのリスクを組み合わせた,分解された評価手順を提案する。
非拡散応答に対しては、さらに応答レベルの害を、重み付けが重要となる動的チェックリストによって定量化された \textsc{Executability} と、検索強化されたクレーム抽出と合成バリア検証によって評価された \textsc{Net-new risk} に分解する。
エキスパートバリデーションの調査によると、‘textsc{DeHarm-Score} はエキスパートアノテーションとの合意を最強のベースラインに対して 90.17\% 改善している。
我々は31のフロンティアLSMとディープリサーチエージェントを広範囲な科学的安全性評価のためにベンチマークした。
特に、ディープ・リサーチ・エージェントは標準のLSMよりも32.3\%高い平均である「textsc{DeHarm-Score}」を出力し、現在の安全防衛における重要な盲点として自律的なエージェントを露出させる。
コードとデータセットはhttps://anonymous.4open.science/r/DeharmScore-7B55で公開されている。
関連論文リスト
- Muse Spark Safety & Preparedness Report [106.21435337776768]
Muse SparkはMetaが開発した最新の大規模言語モデルだ。
われわれはまず,MetaのAdvanced AI Scaling Frameworkの下で破滅的なリスクドメインの評価を行った。
次に、Muse Sparkの広範なコンテンツ安全性や行動プロファイルなど、さらなる考慮事項について論じる。
論文 参考訳(メタデータ) (2026-05-14T23:12:14Z) - SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond [134.43113804188195]
安全評価と科学的文脈の強化のための包括的枠組みであるSafeSciを紹介する。
SafeSciには、0.25Mサンプルを持つマルチディシプリナのベンチマークであるSafeSciBenchと、安全性向上のための1.5Mサンプルを含む大規模データセットであるSafeSciTrainが含まれている。
論文 参考訳(メタデータ) (2026-03-02T08:16:04Z) - DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering [28.427433335623217]
ステップバイステップ推論を統合したディープエビデンス評価エージェント(DeepEra)を提案する。
この研究は、2段階のRAGフレームワークにおいて、無視できないSSLI問題を包括的に研究し、実証的に検証した初めてのものである。
論文 参考訳(メタデータ) (2026-01-23T06:19:08Z) - BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers? [21.78901120638025]
製造指向の紙生成エージェントがマルチモデルLCMレビューシステムを欺くことができるかどうかを考察する。
我々のジェネレータは、実際の実験を必要としないプレゼンテーション操作戦略を採用している。
健全な集約数学にもかかわらず、整合性検査は体系的に失敗する。
論文 参考訳(メタデータ) (2025-10-20T18:37:11Z) - RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration [81.38705556267917]
大規模言語モデル(LLM)の既存の安全性評価手法は、固有の制約に悩まされている。
リスク概念空間を再構築する理論的枠組みを導入する。
マルチエージェント協調評価フレームワークRADARを提案する。
論文 参考訳(メタデータ) (2025-09-28T09:35:32Z) - SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents [11.817130554581436]
我々は、AI駆動科学探査における安全性と倫理的責任を高める革新的なAI科学者フレームワークであるtextbfSafeScientistを紹介する。
SafeScientistは倫理的に不適切な、あるいはリスクの高いタスクを積極的に拒否し、研究プロセスを通して安全を厳格に強調する。
我々は、科学的な文脈でAIの安全性を評価するために特別に設計された新しいベンチマークである textbfSciSafetyBenchを提案する。
論文 参考訳(メタデータ) (2025-05-29T15:35:58Z) - SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge [11.63268709958876]
SOSBenchは、大規模な言語モデルのための規制対象のハザード中心のベンチマークである。
化学、生物学、医学、薬理学、物理学、心理学の6つのリスクの高い分野をカバーしている。
SOSBenchを用いた統合評価フレームワークにおけるフロンティアモデルの評価を行った。
論文 参考訳(メタデータ) (2025-05-27T17:47:08Z) - Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models [29.569220030102986]
textbfBeyond Safe Answers (BSA) ベンチは,3つの異なるSSAシナリオタイプに構成された2,000のチャレンジインスタンスからなる,新しいベンチマークである。
19の最先端のLEMの評価では、このベンチマークの難しさが示され、最高性能のモデルはリスクの合理性を正確に識別する上で、わずか38.0%の精度しか達成していない。
我々の研究は、LEMの安全性推論の忠実さを評価し改善するための総合的な評価ツールを提供し、真にリスクを意識し、確実に安全なAIシステムの開発を進める。
論文 参考訳(メタデータ) (2025-05-26T08:49:19Z) - LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs [78.99703366417661]
大規模言語モデル(LLM)は、手続き的なガイダンスから自律的な実験オーケストレーションまで、タスクをますます支援している。
このような過度な信頼性は、リスク識別やリスクアセスメントの失敗が重大事故を引き起こす高リスクな実験室環境では特に危険である。
実験室安全ベンチマーク (LabSafety Bench) を提案し, 潜在的な危険を識別し, リスクを評価し, 実験室環境における安全でない行動の結果を予測する。
論文 参考訳(メタデータ) (2024-10-18T05:21:05Z) - SeCodePLT: A Unified Platform for Evaluating the Security of Code GenAI [58.29510889419971]
コード生成大型言語モデル(LLM)のセキュリティリスクと能力を評価するための既存のベンチマークは、いくつかの重要な制限に直面している。
手動で検証し、高品質なシード例から始める、汎用的でスケーラブルなベンチマーク構築フレームワークを導入し、ターゲット突然変異を通じて拡張する。
このフレームワークをPython、C/C++、Javaに適用すると、44のCWEベースのリスクカテゴリと3つのセキュリティ機能にまたがる5.9k以上のサンプルデータセットであるSeCodePLTが構築されます。
論文 参考訳(メタデータ) (2024-10-14T21:17:22Z) - OR-Bench: An Over-Refusal Benchmark for Large Language Models [65.34666117785179]
大きな言語モデル(LLM)は、悪意のある出力を防ぐために慎重に安全アライメントを必要とする。
本研究では,大規模なオーバーリファレンスデータセットの自動生成手法を提案する。
OR-Benchは,最初の大規模オーバーリファレンスベンチマークである。
論文 参考訳(メタデータ) (2024-05-31T15:44:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。