論文の概要: A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models
- arxiv url: http://arxiv.org/abs/2607.12200v1
- Date: Mon, 13 Jul 2026 23:03:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.978039
- Title: A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models
- Title(参考訳): 最前線言語モデルにおけるCBRNアップリフト評価のための閾値実行フレームワーク
- Authors: Rahul Gupta, Abhinav Mohanty, Payal Motwani, Venkatesh Saligrama, Satyapriya Krishna, Connor Harris, Gary Anthony Ackerman, Brandon Behlendorf, Tom Hobson, Theodore Wilson, Spyros Matsoukas,
- Abstract要約: 本稿では,Threshold Exceedance Criteria (TEC) フレームワークを導入し,アップリフトスタディを独立して実行可能なコンポーネントに分解する。
本研究では, 大規模な実証研究において, 生成と修正の2つの形態を決定する設計を用いて, フレームワークを運用する。
この制御されたプレリリース評価の下では、モデル支援プランはエキスパート相当の教育評価を受けることもあったが、物質上昇は放射線領域に限られていた。
- 参考スコア(独自算出の注目度): 24.182759489900537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As frontier language models advance, policymakers and model developers need methods for assessing whether model access materially increases a non-expert actor's ability to plan high-consequence Chemical, Biological, Radiological, or Nuclear (CBRN) misuse relative to public tools alone. Existing CBRN evaluations differ in non-expert definitions, threat scope, baselines, scoring rubrics, and decision rules, making results difficult to compare across studies. We introduce a Threshold Exceedance Criteria (TEC) framework that decomposes an uplift study into independently executable components: determining non-expert participant eligibility, defining the CBRN threat scope for the study, and statistically estimating material uplift. We then operationalize the TEC framework in a large-scale empirical study using a design that determines two forms of uplift: generative (where a model assists plan creation from scratch) and revisionist (where a model assists refinement of an existing plan). The study produced attack plans across the CBRN domains, which we evaluated through subject-matter-expert review to estimate generative and revisionist uplift. Applying the framework, our empirical study revealed domain heterogeneity: under this controlled pre-release evaluation, model-assisted plans sometimes received expert-equivalent instructional ratings, but confirmed material uplift was limited to the radiological domain. These findings informed mitigation and deployment-governance decisions rather than characterizing deployed model behavior. We conclude with methodological lessons for future CBRN uplift evaluations, emphasizing prespecified criteria, explicit baselines, separation of generative and revisionist estimates, and careful distinction between preliminary screening signals and confirmed risk determinations.
- Abstract(参考訳): フロンティア言語モデルが進歩するにつれて、政策立案者やモデル開発者は、モデルアクセスが一般のツールのみに対して高頻度の化学、生物、放射線学、核(CBRN)の誤用を計画する非専門家の能力を大幅に向上させるかどうかを評価する方法を必要としている。
既存のCBRN評価は、非専門家の定義、脅威範囲、ベースライン、スコアリングルーリック、および決定規則で異なり、その結果を研究全体で比較することは困難である。
本研究では,Treshold Exceedance Criteria(TEC)フレームワークを導入し,無エキスパート参加者の適格性の決定,CBRNの脅威範囲の定義,材料アップリフトの統計的推定を行う。
次に、生成的(モデルがスクラッチから計画作成を支援する)と修正主義者(モデルが既存の計画の洗練を支援する)の2つの形態を決定する設計を用いて、大規模な実証的研究でTECフレームワークを運用する。
本研究はCBRNドメイン全体に対する攻撃計画を作成し,本研究の主観的評価を通じて,生成性および修正性の向上を推定した。
この制御されたプレリリース評価では、モデル支援プランは、専門家と同等の教育的評価を受けることがあるが、確認された物質上昇は、放射線領域に限られていた。
これらの結果は、デプロイされたモデルの振る舞いを特徴付けるのではなく、緩和とデプロイメントのガバナンスの決定を通知した。
今後のCBRNアップリフト評価の方法論的授業,事前基準の強調,明示的基準,生成的および再検討的推定の分離,事前スクリーニング信号と確認されたリスク判定との注意深い区別を結論付けた。
関連論文リスト
- Model Validation of Agentic AI Systems: A POMDP-Based Framework for Belief-State, Forecast, and Policy Validation [0.0]
本稿では,部分観測可能なマルコフ決定プロセス(POMDP)に基づくエージェントAIのモデル検証フレームワークを提案する。
このフレームワークは、自律的な意思決定を情報、信念、予測、行動、ユーティリティに分解し、各コンポーネントを独立して検証できるようにする。
この論文の主な貢献は、確立されたモデルリスク管理概念を自律型AIシステムに拡張するための実践的なフレームワークである。
論文 参考訳(メタデータ) (2026-06-16T00:40:55Z) - Position: Anthropomorphic Misalignment Research Needs Stronger Evidence [52.76826423649968]
概念的曖昧さ,非ロバストデータセット,実験設計,不十分な因果的介入が,モデル行動の過度な解釈につながることを示す。
本研究の目的は,AMRの方法論的厳密性向上に寄与する明らかな考察のガイダンスを提供することである。
論文 参考訳(メタデータ) (2026-05-29T16:38:53Z) - A Multi-dimensional Framework for Evaluating Generalization in EEG Foundation Models [48.385356148620815]
最近のEEGファンデーションモデルは、タスクとデータセット間で有望な転送機能を示している。
低リソース環境下での脳波モデル評価のための多次元評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-27T14:51:54Z) - Medical AI Consensus: A Multi-Agent Framework for Radiology Report Generation and Evaluation [0.2039123720459736]
放射線学のエコシステムにおけるマルチモーダルな臨床推論のためのベンチマークおよび評価環境として機能するマルチエージェント強化学習フレームワークを提案する。
提案フレームワークは,画像解析,特徴抽出,レポート生成,レビュー,評価を担当する10の特殊エージェントからなるモジュールアーキテクチャにおいて,大規模言語モデル(LLM)と大規模ビジョンモデル(LVM)を統合する。
論文 参考訳(メタデータ) (2025-09-22T04:31:27Z) - Technical Report: Facilitating the Adoption of Causal Inference Methods Through LLM-Empowered Co-Pilot [44.336297829718795]
CATE-Bは,大規模言語モデル(LLM)をエージェントフレームワーク内で使用して,治療効果推定を通じてユーザを誘導する,オープンソースのコパイロットシステムである。
CATE-B は (i) 因果発見と LLM に基づくエッジオリエンテーションによる構造因果モデルの構築、 (ii) 因果構造とデータセット特性に適合した適切な回帰方法を選択することによるロバストな調整セットの同定を支援する。
論文 参考訳(メタデータ) (2025-08-14T12:20:51Z) - Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting Framework [77.45983464131977]
我々は、RAGモデルの予測が誤りであり、現実のアプリケーションにおいて制御不能なリスクをもたらす可能性がどの程度あるかに焦点を当てる。
本研究は,RAGの予測に影響を及ぼす2つの重要な潜伏要因を明らかにする。
我々は,これらの要因をモデルに誘導し,その応答に与える影響を解析する,反実的プロンプトフレームワークを開発した。
論文 参考訳(メタデータ) (2024-09-24T14:52:14Z) - StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation [46.59416831869014]
本稿では,StructEvalと呼ばれる新しい評価フレームワークを提案する。
原子テストの目的から始めて、StructEvalは、複数の認知レベルと批判的概念にまたがって構造化された評価を行うことによって、評価をさらに深め、拡張する。
広く使用されている3つのベンチマークの実験は、StructEvalがデータ汚染のリスクに抵抗する信頼性の高いツールであることを示している。
論文 参考訳(メタデータ) (2024-08-06T16:28:30Z) - GenBench: A Benchmarking Suite for Systematic Evaluation of Genomic Foundation Models [56.63218531256961]
我々はGenomic Foundation Modelsの有効性を評価するためのベンチマークスイートであるGenBenchを紹介する。
GenBenchはモジュラーで拡張可能なフレームワークを提供し、様々な最先端の方法論をカプセル化している。
本稿では,タスク固有性能におけるモデルアーキテクチャとデータセット特性の相互作用のニュアンス解析を行う。
論文 参考訳(メタデータ) (2024-06-01T08:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。