論文の概要: HazardWeaver: Scientific Route Selection for Hazard Analysis Agents
- arxiv url: http://arxiv.org/abs/2610.03591v1
- Date: Fri, 02 Oct 2026 16:59:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.496639
- Title: HazardWeaver: Scientific Route Selection for Hazard Analysis Agents
- Title(参考訳): HazardWeaver:ハザード分析エージェントのための科学的ルート選択
- Abstract要約: 本稿では,ハザードウィーバー(HazardWeaver)について紹介する。
HazardWeaverは既存のエージェントシステムよりも優れており、複数の科学的経路を持つタスクにおいて最大の利益を得ている。
私たちのコードはhttps://github.com/LabRAI/HazardWeaver.comで公開されています。
- 参考スコア(独自算出の注目度): 58.912078868240634
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding and assessing natural hazards is essential for disaster preparedness and risk reduction. Recent advances in large language models have spurred growing interest in AI agents for hazard analysis, particularly their ability to integrate scientific data, models, and tools into automated workflows. However, effective automation requires agents to determine which scientific methods are appropriate for a given event and executable with the available data and tools. As new evidence and execution results become available, these conditions can change, requiring agents to reconsider their choices. We formulate this problem as state-dependent scientific route selection and introduce HazardWeaver. Specifically, HazardWeaver first leverages the Hazard Knowledge Compiler to extract evidence-linked conditions governing scientific applicability, then its Hazard Capability Graph represents executable scientific capabilities and checks compatibility between their inputs and outputs. Using these complementary representations, the Hazard Weaver Agent component selects applicable and executable routes, carries out their workflows, and revises its decisions as the analysis state changes. To evaluate both the scientific outputs and the decisions that produce them, we introduce the Hazard Weaver Benchmark, comprising 141 instances across seven single-hazard domains and four multi-hazard interaction classes. The benchmark accommodates multiple valid scientific routes and evaluates output correctness, route validity, and justified abstention. Extensive experiments on this benchmark show that HazardWeaver outperforms existing agent systems, with the largest gains on tasks with multiple eligible scientific routes. Our code is publicly available at https://github.com/LabRAI/HazardWeaver.
- Abstract(参考訳): 自然災害の理解と評価は、災害の準備とリスク低減に不可欠である。
大規模言語モデルの最近の進歩は、ハザード分析、特に科学データ、モデル、ツールを自動化ワークフローに統合する能力に対するAIエージェントへの関心が高まっている。
しかし、効果的な自動化には、エージェントが与えられたイベントにどの科学的手法が適しているかを判断し、利用可能なデータやツールで実行する必要がある。
新しい証拠と実行結果が利用可能になると、これらの条件は変更され、エージェントは選択を再考する必要がある。
我々は、この問題を国家依存の科学的ルート選択として定式化し、HazardWeaverを紹介した。
具体的には、HazardWeaverはまずHazard Knowledge Compilerを活用して、科学的適用性を管理するエビデンス関連条件を抽出し、Hazard Capability Graphは実行可能な科学的能力を示し、入力と出力の互換性をチェックする。
これらの補完的な表現を使用して、Hazard Weaver Agentコンポーネントは、適用可能なルートと実行可能なルートを選択し、ワークフローを実行し、分析状態が変更されるにつれてその決定を改訂する。
7つの単一ハザードドメインと4つのマルチハザード相互作用クラスにまたがる141のインスタンスからなるハザードウィーバーベンチマークを導入する。
このベンチマークは、複数の有効な科学的経路に対応し、出力の正確性、経路の妥当性、正当化された棄権を評価する。
このベンチマークの大規模な実験は、ハザードウィーバーが既存のエージェントシステムより優れており、複数の科学的経路を持つタスクにおいて最大の利益を得ていることを示している。
私たちのコードはhttps://github.com/LabRAI/HazardWeaver.comで公開されています。
関連論文リスト
- OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software [54.375425166090245]
OSWorldScienceは、科学的に意味のあるタスク、アーティファクト評価、効率的なエージェントハーネスを組み合わせたベンチマークと評価環境である。
ベンチマークには12のVLMと、いくつかの科学領域とソフトウェア構成にわたる146の高品質タスクが含まれている。
以上の結果から,現在の最先端のVLMは,科学的領域において重要な問題に対処する上で,依然として課題に直面していることが明らかとなった。
論文 参考訳(メタデータ) (2026-09-30T15:03:05Z) - SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring [45.617708056629766]
我々はSciHazardを紹介した。SciHazardは、科学的リスクのための実世界のベンチマークであり、有害性を測定するためのデータセット評価フレームワークである。
SciHazardには、12の分野にわたる2400の有害な質問と600の過度な質問が含まれている。
TextscDeHarm-Scoreは、最強のベースラインに対して、エキスパートアノテーションとの合意を90.17%改善している。
論文 参考訳(メタデータ) (2026-07-21T03:25:01Z) - Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents [10.651628193254028]
SciTraceは、科学エージェントパイプラインのすべてのステージに安全推論を織り込むフレームワークである。
240のリスクの高い研究課題と120のツール関連リスクタスクを6つの科学的領域に分散して評価した。
論文 参考訳(メタデータ) (2026-06-06T15:44:50Z) - SciNav: A General Agent Framework for Scientific Coding Tasks [12.136493066748391]
科学的コーディングタスクのためのエージェントフレームワークSciNav(Scientific Navigator)を紹介する。
我々のフレームワークは、制約付き検索予算の下で動作するように設計されている。
2つのベンチマークで異なるタイプのタスクにまたがってエージェントの有効性を示す。
論文 参考訳(メタデータ) (2026-03-11T11:57:51Z) - Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale [82.20980951765891]
エージェントサイエンスのスケーリングにはインフラストラクチャ・アンド・エコシステムアプローチが必要である,と我々は主張する。
BohriumはAI4S資産のマネージドでトレース可能なハブとして機能し、多様な科学データ、ソフトウェア、計算、実験室のシステムをエージェント対応の能力に変換する。
SciMasterはこれらの機能を長い水平科学に編成し、科学エージェントを合成して実行することができる。
論文 参考訳(メタデータ) (2025-12-23T16:04:41Z) - Quantifying detection rates for dangerous capabilities: a theoretical model of dangerous capability evaluations [47.698233647783965]
危険なAI能力を時間とともに追跡する定量的モデルを提案する。
私たちのゴールは、ポリシーと研究コミュニティが、いかに危険な能力テストがAIのリスクに近づくかを早期に警告できるかを可視化するのを支援することです。
論文 参考訳(メタデータ) (2024-12-19T22:31:34Z) - Control Risk for Potential Misuse of Artificial Intelligence in Science [85.91232985405554]
我々は、科学におけるAI誤用の危険性の認識を高めることを目的としている。
化学科学における誤用の実例を取り上げる。
我々は、科学におけるAIモデルの誤用リスクを制御するSciGuardというシステムを提案する。
論文 参考訳(メタデータ) (2023-12-11T18:50:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。