論文の概要: LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratories
- arxiv url: http://arxiv.org/abs/2607.23704v1
- Date: Sun, 26 Jul 2026 14:56:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.20745
- Title: LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratories
- Title(参考訳): LabRobFail: 化学自動運転研究所におけるロボット故障解析のベンチマーク
- Authors: Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang,
- Abstract要約: 本稿では,化学実験室におけるロボット故障解析の学習と評価を目的とした,障害中心のフレームワークであるLabRobFailを紹介する。
LabRobFail-Simは制御、物理、意味レベルで制御可能な障害を注入し、LabRobFail-Dataの構築を可能にする。
構造的故障診断と回復指示を生成するドメイン特化視覚言語モデルである LabRobFail-VLM を開発した。
- 参考スコア(独自算出の注目度): 52.26893354670174
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The deployment of embodied agents in self-driving laboratories could accelerate scientific discovery, yet their reliability is constrained by the irreversible and safety-critical nature of chemical experiments. Progress is further hindered by scarce failure data and the lack of fine-grained evaluation protocols. To address these challenges, we introduce LabRobFail, a failure-centric framework for learning and evaluating robotic failure analysis in chemical laboratories. LabRobFail-Sim injects controllable failures at the control, physics, and semantic levels, enabling the construction of LabRobFail-Data, which contains over 20,000 trajectories across 70+ task scenarios, five failure categories, and 11 fine-grained failure types. LabRobFail-Bench evaluates six capabilities spanning task understanding, failure detection, temporal localization, severity assessment, failure classification, and actionable correction. We further develop LabRobFail-VLM, a domain-specialized vision-language model that generates structured failure diagnoses and recovery instructions. On seen environments, it achieves 92.58% failure-detection accuracy and 85.58% temporal-localization accuracy, substantially outperforming general-purpose VLMs. When integrated as a real-time supervisor, it improves downstream VLA task success rates by 10-20 percentage points, demonstrating the value of fine-grained failure understanding for closed-loop recovery and reliable laboratory autonomy. Our code and data are available at https://github.com/Su-ISE-2001/SciRobo
- Abstract(参考訳): 自動運転車実験室へのエンボディエージェントの配備は科学的な発見を加速させるが、その信頼性は化学実験の不可逆的で安全に重要な性質に制約される。
障害データが少ないことと、きめ細かい評価プロトコルが欠如していることにより、さらなる進歩が妨げられる。
これらの課題に対処するために,化学実験室でロボット故障解析を学習し評価するための,障害中心のフレームワークであるLabRobFailを紹介した。
LabRobFail-Simはコントロール、物理、セマンティックレベルで制御可能な障害を注入し、70以上のタスクシナリオ、5つの障害カテゴリ、11のきめ細かい障害タイプを含むLabRobFail-Dataの構築を可能にする。
LabRobFail-Benchは、タスク理解、障害検出、時間的ローカライゼーション、重大度評価、障害分類、動作可能な修正の6つの機能を評価する。
さらに,構造的故障診断と回復指示を生成するドメイン特化視覚言語モデルであるLabRobFail-VLMを開発した。
観測された環境では、92.58%の故障検出精度と85.58%の時間的局所化精度を達成し、汎用のVLMよりも大幅に優れている。
リアルタイムスーパーバイザとして統合されると、下流のVLAタスク成功率を10~20ポイント向上させ、クローズドループリカバリと信頼性の高い実験室自律性に対するきめ細かい障害理解の価値を示す。
私たちのコードとデータはhttps://github.com/Su-ISE-2001/SciRoboで公開されています。
関連論文リスト
- Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory [47.77200587195896]
Labimusは、有機化学実験室におけるヒューマノイドのデキスタラスな操作に関する最初のベンチマークである。
実際の有機化学のワークステーションから30以上の機能的に忠実な資産を、リアルタイムモデリングによって再構築する。
本稿では,タスク完了,実験精度,長期実行を共同で測定するための精度評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-30T02:14:28Z) - LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories [95.20367571157679]
Vision-Language-Action (VLA) モデルは、記述されたプロトコルとロボット実行の間の1つの可能なインターフェースを提供する。
既存の政策は、主に家庭やテーブルトップのデモンストレーションに基づいて訓練されており、機器、透明な液体、または科学実験室で見られる固定されたプロトコルに遭遇することは滅多にない。
まず、Qwen3-VL-4B-インストラクションバックボーンアクションを学習する前に認識させ、フローマッチング後トレーニングを行い、次に知識絶縁下でDiTアクションエキスパートをアタッチする。
論文 参考訳(メタデータ) (2026-06-11T17:03:53Z) - LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories [41.392364324753224]
MLLM(Multimodal large language model)エージェントは、ラボアシスタントから自動運転ラボオペレータへと進化する。
LABSHIELDは,危険識別と安全クリティカルな推論においてMLLMを評価するために設計された,現実的なマルチビューベンチマークである。
我々は,20のプロプライエタリモデル,9つのオープンソースモデル,および3つの具体的モデルについて,デュアルトラック評価フレームワークを用いて評価する。
論文 参考訳(メタデータ) (2026-03-12T14:38:13Z) - RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation [68.7948300643741]
ロボットの異常検出と介入をリアルタイムに監視するロボット・コンディションド・ノーマライゼーション・フロー(RC-NF)を提案する。
RC-NFは、正規化フロー内のタスク認識ロボットとオブジェクト状態の処理を分離する。
従来のロボットタスクの監視方法と比較して、あらゆる異常なタイプで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T10:14:37Z) - LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs [78.99703366417661]
大規模言語モデル(LLM)は、手続き的なガイダンスから自律的な実験オーケストレーションまで、タスクをますます支援している。
このような過度な信頼性は、リスク識別やリスクアセスメントの失敗が重大事故を引き起こす高リスクな実験室環境では特に危険である。
実験室安全ベンチマーク (LabSafety Bench) を提案し, 潜在的な危険を識別し, リスクを評価し, 実験室環境における安全でない行動の結果を予測する。
論文 参考訳(メタデータ) (2024-10-18T05:21:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。