論文の概要: SciHorizon-eLab: An Agentic Protocol-to-Task Compiler for Scalable Benchmarking of Scientific Embodied Agents
- arxiv url: http://arxiv.org/abs/2609.30971v1
- Date: Fri, 25 Sep 2026 08:18:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.292097
- Title: SciHorizon-eLab: An Agentic Protocol-to-Task Compiler for Scalable Benchmarking of Scientific Embodied Agents
- Title(参考訳): SciHorizon-eLab: サイエンボダイドエージェントのスケーラブルベンチマークのためのエージェントプロトコル・ツー・タスクコンパイラ
- Abstract要約: 身体的エージェントは、科学実験を自動化するための有望なルートを提供する。
既存のシミュレーションベースの実験室ベンチマークは、手作業のエンジニアリングに大きく依存している。
本稿では,エージェントプロトコル対タスクコンパイラであるSciHorizon-eLabを紹介する。
- 参考スコア(独自算出の注目度): 30.43382760502922
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied agents offer a promising route to automating scientific experimentation, yet their progress is constrained by the lack of reliable and systematic evaluation environments. Existing simulation-based laboratory benchmarks rely heavily on manual task engineering, making it challenging to systematically compile diverse scientific protocols into executable and verifiable embodied tasks at scale. To address this challenge, we introduce SciHorizon-eLab, an agentic protocol-to-task compiler that formulates scientific embodied task construction as a compilation problem. Given a natural-language protocol of scientific experiments, SciHorizon-eLab progressively compiles laboratory protocols into semantic-preserving embodied tasks through semantic grounding, executable task synthesis, and multi-stage simulation-based certification. The system generates semantically grounded environments, executable manipulation programs, and step-level success specifications, while enabling reproducible generation of expert demonstrations and execution traces. Using this pipeline, we further construct \BenchName, a ready-to-use benchmark comprising 300 certified tasks across diverse laboratory operations. It supports HIL task execution, reproducible expert-demonstration generation, and ordered step-level evaluation. Across representative tasks, the strongest policy attains an average success rate of only 49.7%, with further evaluations revealing pronounced weaknesses in human and embodied agent coordination. We publicly release the code, benchmark data, and evaluation toolkit at https://github.com/SciHorizon-elab/SciHorizon-elab.
- Abstract(参考訳): エージェントは科学実験を自動化するための有望なルートを提供するが、その進歩は信頼性と体系的な評価環境の欠如によって制約される。
既存のシミュレーションベースの実験室ベンチマークは、手動のタスクエンジニアリングに大きく依存しているため、様々な科学的プロトコルを大規模に実行可能で検証可能な実行可能タスクに体系的にコンパイルすることは困難である。
この課題に対処するため、我々はSciHorizon-eLabを紹介した。SciHorizon-eLabは、科学的具体的タスク構築をコンパイル問題として定式化するエージェントプロトコルとタスクコンパイラである。
科学実験の自然言語プロトコルが与えられたSciHorizon-eLabは、セマンティックグラウンド、実行可能なタスク合成、マルチステージシミュレーションベースの認証を通じて、実験用プロトコルをセマンティック保存されたタスクに徐々にコンパイルする。
システムは、セマンティックグラウンド化された環境、実行可能な操作プログラム、ステップレベルの成功仕様を生成し、再現可能な専門家のデモンストレーションと実行トレースを生成する。
このパイプラインを使用して、様々な実験室で300の認定タスクからなる準備の整ったベンチマークである \BenchName をさらに構築する。
HILタスクの実行、再現可能なエキスパート-デモ生成、ステップレベルの評価をサポートする。
代表的課題全体では、最強の政策は、平均的な成功率は49.7%に過ぎず、さらなる評価により、人的および実施されたエージェント調整における明らかな弱点が明らかになった。
コード、ベンチマークデータ、評価ツールキットをhttps://github.com/SciHorizon-elab/SciHorizon-elabで公開しています。
関連論文リスト
- LabDex: A Hierarchical Benchmark for Dexterous Manipulation in Laboratories [40.311566677309536]
LabDex(ラボデックス)は、化学実験室における厳密な操作のための大規模な実世界のデータセットとベンチマークである。
原子のスキル、構成的タスク、長期にわたる実験にまたがる階層的なタスク分類に基づいて構成されている。
本研究では,実環境とシミュレーション環境の両方において,代表的ロボット学習手法のクロスレベル評価を行う。
論文 参考訳(メタデータ) (2026-08-19T07:11:06Z) - Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory [47.77200587195896]
Labimusは、有機化学実験室におけるヒューマノイドのデキスタラスな操作に関する最初のベンチマークである。
実際の有機化学のワークステーションから30以上の機能的に忠実な資産を、リアルタイムモデリングによって再構築する。
本稿では,タスク完了,実験精度,長期実行を共同で測定するための精度評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-30T02:14:28Z) - LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories [95.20367571157679]
Vision-Language-Action (VLA) モデルは、記述されたプロトコルとロボット実行の間の1つの可能なインターフェースを提供する。
既存の政策は、主に家庭やテーブルトップのデモンストレーションに基づいて訓練されており、機器、透明な液体、または科学実験室で見られる固定されたプロトコルに遭遇することは滅多にない。
まず、Qwen3-VL-4B-インストラクションバックボーンアクションを学習する前に認識させ、フローマッチング後トレーニングを行い、次に知識絶縁下でDiTアクションエキスパートをアタッチする。
論文 参考訳(メタデータ) (2026-06-11T17:03:53Z) - Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments [49.02509634515056]
最近のビジョン言語アクションモデルは、ロボット研究所にとって有望な基盤を提供する。
実験は通常、複数の原子タスクからなる長い水平タスクを含む。
科学的なタスクのために微調整されたVLAモデルは、原子実験的なアクションを確実に実行することができるが、これらの既知の原子のアクションを再順序付けして構成することによって形成される複合的なタスクの実行に失敗することが多い。
論文 参考訳(メタデータ) (2026-02-10T05:50:19Z) - Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale [82.20980951765891]
エージェントサイエンスのスケーリングにはインフラストラクチャ・アンド・エコシステムアプローチが必要である,と我々は主張する。
BohriumはAI4S資産のマネージドでトレース可能なハブとして機能し、多様な科学データ、ソフトウェア、計算、実験室のシステムをエージェント対応の能力に変換する。
SciMasterはこれらの機能を長い水平科学に編成し、科学エージェントを合成して実行することができる。
論文 参考訳(メタデータ) (2025-12-23T16:04:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。