論文の概要: Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments
- arxiv url: http://arxiv.org/abs/2607.25145v1
- Date: Mon, 27 Jul 2026 23:43:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.657242
- Title: Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments
- Title(参考訳): 自律量子センシング実験における科学的推論のためのエージェントAI
- Authors: Takuya Isogawa, Ryotaro Okabe, Nutdech Phadetsuwannukun, Mingda Li, Paola Cappellaro,
- Abstract要約: ダイアモンド中の窒素空洞(NV)中心を自律的に実験するための,大規模言語モデル(LLM)エージェントを中心に構築されたエージェントAIワークフローを実装した。
まず、永続的なプロジェクト記録、定量的計算とデータ分析ツール、決定論的実験制御を組み合わせた自律型NV実験ワークフローを実演する。
第2に、実験室の実行とは別に、エージェントの推論を評価する2つのオフラインベンチマークを導入する。
- 参考スコア(独自算出の注目度): 2.13443056899403
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We implement an agentic AI workflow built around a large language model (LLM) agent for autonomous experiments with nitrogen-vacancy (NV) centers in diamond. NV centers are a widely used platform for quantum sensing, and the ability to control many measurements from a computer makes NV experiments a natural setting for autonomous workflows. We make two main contributions. First, we demonstrate an autonomous NV experiment workflow that combines persistent project records, quantitative calculation and data analysis tools, and deterministic experiment control. In one autonomous experiment, the agent selected a single NV center, calibrated its resonant frequency, measured \(T_2^\ast\) with Ramsey measurements, and added a Carr--Purcell--Meiboom--Gill (CPMG) measurement to check a weak feature that could be related to nearby \(^{13}\mathrm{C}\). Second, we introduce two offline benchmarks that evaluate the agent's reasoning separately from laboratory execution. We evaluated both benchmarks with GPT-5.4, GPT-5.5, and GPT-5.6 Sol. In the Ramsey checkpoint benchmark, greater reasoning effort generally improved recognition of a residual resonance calibration offset. By contrast, in the pulsed optically detected magnetic resonance (pODMR) data evaluation benchmark, pulse sequence information alone produced more false positive resonance judgments at higher reasoning effort. Requiring an expected signal calculation kept false positive rates low across all three models and reasoning settings. The results suggest a clear division of labor for autonomous experiments. The agent forms scientific hypotheses and uses quantitative tools to evaluate data, while deterministic code controls the hardware and enforces safety constraints.
- Abstract(参考訳): ダイアモンド中の窒素空洞(NV)中心を自律的に実験するための,大規模言語モデル(LLM)エージェントを中心に構築されたエージェントAIワークフローを実装した。
NVセンターは量子センシングのための広く使われているプラットフォームであり、コンピュータから多くの測定値を制御する能力によって、NV実験は自律的なワークフローの自然な設定となっている。
主な貢献は2つある。
まず、永続的なプロジェクト記録、定量的計算とデータ分析ツール、決定論的実験制御を組み合わせた自律型NV実験ワークフローを実演する。
ある自律的な実験では、エージェントは単一のNV中心を選択し、共鳴周波数を調整し、ラムゼーの測定で \(T_2^\ast\) を測定し、近くの \(^{13}\mathrm{C}\) に関連する弱い特徴をチェックするために Carr-Purcell--Meiboom--Gill (CPMG) 測定を加えた。
第2に、実験室の実行とは別に、エージェントの推論を評価する2つのオフラインベンチマークを導入する。
両ベンチマークをGPT-5.4, GPT-5.5, GPT-5.6 Solで評価した。
ラムゼーチェックポイントのベンチマークでは、より大きな推論の努力により、残留共鳴校正オフセットの認識が向上した。
対照的に、パルス検出磁気共鳴(pODMR)データ評価ベンチマークでは、パルスシーケンス情報だけで、より高い推論努力でより偽の正の共鳴判定が得られた。
期待された信号計算の必要性は、3つのモデルすべてと推論設定で偽陽性率を低く保った。
その結果、自律的な実験のための労働の明確な分割が示唆された。
エージェントは科学的仮説を作成し、定量的ツールを使用してデータを評価する一方、決定論的コードはハードウェアを制御し、安全性の制約を強制する。
関連論文リスト
- TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration [0.2343856409260935]
対象の臨床試験をエミュレートする現実世界のエビデンス研究は、規制や臨床の判断をますます伝達するが、残酷な偏見は信頼性を制限している。
最近提案されたBenchExCalフレームワークは、2段階のBenchmark、Expand、Calibrateプロセスを通じてこの問題に対処している。
本稿では,BenchExCalプロセスの自動化とスケールアップを目的とした,概念化されたマルチエージェントシステムであるTrialCalibreを紹介する。
論文 参考訳(メタデータ) (2026-04-28T16:39:13Z) - Estimating Dense-Packed Zone Height in Liquid-Liquid Separation: A Physics-Informed Neural Network Approach [35.66975292316149]
重力開拓地における液体-液体分散の分離は、化学、医薬品、リサイクルプロセスにおいて重要である。
密集したゾーンの高さは重要な性能と安全性の指標であるが、しばしば高価であり、測定することができない。
安価な体積流量測定のみを用いて位相高さを推定することを提案する。
論文 参考訳(メタデータ) (2026-01-26T11:57:28Z) - How can we assess human-agent interactions? Case studies in software agent design [52.953425368394306]
我々は,人間とエージェントの相互作用の厳密な評価に向けて,二つの大きな一歩を踏み出した。
エージェント設計のより効率的な人間中心評価のためのフレームワークであるPULSEを提案する。
私たちは、オープンソースのソフトウェアエージェントOpenHandsを中心に構築された大規模なWebプラットフォームにフレームワークをデプロイします。
論文 参考訳(メタデータ) (2025-10-10T19:04:28Z) - Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems [3.215065407261898]
大規模言語モデルと外部ツールを組み合わせたマルチエージェントシステムは、研究機関からハイテイクドメインへと急速に移行している。
この「先進的な」続編は、アルゴリズムのインスタンス化や経験的な証拠を提供することで、そのギャップを埋める。
AMDMは擬似ゴールドリフトで異常検出遅延を12.3秒から5.6秒に減らし、偽陽性率を4.5%から0.9%に下げる。
論文 参考訳(メタデータ) (2025-08-28T15:52:49Z) - Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination [67.67725938962798]
大規模なWebスケールコーパスの事前トレーニングは、広く使用されているベンチマークでデータ汚染の影響を受けやすいQwen2.5が残る。
我々はRandomCalculationと呼ばれる任意の長さと難易度を持つ完全クリーンな算術問題を生成するジェネレータを導入する。
精度の高い報酬信号のみがベースモデルの性能境界を超える安定した改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-07-14T17:55:15Z) - MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback [136.27567671480156]
先行テストからのフィードバックに基づいて仮説を優先順位付けする実験誘導ランキングを導入する。
我々は、シーケンシャルな意思決定問題として実験誘導型ランキングを定めている。
我々のアプローチは、実験前のベースラインと強い改善を著しく上回る。
論文 参考訳(メタデータ) (2025-05-23T13:24:50Z) - Testing Conditional Mean Independence Using Generative Neural Networks [8.323172773256449]
我々は,新しい集団CMI尺度とブートストラップモデルに基づくテスト手順を導入する。
深部生成ニューラルネットワークは、人口測定に関わる条件付き平均関数を推定するために用いられる。
論文 参考訳(メタデータ) (2025-01-28T23:35:24Z) - On the Theories Behind Hard Negative Sampling for Recommendation [51.64626293229085]
ハードネガティブサンプリング(HNS)を効果的に活用するための2つの洞察に富んだガイドラインを提供する。
パーソナライズされたランク付け(BPR)学習者におけるHNSの利用は、一方通行部分AUC(OPAUC)の最適化と等価であることを示す。
これらの分析は、初めてトップKレコメンデーションパフォーマンスを最適化するHNSの理論的基盤を確立する。
論文 参考訳(メタデータ) (2023-02-07T13:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。