論文の概要: Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis
- arxiv url: http://arxiv.org/abs/2607.28200v1
- Date: Thu, 30 Jul 2026 13:38:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.579146
- Title: Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis
- Title(参考訳): Vibe-FDTR:再現可能な周波数領域熱反射データ解析のためのエージェント指向フレームワーク
- Abstract要約: 本稿では,大規模言語モデル (LLM) エージェントが信頼性および再現可能なR分析を行うためのエージェント指向フレームワークであるVibe-FDTRを提案する。
合成シングルステップタスクと実データマルチステップタスクの2つのレベルの制御されたベンチマークを用いて、Vibe-FDTRを評価する。
対照的に、非難スキル(コードエージェント)は91.4%と36.7%に性能を低下させ、ドメインパッケージを省略するとさらに38.6%と0%に低下する。
- 参考スコア(独自算出の注目度): 0.23895981099137534
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Frequency-domain thermoreflectance (FDTR) is a laser pump-probe technique widely used to measure thermal properties at the micro- and nanoscale; however, it relies on a complex data analysis procedure that demands substantial domain expertise and is susceptible to subtle human errors. Here, we present Vibe-FDTR, an agent-oriented framework that enables large language model (LLM) agents to perform reliable and reproducible FDTR analyses directly from natural language requests. This framework couples a configuration-driven FDTR code package, which enforces physical and parametric consistency, with procedural agent skills that translate user intentions into organized and verifiable analysis steps. We evaluate Vibe-FDTR using a controlled benchmark with two levels: synthetic single-step tasks and real-data multi-step tasks based on measurements of gold-coated graphite samples. Across the two levels, agents using Vibe-FDTR achieve success rates of 100% and 98.9%, respectively. In sharp contrast, ablating skills (Code-agent) reduces performance to 91.4% and 36.7%, which drops further to 38.6% and 0% when the domain package is also omitted (Agent-only). Beyond success rate, Vibe-FDTR also reduces computational cost by 87.7% relative to the Code-agent variant and cuts execution time by more than 60%. Finally, an optional expert mode supports experimental planning via autonomous sensitivity and uncertainty evaluations, and formulates physically grounded recommendations for underspecified tasks. These results demonstrate that encapsulating domain code and expert knowledge into agent skills offers a promising route toward low-barrier, autonomous, and trustworthy thermal metrology.
- Abstract(参考訳): 周波数領域熱反射率 (FDTR) は、マイクロスケールとナノスケールの熱特性を測定するために広く使われているレーザーポンププローブ技術である。
本稿では,大規模言語モデル (LLM) エージェントが自然言語要求から直接,信頼性と再現性のあるFDTR解析を行うことのできるエージェント指向フレームワークであるVibe-FDTRを提案する。
このフレームワークは、物理的およびパラメトリックな一貫性を強制する構成駆動型FDTRコードパッケージと、ユーザの意図を組織的で検証可能な分析ステップに変換する手続き的エージェントスキルを結合する。
合成シングルステップタスクと実データマルチステップタスクの2つのレベルの制御されたベンチマークを用いて,金めっきグラファイト試料の測定に基づくVibe-FDTRの評価を行った。
2つのレベルにおいて、Vibe-FDTRのエージェントはそれぞれ100%と98.9%の成功率を達成した。
対照的に、非難スキル(コードエージェント)は91.4%と36.7%に低下し、ドメインパッケージも省略される(Agent-only)とさらに38.6%と0%に低下する。
成功率以外にも、Vibe-FDTRはCode-Adntの変種と比較して計算コストを87.7%削減し、実行時間を60%以上削減している。
最後に、オプションのエキスパートモードは、自律的な感度と不確実性評価による実験計画をサポートし、未特定タスクに対する物理的に根拠づけられた推奨を定式化する。
これらの結果は、ドメインコードと専門家の知識をエージェントスキルにカプセル化することで、低バリアで自律的で信頼性の高い熱気象学への有望な道のりが示される。
関連論文リスト
- DPIAgent: Divide, Protocol, Isolate for Agentic Reproduction Test Generation [31.816679197888366]
DPIAgentは3つの原則に基づいて構築された構造化エージェントフレームワークである。
タスクを、欠陥探索とテスト生成の単一目的のフェーズに分割する。
診断とテスト計画を記録するハンドオフプロトコルを施行し、コンテキスト損失を防ぐ。
論文 参考訳(メタデータ) (2026-08-24T14:51:15Z) - RESTOR: Automated Test Oracle Generation for RESTful APIs via Reinforcement Learning [21.927343858709122]
Restorは、ブラックボックスの設定で単一のリクエスト-レスポンスペアから実行可能なテストアサーションを生成するフレームワークである。
実世界の246のサービスにまたがる2,300以上のAPIトレースからなる産業データセット上でRestorを評価する。
論文 参考訳(メタデータ) (2026-07-27T03:20:28Z) - NMR Elucidation as an Agentic Search Problem, Not a Modeling Problem [3.8929079574413508]
核磁気共鳴データからの構造解明は、化学、材料科学、生物学における根本的なボトルネックとなっている。
我々はエージェントAIシステムが、大学院レベルの化学生に匹敵するレベルでこのタスクを実行できることを実証した。
エージェントは,トップ1の精度が71%である構造を解明し,その精度は66%の大学生に匹敵する。
論文 参考訳(メタデータ) (2026-07-07T22:05:25Z) - Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System [1.8463920355489722]
エージェントデータ分析システムは、コード、数値結果、言語診断を含む豊富な出力を生成する。
したがって、エージェントの出力と根本的真正解との真に不一致を分解物と区別する必要がある。
DSGymから153個の数値QRDataタスクに対して,マルチエージェントデータ分析システムであるLAMBDAを適用し,システム評価の信頼性と品質向上の戦略について検討した。
論文 参考訳(メタデータ) (2026-06-23T17:18:28Z) - Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows [0.9025503352150883]
原因は、環境トポロジ、属性依存、因果関係の構造化された表現を維持する因果インテリジェンス層である。
我々は,24-microservice OpenTelemetry デモアプリケーションにおいて,インジェクト障害を伴う制御された環境下で実施したベンチマークにより,この価値提案を評価する。
論文 参考訳(メタデータ) (2026-05-18T12:45:02Z) - Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Agent Collaboration [53.772014300855375]
我々は,自律型エンドツーエンド神経画像解析のためのマルチエージェントシステムであるNIAgentを紹介する。
従来のフラットなツール呼び出しエージェントとは異なり、NIAgentはコード中心の実行パラダイムを採用している。
本稿では,コホートレベルの検定とエージェント視覚検査を組み合わせた,自律的品質管理のための階層的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-10T06:30:19Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Towards Multi-Agent Autonomous Reasoning in Hydrodynamics [0.06999740786886537]
本稿では,多エージェントをレイヤ実行グラフ(LEG)を介して協調させる,流体力学のためのマルチエージェントシステム(MAS)のプロトタイプを提案する。
プランナーエージェントは、ドメイン知識を厳密な制御ロジックとしてハードコーディングすることなく、自然言語ルーティングからクエリ固有の実行トポロジを構築する。
レポーターエージェントが最終応答を合成し、ランタイムが監査性をサポートするためのツール呼び出し毎に証明をログする。
論文 参考訳(メタデータ) (2026-05-01T21:17:55Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - AgentRaft: Automated Detection of Data Over-Exposure in LLM Agents [40.88941407116349]
本稿では,大規模言語モデル(LLM)エージェントにおけるデータオーバー露光(DOE)リスクを検出するための,最初の自動化フレームワークであるAgentRaftを紹介する。
実世界のエージェントツール6,675のテスト環境でAgentRaftを評価した。
論文 参考訳(メタデータ) (2026-03-08T09:40:54Z) - UAV Individual Identification via Distilled RF Fingerprints-Based LLM in ISAC Networks [60.16924915676577]
無人航空機(UAV)個人識別は、低高度統合センシング通信(ISAC)ネットワークにおける重要なセキュリティ監視戦略である。
UAVID識別のための新しい動的知識蒸留(KD)対応無線周波数指紋大言語モデル(RFF-LLM)を提案する。
実験結果から,提案フレームワークは,0.15万のパラメータと2.74ミリ秒の応答時間で,98.38%のID識別精度を実現していることがわかった。
論文 参考訳(メタデータ) (2025-08-18T03:14:44Z) - DrugPilot: LLM-based Parameterized Reasoning Agent for Drug Discovery [54.79763887844838]
大規模言語モデル(LLM)と自律エージェントの統合は、自動推論とタスク実行を通じて科学的発見を促進する大きな可能性を秘めている。
本稿では,薬物発見におけるエンドツーエンド科学のために設計されたパラメータ化推論アーキテクチャを備えたLSMベースのエージェントシステムであるDrarmPilotを紹介する。
DrugPilot は ReAct や LoT のような最先端のエージェントよりも優れており、タスク完了率は98.0%、93.5%、64.0%である。
論文 参考訳(メタデータ) (2025-05-20T05:18:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。