論文の概要: A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility
- arxiv url: http://arxiv.org/abs/2607.24663v1
- Date: Mon, 27 Jul 2026 17:01:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.518106
- Title: A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility
- Title(参考訳): 修復型エージェントハイブリッドRAGと科学施設の運用評価
- Authors: Rajat Sainju, Dariusz Jarosz, Hairong Shang, Michael Prince, Ryan M. Aydelott, Mathew J. Cherukara, Yine Sun, Michael D. Borland,
- Abstract要約: APS-RAG(Advanced Photon Source Retrieval Augmented Generation)を提案する。
検索エンジンは、密度、スパース、知識グラフチャネルをクエリ型適応逆数融合で融合する。
APS-Benchは50問の質問応答(QA)データセットで、監査可能な金の回答を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific user facilities accumulate decades of operational knowledge that no single search index covers: electronic logbooks, technical documents, internal wikis, operations chat messages, maintenance records, and live control-system data. We present APS-RAG, Advanced Photon Source Retrieval Augmented Generation, a deployed platform that makes the institutional knowledge at the Advanced Photon Source (APS) accessible to staff through natural-language queries, along with an operations-grounded evaluation. The retrieval engine fuses dense, sparse, and knowledge-graph (KG) channels with query-type-adaptive reciprocal-rank fusion, adds a corrective agentic loop, and runs a native-tool ReAct executor over a Model Context Protocol (MCP) tooling layer. We construct APS-Bench, a 50-question, question-answering (QA) dataset with auditable gold answers. Every retrieval-augmented variant numerically improves strict vital-nugget recall over a naive BM25 baseline (63.8%), with the full corrective Agentic GraphRAG scoring (70.3%). The cross-encoder reranker contributes significantly to answer quality: removing it and allowing the LLM to score relevance drastically reduces strict vital recall by 32.8%. The graph channel and corrective loop contribute positively as expected, but the performance gains are marginal. Additionally, we also compare the performance of open-source and closed-source LLMs in final answer synthesis. We release the APS-Bench construction methodology, the six-layer evaluation harness, and the underlying codebase, along with the '/aps-rag' retrieval agent skill framework, to support reproduction and adoption at other facilities. Together, the deployed platform and its operations-grounded evaluation present a promising workflow for trustworthy, statistically grounded AI assistance in facility operations, transferable to other large scientific instruments.
- Abstract(参考訳): 科学ユーザー施設は、電子ログブック、技術文書、内部wiki、チャットメッセージの操作、保守記録、ライブ制御システムデータなど、単一の検索インデックスがカバーしていない何十年もの運用知識を蓄積している。
本稿では,APS-RAG(Advanced Photon Source Retrieval Augmented Generation)について紹介する。
検索エンジンは、クエリ型適応逆数核融合と密度、疎度、知識グラフ(KG)チャネルを融合させ、修正されたエージェントループを追加し、モデルコンテキストプロトコル(MCP)ツール層上でネイティブツールのReActエグゼキュータを実行する。
APS-Benchは50問の質問応答(QA)データセットで、監査可能な金の回答を提供する。
検索強化された全ての派生型は、厳格なバイタル・ナゲットリコールをBM25ベースライン(63.8%)で改善し、完全な修正型Agenic GraphRAGスコア(70.3%)を持つ。
クロスエンコーダのリランカーは、解答の品質に大きく貢献する:それを除去し、LLMが関連性を評価することで、厳密な致命的リコールを32.8%削減する。
グラフチャネルと補正ループは、期待通りに肯定的に寄与するが、性能の上昇は限界である。
さらに、最終回答合成において、オープンソースとクローズドソースのLLMの性能を比較する。
APS-Bench構築手法,6層評価ハーネス,基盤となるコードベース,および'/aps-rag'検索エージェントスキルフレームワークを,他の施設での再生と採用を支援するためにリリースする。
デプロイされたプラットフォームとその運用基盤評価は、他の大規模な科学機器に転送可能な、信頼性の高い統計的基盤を持つAI支援のための、有望なワークフローを提供する。
関連論文リスト
- REFORGE: A Method for Benchmarking LLMs' Reverse Engineering Capabilities in Decompiled Binary Function Naming [0.0]
大規模な言語モデル(LLM)は、リバースエンジニアリングタスクにますます適用されている。
しかし、彼らの能力に関する主張は、それを測定する能力よりも優れている。
本稿では,関数レベル基底真理をCソースから構築する証明追跡パイプラインであるReforgeを提案する。
論文 参考訳(メタデータ) (2026-07-07T23:17:03Z) - LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - Towards Multi-Agent Autonomous Reasoning in Hydrodynamics [0.06999740786886537]
本稿では,多エージェントをレイヤ実行グラフ(LEG)を介して協調させる,流体力学のためのマルチエージェントシステム(MAS)のプロトタイプを提案する。
プランナーエージェントは、ドメイン知識を厳密な制御ロジックとしてハードコーディングすることなく、自然言語ルーティングからクエリ固有の実行トポロジを構築する。
レポーターエージェントが最終応答を合成し、ランタイムが監査性をサポートするためのツール呼び出し毎に証明をログする。
論文 参考訳(メタデータ) (2026-05-01T21:17:55Z) - Can Coding Agents Reproduce Findings in Computational Materials Science? [49.254975563645786]
本稿では,大規模言語モデルの科学的主張を再現する能力を評価するためのベンチマークであるAutoMatを紹介する。
課題を専門とする専門家と緊密に連携することで、実際の材料科学論文からの一連の主張をキュレートし、コーディングエージェントがエンドツーエンドのワークフローを回復し実行できるかどうかを検証します。
結果、現在のLSMベースのエージェントはAutoMatの全体的な成功率を低くし、最も優れた設定は54.1%に過ぎなかった。
論文 参考訳(メタデータ) (2026-05-01T17:42:12Z) - Towards Compositional Generalization in LLMs for Smart Contract Security: A Case Study on Reentrancy Vulnerabilities [35.39583123277091]
本稿では,原子タスクの分解と融合に基づくポストトレーニングアルゴリズムを提案する。
再帰的脆弱性検出タスクを4つの線形独立原子タスクに分解する。
合成データセットのトレーニングにより、3つのコンパイラ検証データセットを生成する。
次に、Slitherツールを使用して、制御フローグラフとデータフローグラフから構造情報を抽出する。
論文 参考訳(メタデータ) (2026-01-11T13:52:07Z) - Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions [8.97512410819274]
本稿では,データセット適応タスクにおいて,最先端のマルチエージェントシステムがどのように機能するかについて,最初の実証的研究を行う。
我々は、GitHub Copilotを評価し、ROCODEやLogHub2.0といったベンチマークリポジトリからSE研究成果物を適用する。
その結果、現在のシステムはキーファイルを識別し、部分的な適応を生成することができるが、正しい実装を生成することは滅多にない。
論文 参考訳(メタデータ) (2025-11-26T13:26:11Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - LLM Agents Improve Semantic Code Search [6.047454623201181]
本稿では、ユーザプロンプトに情報を注入する検索拡張型エージェントのアプローチを提案する。
RAGを利用することで、エージェントはGitHubリポジトリから関連する詳細でユーザクエリを強化し、より情報的でコンテキスト整合性を高めます。
CodeSearchNetデータセットの実験結果は、RepoRiftが既存のメソッドを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2024-08-05T00:43:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。