論文の概要: MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing
- arxiv url: http://arxiv.org/abs/2607.19935v1
- Date: Wed, 22 Jul 2026 09:05:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.035358
- Title: MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing
- Title(参考訳): MOF-Sleuth: 説明可能な細粒化MOF CIF監査用ツールグラウンドリワードアライメント
- Abstract要約: 大規模金属有機フレームワーク(MOF)データベースは、結晶情報ファイル(CIF)を通してシミュレーション、スクリーニング、機械学習をサポートする
MoF-Sleuthは強化誘導型CIF監査剤で、決定論的法医学研究所とスルース推論エンジンの2つのモジュールを備える。
Chem-GDは、CIFに由来する事実的、関連する証拠によって正しい診断が説明されるかどうかを評価する指標である。
- 参考スコア(独自算出の注目度): 23.102528931329715
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large metal-organic framework (MOF) databases support simulation, screening, and machine learning through crystallographic information files (CIFs). Subtle chemical and structural errors in these inputs can compromise downstream results and hinder manual inspection. LLM advances in computational chemistry offer paths beyond predictive screening toward fine-grained diagnosis with evidence-grounded explanations. However, two challenges remain: (i) limited fine-grained attribution: MOF-specific validators and machine-learning models scale detection but provide fixed checks, readiness scores, or coarse labels rather than evidence-grounded explanations; and (ii) unreliable CIF reasoning: direct LLM auditing is costly and unreliable because chemical evidence is implicit across atom-site records and requires geometric, connectivity, occupancy, and charge calculations. Both stem from weak coupling between chemical evidence and language-model explanation. We introduce MOF-Sleuth, a reinforcement-guided CIF auditing agent with two modules: a deterministic Forensic Lab and a Sleuth reasoning engine. The Lab derives composition, geometry, connectivity, occupancy, coordination, and charge evidence, and Sleuth uses this evidence to produce an evidence-grounded explanation, error types, and a binary decision. Reward-guided reinforcement learning (RL) turns tool measurements into chemical explanation-level supervision, rewarding not only the final answer but also cited chemical evidence and evidence-supported diagnoses. We introduce Chemically Grounded Diagnosis (Chem-GD), a metric that assesses whether a correct diagnosis is explained by factual, relevant CIF-derived evidence. Across four benchmarks, MOF-Sleuth establishes state-of-the-art performance among LLM-based approaches and MOF-specific machine-learning methods, demonstrating gains in detection, attribution, and grounded explanation quality.
- Abstract(参考訳): 大規模な金属-有機フレームワーク(MOF)データベースは、結晶情報ファイル(CIF)を通じてシミュレーション、スクリーニング、機械学習をサポートする。
これらの入力の化学的および構造的誤りは、下流の結果を妥協し、手動による検査を妨げる可能性がある。
LLMの計算化学の進歩は、エビデンスを根拠とした詳細な診断への予測スクリーニングを超える道を提供する。
しかし、2つの課題が残る。
一 限定的な微粒化属性:MOF固有のバリデータ及び機械学習モデルによるスケール検出を行うが、証拠を根拠とした説明ではなく、固定チェック、準備スコア又は粗いラベルを提供する。
(II)信頼性の低いCIF推論:直接LCM監査は、原子サイトレコード全体で化学的証拠が暗黙的であり、幾何学的、接続性、占有性、電荷計算を必要とするため、費用がかかり信頼性が低い。
どちらも、化学的な証拠と言語モデルの説明の弱い結合に由来する。
我々は,2つのモジュールを持つ強化誘導型CIF監査エージェントMOF-SleuthとSleuth推論エンジンを紹介する。
ラボは構成、幾何学、接続性、占有性、調整、電荷のエビデンスを導き、スルースはこのエビデンスを用いてエビデンスに基づく説明、エラータイプ、二項決定を生成する。
Reward-guided reinforcement learning (RL)は、ツール測定を化学説明レベルの監視に転換し、最終回答だけでなく、化学証拠やエビデンスに支えられた診断を引用する。
そこで我々は,Chem-GD(Chem-GD)という,正確な診断が事実,関連性のあるCIF由来の証拠によって説明されるかどうかを評価する指標を紹介した。
4つのベンチマークで、MOF-SleuthはLLMベースのアプローチとMOF固有の機械学習手法の間で最先端のパフォーマンスを確立し、検出、属性、グラウンドドの説明品質の向上を示す。
関連論文リスト
- Chemically Meaningful Textualization Enables Explainable Validation of Metal-Organic Frameworks by Large Language Models [11.64834318585455]
既存のバリデーションアプローチでは、計算不能な構造を識別できるが、検証ルールやライセンス要件に依存したり、限定的な解釈性を提供することが多い。
ここでは, 大規模言語モデル (LLM) が, 結晶情報を化学的に意味のあるテキストに変換する際に, MOF構造の解釈可能なバリデータとして機能することを示す。
論文 参考訳(メタデータ) (2026-08-11T12:48:44Z) - Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations [27.330265411994258]
SCHEMA(SCHEMA)は、科学的エージェントの幻覚評価のためのエビデンスベースのトポロジー対応評価フレームワークである。
幻覚は、高度に接続された知識ハブの小さなセットに集中していることが示される。
その結果, 高精度な科学的応用においては, 端末の精度だけではエージェントの信頼性が不十分な信号であることが示唆された。
論文 参考訳(メタデータ) (2026-08-01T15:19:10Z) - SciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding [63.71245376513854]
SciLensは、マルチモーダルな科学的クレーム検証のためのエビデンス条件の原子包含フレームワークである。
SciLensは、それぞれの主張を中央の経験的原子と背景の原子に分解し、中央の原子をモダリティ固有の証拠として根拠付け、最終的なラベルを予測する。
表では、原子は行、列、セル、算術関係、テーブルスコープに接地され、図ではパネル、軸、伝説、視覚的エンコーディング、カテゴリー、傾向、ランク、等式チェックによって接地される。
論文 参考訳(メタデータ) (2026-06-18T19:02:17Z) - From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Large Language Models [37.34302729762671]
ChemCoTBench-V2は、構造化された検証可能な化学推論トレースの評価のための、ルール検証可能な診断ベンチマークである。
分子理解、分子編集、分子最適化、反応予測にまたがっており、18の報告タスクで5,620個の評価サンプルがある。
論文 参考訳(メタデータ) (2026-06-02T13:47:19Z) - VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection [49.88962095967614]
本稿では,正確な動的偽情報検索と強力なクリティカル推論機能を備えたVRAG-DFDフレームワークを提案する。
データに関しては、DFD知識アノテーションのためのForensic Knowledge Database(FKD)と、重要なCoT構築のためのForensic Chain-of-Thoughtデータセット(F-CoT)の2つのデータセットを構築した。
性能面では、VRAG-DFD は SOTA と DFD の一般化テストにおける競合性能を達成した。
論文 参考訳(メタデータ) (2026-04-15T09:27:49Z) - How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning? [51.286853421822705]
大規模言語モデル (LLM) は推論集約的な科学的タスクを約束するが、化学的解釈の能力はまだ不明である。
我々は、分子構造を予測するために、LLMが質量スペクトルデータに対してどのように理由を持つかを評価する、Chain-of-Thought(CoT)プロンプトフレームワークとベンチマークを導入する。
SMILESの妥当性, 式整合性, 構造的類似性の指標による評価の結果, LLMは合成学的に有効で, 部分的に可視な構造を生成できるが, 分子予測の正確性やリンク推論を達成できないことがわかった。
論文 参考訳(メタデータ) (2026-01-09T20:08:42Z) - SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence [60.202862987441684]
科学的妥当性を確立する制約に厳格に固執しながら、問題を解決する能力。
具体的には,大学レベルの問題と制約の固定されたカタログをペアにすることで,この能力を評価するマルチディシプリンのベンチマークであるSciIFを紹介する。
SciIFは、解の正当性と多拘束性の両方を測定することにより、構成的推論失敗のきめ細かい診断を可能にする。
論文 参考訳(メタデータ) (2026-01-08T09:45:58Z) - ChemOrch: Empowering LLMs with Chemical Intelligence via Synthetic Instructions [52.79349601462865]
ChemOrchは化学的に接地した命令応答対を合成するフレームワークである。
ChemOrchは、生成したタスクに対して、制御可能な多様性と難易度を実現する。
論文 参考訳(メタデータ) (2025-09-20T05:43:58Z) - MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision [22.708008313748824]
LLM(Large Language Models)は、分子科学における潜在的な可能性を示すが、しばしば化学的に不正確な記述を生成する。
これにより、科学的応用における堅牢性と信頼性に関する重要な懸念が持ち上がる。
分子記述における誤り検出と訂正におけるLCMの評価を目的としたMollErr2Fixベンチマークを提案する。
論文 参考訳(メタデータ) (2025-08-26T05:43:45Z) - FactCHD: Benchmarking Fact-Conflicting Hallucination Detection [64.4610684475899]
FactCHD は LLM からファクトコンフリクトの幻覚を検出するために設計されたベンチマークである。
FactCHDは、バニラ、マルチホップ、比較、セット操作など、さまざまな事実パターンにまたがる多様なデータセットを備えている。
Llama2 に基づくツール強化 ChatGPT と LoRA-tuning による反射的考察を合成する Truth-Triangulator を提案する。
論文 参考訳(メタデータ) (2023-10-18T16:27:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。