論文の概要: From Papers to Mechanisms: An Evidence-Grounded Knowledge Substrate for Scientific Language Models
- arxiv url: http://arxiv.org/abs/2610.06248v1
- Date: Mon, 05 Oct 2026 12:47:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 17:27:28.34416
- Title: From Papers to Mechanisms: An Evidence-Grounded Knowledge Substrate for Scientific Language Models
- Title(参考訳): 論文からメカニズムへ:科学言語モデルのためのエビデンスを取り巻く知識基盤
- Abstract要約: 本稿では, 科学的文献を実証関連エビデンス単位, 役割型エンティティ, 指示機構パスにまとめるエビデンス基底機構知識基盤を提案する。
ドメイン内およびカバレッジシフトの質問回答ベンチマークでは、クローズドブック生成、Web検索、Raw-PDF RAG、MS$3$の検索を10の言語モデルで比較する。
- 参考スコア(独自算出の注目度): 12.848566723659308
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scientific language models often access literature through untyped text chunks, which fragment the functional and evidential structure required for mechanism-rich questions. We introduce an evidence-grounded mechanism knowledge substrate that organizes scientific literature into provenance-linked evidence units, role-typed entities, and directed mechanism paths. We instantiate it as MS$^3$, a Material-Sensor-Signal-System schema for conductive-fiber flexible sensors, over 13,689 papers, 131,083 evidence items, and 26,648 mechanism objects. On in-domain and coverage-shift question-answering benchmarks, we compare closed-book generation, Web search, Raw-PDF RAG, and MS$^3$ retrieval across ten language models. MS$^3$ improves macro-averaged scientific correctness. It also improves citation entailment and answer completeness. These results support mechanism substrates as a reliable representation layer for scientific language models and motivate a source-repair workflow in which insufficient MS$^3$ evidence triggers targeted retrieval from its linked papers rather than assuming that a user has already supplied the correct PDFs.
- Abstract(参考訳): 科学言語モデルは、しばしば非型付けされたテキストチャンクを通して文学にアクセスし、機構に富む質問に必要な機能的および明白な構造を断片化する。
本稿では, 科学的文献を実証関連エビデンス単位, 役割型エンティティ, 指示機構パスにまとめるエビデンス基底機構知識基盤を提案する。
私たちはそれをMS$^3$、導電性繊維フレキシブルセンサーのためのマテリアル・センサ・シグナル・システム・スキーマ、13,689枚の論文、131,083個のエビデンス・アイテム、26,648個のメカニズム・オブジェクトとしてインスタンス化する。
ドメイン内およびカバレッジシフトの質問応答ベンチマークでは、クローズドブック生成、Web検索、Raw-PDF RAG、MS$^3$検索を10言語モデルで比較する。
MS$^3$は、マクロ平均的な科学的正確性を改善する。
また、引用の含意と答えの完全性も向上する。
これらの結果は、科学的言語モデルのための信頼できる表現層としてメカニズム基板をサポートし、MS$^3$エビデンス不足が、ユーザが既に正しいPDFを供給していると仮定するのではなく、リンクされた論文からのターゲット検索を誘導するソース・リペア・ワークフローを動機付ける。
関連論文リスト
- Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation [60.151050016855834]
DASは出版指向の学術調査を作成するためのステートフルなエージェント・フレームワークである。
その鍵となる考え方は、再利用可能な紙分析とトピック固有の原稿構築を分離することである。
DASは4つの次元で最高点に達し、総合スコアは4.34であり、最強の競争相手は4.03である。
論文 参考訳(メタデータ) (2026-08-18T17:29:00Z) - LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering [30.616598264585203]
本稿では,学術論文に対する文献的回答のベンチマークであるLitTraceQAを紹介する。
研究質問と論文のメタデータプールが与えられた場合、システムは3つの接続された出力を返す必要がある。
我々は4,859枚のユニークなゴールド・ペーパーの4,978枚のユニーク・クエスト・レコードを用いて、より大規模な最終アノテーション・コレクションを解析した。
論文 参考訳(メタデータ) (2026-08-07T16:11:52Z) - HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - Agents-K1: Towards Agent-native Knowledge Orchestration [59.22667222947257]
textbfAgents-K1はエンドツーエンドの知識オーケストレーションパイプラインである。
生文書をエージェントネイティブな科学知識グラフに変換する。
我々は6つの被験者にわたる246万件の科学論文を処理し、TextbfScholar-KGを作成し、そのうち100万件の論文のサブセットを公開します。
論文 参考訳(メタデータ) (2026-06-11T17:58:35Z) - Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis [8.055788977592144]
材料科学文献分析は、合成、処理、特徴付け、資産関係に同時に注意を払う必要がある。
ここでは、論文レベルのレポート生成から検索に基づく質問応答を分離する、スキル駆動型エージェントフレームワークであるAlphaAgentを紹介する。
専用のスキルは、ユーザ要求を素材固有の意図に書き換え、Journal Reports Citation and Metallurgical Engineeringの30万以上の論文のキュレートされたインデックスをクエリし、初期証拠が不十分な場合にクエリを再構築する。
論文 参考訳(メタデータ) (2026-05-10T13:00:32Z) - From Articles to Premises: Building PrimeFacts, an Extraction Methodology and Resource for Fact-Checking Evidence [27.242475349674155]
PrimeFactsは、完全な事実チェック記事からきめ細かい証拠を抽出する方法論である。
我々は13,106のPoitiFact記事にクレーム、評決、およびすべての参照ソースをまとめる。
私たちのフレームワークは、アンカー文をスタンドアローンでコンテキストに依存しない前提に書き直します。
論文 参考訳(メタデータ) (2026-05-07T10:58:29Z) - PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers [52.97586643334384]
本稿ではエージェントディープリサーチのベンチマークであるPaperScopeを紹介する。
3年にわたる2000以上のAI論文の知識グラフ上に構築されている。
意味的に関連するキー情報ノードを統合し、最適化されたランダムウォーク記事セレクタを使用する。
論文 参考訳(メタデータ) (2026-04-13T11:07:08Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - FlyAOC: Evaluating Agentic Ontology Curation of Drosophila Scientific Knowledge Bases [10.00386797940562]
本研究では,FlyBenchを用いて,エンドツーエンドのエージェントキュレーションにおけるAIエージェントの評価を行う。
遺伝子記号のみが与えられた場合、エージェントは構造化アノテーションを生成するために16,898のフルテキスト文書のコーパスを検索して読み込まなければならない。
このベンチマークには、FlyBaseから引き出された100の遺伝子にまたがる、専門家による7,397のアノテーションが含まれている。
論文 参考訳(メタデータ) (2026-02-09T20:12:38Z) - BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature [21.872874595027824]
BibAgentは、自動引用検証のためのスケーラブルでエンドツーエンドのエージェントフレームワークである。
検索、推論、アダプティブ・エビデンス・アグリゲーションを統合し、アクセス可能で有料のソースに戦略を適用する。
以上の結果から,BibAgentは引用精度と解釈可能性において,最先端のLarge Language Model(LLM)のベースラインよりも優れていた。
論文 参考訳(メタデータ) (2026-01-12T16:30:45Z) - SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature [52.36039386997026]
我々は科学文献探索のためのオープンソースのフレームワークであるSciRAGを紹介する。
1) 逐次的証拠収集と並列的証拠収集を柔軟に交互に交互に行う適応的検索,(2) 引用グラフを利用して文書を整理・フィルタリングする引用型記号推論,(3) 整合性と透過的帰属性を確保するために回答を計画・批評・洗練するアウトライン誘導合成,である。
論文 参考訳(メタデータ) (2025-11-18T11:09:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。