論文の概要: Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis
- arxiv url: http://arxiv.org/abs/2607.20431v1
- Date: Sun, 10 May 2026 13:00:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.157628
- Title: Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis
- Title(参考訳): エビデンスを意識した資料文献分析のためのスキル抽出エージェント
- Abstract要約: 材料科学文献分析は、合成、処理、特徴付け、資産関係に同時に注意を払う必要がある。
ここでは、論文レベルのレポート生成から検索に基づく質問応答を分離する、スキル駆動型エージェントフレームワークであるAlphaAgentを紹介する。
専用のスキルは、ユーザ要求を素材固有の意図に書き換え、Journal Reports Citation and Metallurgical Engineeringの30万以上の論文のキュレートされたインデックスをクエリし、初期証拠が不十分な場合にクエリを再構築する。
- 参考スコア(独自算出の注目度): 8.055788977592144
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Materials science literature analysis requires simultaneous attention to composition, processing, characterization, and property relationships, yet conventional retrieval-augmented generation pipelines struggle to reconcile heterogeneous tasks within a single retrieve-then-generate architecture. Here we present AlphaAgent, a skill-driven agent framework that decouples retrieval-based question answering from paper-level report generation through explicit skill contracts. A dedicated retrieval skill rewrites user requests into material-specific search intents, queries a curated index of more than 300,000 papers from the Journal Citation Reports Metallurgy and Metallurgical Engineering category, and reformulates queries when initial evidence is insufficient. A separate report-generation skill parses full-text PDFs to produce structured per-paper analytical reports and cross-paper summaries. In a blind evaluation on 40 materials-science questions, half of which required deep analytical reasoning, AlphaAgent substantially outperformed a baseline system matched for underlying model, document index, and retrieval scale, with the largest gains in mechanistic explanation and awareness of credibility boundaries. These results indicate that explicit task separation, refined retrieval intent, and evidence-aware generation improve large-language-model-based literature analysis for materials research.
- Abstract(参考訳): 材料科学文献分析では, 合成, 処理, キャラクタリゼーション, 特性関係に同時に注目する必要があるが, 従来の検索拡張生成パイプラインでは, 単一の検索列生成アーキテクチャ内での不均一なタスクの調整に苦慮している。
ここでは、論文レベルのレポート生成から明示的なスキル契約を通じて、検索に基づく質問応答を分離する、スキル駆動型エージェントフレームワークであるAlphaAgentを紹介する。
専用の検索スキルは、ユーザ要求を素材固有の検索意図に書き換え、Journal Citation Reports Metallurgy and Metallurgical Engineeringの30万以上の論文のキュレートされたインデックスをクエリし、初期証拠が不十分な場合にクエリを再構築する。
レポート生成スキルは、フルテキストのPDFを解析して、構造化された紙毎の分析レポートとクロスペーパー要約を生成する。
深い分析的推論を必要とする40の材料科学の質問に対する盲点評価において、AlphaAgentは基礎となるモデル、文書インデックス、検索スケールに適合するベースラインシステムを大幅に上回り、機械的説明と信頼性境界の認識において最大の利益を得た。
これらの結果から,明示的なタスク分離,精巧な検索意図,エビデンス・アウェア・ジェネレーションが,材料研究における大規模言語モデルに基づく文献分析を改善することが示唆された。
関連論文リスト
- TVIR: Building Deep Research Agents Towards Text--Visual Interleaved Report Generation [63.89818340842003]
TVIR (Text-Visual Interleaved Report Generation) は、100名の専門家によるマルチモーダルディープリサーチタスクのベンチマークである。
TVIR-Agentは階層的なマルチエージェントフレームワークで、アウトラインの構築と画像検索のための強力なベースラインとして機能する。
テキストアセスメントとビジュアルアセスメントを組み合わせたデュアルパスアセスメントフレームワークを開発した。
論文 参考訳(メタデータ) (2026-06-01T14:35:14Z) - Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation [74.0621258662676]
レポート生成のためのマルチエージェントハーネスであるPtahを提案する。
Ptahは計画、研究、執筆段階を通じて、ユーザクエリからレンダリングされたWebレポートまでのライフサイクルを編成する。
検証エージェントがハーネスの受け入れ機能として機能し、ワークフロー全体を通して事実的接地、引用の忠実性、相互の整合性を強制する。
論文 参考訳(メタデータ) (2026-05-28T12:40:34Z) - IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review [10.586701795115609]
IntrAgentは、情報検索のために文学を読むときの人間の行動を模倣するように設計されている。
関連するセクションを特定し、キーの詳細を反復的に抽出して、検索した情報を精査する。
IntrAgentは最先端のRAGや研究エージェントのベースラインよりも13.2%高いドメイン間精度を実現している。
論文 参考訳(メタデータ) (2026-04-23T01:55:08Z) - FlyAOC: Evaluating Agentic Ontology Curation of Drosophila Scientific Knowledge Bases [10.00386797940562]
本研究では,FlyBenchを用いて,エンドツーエンドのエージェントキュレーションにおけるAIエージェントの評価を行う。
遺伝子記号のみが与えられた場合、エージェントは構造化アノテーションを生成するために16,898のフルテキスト文書のコーパスを検索して読み込まなければならない。
このベンチマークには、FlyBaseから引き出された100の遺伝子にまたがる、専門家による7,397のアノテーションが含まれている。
論文 参考訳(メタデータ) (2026-02-09T20:12:38Z) - DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing [53.85037373860246]
本稿では,情報統合能力を客観的に評価するためのベンチマークであるDeep Synth-Evalを紹介する。
一般チェックリスト(実例)と制約チェックリスト(構造体)を用いたきめ細かい評価プロトコルを提案する。
その結果,エージェント型プラン・アンド・ライトは単ターン生成よりも大幅に優れていた。
論文 参考訳(メタデータ) (2026-01-07T03:07:52Z) - LongDA: Benchmarking LLM Agents for Long-Document Data Analysis [55.32211515932351]
LongDAは、長いドキュメントと複雑なデータをナビゲートする実際の設定をターゲットとしています。
LongTAは、ドキュメントアクセス、検索、コード実行を可能にするツール拡張されたエージェントフレームワークである。
実験の結果, 最先端モデルにおいても, かなりの性能差が認められた。
論文 参考訳(メタデータ) (2026-01-05T23:23:16Z) - OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment [63.662126457336534]
OpenNoveltyは、透明で証拠に基づく新規性分析のためのエージェントシステムである。
回収された実論文のすべての評価を根拠にし、検証可能な判断を確実にする。
OpenNoveltyは、公正で一貫性があり、エビデンスに支えられたピアレビューを促進するスケーラブルなツールで、研究コミュニティに力を与えることを目指している。
論文 参考訳(メタデータ) (2026-01-04T15:48:51Z) - SciNetBench: A Relation-Aware Benchmark for Scientific Literature Retrieval Agents [12.057215000080705]
本稿では,文献検索エージェントのためのSciNetBenchを提案する。
本ベンチマークでは,新しい知識構造を持つ論文のエゴ中心検索,学術的関係のペアワイド同定,科学的進化的軌道のパスワイド再構築の3つのレベルを体系的に評価した。
関係認識検索タスクの精度は20%以下に低下することが多く、現在の検索パラダイムの中核的な欠点が浮かび上がっている。
論文 参考訳(メタデータ) (2025-12-16T02:53:02Z) - Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - Analise Semantica Automatizada com LLM e RAG para Bulas Farmaceuticas [0.0]
本研究では,大規模言語モデル(LLM)と組み合わせたRAGアーキテクチャを用いて,PDF形式の文書解析を自動化する。
本提案では, 埋め込み, 意味データ抽出, 文脈化自然言語応答の生成によるベクトル探索手法を統合する。
論文 参考訳(メタデータ) (2025-07-07T17:48:15Z) - Benchmarking Deep Search over Heterogeneous Enterprise Data [73.55304268238474]
検索強化生成(RAG)の形式を評価するための新しいベンチマークを提案する。
RAGは、多種多様な、しかし関連するソースに対して、ソースを意識したマルチホップ推論を必要とする。
製品計画、開発、サポートステージをまたいだビジネスをシミュレートする合成データパイプラインを使用して構築します。
論文 参考訳(メタデータ) (2025-06-29T08:34:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。