論文の概要: Errors of LLM-Assisted Literature Retrieval in Environmental Science: A Comparison Study of Abstract versus Full-text Based Prompts
- arxiv url: http://arxiv.org/abs/2610.05690v1
- Date: Mon, 05 Oct 2026 02:04:32 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:34:45.630927
- Title: Errors of LLM-Assisted Literature Retrieval in Environmental Science: A Comparison Study of Abstract versus Full-text Based Prompts
- Title(参考訳): 環境科学におけるLLM支援文学検索の誤り--要約と全文ベース・プロンプトの比較研究
- Abstract要約: 大規模合成モデル(LLM)が環境科学において正確な情報を取得するかどうかは不明である。
環境科学雑誌5誌の原記事を参照し, 広く使用されているLLMプラットフォームの誤りを定量的に比較した。
抽象的なプロンプトはフルテキストのプロンプトよりもかなり精度が高かった。
- 参考スコア(独自算出の注目度): 33.4246547789668
- License:
- Abstract: Large language models (LLMs) are increasingly used for literature search and synthesis. However, it is unclear whether they retrieve accurate bibliographic information in environmental science. Therefore, we quantitatively compared the errors of widely used LLM platforms in retrieving references related to original articles from five leading environmental science journals (Energy and Environmental Science, Nature Sustainability, Nature Climate Change, Lancet Planetary Health, and Environmental Science and Technology) published in 2024 to 2025. Claude, ChatGPT, Grok, DeepSeek, Perplexity, and Gemini were used as the LLM platforms. LLMs retrieved 10 references for each of the 50 randomly selected original article using either the article's abstract or its full-text as prompt. The retrieved references were subject to a multimetric score ratio combining validity of bibliographic data, Google Scholar link, digital object identifier, Scopus Electronic Identifier and relevance score (cited by or being the index paper), and the proportion of complete fabrication that failed all metrics. Abstract-only prompt yielded significantly higher accuracy than full-text one. This advantage was confirmed in multilevel mixed-effect multivariable regression after adjusting for journal, platform, and output order. Source journal and the position of a reference within the output list were also independently associated with retrieval accuracy, with lower-listed references associated with lower accuracy. These findings suggest that LLM assisted literature retrieval in environmental science remains moderately accurate and overall inconsistent, varying significantly by platform, journal, prompt type, and output position. Abstract-based prompting, as task-aligned information compression, may outperform full-text one in literature retrieval. Caution should be used when generalizing our findings.
- Abstract(参考訳): 大きな言語モデル(LLM)は、文学的な検索と合成にますます使われている。
しかし, 環境科学における正確な文献情報を取得するかどうかは不明である。
そこで,2024年から2025年にかけて発行された5つの主要な環境科学雑誌(エネルギー・環境科学,自然持続性,自然環境変化,ランセットプラネタリーヘルス,環境科学・技術)の原資料の検索において,広く使用されているLLMプラットフォームの誤りを定量的に比較した。
Claude、ChatGPT、Grok、DeepSeek、Perplexity、GeminiがLLMプラットフォームとして使用された。
LLMは、記事の要約または全文をプロンプトとして使用して、ランダムに選択された50のオリジナル記事のそれぞれについて10の参照を検索した。
文献データ, Google Scholar Link, Digital Object ID, Scopus Electronic Identifier and Relevance score (index paper) の妥当性と,すべての指標が失敗した完全製法の割合を組み合わせた多値スコア比が得られた。
抽象的なプロンプトはフルテキストのプロンプトよりもかなり精度が高かった。
この利点は, ジャーナル, プラットフォーム, 出力順序の調整後, 多レベル混合効果多変量回帰において確認された。
ソースジャーナルと出力リスト内の参照の位置は、検索精度と独立に関連付けられ、低いリストの参照は低い精度で関連づけられた。
これらの結果から, LLMは環境科学における文献検索を適度に高精度かつ総合的に不整合に保ち, プラットフォーム, ジャーナル, プロンプトタイプ, 出力位置によって大きく異なることが示唆された。
抽象的なプロンプトは、タスク整合情報圧縮として、文学検索においてフルテキストのプロンプトよりも優れている。
発見の一般化には注意が必要である。
関連論文リスト
- Errors in AI-Assisted Retrieval of Medical Literature: A Comparative Study [29.514173936305784]
大規模言語モデル (LLM) による文献検索は誤った参照につながる可能性がある。
我々は,広く使用されているフリーバージョンLLMプラットフォームの参照検索における誤りを評価する。
論文 参考訳(メタデータ) (2026-03-21T21:39:55Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - How Do LLM-Generated Texts Impact Term-Based Retrieval Models? [76.92519309816008]
本稿では,大規模言語モデル(LLM)が項ベース検索モデルに与える影響について検討する。
言語学的解析により,LLM生成テキストはよりスムーズで低周波なZipf勾配を示すことが明らかとなった。
本研究は,項分布がクエリと密接に一致した文書を優先して,項ベース検索モデルがソースバイアスを示すかどうかを考察する。
論文 参考訳(メタデータ) (2025-08-25T06:43:27Z) - Scientific Paper Retrieval with LLM-Guided Semantic-Based Ranking [23.23119083861653]
SemRankは効率的かつ効率的な紙検索フレームワークである。
クエリ理解と概念ベースのセマンティックインデックスを組み合わせる。
実験の結果、SemRankは様々なベースレトリバーの性能を一貫して改善していることがわかった。
論文 参考訳(メタデータ) (2025-05-27T22:49:18Z) - How Deep Do Large Language Models Internalize Scientific Literature and Citation Practices? [1.130790932059036]
論文の引用において,大規模言語モデル (LLM) がマシュー効果の強化に寄与していることが示唆された。
我々はGPT-4oが生成した274,951個の参照を1万件の論文に対して分析した。
論文 参考訳(メタデータ) (2025-04-03T17:04:56Z) - Idiosyncrasies in Large Language Models [54.26923012617675]
大規模言語モデル(LLM)における慣用句の公開と研究
LLM生成テキストへの微調整テキスト埋め込みモデルにより,優れた分類精度が得られることがわかった。
我々はLLMを審査員として利用し、各モデルの慣用句の詳細かつオープンな記述を生成する。
論文 参考訳(メタデータ) (2025-02-17T18:59:02Z) - Mapping the Increasing Use of LLMs in Scientific Papers [99.67983375899719]
2020年1月から2024年2月にかけて、arXiv、bioRxiv、Natureのポートフォリオジャーナルで950,965の論文をまとめて、体系的で大規模な分析を行った。
計算機科学の論文では, LLMの使用が着実に増加し, 最大, 最速の成長が観察された。
論文 参考訳(メタデータ) (2024-04-01T17:45:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。