論文の概要: A Human-in-the-Loop Corpus for LLM-Based Simplification of Scientific Summaries
- arxiv url: http://arxiv.org/abs/2607.25630v1
- Date: Tue, 28 Jul 2026 12:12:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.822154
- Title: A Human-in-the-Loop Corpus for LLM-Based Simplification of Scientific Summaries
- Title(参考訳): LLMによる科学サプライヤーの簡易化のためのロボットコーパス
- Authors: Kyuri Im, Michael Färber,
- Abstract要約: 学術テキストの単純化を基礎とした大規模言語モデル(LLM)について検討する。
我々は、専門家の要約を、専門家以外の人たちによりアクセスしやすいバージョンに変換する、ループ内人間ワークフローを提案する。
- 参考スコア(独自算出の注目度): 4.972323953932128
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interdisciplinary research is accelerating, yet scientific papers remain difficult to understand outside their home fields. We study large language model (LLM)-based simplification of scientific texts and present a human-in-the-loop workflow that transforms expert summaries into more accessible versions for non-specialists. Using SciSummNet as the source corpus, we first generate baseline simplifications with GPT-4o-mini. In Phase 1, readers from STEM fields outside computer science identify difficult sentences and phrases and compare the original and GPT-simplified summaries in terms of comprehensibility, naturalness, and simplicity. In Phase 2, computer science experts use this feedback to create expert-edited reference simplifications. We release the resulting corpus together with human judgments and automatic evaluation results. The Phase 1 judgments show a clear preference for the GPT-generated summaries in terms of comprehensibility and simplicity, while qualitative analysis of the Phase 2 edits highlights the importance of preserving domain-specific terminology and the strength of scientific claims. The resulting resource supports the training and benchmarking of simplification systems for cross-disciplinary scientific communication.
- Abstract(参考訳): 学際的な研究は加速しているが、科学論文は家庭の外では理解が難しいままである。
本研究では,大規模言語モデル(LLM)に基づく科学テキストの簡易化について検討し,専門家の要約を非専門家のよりアクセスしやすいバージョンに変換するヒューマン・イン・ザ・ループ・ワークフローを提案する。
ソースコーパスとしてSciSummNetを使用すると、まずGPT-4o-miniでベースラインの単純化を生成する。
フェーズ1では、コンピュータ科学以外のSTEM分野の読者が、難解な文やフレーズを識別し、理解性、自然性、単純性の観点から、原文とGPTを単純化した要約を比較した。
フェーズ2では、コンピュータサイエンスの専門家がこのフィードバックを使って専門家が編集した参照の単純化を作成する。
得られたコーパスを人的判断と自動評価結果とともに解放する。
第1相の判断は、GPT生成した要約を理解性と単純性の観点から明らかに好み、第2相の質的な分析は、ドメイン固有の用語の保存の重要性と科学的主張の強さを強調している。
結果として得られたリソースは、学際的な科学コミュニケーションのための単純化システムのトレーニングとベンチマークをサポートする。
関連論文リスト
- Towards a Science of Collective AI: LLM-based Multi-Agent Systems Need a Transition from Blind Trial-and-Error to Rigorous Science [70.3658845234978]
大規模言語モデル(LLM)はマルチエージェントシステム(MAS)の機能を大幅に拡張した。
この急速な進歩にもかかわらず、この分野はいまだに実証的な試行錯誤に大きく依存している。
このボトルネックは、帰属の曖昧さに起因している。
本稿では,協調運転要因を体系的に同定する要因帰属パラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-05T04:19:52Z) - SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature [52.36039386997026]
我々は科学文献探索のためのオープンソースのフレームワークであるSciRAGを紹介する。
1) 逐次的証拠収集と並列的証拠収集を柔軟に交互に交互に行う適応的検索,(2) 引用グラフを利用して文書を整理・フィルタリングする引用型記号推論,(3) 整合性と透過的帰属性を確保するために回答を計画・批評・洗練するアウトライン誘導合成,である。
論文 参考訳(メタデータ) (2025-11-18T11:09:19Z) - Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning [53.82037883518254]
SciReasは、科学的推論タスクのための様々なベンチマークスイートである。
次に、科学的タスクにおける推論と知識の異なる役割を研究するための探索フレームワークであるKRUXを提案する。
論文 参考訳(メタデータ) (2025-08-26T17:04:23Z) - SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding [22.131371019641417]
大言語モデルの成功にもかかわらず、科学文献理解の課題に直面している。
連続事前学習(CPT)と教師付き微調整(SFT)を統合したハイブリッド戦略を提案する。
我々は科学文献理解に特化したLLMスイートSciLitLLMを提案する。
論文 参考訳(メタデータ) (2024-08-28T05:41:52Z) - Automating Intervention Discovery from Scientific Literature: A Progressive Ontology Prompting and Dual-LLM Framework [56.858564736806414]
本稿では,大規模言語モデル(LLM)を利用した科学文献の介入の同定手法を提案する。
言語病理領域における64,177論文のコーパスから,2,421件の介入が得られた。
論文 参考訳(メタデータ) (2024-08-20T16:42:23Z) - SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature [97.31347312130119]
SciRIFF(Scientific Resource for Instruction-Following and Finetuning)は、トレーニングと評価のための137K命令フォローインスタンスのデータセットで、54のタスクをカバーする。
これらのタスクは、情報抽出、要約、質問応答、クレーム検証、分類の5つの中核的な科学文献理解能力にまたがる。
SciRIFFは、さまざまな科学分野にわたる研究文献から情報を抽出し、合成するための、完全に専門家によって書かれた高品質な命令追跡データセットである。
論文 参考訳(メタデータ) (2024-06-10T21:22:08Z) - What's New? Summarizing Contributions in Scientific Literature [85.95906677964815]
本稿では,論文のコントリビューションと作業状況について,個別の要約を生成するために,論文要約のアンタングル化という新たなタスクを導入する。
本稿では,学術論文のS2ORCコーパスを拡張し,コントリビューション・コントリビューション・コントリビューション・レファレンス・ラベルを付加する。
本稿では, 生成した出力の関連性, 新規性, 絡み合いを報告する総合的自動評価プロトコルを提案する。
論文 参考訳(メタデータ) (2020-11-06T02:23:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。