論文の概要: Prompt Chaining in Practice: A Case Study in Automated Scholarly Report Generation
- arxiv url: http://arxiv.org/abs/2607.27210v1
- Date: Wed, 06 May 2026 13:28:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.101151
- Title: Prompt Chaining in Practice: A Case Study in Automated Scholarly Report Generation
- Title(参考訳): Prompt Chaining in Practice:A Case Study in Automated Scholarly Report Generation
- Authors: Andrei Lazarev,
- Abstract要約: このようなタスクに対して,より信頼性の高いアーキテクチャパターンとして,マルチステージのプロンプトチェーン手法を導入し,実証的に評価する。
このアプローチは,学術的な消化を自動生成するAI SciBriefに実装されている。
我々は、複雑な多段階生成タスクにおいて、プロンプトチェインはより信頼性が高く効果的なエンジニアリングアプローチである、と結論付けている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The exponential growth of scholarly publications requires automated tools for effective information synthesis. However, simple, single-shot prompting methods often lack the reliability and quality required for complex synthesis tasks. This paper introduces and empirically evaluates a multi-stage prompt chaining methodology as a more reliable architectural pattern for such tasks. This approach is implemented in our system, AI SciBrief, which automatically generates scholarly digests. We conducted a comparative experiment, measuring the performance of our prompt chaining method against a carefully optimized single-shot baseline. Both systems were evaluated against a human-authored "gold standard" report for the "Education" domain. The results demonstrate a significant difference in reliability: our prompt chaining method achieved a 100% success rate, whereas the optimized baseline failed in 50% of its runs. In terms of quality, the proposed method also demonstrated a clear advantage, achieving a superior ROUGE-L F1-score (0.507 vs. 0.486), driven primarily by higher precision. We conclude that prompt chaining is a more dependable and effective engineering approach for complex, multi-step generative tasks, significantly mitigating the risks of failure and inconsistency inherent in monolithic prompts.
- Abstract(参考訳): 学術出版物の指数的成長には、効果的な情報合成のための自動化ツールが必要である。
しかし、単純な単発プロンプト法は複雑な合成タスクに必要な信頼性と品質を欠いていることが多い。
本稿では,このようなタスクに対して,より信頼性の高いアーキテクチャパターンとして,多段階のプロンプト連鎖手法を導入し,実証的に評価する。
このアプローチは,学術的な消化を自動生成するAI SciBriefに実装されている。
単発単発ベースラインに対して,プロンプトチェイン法の性能を比較検討した。
どちらのシステムも「教育」領域の「ゴールドスタンダード」レポートに対して評価された。
その結果,提案手法が100%の成功率を達成したのに対して,最適化されたベースラインは50%を達成できなかった。
提案手法は,高い精度で駆動される優れたROUGE-L F1スコア(0.507 vs. 0.486)を達成し,品質面でも明らかな優位性を示した。
我々は,モノリシックなプロンプトに固有の障害や不整合のリスクを著しく軽減する,複雑な多段階生成タスクにおいて,プロンプト連鎖はより信頼性が高く効果的なエンジニアリングアプローチである,と結論付けた。
関連論文リスト
- Better, Faster: Harnessing Self-Improvement in Large Reasoning Models [88.9107786925265]
本稿では,2つの単純なyet- Effectiveアプローチにより,大規模推論モデルにおける自己改善を効果的に促進するHSIRを提案する。
具体的には、HSIRはデータの不均衡を軽減するために、検証済みの外部サンプリング戦略を導入する。
HSIRはまた、望ましくないソリューションを定量化しフィルタリングするために、固有の多様性スコアも設計している。
論文 参考訳(メタデータ) (2026-05-24T10:54:46Z) - Evaluating LLM-Based Goal Extraction in Requirements Engineering: Prompting Strategies and Their Limitations [4.451267761568192]
本稿では,Goal-Oriented Requirements Engineering(GORE)プロセスを自動化するための,ソフトウェアドキュメントから機能目標を抽出するアプローチについて議論する。
これらの機能を実装するために,工学的なプロンプトを組み込んだ大規模言語モデルの連鎖を提案する。
パイプラインは最終段階である低レベルゴール識別において61%の精度を達成したが、これらの結果は手動抽出を高速化するツールとして最適であることを示している。
論文 参考訳(メタデータ) (2026-04-24T04:22:17Z) - AutoICE: Automatically Synthesizing Verifiable C Code via LLM-driven Evolution [20.91584024250844]
AutoICEは、検証可能なCコードの合成のための進化的検索である。
90.36$%のコードを検証し、最先端のSOTA(State-of-the-art)アプローチを上回った。
論文 参考訳(メタデータ) (2025-12-08T12:35:10Z) - AutoMalDesc: Large-Scale Script Analysis for Cyber Threat Research [81.04845910798387]
脅威検出のための自然言語の説明を生成することは、サイバーセキュリティ研究において未解決の問題である。
本稿では,大規模に独立して動作する自動静的解析要約フレームワークAutoMalDescを紹介する。
アノテーション付きシード(0.9K)データセットや方法論,評価フレームワークなど,100万以上のスクリプトサンプルの完全なデータセットを公開しています。
論文 参考訳(メタデータ) (2025-11-17T13:05:25Z) - EvoSyn: Generalizable Evolutionary Data Synthesis for Verifiable Learning [63.03672166010434]
我々は、進化的、タスクに依存しない、戦略を導いた、実行可能検証可能なデータ合成フレームワークを紹介します。
問題、多様な候補解、検証成果物を共同で合成する。
これは、人間による注釈付きチェックと戦略によるチェックの合意を強制する一貫性に基づく評価器を通じて戦略を反復的に発見する。
論文 参考訳(メタデータ) (2025-10-20T11:56:35Z) - Automated Skill Decomposition Meets Expert Ontologies: Bridging the Granularity Gap with LLMs [1.2891210250935148]
本稿では,Large Language Models (LLM) を用いた自動スキル分解について検討する。
我々のフレームワークは、パイプラインをプロンプトと生成から正規化とオントロジーノードとのアライメントまで標準化する。
出力を評価するために、コンテンツ精度を評価するために最適な埋め込みベースのマッチングを使用するF1スコアと、粒度を評価するために構造的に正しい配置を信用する階層型F1スコアの2つの指標を導入する。
論文 参考訳(メタデータ) (2025-10-13T12:03:06Z) - Automatic Failure Attribution and Critical Step Prediction Method for Multi-Agent Systems Based on Causal Inference [8.823529310904162]
マルチエージェントシステム(MAS)は複雑なタスクの自動化に不可欠であるが、その実践的展開は障害帰属の課題によって妨げられている。
マルチグラニュラリティ因果推論に基づくMASのための最初の失敗帰属フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-10T15:22:00Z) - Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs [102.48588475875749]
本稿では,新しい並列テスト時間スケーリングフレームワークであるGenerative Self-Refinement (GSR)を紹介する。
GSRは一連の候補応答を並列に生成し、その後自己精製を行い、新しい優れた解を合成する。
提案手法は,5つの数学ベンチマークにおいて,最先端性能を実現する。
論文 参考訳(メタデータ) (2025-08-27T06:51:48Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - A Discrepancy Aware Framework for Robust Anomaly Detection [51.710249807397695]
本稿では,DAF(Disdisrepancy Aware Framework)を提案する。
本手法は,デコーダの欠陥同定に外見に依存しないキューを利用して,その合成外観への依存を緩和する。
単純な合成戦略の下では,既存の手法を大きなマージンで上回り,また,最先端のローカライゼーション性能も達成している。
論文 参考訳(メタデータ) (2023-10-11T15:21:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。