論文の概要: GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation
- arxiv url: http://arxiv.org/abs/2607.11503v1
- Date: Mon, 13 Jul 2026 12:54:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.473841
- Title: GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation
- Title(参考訳): GEIS:長期記事作成のためのエージェントスキルの世代評価改善ループ
- Abstract要約: 本稿では、ウィキペディアスタイルの長文記事生成のための名前付き宣言的スキルのループであるGEIS(Generation-Evaluation-Improvement loop of Agent Skills)を提案する。
GEISは、記事作成、ブラウザベースのエビデンスと画像収集、図表示、PDF対応のペア評価、ルールレベルのスキル改善のためのスキルを構成する。
同じ世代のバックエンドの下で、GEISは、Tasi Harnessデフォルトのライターよりも、100ポイントのPDF品質のルーリックで8.0ポイント改善している。
- 参考スコア(独自算出の注目度): 11.803673995781468
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-form article generation remains difficult for large language models because it combines long context, long instructions, and long outputs. Existing multi-agent pipelines such as STORM improve information coverage by simulating role-specialized agents, but their capabilities are often entangled in prompts and fixed procedures, making them hard to inspect, reuse, or iteratively improve. This paper presents GEIS (Generation-Evaluation-Improvement loop of agent Skills), a loop of named and declarative skills for Wikipedia-style long-form article generation. Implemented and evaluated in Tasi Harness, GEIS composes skills for article writing, browser-based evidence and image collection, diagram rendering, PDF-aware pairwise evaluation, and rule-level skill improvement. Its core writing skill follows Request, Plan, Draft, Audit, Refine, and Deliver; the pairwise evaluation skill produces structured quality reports; and the improvement skill maps recurrent findings into permanent patches to the writing skill in our 20-topic experiment. We evaluate GEIS on 20 Wikipedia Featured Article topics. Under the same generation backend, GEIS improves over the Tasi Harness default writer by 8.0 points on a 100-point PDF quality rubric and outperforms STORM on the two comparable writing dimensions, structural quality and content quality. In the 20-topic improvement experiment, the patched writing skill raises the average score from 82.90 to 86.95, with 17 out of 20 topics improved and the gain mainly coming from content quality. These results show that long-form generation can be reframed from a fixed workflow into an inspectable, modular, and evaluation-guided improvement loop.
- Abstract(参考訳): 長いコンテクスト、長い命令、長いアウトプットを組み合わせた長い形式の記事生成は、大きな言語モデルでは難しいままである。
STORMのような既存のマルチエージェントパイプラインは、ロール特化エージェントをシミュレートすることで情報カバレッジを改善するが、その機能はプロンプトや固定プロシージャに絡まっており、検査、再利用、反復的に改善することが難しい。
本稿では、ウィキペディアスタイルの長文記事生成のための名前付き宣言的スキルのループであるGEIS(Generation-Evaluation-Improvement loop of Agent Skills)を提案する。
Tasi Harnessで実装され、評価されているGEISは、記事の執筆、ブラウザベースのエビデンスと画像収集、図面レンダリング、PDF対応のペアワイド評価、ルールレベルのスキル改善のスキルを構成している。
その中核的な筆記スキルは、Request, Plan, Draft, Audit, Refine, Deliver に続く; 相互評価スキルは構造化された品質レポートを生成する; 改善スキルマップは、20のトピックの実験において、筆記スキルに永続的なパッチを繰り返す。
日本語版ウィキペディア特集記事20項目についてGEISを評価した。
同じ世代のバックエンドの下で、GEISは、Tasi Harnessデフォルトのライターを8.0ポイント改善し、100ポイントのPDF品質のルーブリックを出力し、2つの同等の書き込みディメンション、構造的品質とコンテンツ品質でSTORMを上回っている。
20トピック改善実験では、パッチによる筆記スキルが平均スコアを82.90から86.95に引き上げ、20トピック中17トピックが改善され、内容の質が向上した。
これらの結果から, 長期生成は固定ワークフローから検査可能, モジュール化, 評価誘導改善ループに再構成可能であることがわかった。
関連論文リスト
- Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles [56.724847946825285]
Wiki Live Challenge (WLC)は、最新のWikipedia Good Articles(GA)をエキスパートレベルの参照として活用する、ライブベンチマークである。
Wiki Evalは, 品質基準39の細粒度評価手法と, 事実検証性のための厳密な指標を含む総合的な評価フレームワークである。
論文 参考訳(メタデータ) (2026-02-02T03:30:13Z) - DeepWriter: A Fact-Grounded Multimodal Writing Assistant Based On Offline Knowledge Base [10.572896494190669]
私たちはDeepWriterを紹介します。DeepWriterはカスタマイズ可能で、マルチモーダルで、長い形式の書き込みアシスタントで、キュレートされたオフラインの知識ベースで動作します。
構造化されたコーパスから情報を深く掘り下げることで、DeepWriterは一貫性があり、事実上基礎があり、専門レベルのドキュメントを生成する。
ファイナンシャルレポート生成実験は,DeepWriterが高品質で検証可能な記事を生成することを示す。
論文 参考訳(メタデータ) (2025-07-14T02:13:22Z) - GenerationPrograms: Fine-grained Attribution with Executable Programs [72.23792263905372]
コードエージェント」アーキテクチャの最近の進歩に触発されたモジュラー生成フレームワークであるGenerationProgramsを導入する。
GenerationProgramsは、プロセスを2つの異なるステージに分解する: まず、クエリに明示的に調整されたモジュール形式のテキスト操作からなる実行可能なプログラムプランを作成し、次に、プログラムの指定した命令に従ってこれらの操作を実行し、最終的な応答を生成する。
経験的評価は、生成プログラムは文書レベルと文レベルの両方の属性品質を著しく改善することを示している。
論文 参考訳(メタデータ) (2025-06-17T14:37:09Z) - ScoreRAG: A Retrieval-Augmented Generation Framework with Consistency-Relevance Scoring and Structured Summarization for News Generation [0.0]
現在のニュース生成手法は、幻覚、事実的矛盾、ドメイン固有の専門知識の欠如に苦慮している。
ScoreRAGは、検索拡張生成、一貫性関連性評価、構造化要約を組み合わせた多段階フレームワークを通じて、これらの課題に対処する。
論文 参考訳(メタデータ) (2025-06-04T08:35:06Z) - Retrieval is Accurate Generation [99.24267226311157]
本稿では,支援文書の集合からコンテキスト認識句を選択する新しい手法を提案する。
本モデルでは,検索対象のベースラインの中で,最高の性能と低レイテンシを実現する。
論文 参考訳(メタデータ) (2024-02-27T14:16:19Z) - PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models [72.57329554067195]
ProxyQAは、長文生成を評価するための革新的なフレームワークである。
さまざまなドメインにまたがる詳細なヒューマンキュレートされたメタクエストで構成されており、それぞれに事前にアノテートされた回答を持つ特定のプロキシクエストが伴っている。
プロキシクエリに対処する際の評価器の精度を通じて、生成されたコンテンツの品質を評価する。
論文 参考訳(メタデータ) (2024-01-26T18:12:25Z) - Enhancing Retrieval-Augmented Large Language Models with Iterative
Retrieval-Generation Synergy [164.83371924650294]
検索と生成を反復的に同期させるIter-RetGenと呼ばれる手法により,高い性能が得られることを示す。
モデル出力は、タスクを完了するために必要なものを示し、より関連する知識を取得するための情報的コンテキストを提供する。
Iter-RetGenプロセスは、すべての知識を全体として取得し、構造的な制約なしに生成時の柔軟性をほとんど保持します。
論文 参考訳(メタデータ) (2023-05-24T16:17:36Z) - EditEval: An Instruction-Based Benchmark for Text Improvements [73.5918084416016]
編集機能の自動評価のためのインストラクションベース、ベンチマーク、評価スイートであるEditEvalを提示する。
InstructGPTとPEERが最良であることを示す事前学習モデルをいくつか評価するが,ほとんどのベースラインは教師付きSOTA以下である。
我々の分析は、タスクの編集によく使われるメトリクスが必ずしも相関しているとは限らないことを示し、最高の性能を持つプロンプトに対する最適化は、必ずしも異なるモデルに対して強い堅牢性を持つとは限らないことを示唆している。
論文 参考訳(メタデータ) (2022-09-27T12:26:05Z) - GENIE: A Leaderboard for Human-in-the-Loop Evaluation of Text Generation [83.10599735938618]
リーダーボードは、評価を標準化し、独立した外部リポジトリに委譲することで、多くのNLPデータセットのモデル開発を容易にしています。
本研究では、テキスト生成タスクにリーダーボードの容易さをもたらす人間評価リーダーボードであるGENIEを紹介します。
論文 参考訳(メタデータ) (2021-01-17T00:40:47Z) - The Pile: An 800GB Dataset of Diverse Text for Language Modeling [2.3336168869135605]
大規模言語モデルの訓練を目的とした,825 GiB の英語テキストコーパス Pile' を提示する。
パイルは22の多様な高品質のサブセットから作られており、その多くは学術的または専門的な情報源に由来する。
論文 参考訳(メタデータ) (2020-12-31T19:00:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。