論文の概要: From Final Artifacts to Trajectories: Retrospective Process Supervision for Evidence-Grounded Long-Form Generation
- arxiv url: http://arxiv.org/abs/2608.30461v1
- Date: Mon, 31 Aug 2026 08:47:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.321002
- Title: From Final Artifacts to Trajectories: Retrospective Process Supervision for Evidence-Grounded Long-Form Generation
- Title(参考訳): 最終人工物から軌道へ:証拠収集型長期生成のための振り返りプロセスのスーパービジョン
- Authors: Junjie Huang, Jiarui Qin, Di Yin, Weiwen Liu, Yong Yu, Xing Sun, Weinan Zhang,
- Abstract要約: RetroGenは、レトロスペクティブプロセスの監視のための自己改善フレームワークである。
専門の工芸品から潜伏軌跡を再構築し、その工芸品に対して検証し、証拠を裏付け、独自の再建データに基づいて模型を訓練する。
実験の結果、RetroGenは接地、忠実な合成、長期にわたるエビデンス検索のタスクを改善していることがわかった。
- 参考スコア(独自算出の注目度): 49.496216822640974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Trajectory data is getting more vital for training large language models for boosting the agentic abilities. Unlike the verifiable domains such as coding or mathematics, scaling trajectory data for open-ended tasks is much more difficult because these tasks lack singular ground truth and are costly to annotate or verify. In this paper, we propose RetroGen, a self-improving framework of retrospective process supervision. Our key observation is that although expert trajectories are scarce, high-quality final artifacts such as literature reviews, analyst reports and legal judgments, are abundant in pre-training data and can be viewed as compressed traces of the evidence-seeking processes that produced them. RetroGen reconstructs candidate latent trajectories from expert artifacts, verifies them against both the artifact and supporting evidence, and trains models on their own successful reconstruction data, without requiring trajectory data from stronger models. Experiments show that RetroGen improves grounding, faithful synthesis, and long-form evidence-seeking agent tasks.
- Abstract(参考訳): エージェント能力を高めるために、大規模言語モデルをトレーニングするために、軌道データはますます重要になっている。
コーディングや数学のような検証可能な領域とは異なり、オープンエンドタスクの軌跡データのスケーリングは、これらのタスクには特異な基礎的真理がなく、注釈や検証に費用がかかるため、はるかに困難である。
本稿では,レトロスペクティブプロセス監視の自己改善フレームワークであるRetroGenを提案する。
我々のキーとなる観察は、専門家の軌跡は乏しいが、文献レビュー、アナリストレポート、法的判断などの高品質な最終成果物は事前学習データに豊富であり、それらを生成した証拠探索過程の圧縮された痕跡と見なすことができることである。
RetroGenは、専門家のアーティファクトから候補の潜在軌道を再構築し、アーティファクトと支持証拠の両方に対して検証し、より強力なモデルからの軌道データを必要とせずに、独自の再構築データに基づいてモデルを訓練する。
実験の結果、RetroGenは接地、忠実な合成、長期にわたるエビデンス検索のタスクを改善していることがわかった。
関連論文リスト
- Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning [42.17614767170884]
そこで本研究では,入力からテキストを推論トレースに広範囲にコピーする手法を提案する。
各プロンプトをタスク関連キーエビデンスと無関係インタプタコンテキストに分離することにより,根本原因が不十分であることを示す。
この診断に触発されたGEARは,キーエビデンスと重複するグラウンドング報酬と無関係な文脈と重複するイントラクタペナルティを付与し,精度を向上する報酬形成手法である。
論文 参考訳(メタデータ) (2026-07-21T17:59:21Z) - AgentTrails: Towards Trust and Reuse for Agentic Tasks [12.615897924172812]
LLMベースのエージェントは、ツールの呼び出し、データベースのクエリ、コードの実行、中間アーティファクトの操作によって複雑なタスクに対処する。
これらのエージェントは、通常、時系列ログとして格納されるトラジェクトリに従い、基礎となるデータフローを隠蔽する。
本稿ではエージェント証明とセンスメイキングのためのプロトタイプシステムであるAgentTrailsを紹介する。
論文 参考訳(メタデータ) (2026-07-21T07:53:58Z) - Experience Graphs: The Data Foundation for Self-Improving Agents [24.60392207371798]
我々は、コード生成、科学的発見、設計といった長期のエージェントタスクがそのような作業負荷であると主張している。
この検索は、私たちがエクスペリエンスグラフと呼ぶ構造化オブジェクトを生成します。
Trellisは、エクスペリエンスグラフを第一級で、管理され、クエリ可能なデータベースとして扱うデータ基盤である。
論文 参考訳(メタデータ) (2026-06-29T06:02:20Z) - Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining [66.89012795621349]
大規模言語モデル(LLM)は、複雑なソフトウェア工学に必要な、深く、長期にわたる推論に苦しむことが多い。
本稿では,再構築による理解という,新しいパラダイムを提案する。
マルチエージェントシミュレーションを用いて潜在エージェント軌道を合成するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T09:23:20Z) - Large Language Models as Realistic Microservice Trace Generators [48.730974361862366]
本稿では,大規模言語モデル (LLM) を用いて, 合成作業負荷トレースを生成する手法を提案する。
我々はTraceLLMが様々な条件下で多様なリアルなトレースを生成し、精度と妥当性の両方において既存のアプローチよりも優れていることを示す。
TraceLLMは、キートレース機能を予測したり、欠落したデータを埋め込むといった、下流のトレース関連タスクに適応する。
論文 参考訳(メタデータ) (2024-12-16T12:48:04Z) - Enhancing Retrieval-Augmented Large Language Models with Iterative
Retrieval-Generation Synergy [164.83371924650294]
検索と生成を反復的に同期させるIter-RetGenと呼ばれる手法により,高い性能が得られることを示す。
モデル出力は、タスクを完了するために必要なものを示し、より関連する知識を取得するための情報的コンテキストを提供する。
Iter-RetGenプロセスは、すべての知識を全体として取得し、構造的な制約なしに生成時の柔軟性をほとんど保持します。
論文 参考訳(メタデータ) (2023-05-24T16:17:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。