論文の概要: GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning
- arxiv url: http://arxiv.org/abs/2608.22479v2
- Date: Sun, 30 Aug 2026 08:43:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.673864
- Title: GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning
- Title(参考訳): GTA-RAG:マルチTurn Retrieval-Augmented Reasoningのためのグラフトラジェクトリ強化強化学習
- Authors: Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo,
- Abstract要約: グラフトラジェクトリ拡張RLフレームワークであるtextscGTA-RAG について述べる。
メソッドは、Qwen2.5-3BとQwen2.5-7BのバックボーンでRLベースのRAGベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 27.83191719981676
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG) enables LLMs to access external knowledge for answering knowledge-intensive questions. For complex multi-hop questions, multi-turn retrieval-augmented reasoning extends RAG into an iterative process that repeatedly searches for and integrates evidence across documents. However, existing reinforcement-learning (RL) approaches for agentic RAG are typically optimized with final-answer rewards, which provide sparse supervision and overlook whether the model actually retrieves the required evidence chain. We present \textsc{GTA-RAG}, a graph-trajectory-augmented RL framework for multi-turn retrieval-augmented reasoning. From an entity--document graph, we sample connected document paths, synthesize multi-hop QA trajectories, and validate them with the deployed retriever to obtain executable trajectory-level supervision. We then optimize the retrieval policy with Group Relative Policy Optimization (GRPO) and a trajectory-guided reward that encourages both accurate answers and acquisition of target evidence documents, followed by answer-reward training on natural QA instances. Experiments on three multi-hop and two simple QA benchmarks show that \method{} consistently outperforms RL-based RAG baselines with both Qwen2.5-3B and Qwen2.5-7B backbones, while substantially improving evidence-chain coverage. Our code is available at https://github.com/cjcj46262/GTA-RAG.
- Abstract(参考訳): Retrieval-augmented Generation (RAG) は、LLMが知識集約的な質問に答えるために外部知識にアクセスすることを可能にする。
複雑なマルチホップ問題に対して、マルチターン検索拡張推論はRAGを反復的なプロセスに拡張し、文書をまたいだ証拠を何度も検索し、統合する。
しかしながら、エージェントRAGに対する既存の強化学習(RL)アプローチは、一般的に最終回答報酬に最適化されており、モデルが実際に必要なエビデンスチェーンを回収するかどうかを疎い監視と見落としを提供する。
本稿では,マルチターン検索拡張推論のためのグラフトラジェクトリ拡張RLフレームワークであるtextsc{GTA-RAG}を提案する。
エンティティドキュメントグラフから、接続されたドキュメントパスをサンプリングし、マルチホップQAトラジェクトリを合成し、それらをデプロイされたレトリバーで検証して、実行可能なトラジェクトリレベルの監視を行う。
次に,グループ相対政策最適化(GRPO)と,目標とする証拠文書の正確な回答と取得を奨励する軌道誘導報酬を用いて検索ポリシーを最適化し,続いて自然QAインスタンス上での回答回帰訓練を行う。
3つのマルチホップと2つの単純なQAベンチマークの実験により、'method{} はQwen2.5-3B と Qwen2.5-7B のバックボーンで RL ベースのRAG ベースラインを一貫して上回り、エビデンスチェーンのカバレッジを大幅に改善した。
私たちのコードはhttps://github.com/cjcj46262/GTA-RAGで公開されています。
関連論文リスト
- ConRAG: Consensus-Driven Multi-View Retrieval for Multi-Hop Question Answering [39.600349916489144]
Retrieval-augmented Generation (RAG) は、大規模言語モデル(LLM)をマルチホップ質問応答(QA)上で拡張するための有望なパラダイムとして登場した。
コンセンサス駆動型マルチビューRAGフレームワークであるConRAGを提案する。
論文 参考訳(メタデータ) (2026-05-27T07:51:46Z) - RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning [69.87510139069218]
Retrieval-Augmented Generation (RAG)は、非パラメトリック知識をLarge Language Models (LLM)に統合する
強化学習(RL)による多ターン推論へのテキストベースRAGの進歩
LLMがマルチターンおよび適応的なグラフテキストハイブリッドRAGを実現するためのRLベースのフレームワークであるモデルを導入する。
論文 参考訳(メタデータ) (2025-12-10T10:05:31Z) - ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval [50.30107119622642]
大規模言語モデル(LLM)は推論と生成において優れているが、本質的には静的事前学習データによって制限されている。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識に基盤を置くことでこの問題に対処する。
MarAG-R1は、LLMが複数の検索機構を動的に調整できる強化学習型マルチツールRAGフレームワークである。
論文 参考訳(メタデータ) (2025-10-31T15:51:39Z) - SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent Framework [7.37561751991963]
本稿では,レシーバとジェネレータのギャップを埋めるプロセス管理型マルチエージェントフレームワークを提案する。
提案するフレームワークはモジュール式でプラグアンドプレイで、レトリバーやジェネレータを変更する必要はない。
論文 参考訳(メタデータ) (2025-09-17T09:09:28Z) - FrugalRAG: Learning to retrieve and reason for multi-hop QA [10.193015391271535]
RAGメトリクスを改善するために大規模な微調整は必要ない。
監督されたRLベースの微調整は、粗悪さの観点からRAGに役立つ。
論文 参考訳(メタデータ) (2025-07-10T11:02:13Z) - LTRR: Learning To Rank Retrievers for LLMs [53.285436927963865]
ルーティングベースのRAGシステムは、単一リトリバーベースのシステムよりも優れていることを示す。
パフォーマンス向上は、特にAnswer Correctness(AC)メトリックでトレーニングされたモデルで顕著である。
SIGIR 2025 LiveRAG チャレンジの一環として,提案システムを用いて提案手法の有効性を実証した。
論文 参考訳(メタデータ) (2025-06-16T17:53:18Z) - R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning [60.17074283370798]
Retrieval-Augmented Generation (RAG)は、外部知識をLLM(Large Language Models)と統合し、事実の正しさと幻覚を高める。
我々は、 $textbfR$einforcement Learning を用いて LLM に $textbfR$eason と $textbfR$etrieve を段階的に学習させる $textbfR3-RAG$ を提案する。
論文 参考訳(メタデータ) (2025-05-26T12:25:37Z) - TRACE the Evidence: Constructing Knowledge-Grounded Reasoning Chains for Retrieval-Augmented Generation [30.485127201645437]
本稿では,RAGモデルのマルチホップ推論能力を高めるためにTRACEを提案する。
TRACEは、論理的に連結された一連の知識三重項である知識基底推論連鎖を構成する。
TRACEは、取得したすべてのドキュメントと比較して、平均14.03%の性能向上を実現している。
論文 参考訳(メタデータ) (2024-06-17T12:23:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。