論文の概要: G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution
- arxiv url: http://arxiv.org/abs/2608.01324v1
- Date: Sun, 02 Aug 2026 15:43:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.16516
- Title: G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution
- Title(参考訳): G-ReAct: 構造-状態共進化によるグラフ誘導深層探索
- Authors: Shaoxiong Yang, Mengyuan Zhang, Shaojun Lin, Chao Li, Wei Liu, Kun Shao, Jian Luan,
- Abstract要約: $textbfG-ReActはディープ検索のための推論フレームワークである。
それは、固定トポロジークエリグラフ上の$textbfstateの進化として推論を整理する。
G-ReActはトレーニングと推論の両方をサポートしている。
- 参考スコア(独自算出の注目度): 16.818086150132853
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep search has become a fundamental capability of large language models (LLMs) for solving open-domain complex tasks. However, existing approaches typically rely on linear sequential reasoning for both trajectory generation and inference, making it difficult to consistently preserve intermediate states and constraints throughout long-horizon multi-hop search. Consequently, they often suffer from context forgetting, search drift, and inefficient exploration. To address these limitations, we propose $\textbf{G-ReAct}$, a reasoning framework for deep search that organizes reasoning as $\textbf{state evolution over a fixed-topology query graph}$. The evolving graph state explicitly tracks search progress and guides subsequent decisions, transforming exploratory search driven by textual history into graph-guided reasoning under explicit constraints. G-ReAct supports both training and inference: it generates high-quality deep-search trajectories for supervised fine-tuning and provides structured guidance for inference-time search without additional fine-tuning. Experiments demonstrate that with only 1.9K generated trajectories for fine-tuning, Qwen3-30B-A3B-Thinking-2507 achieves $52.6\%$ accuracy on BrowseComp-ZH and $79.0\%$ on XBench, outperforming comparable open-source methods trained on substantially larger datasets, including RL-enhanced methods. Furthermore, when applied at inference time, G-ReAct consistently improves the performance of existing strong LLMs on deep-search tasks. We will publicly release all code and model weights.
- Abstract(参考訳): ディープサーチは、オープンドメインの複雑なタスクを解決するための大規模言語モデル(LLM)の基本的な機能となっている。
しかし、既存のアプローチは通常、軌道生成と推論の両方に線形シーケンシャル推論を頼りにしており、長い水平多重ホップ探索を通して中間状態と制約を一貫して保存することは困難である。
その結果、彼らはしばしばコンテキストの忘れ、探索のドリフト、非効率な探索に悩まされる。
これらの制限に対処するため、我々は、深い検索のための推論フレームワークである$\textbf{G-ReAct}$を提案し、固定トポロジークエリグラフ上での推論を$\textbf{state evolutionとして整理する。
進化するグラフ状態は、検索の進捗を明示的に追跡し、その後の決定をガイドし、テキスト履歴によって駆動される探索的検索を、明示的な制約の下でグラフ誘導推論に変換する。
G-ReActはトレーニングと推論の両方をサポートし、教師付き微調整のための高品質な深層探索トラジェクトリを生成し、追加の微調整なしで推論時間探索のための構造化されたガイダンスを提供する。
Qwen3-30B-A3B-Thinking-2507は、微調整のために1.9Kしか生成していないため、BrowseComp-ZH上では522.6\%、XBench上では79.0\%、RL拡張メソッドを含むかなり大きなデータセットでトレーニングされた同等のオープンソースメソッドよりも優れている。
さらに、G-ReActは、推論時に適用した場合、ディープサーチタスクにおける既存の強力なLCMの性能を一貫して改善する。
すべてのコードとモデルの重みを公開します。
関連論文リスト
- Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs [6.058906522832935]
TIGRAG(Token-induced GraphRAG)はトークン共起知識グラフに基づく効率的なグラフ拡張RAGフレームワークである。
推論中に、グラフベースのセマンティック展開とニューラルリグレードを組み合わせて、マルチホップ推論のための相互接続された証拠を検索する。
論文 参考訳(メタデータ) (2026-06-29T10:29:51Z) - CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG [18.557095117884472]
CuSearchは、Search-Depth Greedy Allocation上に構築されたカリキュラムのロールアウトサンプリングフレームワークである。
我々は、ZeroSearch上の標準GRPOよりも最大11.8の正確なマッチングポイントを達成することで、CuSearchが継続的にパフォーマンスを改善していることを示す。
これらの結果は、RLVRベースのエージェントRAGトレーニングにおける検索監督密度の信頼性、アノテーションなしプロキシとして、軌跡ごとの探索深度を確立した。
論文 参考訳(メタデータ) (2026-05-12T06:42:17Z) - DOTRAG: Retrieval-Time Reasoning Along Paths [36.96341842051057]
本研究では,学習不要なグラフRAGフレームワークであるDotRAGを提案する。
提案手法は,グラフ探索,無関係領域の探索,および明示的なステップバイステップ推論連鎖に頼ることなく反復的に関係経路を探索するクエリ条件付き制約を生成する。
論文 参考訳(メタデータ) (2026-04-06T22:38:15Z) - Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems [9.226583502132753]
Retrieval-augmented Generation(RAG)とそのグラフベースの拡張(GraphRAG)は、大規模言語モデル(LLM)推論を改善する効果的なパラダイムである。
近年のエージェントサーチシステムでは,推論中の動的,多ラウンド検索,シーケンシャルな意思決定が可能である。
本稿では,エージェント検索に基づく検索基盤として高密度なRAGと代表的なGraphRAG手法を評価する統一ベンチマークであるRAGSearchを紹介する。
論文 参考訳(メタデータ) (2026-04-01T07:21:32Z) - HELP: HyperNode Expansion and Logical Path-Guided Evidence Localization for Accurate and Efficient GraphRAG [53.30561659838455]
大きな言語モデル(LLM)は、しばしば固有の知識境界と幻覚に苦しむ。
Retrieval-Augmented Generation (RAG) は、マルチホップ推論に不可欠な構造的相互依存性をしばしば見落としている。
ヘルプは、複数の単純でマルチホップなQAベンチマークで競合性能を達成し、グラフベースのRAGベースラインよりも28.8$times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-02-24T14:05:29Z) - RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning [69.87510139069218]
Retrieval-Augmented Generation (RAG)は、非パラメトリック知識をLarge Language Models (LLM)に統合する
強化学習(RL)による多ターン推論へのテキストベースRAGの進歩
LLMがマルチターンおよび適応的なグラフテキストハイブリッドRAGを実現するためのRLベースのフレームワークであるモデルを導入する。
論文 参考訳(メタデータ) (2025-12-10T10:05:31Z) - Search-on-Graph: Iterative Informed Navigation for Large Language Model Reasoning on Knowledge Graphs [26.0585592684229]
大規模言語モデル(LLM)は、知識集約型マルチホップ質問では信頼性が保たれていない印象的な推論能力を示している。
本稿では,LLMの反復的なグラフナビゲーションを実現するための,シンプルかつ効果的なフレームワークである検索オングラフ(SoG)を提案する。
Wikidataベンチマーク(以前のベストメソッドよりも+16%改善)とFreebaseベンチマークの一貫性のある改善は特に顕著です。
論文 参考訳(メタデータ) (2025-10-09T21:20:16Z) - DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search [53.27052683356095]
我々はモンテカルロ木探索を直接RLVRトレーニングに統合するフレームワークであるDeepSearchを紹介する。
推論時にのみツリー検索に依存する既存のメソッドとは対照的に、DeepSearchは構造化された検索をトレーニングループに埋め込む。
コントリビューションには,(1)検索ツリー全体にわたって有望なノードを優先するグローバルフロンティア選択戦略,(2)監督のための確実なパスを識別するエントロピーベースのガイダンスによる選択,(3)効率的なソリューションキャッシングによる適応的リプレイバッファトレーニングなどが含まれている。
論文 参考訳(メタデータ) (2025-09-29T20:00:29Z) - GRIL: Knowledge Graph Retrieval-Integrated Learning with Large Language Models [59.72897499248909]
本稿では,Large Language Models (LLM) を用いたエンドツーエンド学習のための新しいグラフ検索手法を提案する。
抽出したサブグラフでは, 構造的知識と意味的特徴をそれぞれ軟式トークンと言語化グラフで符号化し, LLMに注入する。
提案手法は、複雑な推論タスクに対する結合グラフ-LLM最適化の強みを検証し、最先端の性能を一貫して達成する。
論文 参考訳(メタデータ) (2025-09-20T02:38:00Z) - DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL [60.47878242100153]
我々は、ディープサーチエージェントを進化させるためにDeepDiveを提示する。
オープンな知識グラフから複雑で難解な質問を自動的に合成する戦略を提案する。
深層探索によるLLMの長距離推論を強化するために, エンドツーエンドのマルチターン強化学習を適用した。
論文 参考訳(メタデータ) (2025-09-12T17:52:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。