論文の概要: Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.18481v1
- Date: Mon, 20 Jul 2026 19:58:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.237237
- Title: Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning
- Title(参考訳): Search-on-Graph-R1:強化学習による知識グラフ検索のための大規模言語モデルの学習
- Abstract要約: Search-on-Graph-R1はナビゲーションを8Bモデルに内部化する。
ソグロンは8Bで凍結フロンティア-LLM系を上回ります。
- 参考スコア(独自算出の注目度): 44.1709905429432
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge graph question answering (KGQA) requires navigating from topic entities to an answer several relations away. Recent methods prompt a frontier LLM to explore the graph through a retrieval tool, but their reliance on frontier-scale inference makes them costly to deploy. We present Search-on-Graph-R1 (\sogrone{}), which internalizes this navigation into a compact 8B model through supervised fine-tuning (SFT) followed by reinforcement learning (RL). Our central idea is to scaffold a frontier teacher with each question's gold SPARQL query, so the teacher traverses a known answer-bearing path with a live \texttt{Search} tool rather than having to discover the path itself. Since every call executes against a live Freebase server, the resulting trajectories are grounded in the knowledge graph by construction. On WebQSP, CWQ, and GrailQA, \sogrone{} at 8B surpasses every frozen frontier-LLM system in our comparison and posts the strongest results on CWQ of any system we compare against. It does so using no auxiliary module at inference and no LLM judge during training. Isolating each training stage shows that SFT and RL contribute complementary gains, our approach transfers across model families, and RL learns to reach answers in fewer \texttt{Search} calls than its SFT initialization.
- Abstract(参考訳): 知識グラフ質問応答(KGQA)は、トピックエンティティからいくつかの関係に答えるためにナビゲートする必要がある。
近年の手法では、フロンティアLLMが検索ツールを通じてグラフを探索するが、フロンティアスケールの推論に依存するため、デプロイにコストがかかる。
本稿では,このナビゲーションを教師付き微調整(SFT)および強化学習(RL)により,コンパクトな8Bモデルに内部化する検索オングラフR1(\sogrone{})を提案する。
私たちの中心的な考え方は、各質問のゴールドなSPARQLクエリでフロンティアの教師を足場させることです。
すべての呼び出しがライブのFreebaseサーバに対して実行されるので、結果として得られるトラジェクトリは、構築によってナレッジグラフにグラウンドされる。
WebQSP, CWQ, および GrailQA では, 8B における \sogrone{} は凍結フロンティア-LLM 系を全て上回り, 比較したシステムの CWQ 上で最強の結果をポストする。
推論時に補助モジュールを使わず、訓練中にLLMの審査員も使用しない。
各トレーニング段階を分離すると、SFTとRLは相補的な利得を寄与し、我々のアプローチはモデルファミリ間で伝達され、RLはSFTの初期化よりも、より少ない‘texttt{Search}呼び出しで回答に到達することを学ぶ。
関連論文リスト
- Iris: Climbing to the Search Frontier [21.066541702697112]
我々は35B-A3Bスケールと397B-A17Bスケールでトレーニングされた2つの検索エージェントであるIris-miniとIris-proを紹介する。
論文 参考訳(メタデータ) (2026-09-03T17:51:01Z) - GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning [27.83191719981676]
グラフトラジェクトリ拡張RLフレームワークであるtextscGTA-RAG について述べる。
メソッドは、Qwen2.5-3BとQwen2.5-7BのバックボーンでRLベースのRAGベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T16:05:20Z) - LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards [53.339700196282905]
検証可能な報酬(RLVR)による強化学習は,この課題を約束している。
既存の方法は、信頼性の低いインタプリタと、スパースで結果のみの報酬信号によって制限される。
textscLongTraceRLは、ランダムサンプリングやワンショット検索によって作られたものよりもはるかに難しいトレーニングコンテキストを生成する。
論文 参考訳(メタデータ) (2026-05-29T17:51:40Z) - GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum [22.56991897386462]
エージェント知識グラフ質問応答(KGQA)は、エージェントが知識グラフ(KG)と反復的に対話する必要がある。
既存のアプローチではエージェント探索が制限されることが多いが、現在のトレーニングパイプラインは通常、事前に定義された軌道に対する推論を限定する。
本稿では,これらの課題に対処するエージェントKGQAフレームワークである textitGraphWalker を提案する。
論文 参考訳(メタデータ) (2026-03-30T14:56:59Z) - GraphDancer: Training LLMs to Explore and Reason over Graphs via Curriculum Reinforcement Learning [19.78190825157365]
大規模な言語モデルは、事実性を改善するために外部知識に依存している。
多くの実世界の知識ソースは、平文ではなく異種グラフとして整理されている。
提案するGraphDancerは,LLMに推論と関数の実行をインターリーブしてグラフをナビゲートするフレームワークである。
論文 参考訳(メタデータ) (2026-01-24T02:44:49Z) - MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval [50.30107119622642]
大規模言語モデル(LLM)は推論と生成において優れているが、本質的には静的事前学習データによって制限されている。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識に基盤を置くことでこの問題に対処する。
MarAG-R1は、LLMが複数の検索機構を動的に調整できる強化学習型マルチツールRAGフレームワークである。
論文 参考訳(メタデータ) (2025-10-31T15:51:39Z) - Search-on-Graph: Iterative Informed Navigation for Large Language Model Reasoning on Knowledge Graphs [26.0585592684229]
大規模言語モデル(LLM)は、知識集約型マルチホップ質問では信頼性が保たれていない印象的な推論能力を示している。
本稿では,LLMの反復的なグラフナビゲーションを実現するための,シンプルかつ効果的なフレームワークである検索オングラフ(SoG)を提案する。
Wikidataベンチマーク(以前のベストメソッドよりも+16%改善)とFreebaseベンチマークの一貫性のある改善は特に顕著です。
論文 参考訳(メタデータ) (2025-10-09T21:20:16Z) - GRIL: Knowledge Graph Retrieval-Integrated Learning with Large Language Models [59.72897499248909]
本稿では,Large Language Models (LLM) を用いたエンドツーエンド学習のための新しいグラフ検索手法を提案する。
抽出したサブグラフでは, 構造的知識と意味的特徴をそれぞれ軟式トークンと言語化グラフで符号化し, LLMに注入する。
提案手法は、複雑な推論タスクに対する結合グラフ-LLM最適化の強みを検証し、最先端の性能を一貫して達成する。
論文 参考訳(メタデータ) (2025-09-20T02:38:00Z) - LTRR: Learning To Rank Retrievers for LLMs [53.285436927963865]
ルーティングベースのRAGシステムは、単一リトリバーベースのシステムよりも優れていることを示す。
パフォーマンス向上は、特にAnswer Correctness(AC)メトリックでトレーニングされたモデルで顕著である。
SIGIR 2025 LiveRAG チャレンジの一環として,提案システムを用いて提案手法の有効性を実証した。
論文 参考訳(メタデータ) (2025-06-16T17:53:18Z) - Enhancing Large Language Models with Reward-guided Tree Search for Knowledge Graph Question and Answering [8.449873147110516]
大規模言語モデル(LLM)は、知識グラフ質問回答(KGQA)タスクにおいて素晴らしいパフォーマンスを示している。
本稿では、RTSoG(Reward-guided Tree Search on Graph)と呼ばれる、KGQAタスクのための新しい学習不要フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-18T15:52:57Z) - UniKGQA: Unified Retrieval and Reasoning for Solving Multi-hop Question
Answering Over Knowledge Graph [89.98762327725112]
KGQA(Multi-hop Question Answering over Knowledge Graph)は、自然言語の質問で言及されているトピックエンティティから、複数のホップを持つ回答エンティティを見つけることを目的としている。
我々は、モデルアーキテクチャとパラメータ学習の両方において、検索と推論を統合することで、マルチホップKGQAタスクの新しいアプローチであるUniKGQAを提案する。
論文 参考訳(メタデータ) (2022-12-02T04:08:09Z) - Question-Answer Sentence Graph for Joint Modeling Answer Selection [122.29142965960138]
我々は,質問文,質問文,回答文のペア間のスコアを計算するための最先端(SOTA)モデルを訓練し,統合する。
オンライン推論は、目に見えないクエリのAS2タスクを解決するために実行される。
論文 参考訳(メタデータ) (2022-02-16T05:59:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。