論文の概要: LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
- arxiv url: http://arxiv.org/abs/2605.31584v1
- Date: Fri, 29 May 2026 17:51:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.780024
- Title: LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
- Title(参考訳): LongTraceRL:Rubric Rewardsを用いた検索エージェント軌道からのLong-Context Reasoning学習
- Authors: Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li,
- Abstract要約: 検証可能な報酬(RLVR)による強化学習は,この課題を約束している。
既存の方法は、信頼性の低いインタプリタと、スパースで結果のみの報酬信号によって制限される。
textscLongTraceRLは、ランダムサンプリングやワンショット検索によって作られたものよりもはるかに難しいトレーニングコンテキストを生成する。
- 参考スコア(独自算出の注目度): 53.339700196282905
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context reasoning remains a central challenge for large language models, which often fail to locate and integrate key information in extensive distracting content. Reinforcement learning with verifiable rewards (RLVR) has shown promise for this task, yet existing methods are limited by low-confusability distractors and sparse, outcome-only reward signals that cannot supervise intermediate reasoning steps. To address these issues, we introduce \textsc{LongTraceRL}. For data construction, we generate multi-hop questions via knowledge graph random walks and leverage search agent trajectories to build \emph{tiered distractors}: documents the agent read but did not cite (high confusability) and documents that appeared in search results but were never opened (low confusability), producing training contexts that are far more challenging than those built by random sampling or one-shot search. For reward design, we propose a \emph{rubric reward} that uses the gold entities along each reasoning chain as fine-grained, entity-level process supervision. This rubric reward is applied only to responses with correct final answers (positive-only strategy), distinguishing the reasoning quality among correct responses and preventing reward hacking. Experiments on three reasoning LLMs (4B--30B) across five long-context benchmarks demonstrate that \textsc{LongTraceRL} consistently outperforms strong baselines and encourages comprehensive, evidence-grounded reasoning. Codes, datasets and models are available at \href{https://github.com/THU-KEG/LongTraceRL}{https://github.com/THU-KEG/LongTraceRL}.
- Abstract(参考訳): 長いコンテキスト推論は、大きな言語モデルにとって依然として中心的な課題であり、しばしば重要な情報を広範囲に散らばるコンテンツを見つけ統合するのに失敗する。
検証可能な報奨(RLVR)を用いた強化学習は,この課題に対して有望であるが,既存の手法は,中間推論ステップを監督できない低信頼性障害や,結果のみの報奨信号によって制限されている。
これらの問題に対処するために、 \textsc{LongTraceRL} を紹介する。
データ構築のためには、知識グラフのランダムウォークを用いてマルチホップの質問を生成し、検索エージェントのトラジェクトリを活用して「emph{tiered distractors}」を構築する: エージェントが読み取ったが(高い難読性)引用しなかった文書と検索結果に現れるが(低い難読性)決して開かなかった文書を生成し、ランダムサンプリングやワンショット検索によって作られたものよりもはるかに難しいトレーニングコンテキストを生成する。
報酬設計では、各推論チェーンに沿った金のエンティティを細粒度でエンティティレベルのプロセス監視として使用する「emph{rubric reward}」を提案する。
このルーリック報酬は、正の最終回答(正の戦略のみ)の応答のみに適用され、正の応答の推論品質を識別し、報酬ハッキングを防止する。
5つの長文ベンチマークにおける3つの推論 LLM (4B--30B) の実験は、 \textsc{LongTraceRL} が強い基準線を一貫して上回り、包括的でエビデンスに基づく推論を促進することを示した。
コード、データセット、モデルは \href{https://github.com/THU-KEG/LongTraceRL}{https://github.com/THU-KEG/LongTraceRL} で公開されている。
関連論文リスト
- LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards [51.45138356629732]
我々は,疎解報酬を高密度で検証可能な文脈報酬で増強するためにLongRLVRを導入する。
この補助信号は、正しい接地情報を選択するためのモデルを直接インセンティブ化する。
LongRLVRは、すべてのモデルとベンチマークで標準のRLVRよりも一貫して、大幅に優れています。
論文 参考訳(メタデータ) (2026-03-02T18:07:53Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards [60.0970117192627]
強化学習(Reinforcement Learning, RL)は, LLMに基づくディープサーチエージェントの強化に重要な手法である。
既存のアプローチは主にバイナリ結果の報酬に依存しており、エージェントの推論プロセスの包括性と事実性を捉えていない。
ディープサーチエージェントのための微粒化報酬フレームワークである textbfCitation-aware RL Rewards (CaRR) を提案する。
論文 参考訳(メタデータ) (2026-01-09T18:57:53Z) - Lightweight Latent Reasoning for Narrative Tasks [89.94576985780549]
大規模言語モデル(LLM)は、思考の長い連鎖や「推論トレース」を生成することで複雑なタスクに取り組む
本稿では,LiteReasonを提案する。LiteReasonは,標準的なトークンサンプリングとインターリーブすることができ,強化学習と簡単に組み合わせることができる。
LiteReasonは軽量なReasoning Projectorモジュールを使用しており、モデル'スキップ'推論ステップに役立つ持続的な遅延トークンを生成するように訓練されている。
論文 参考訳(メタデータ) (2025-12-01T22:07:32Z) - InfoFlow: Reinforcing Search Agent Via Reward Density Optimization [37.266452141225415]
Reinforcement Learning with Verifiable Rewards (RLVR) はエージェントディープサーチを強化するための有望なアプローチである。
本稿では,この課題を,探索費用単位当たりの報酬改善を目的としたtextbfReward Density Optimization 問題として定式化する。
この問題に3つの側面から対処する体系的なフレームワークである textbfInfoFlow を紹介します。
論文 参考訳(メタデータ) (2025-10-30T15:03:21Z) - FLARE: Faithful Logic-Aided Reasoning and Exploration [47.46564769245296]
タスク分解を用いて問題空間をトラバースする新しい手法を提案する。
我々はLarge Language Modelsを使ってソリューションを計画し、クエリを事実に軟式化し、論理プログラミングコードを使って述語する。
提案手法は,生成したコードに対する推論プロセスの忠実度を計算し,外部の解法に頼らずにマルチホップ探索のステップを解析する。
論文 参考訳(メタデータ) (2024-10-14T19:39:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。