論文の概要: CRISP: Critical Step Perception for Training Efficient Deep Search Agents
- arxiv url: http://arxiv.org/abs/2608.01867v2
- Date: Tue, 04 Aug 2026 02:03:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.431479
- Title: CRISP: Critical Step Perception for Training Efficient Deep Search Agents
- Title(参考訳): CRISP: 効率的なディープサーチエージェントを訓練するための重要なステップ
- Authors: Haosi Mo, Zihao Yan, Ruiqing Zhang, Zhongli Li, Hexuan Deng, Xuebo Liu, Min Zhang,
- Abstract要約: 本稿では,効率的な深層探索エージェントを重要ステップ認識により訓練するフレームワークであるCRISPを提案する。
ツール使用を均一にペナルティ化する以前の効率の方法とは異なり、CRISPは冗長なものから必要な証拠を収集する相互作用を区別する。
実験の結果、CRISPは、平均的な相互作用をそれぞれ15.1%、33.2%減少させながら、競合する最終回答の精度を維持していることがわかった。
- 参考スコア(独自算出の注目度): 19.74419958232817
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly extended into deep search agents that solve complex questions through multi-step interaction with external search and browsing tools. However, existing agents often incur substantial computational and interaction costs, generating lengthy trajectories that contain redundant queries, inefficient exploration, and irrelevant observations. Existing efficiency-oriented methods usually encourage agents to use tools less frequently, but treating all tool interactions uniformly may also suppress steps that gather necessary evidence. In this paper, we propose CRISP, a framework for training efficient deep search agents through critical step perception. Unlike prior efficiency methods that uniformly penalize tool use, CRISP distinguishes interactions that gather necessary evidence from redundant ones and shapes the training reward to preserve the former while pruning the latter, improving efficiency without sacrificing the evidence needed for correct answers. Specifically, CRISP first constructs critical-step labels with Backward Evidence Induction: starting from the final answer, a strong model traverses a completed search trajectory backward and judges whether each tool-interaction step provides or preserves evidence for the final answer. We then distill these step-wise judgments into a smaller critical-step recognizer, enabling full-trajectory analysis in a single pass. During policy optimization, an efficiency-aware reward is applied only to successful rollouts. Experiments on BrowseComp and HLE-Verified show that CRISP maintains competitive final-answer accuracy while reducing average interaction turns by 15.1% and 33.2%, respectively, demonstrating substantial improvements in interaction efficiency.
- Abstract(参考訳): 大規模言語モデル(LLM)は、外部検索やブラウジングツールとの多段階のインタラクションを通じて複雑な問題を解決するディープ検索エージェントへと拡張されつつある。
しかし、既存のエージェントは、しばしばかなりの計算と相互作用のコストを発生させ、冗長なクエリ、非効率な探索、無関係な観測を含む長い軌道を生成する。
既存の効率指向の手法は、エージェントにツールの使用頻度を下げるよう促すが、すべてのツールの相互作用を均一に扱うことは、必要な証拠を集めるステップを抑えることもできる。
本稿では,効率的な深層探索エージェントをクリティカルステップ認識により訓練するフレームワークであるCRISPを提案する。
ツール使用を均一にペナルティ化する従来の方法とは異なり、CRISPは冗長なものから必要なエビデンスを収集する相互作用を区別し、前者をプルーニングしながら前者を保存するためのトレーニング報酬を形作り、正しい答えに必要なエビデンスを犠牲にすることなく効率を向上させる。
具体的には、CRISPはまず、最終回答から、強力なモデルが完全な探索軌跡を後方に通過し、各ツール-インタラクションステップが最終回答の証拠を提供するか、または保存するかどうかを判断する。
次に、これらの段階的判断をより小さな臨界ステップ認識器に蒸留し、1回のパスで全軌道解析を可能にする。
ポリシー最適化の間、効率を意識した報酬はロールアウトの成功にのみ適用される。
BrowseComp と HLE-Verified の実験は、CRISP がそれぞれ平均的な相互作用を 15.1% と 33.2% に減らし、競合する最終回答の精度を維持していることを示している。
関連論文リスト
- HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents [6.536862833942476]
視覚的接地と検索を1つのアトミックアクションに融合させる並列マルチモーダル検索エージェントHyperEyesを提案する。
6つのベンチマークで、HyperEyes-30Bは最上位のオープンソースエージェントを9.9%上回り、平均5.3倍のツールコールラウンドを減らした。
論文 参考訳(メタデータ) (2026-05-08T03:16:08Z) - AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning [52.305422887002656]
本稿では,自己生成中間回答を用いて各探索ステップを評価する強化学習フレームワークを提案する。
自己回答機構により、AutoSearchは最小限の検索深度を特定し、効率的な検索を促進する。
実験の結果、AutoSearchは検索品質を維持しながら過剰検索を軽減し、精度と効率のトレードオフが優れていることがわかった。
論文 参考訳(メタデータ) (2026-04-19T09:05:48Z) - Learning to Retrieve from Agent Trajectories [72.8923565916533]
我々はエージェント間相互作用データから直接エージェント探索のための検索モデルを訓練すべきであると主張している。
エージェント・トラジェクトリからの学習を新たな訓練パラダイムとして導入し,マルチステップエージェントのインタラクションから指導を導出する。
本研究は,エージェント探索時代における検索の方向性を示すとともに,エージェントトラジェクトリを実用的でスケーラブルな監視源として強調するものである。
論文 参考訳(メタデータ) (2026-03-30T17:59:02Z) - SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents [30.92763154920672]
SRR-Judgeは、推論と探索行動の信頼性の高い段階評価のためのフレームワークである。
SRR-Judgeは、探索積分推論のためのきめ細かいガイダンスを提供し、効率的な後トレーニングアノテーションを可能にする。
SRR-Judgeは、DeepSeek-V3.1のようなより大きなモデルよりも信頼性の高いステップレベルの評価を提供する。
論文 参考訳(メタデータ) (2026-02-08T02:07:41Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning [137.33138614095435]
Retrieval-augmented Generation (RAG) は、大規模言語モデルにおける幻覚の緩和に有効であることが証明されている。
近年、検索に基づく対話をRAGに組み込んで、リアルタイム検索による反復推論を可能にしている。
提案するBi-RARは,各中間ステップを前方方向と後方方向の両方で共同で評価する,新たな検索拡張推論フレームワークである。
論文 参考訳(メタデータ) (2025-11-12T08:29:39Z) - WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich Seeking [60.35109192765302]
情報検索は、自律的な推論と意思決定を可能にする中核的な能力である。
我々は、高カバレッジなISタスクを構築し、効率的なソリューショントラジェクトリを生成するためのフレームワークであるWebLeaperを提案する。
本手法は,強いベースラインに対する有効性と効率性の向上を継続的に達成する。
論文 参考訳(メタデータ) (2025-10-28T17:51:42Z) - Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents [19.31471304268234]
DeSA(Decoupling Search-and-Answering)は,検索最適化と回答生成を明確に分離する単純な2段階トレーニングフレームワークである。
7つのQAベンチマークで、DeSAがトレーニングしたエージェントは検索の振る舞いを継続的に改善し、結果のみのベースラインよりも検索リコールと回答の精度が大幅に向上した。
論文 参考訳(メタデータ) (2025-10-06T11:09:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。