論文の概要: One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.00813v1
- Date: Tue, 01 Sep 2026 07:12:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.427601
- Title: One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning
- Title(参考訳): 予算の1つの政策 : 強化学習による予算意識探索の内在化
- Authors: Xiaowei Sun, Jin Li, Yili Hong, Yikun Fu, Yanghua Xiao,
- Abstract要約: 我々は,予算制約下での予算対応検索を単一ポリシーで行えるフレームワークであるAnySearchを提案する。
第1フェーズでは、明確な予算状態注入と構造化推論プロンプトでエージェントを訓練する。
第2段階では、足場を除去し、エージェントは適応的にサンプル化された予算制約の下で自律的に操作することを学ぶ。
- 参考スコア(独自算出の注目度): 41.55260785497756
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While reinforcement learning has enabled LLM-based search agents to invoke external tools, existing methods train under fixed budgets and cannot adapt when constraints vary at deployment. We propose AnySearch, a framework that enables a single policy to perform budget-aware search under any budget constraint through a training scaffold and curriculum reinforcement learning. In the first phase, we train the agent with explicit budget state injection and structured reasoning prompts that guide efficient allocation under linearly decaying budgets. In the second phase, the scaffold is removed and the agent learns to operate autonomously under adaptively sampled budget constraints, matching inference conditions. Both phases are optimized with a composite reward that couples answer accuracy with budget efficiency through absolute and relative signals, where an adaptive weight amplifies the efficiency signal for high-accuracy queries and attenuates it for low-accuracy ones. Extensive experiments on seven general and multi-hop QA benchmarks show that our method outperforms baselines across all budget scales, generalizes to unseen constraints beyond the training range, and achieves superior tool productivity without excessive token overhead. Our code is available at https://github.com/xwsun01/AnySearch.
- Abstract(参考訳): 強化学習により、LLMベースの検索エージェントは外部ツールを起動できるが、既存のメソッドは固定予算の下で訓練され、デプロイ時に制約が変化しても適応できない。
我々は,AnySearchを提案する。AnySearchは,トレーニングの足場とカリキュラムの強化学習を通じて,予算制約下での予算対応検索を可能にするフレームワークである。
第1段階では、明確な予算状態注入と構造的推論によりエージェントを訓練し、線形減衰予算下での効率的な割当を導出する。
第2のフェーズでは、足場を除去し、エージェントは、適応的にサンプリングされた予算制約の下で自律的に動作することを学び、推論条件に適合する。
両位相は、絶対的および相対的な信号を通じて予算効率に応答し、適応重みは高精度なクエリの効率信号を増幅し、低精度なクエリでは減衰する合成報酬で最適化される。
7つの一般およびマルチホップQAベンチマークの大規模な実験により、我々の手法は全ての予算規模でベースラインを上回り、トレーニング範囲を超えた制約を一般化し、過剰なトークンオーバーヘッドを伴わずに優れたツール生産性を実現する。
私たちのコードはhttps://github.com/xwsun01/AnySearchで利用可能です。
関連論文リスト
- Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs [36.73612668202756]
HABは、PPL由来のステップ比較からステップ固有のトークン予算信号を学ぶ。
GSM8KとMATH500の実験では、HABが標準的なCoTを超えるだけでなく、トークンの使用量を減らすことが示されている。
論文 参考訳(メタデータ) (2026-05-31T11:20:00Z) - When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search [61.73232505100331]
アクティベーションステアリングは、再トレーニングせずにLSMを制御する軽量な方法を提供するが、その効果は概念によって大きく異なる。
我々は介入層と係数に対する予算制約付き最適化としてランク1ステアリングを定式化する。
操作困難の原因の診断にアクティベーション幾何を利用するグラニュラリティおよび表現認識概念工学フレームワークである textitGRACE を提案する。
論文 参考訳(メタデータ) (2026-05-09T14:26:49Z) - Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization [18.737087162461563]
テストタイムの計算スケーリングは、大規模言語モデルのパフォーマンスを向上させるための強力なレバーとなっている。
しかし、これらのテクニックを有限の推論予算の下で展開するには、現在のシステムがほとんど無視する決定が必要である。
我々はこれを制約付き最適化問題(平均計算予算の予測精度を最大化する)として定式化し、2段階のソルベ・テン・ラーンパイプラインで解いた。
論文 参考訳(メタデータ) (2026-04-16T10:39:22Z) - Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search [0.7243632426715941]
Agentic Retrieval-Augmented Generation (RAG) システムは反復検索、計画プロンプト、検索を組み合わせるが、配置設定はツールコールと完了トークンに明確な予算を課している。
本研究では, 探索深度, 検索戦略, 完成予算が, 一定の制約下での精度とコストに与える影響について, 制御された測定結果を示す。
論文 参考訳(メタデータ) (2026-03-09T19:42:21Z) - Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory [56.0946692457838]
BudgetMemは、明示的でクエリ対応のパフォーマンスコスト管理のためのランタイムエージェントメモリフレームワークである。
軽量ルータは、タスク性能とメモリ構築コストのバランスをとるために、モジュール間の予算層ルーティングを実行する。
LoCoMo、LongMemEval、HotpotQAの他、BudgetMemはパフォーマンスが優先されるときに、強力なベースラインを超える。
論文 参考訳(メタデータ) (2026-02-05T18:57:09Z) - Train Long, Think Short: Curriculum Learning for Efficient Reasoning [51.506559652495476]
長さ制御推論のためのカリキュラム学習戦略を提案する。
当社の手法は寛大なトークン予算から始まり、トレーニングをしながら徐々に厳格化します。
GSM8K、MATH500、SVAMP、College Math、GSM+の実験は、カリキュラムベースのトレーニングが固定予算ベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2025-08-12T13:48:03Z) - Why Ask One When You Can Ask $k$? Learning-to-Defer to the Top-$k$ Experts [6.792743621449621]
我々は、Top-k$ Learning-to-Deferの最初のフレームワークを紹介します。
クエリを$k$のコスト効率の高いエンティティに割り当てる。
また、クエリ毎に最適な専門家数を学ぶ適応型変種であるTop-$k(x)$ Learning-to-Deferを提案する。
論文 参考訳(メタデータ) (2025-04-17T14:50:40Z) - Scalable Online Exploration via Coverability [45.66375686120087]
探索は、特に関数近似を必要とする高次元領域において、強化学習において大きな課題である。
従来の探索手法を一般化し,3つの基本デシラタをサポートする新しい目的である$L_Coverageを導入する。
$L_Coverageは、カバー可能性の低いMDPにおけるオンライン(リワードフリーまたは報酬駆動)強化学習のための、最初の計算効率のよいモデルベースおよびモデルフリーのアルゴリズムを可能にする。
論文 参考訳(メタデータ) (2024-03-11T10:14:06Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。