論文の概要: When Should Agents Check External State? Budgeting Observations for Stored Intentions
- arxiv url: http://arxiv.org/abs/2609.37125v2
- Date: Wed, 30 Sep 2026 01:40:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.264975
- Title: When Should Agents Check External State? Budgeting Observations for Stored Intentions
- Title(参考訳): エージェントはいつ外部状態をチェックするべきか? 保管施設の予算観測
- Abstract要約: BudgetPMは、ハード・バッジ・エグゼキューターを共有する2つのポリシーのバリエーションを提供している。
BudgetPM-Staticは軽量のロジスティックスコアラーを使用して、チェックが現在の判断を改善するかどうかを学習する。
BudgetPM-Sequentialは、フルエピソードの後見スケジュールを軽量なポリシーに蒸留する。
- 参考スコア(独自算出の注目度): 22.90985978122328
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Prospective memory allows an agent to retain an intention tied to a future condition, but the stored intention does not reveal whether that condition currently holds. Checking it may require web access, multi-step tool use, and paid calls. Existing systems decide when intentions require attention, but do not allocate the resulting observations under a shared budget. We introduce the first resource-allocation formulation for the external observations required by stored intentions under a shared episode budget. BudgetPM offers two policy variants that share a hard-budget executor. BudgetPM-Static uses a lightweight Logistic scorer to learn whether a check improves the current decision. BudgetPM-Sequential distills full-episode hindsight schedules into a lightweight policy that decides when to spend or reserve capacity using only pre-query information at deployment. We evaluate BudgetPM against two public memory-agent systems, five matched controls, and four hand-designed monitoring or budget-adaptation rules. Across two benchmarks and three backbones, BudgetPM-Static outperforms adapted Mem0 and PMA workflows. On PM-Bench, its Logistic scorer reaches competitive quality--cost operating points alongside higher-capacity scorers and retains 99.9--100\% of unconstrained quality with 42--54\% fewer observations. Under severe scarcity and the same hard caps, BudgetPM-Sequential exceeds the strongest tested natural monitoring schedule by 1.92--2.58 Set F1 points. It reaches the same Set F1 and on-time recall with 16--33\% fewer observations. Matched attribution, exact-cost analysis, and a fixed-budget load intervention link this gain to competition between present and future opportunities. These results yield a demand--capacity design rule: local gating works when capacity covers demand, while future-aware supervision adds value when observations compete across time.
- Abstract(参考訳): 予見記憶により、エージェントは将来の状態に結びついた意図を維持することができるが、格納された意図は、その状態が現在保持されているかどうかを明らかにしない。
チェックには、Webアクセス、マルチステップツールの使用、有償通話が必要になる可能性がある。
既存のシステムは、意図がいつ注意を必要とするかを決定するが、共有予算の下で結果の観測を割り当てない。
本稿では,共有エピソード予算の下で,記憶された意図によって要求される外部観測のための最初の資源配置定式化について紹介する。
BudgetPMは、ハード・バッジ・エグゼキューターを共有する2つのポリシーのバリエーションを提供している。
BudgetPM-Staticは軽量のロジスティックスコアラーを使用して、チェックが現在の判断を改善するかどうかを学習する。
BudgetPM-Sequentialは、事前クエリ情報のみを使用して、いつ使用するか、予約するかを決定する軽量なポリシーに、フルエピソードの後見スケジュールを蒸留する。
我々は,BudgetPMを2つのパブリックメモリエージェントシステム,5つの整合制御,手作業による監視・予算適応ルールに対して評価した。
2つのベンチマークと3つのバックボーンで、BudgetPM-StaticはMem0とPMAのワークフローに適合している。
PM-Benchでは、ロジスティックスコアは高容量のスコアラーと共に競争力のあるコストの操作ポイントに達し、42-54-%の観測で99.9-100-%の非拘束品質を維持している。
BudgetPM-Sequentialは、重度の不足と同じハードキャップの下で、1.92--2.58 セット F1 ポイントで試験された最強の自然観測スケジュールを超えた。
同じセットF1に到達し、16-33\%の観測でオンタイムリコールを行う。
一致した属性、正確なコスト分析、固定予算の負荷介入は、この利益を現在の機会と将来の機会の競争に結び付ける。
これらの結果は、需要-能力設計ルールをもたらす: キャパシティが需要をカバーするとき、ローカルゲーティングは機能する。
関連論文リスト
- SlackDrive: Reclaiming Runtime Slack for Adaptive Driving Inference [63.65135278399311]
我々は、ワールドアクションモデルを駆動するプリ推論計算アロケータである textbfSlackDrive を提案する。
SlackDriveは、モデル実行前の各コントロールステップの計算予算を選択するために、実行中のレイテンシを再利用する。
DriveDreamer-Policyを使用したNAVSIM v2では、SlackDriveはレイテンシ制約付きSを、強いレイテンシ体制の下で最強のベースラインに対して21.7%改善する。
論文 参考訳(メタデータ) (2026-09-23T13:13:19Z) - BudgetBench: A Budget-Tiered Protocol and Pilot Harness for Memory Strategy Evaluation in Local Large Language Model Agents [0.0]
BudgetBenchは、メモリ戦略を比較する際に、呼び出しごとの入出力予算を独立変数として扱うアクティブ予算プロトコルである。
予算は2K、4K、8K、16K、32Kのトークンを網羅し、品質、予算利用、レイテンシ、そして第一級の結果として、予算違反率を記録している。
論文 参考訳(メタデータ) (2026-07-01T19:15:46Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - BAGEN: Are LLM Agents Budget-Aware? [35.04587529168086]
予算対応エージェント(BAGEN)は、受動的コストメトリックではなく、予算をアクティブな制御シグナルとして扱うべきである。
まず、内部予算(エージェント計算から)と外部予算(エージェント行動から)として予算見積もりを体系的に定義する。
次に、予算認識を段階的間隔推定として定式化する。
論文 参考訳(メタデータ) (2026-05-29T17:02:17Z) - Inference-Time Budget Control for LLM Search Agents [21.14983754890843]
マルチホップ質問応答(QA)の問題を2段階の推論時間予算制御として定式化する。
検索時には,各実行可能なアクションに対して,タスクレベルの値情報(VOI)スコアを割り当てる。
探索後、選択的エビデンスグラウンドのファイナライザは、軌道解答を洗練された候補と比較し、残差エラーが低リスクな解形式エラーであるように見える場合にのみ書き換える。
論文 参考訳(メタデータ) (2026-05-07T05:45:58Z) - Learning to Spend: Model Predictive Control for Budgeting under Non-Stationary Returns [0.0]
閉ループ経済制御問題として,有限ホライゾンの予算配分について検討する。
我々は, 回帰水平モデル予測制御(MPC)を, 反応性予算政策と比較して評価した。
論文 参考訳(メタデータ) (2026-04-29T20:39:25Z) - Stateless Decision Memory for Enterprise AI Agents [0.0]
規制領域における長期水平決定エージェントは、検索強化パイプラインによって支配される。
規制されたデプロイメントは、4つのシステムプロパティのロードバランシングです。
本稿では,DPM(Deterministic Projection Memory)を提案する。
論文 参考訳(メタデータ) (2026-04-22T03:51:52Z) - Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory [56.0946692457838]
BudgetMemは、明示的でクエリ対応のパフォーマンスコスト管理のためのランタイムエージェントメモリフレームワークである。
軽量ルータは、タスク性能とメモリ構築コストのバランスをとるために、モジュール間の予算層ルーティングを実行する。
LoCoMo、LongMemEval、HotpotQAの他、BudgetMemはパフォーマンスが優先されるときに、強力なベースラインを超える。
論文 参考訳(メタデータ) (2026-02-05T18:57:09Z) - Monitoring State Transitions in Markovian Systems with Sampling Cost [65.4151496405543]
自然なアプローチは、予想される予測損失がクエリコスト以下で、クエリがなければいつ発生するかを予測する、欲張りのポリシーである。
最適(OPT)戦略は状態依存のしきい値ポリシである。
遷移確率が未知の場合、我々は、グレディポリシーの予測勾配降下(PSGD)に基づく学習変種を提案する。
論文 参考訳(メタデータ) (2025-10-25T15:07:37Z) - Confidence-Budget Matching for Sequential Budgeted Learning [69.77435313099366]
問合せ予算で意思決定問題を定式化する。
我々は,多腕バンディット,線形バンディット,強化学習問題を考察する。
我々は,CBMに基づくアルゴリズムが逆性の存在下で良好に動作することを示す。
論文 参考訳(メタデータ) (2021-02-05T19:56:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。