論文の概要: Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents
- arxiv url: http://arxiv.org/abs/2606.05296v1
- Date: Wed, 03 Jun 2026 18:00:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:44.318828
- Title: Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents
- Title(参考訳): エージェントモンテカルロ:ブラックボックスエージェントの強化学習のシミュレーション
- Authors: Dae Yon Hwang, Raunaq Suri, Valentin Villecroze, Anthony L. Caterini, Jesse C. Cresswell, Noël Vouitsis, Brendan Leigh Ross,
- Abstract要約: LLMエージェントは、強化学習(RL)に適したオープンウェイトエージェントと、テスト時に純粋に制御されなければならないブラックボックスエージェントの2つの異なる状態で動作する。
我々は,ブラックボックスエージェントの最適ポリシから直接,エージェントモンテカルロを提案する。
我々は、AgentGymベンチマークから3つの多様な環境においてAMCを検証し、ベースラインの促進よりも大幅に改善したことを示す。
- 参考スコア(独自算出の注目度): 17.301101260503252
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents operate in two distinct regimes: open-weight agents amenable to reinforcement learning (RL) and black-box agents whose behaviour must be controlled purely at test time. Although black-box agents are often backed by state-of-the-art proprietary LLMs, API-only access precludes parameter-level optimization, rendering most RL methods inapplicable. To address this limitation, we turn to a known equivalence between RL and Bayesian inference. We propose Agentic Monte Carlo (AMC) to directly sample from the optimal policy of a black-box agent rather than training it through RL. The optimal policy is a posterior over trajectories whose prior we define as the fixed black-box LLM agent. We employ Sequential Monte Carlo to sample from this posterior by learning a value function to steer the agent while leaving the underlying black-box model unchanged. We validate AMC on three diverse environments from the AgentGym benchmark, demonstrating significant improvements over prompting baselines and even outperforming Group Relative Policy Optimization (GRPO) as we scale the test-time compute of our method. AMC demonstrates the feasibility of performing principled RL-style optimization of black-box LLM agents. Code is available at https://github.com/layer6ai-labs/Agentic-Monte-Carlo
- Abstract(参考訳): LLMエージェントは、強化学習(RL)に適したオープンウェイトエージェントと、テスト時に純粋に制御されなければならないブラックボックスエージェントの2つの異なる状態で動作する。
ブラックボックスエージェントは、しばしば最先端のプロプライエタリなLLMによってバックアップされるが、APIのみのアクセスはパラメータレベルの最適化を妨げ、ほとんどのRLメソッドを適用できない。
この制限に対処するために、RL とベイズ予想の間の既知の等価性に目を向ける。
本稿では, エージェントモンテカルロ (AMC) を用いて, ブラックボックスエージェントの最適ポリシーをRLで学習するのではなく, 直接サンプリングする手法を提案する。
最適方針は、固定ブラックボックスLSM剤として定義されている軌道上の後部である。
我々はシークエンシャル・モンテ・カルロ(Sequential Monte Carlo)を用いて、エージェントを操る値関数を学習し、基礎となるブラックボックスモデルをそのまま残す。
我々は、AgentGymベンチマークから3つの異なる環境においてAMCを検証し、ベースラインの促進や、テスト時間計算をスケールするときにGRPO(Group Relative Policy Optimization)よりも優れていることを実証した。
AMC はブラックボックス LLM エージェントの原則的 RL スタイルの最適化の実現可能性を示した。
コードはhttps://github.com/layer6ai-labs/Agentic-Monte-Carloで入手できる。
関連論文リスト
- Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems [20.971694319263353]
マルチエージェントLLMシステムのためのシンプルで安定したRLトレーニングレシピであるDr. MASを提案する。
MAS博士はエージェントワイド療法を使用し、各エージェントの報酬統計を用いてエージェントごとの利益を正規化する。
MASはマルチエージェントLLMシステムのためのエンドツーエンドのRLトレーニングフレームワークを提供する。
論文 参考訳(メタデータ) (2026-02-09T16:13:39Z) - Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates [53.3717573880076]
JitRL(Just-In-Time Reinforcement Learning、ジャスト・イン・タイム強化学習)は、テスト時間ポリシーの最適化を可能にするトレーニング不要のフレームワークである。
JitRLは、経験の動的で非パラメトリックな記憶を維持し、関連する軌跡を取得して、オンザフライでのアクションの利点を推定する。
WebArenaとJerrichoの実験では、JitRLがトレーニング不要メソッドの間に新しい最先端技術を確立していることが示されている。
論文 参考訳(メタデータ) (2026-01-26T14:16:51Z) - Memento: Fine-tuning LLM Agents without Fine-tuning LLMs [36.3424780932712]
本稿では,適応型大言語モデル(LLM)エージェントのための新しい学習パラダイムを提案する。
本手法は,メモリベースのオンライン強化学習により,低コストで連続的な適応を可能にする。
我々はエージェントモデルを,GAIA検証でトップ1に達するemphMementoというディープリサーチ環境でインスタンス化する。
論文 参考訳(メタデータ) (2025-08-22T07:25:30Z) - Collab: Controlled Decoding using Mixture of Agents for LLM Alignment [90.6117569025754]
人間のフィードバックからの強化学習は、大規模言語モデルを整合させる効果的な手法として現れてきた。
制御された復号化は、再訓練せずに推論時にモデルを整列するメカニズムを提供する。
本稿では,既存の既成のLCMポリシを活用するエージェントベースのデコーディング戦略の混合を提案する。
論文 参考訳(メタデータ) (2025-03-27T17:34:25Z) - $Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training [63.602824642605775]
$Qsharp$ は KL 正規化 RL の値に基づくアルゴリズムで、最適な正規化 $Q$ 関数を使用して参照ポリシーを導出する。
この結果から,LLMのポストトレーニングに有効なアプローチとして$Qsharp$が注目され,性能と理論的保証が向上した。
論文 参考訳(メタデータ) (2025-02-27T21:43:00Z) - Process Reward Models for LLM Agents: Practical Framework and Directions [10.986389591866617]
エージェントプロセス・リワード・モデル (AgentPRM) を導入する。
InversePRMを提案する。これは、明示的な結果の監督なしに、デモから直接プロセス報酬を学習する。
ALFWorldベンチマークで評価したところ、AgentPRMとInversePRMで訓練された3Bモデルは、強力なGPT-4oベースラインよりも優れていた。
論文 参考訳(メタデータ) (2025-02-14T17:34:28Z) - Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models [56.00992369295851]
オープンソースのLarge Language Models(LLM)は、さまざまなNLPタスクで大きな成功を収めていますが、エージェントとして振る舞う場合、それでもAPIベースのモデルよりもはるかに劣っています。
本稿では,(1) エージェント学習コーパスを,(1) エージェント学習データの分布から大きくシフトするエージェント推論と,(2) エージェントタスクが必要とする能力に異なる学習速度を示すエージェント学習コーパスと,(3) 幻覚を導入することでエージェント能力を改善する際の副作用について述べる。
本稿では,エージェントのためのFLANモデルを効果的に構築するためのエージェントFLANを提案する。
論文 参考訳(メタデータ) (2024-03-19T16:26:10Z) - Reinforcement Learning from LLM Feedback to Counteract Goal
Misgeneralization [0.0]
強化学習(RL)における目標誤一般化に対処する手法を提案する。
目標の誤一般化は、エージェントがその能力のアウト・オブ・ディストリビューションを維持しながら、意図したものよりもプロキシを追求する場合に発生する。
本研究では,大規模言語モデルを用いてRLエージェントを効率的に監視する方法を示す。
論文 参考訳(メタデータ) (2024-01-14T01:09:48Z) - LaGR-SEQ: Language-Guided Reinforcement Learning with Sample-Efficient
Querying [71.86163159193327]
大規模言語モデル(LLM)は、最近、テキストを介してコンテキスト対応の応答を提供するという、印象的な能力を実証した。
この能力は、パターン補完に関連するシーケンシャルな意思決定タスクにおいて、妥当なソリューションを予測するために使われる可能性がある。
第一強化学習(RL)エージェントによって部分的に完了したタスクに対する解を提案するために,LLMのこの予測能力を利用するLaGRを紹介した。
論文 参考訳(メタデータ) (2023-08-21T02:07:35Z) - Policy Search using Dynamic Mirror Descent MPC for Model Free Off Policy
RL [0.0]
強化学習(RL)における最近の研究は、モデルフリー(Mf)-RLアルゴリズムとモデルベース(Mb)-RLアルゴリズムを組み合わせている。
本稿では,Mb軌道最適化のためのオンライン学習と,Mf-RLの外部政治手法を統合する階層的フレームワークを提案する。
論文 参考訳(メタデータ) (2021-10-23T15:16:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。