論文の概要: Smarter by the Moment: Environment-Driven Dynamic Policies for Continual LLM Improvement
- arxiv url: http://arxiv.org/abs/2609.16800v2
- Date: Sun, 20 Sep 2026 14:35:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:28:59.86488
- Title: Smarter by the Moment: Environment-Driven Dynamic Policies for Continual LLM Improvement
- Title(参考訳): 環境駆動型動的ポリシによるLCMの継続的な改善
- Abstract要約: 本稿では,動的ポリシー生成とメモリベースの検索を統合するフレームワークである動的検索型ポリシー生成(DRPG)を提案する。
DRPGをテキストから回答、質問応答、診断、Pythonプログラミングにまたがる6つのベンチマークで評価した。
DRPGのポリシー生成は、検索戦略に対して堅牢であり、事前のポリシー継続性なしに効果的に動作し、コスト効率の良いポリシー生成装置として、小型またはクロスファミリーモデルを利用することができる。
- 参考スコア(独自算出の注目度): 22.481667463025214
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have achieved remarkable progress across diverse domains, but continual adaptation to evolving tasks and environments remains a key challenge. Existing memory-augmented approaches retrieve individual past examples as direct references, but do not explicitly synthesize actionable strategies from them, causing the same types of errors to recur. We propose Dynamic Retrieval-based Policy Generation (DRPG), a framework that integrates memory-based retrieval with a dynamic policy generator, leveraging historical data and environment feedback to produce task-specific policies for continual LLM improvement. We evaluate DRPG across six benchmarks spanning text-to-SQL, question answering, medical diagnosis, and Python programming, using seven LLMs from both proprietary and open-weight families. DRPG outperforms strong baselines across most datasets and models. Further analysis demonstrates that DRPG's policy generation is robust to retrieval strategy, operates effectively without prior policy continuity, and can leverage smaller or cross-family models as cost-efficient policy generators. We also find that the benefit of policy-level guidance depends on task characteristics, offering practical insights into when and under what conditions this mechanism is most effective.
- Abstract(参考訳): 大規模言語モデル(LLM)は様々な領域で顕著な進歩を遂げていますが、タスクや環境への継続的な適応は依然として重要な課題です。
既存のメモリ拡張アプローチでは、個々の過去の例を直接参照として検索するが、実行可能な戦略を明示的に合成しないため、同じタイプのエラーが再帰する。
本研究では,メモリベース検索と動的ポリシー生成を統合した動的検索型ポリシー生成(DRPG)を提案する。
テキストからSQLまでの6つのベンチマーク、質問応答、診断、PythonプログラミングにまたがるDRPGを、プロプライエタリおよびオープンウェイトの両方のファミリーから7つのLSMを用いて評価した。
DRPGは、ほとんどのデータセットやモデルで強力なベースラインを上回ります。
さらなる分析により、DRPGのポリシー生成は検索戦略に堅牢であり、事前のポリシー継続性なしに効果的に動作し、コスト効率の良いポリシー生成装置として小型またはクロスファミリーモデルを利用することができることが示された。
また、政策レベルのガイダンスの利点はタスクの特性に依存しており、このメカニズムがどのような状況で最も効果的かについての実践的な洞察を提供する。
関連論文リスト
- OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks [17.773038952370865]
本稿では,ループポリシーを中心とした自己進化フレームワークであるOpenLoopEvolve(OLE)について述べる。
OLEは、エージェントの観察、計画、記憶、行動、検証、回復、停止、予算管理を、バージョンと系統を持つポータブルなポリシー資産として表現する。
オンラインモードは連続的な操作からのフィードバックに基づいて候補生成をトリガーし、オフラインモードはアーカイブされたトレースと障害証拠から候補ポリシーを検索する。
論文 参考訳(メタデータ) (2026-08-10T09:57:26Z) - LLM-Guided Evolutionary Search for Constraint Model Reformulation to Improve Solver Efficiency [5.774119507201688]
大きな言語モデル(LLM)は、自然言語から正しいモデルを生成することができるが、正しいモデルでさえ解決するのにコストがかかる。
我々は,LLMがユーザ定義ベースラインモデルに対して検証およびベンチマークを行う候補修正を提案する進化的フレームワークを用いる。
既存の保持戦略は、正確さやパフォーマンスを優先するが、コンテキストを明示的に多様化するものではない。
検証に基づく最終モデル選択を用いて,8つのCSPLib問題の戦略を体系的に評価した。
論文 参考訳(メタデータ) (2026-07-30T14:21:55Z) - Policy-Conditioned Policies for Multi-Agent Task Solving [53.67744322553693]
本研究では,ポリシーを人間の解釈可能なソースコードとして表現することでギャップを埋めるパラダイムシフトを提案する。
本研究では,Large Language Models (LLM) を近似インタプリタとして利用することにより,学習問題を再構築する。
我々はこのプロセスを,ポリシーコードをテキスト勾配で最適化するアルゴリズムである TextitProgrammatic Iterated Best Response (PIBR) として定式化する。
論文 参考訳(メタデータ) (2025-12-24T07:42:10Z) - EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models [79.2162092822111]
我々は,一連のナビゲーションタスクにおいて,強化学習(RL)と制御に基づく手法を体系的に評価する。
我々は、JEPA(Joint Embedding Predictive Architecture)を使用して、潜在ダイナミクスモデルを使用し、それを計画に使用します。
その結果,モデルベースプランニングではレイアウトが不明瞭になるのに対して,モデルフリーのRLは高品質なデータから恩恵を受けることがわかった。
論文 参考訳(メタデータ) (2025-02-20T18:39:41Z) - IMLE Policy: Fast and Sample Efficient Visuomotor Policy Learning via Implicit Maximum Likelihood Estimation [3.7584322469996896]
IMLEポリシーは、Implicit Maximum Likelihood Estimation (IMLE)に基づく新しい行動クローニング手法である
複雑なマルチモーダルな振る舞いを学ぶ上で、ベースラインメソッドのパフォーマンスに合わせるために、最小限のデモから効果的に学習し、平均で38%のデータを必要とします。
シミュレーションおよび実環境における多様な操作タスクに対するアプローチを検証し、データ制約下で複雑な振る舞いをキャプチャする能力を示す。
論文 参考訳(メタデータ) (2025-02-17T23:22:49Z) - Adapting to Non-Stationary Environments: Multi-Armed Bandit Enhanced Retrieval-Augmented Generation on Knowledge Graphs [23.357843519762483]
近年の研究では、検索-拡張生成フレームワークと知識グラフを組み合わせることで、大規模言語モデルの推論能力を強力に向上することが示されている。
我々は多目的帯域拡張RAGフレームワークを導入し、多様な機能を持つ複数の検索手法をサポートする。
本手法は,定常環境下での最先端性能を達成しつつ,非定常環境でのベースライン手法を著しく向上させる。
論文 参考訳(メタデータ) (2024-12-10T15:56:03Z) - DRDT: Dynamic Reflection with Divergent Thinking for LLM-based
Sequential Recommendation [53.62727171363384]
進化的思考を伴う動的反射(Dynamic Reflection with Divergent Thinking)という新しい推論原理を導入する。
我々の方法論はダイナミックリフレクション(動的リフレクション)であり、探索、批評、反射を通じて人間の学習をエミュレートするプロセスである。
6つの事前学習 LLM を用いた3つのデータセットに対するアプローチの評価を行った。
論文 参考訳(メタデータ) (2023-12-18T16:41:22Z) - Reparameterized Policy Learning for Multimodal Trajectory Optimization [61.13228961771765]
本研究では,高次元連続行動空間における強化学習のためのパラメータ化政策の課題について検討する。
本稿では,連続RLポリシーを最適軌道の生成モデルとしてモデル化する原理的フレームワークを提案する。
本稿では,マルチモーダルポリシーパラメータ化と学習世界モデルを活用した実用的モデルベースRL手法を提案する。
論文 参考訳(メタデータ) (2023-07-20T09:05:46Z) - Latent-Variable Advantage-Weighted Policy Optimization for Offline RL [70.01851346635637]
オフラインの強化学習メソッドは、新しいトランジションを環境に問い合わせる必要なしに、事前にコンパイルされたデータセットから学習ポリシーを保証します。
実際には、オフラインデータセットは、しばしば異種、すなわち様々なシナリオで収集される。
より広範な政策分布を表現できる潜在変数ポリシーを活用することを提案する。
提案手法は,次回のオフライン強化学習法の性能を,異種データセット上で49%向上させる。
論文 参考訳(メタデータ) (2022-03-16T21:17:03Z) - Policy Information Capacity: Information-Theoretic Measure for Task
Complexity in Deep Reinforcement Learning [83.66080019570461]
課題の難易度について,環境にとらわれない,アルゴリズムにとらわれない2つの定量的指標を提案する。
これらの指標は、様々な代替案よりも、正規化タスク可解性スコアとの相関が高いことを示す。
これらのメトリクスは、鍵設計パラメータの高速かつ計算効率の良い最適化にも使用できる。
論文 参考訳(メタデータ) (2021-03-23T17:49:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。