論文の概要: Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents
- arxiv url: http://arxiv.org/abs/2607.22157v1
- Date: Fri, 24 Jul 2026 10:01:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.098192
- Title: Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents
- Title(参考訳): ジョブの学習:凍結重量エージェントのデプロイメントフィードバックからの継続的な学習
- Authors: Valentin Tablan, Scott Taylor, Kristoffer Bernhem,
- Abstract要約: AIエージェントは、実行している各エピソードで学習機会に遭遇し、ほとんどすべてのエピソードを破棄する。
このフィードバックは, 凍結モデルと外部メモリとのペアリングにおいて, 連続学習に十分な信号であることを示す。
1ビットの判定結果から得られた学習は、単一審理成功を1.6$times$ベースラインに引き上げ、修正から2.6$times$に学習し、84のタスクのうち22をベースラインが解決しなかったタスクに変換する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents encounter learning opportunities in every episode they run, and discard nearly all of them: the underlying models are frozen at deployment, so an agent that resolves a difficult request today starts from zero when it recurs tomorrow. Yet ordinary operation already produces feedback, in the form of outcome verdicts and after-the-fact corrections. We show that this feedback is a sufficient signal for continual learning when the frozen model is paired with an external memory that distils each episode into retrievable natural-language rules. On the banking domain of $τ$-bench, against a static-RAG control retrieving over the complete policy corpus, learning from the one-bit outcome verdict lifts single-trial success to 1.6$\times$ the baseline, and learning from corrections to 2.6$\times$, converting 22 of the 84 tasks the baseline never solves. The result spans the deployment spectrum, measured on Mistral Large, an open-weights model that organisations with data sovereignty requirements can self-host, and replicated on a frontier model, Claude Sonnet 5. The accumulated memory also transfers: each model, reading the store built by the other, rises above its own no-memory baseline. The harness, protocol, and data are released.
- Abstract(参考訳): AIエージェントは、実行している各エピソードで学習機会に遭遇し、ほとんどすべてのエピソードを破棄する。基盤となるモデルがデプロイ時に凍結されるため、今日の困難な要求を解決するエージェントは、明日再帰したときにゼロから始まります。
しかし、通常の操作は、結果の判断や事後修正という形で、フィードバックをすでに生成している。
凍結モデルと外部メモリを組み合わせて各エピソードを抽出可能な自然言語規則に変換する場合,このフィードバックは連続学習に十分な信号であることを示す。
バンクドメインの$τ$-benchでは、完全なポリシーコーパスを検索する静的RAGコントロールに対して、1ビットの判定から1ビットの判定から、単一審理成功を1.6$\times$に引き上げ、修正から2.6$\times$に学習し、ベースラインが解決しない84のタスクのうち22を変換する。
データ主権要件を持つ組織が自己ホスト可能なオープンウェイトモデルであるMistral Largeで測定され、フロンティアモデルであるClaude Sonnet 5で複製される。
蓄積されたメモリも転送される: 各モデルは、他のモデルによって構築されたストアを読み、自身のメモリのベースラインの上に上昇する。
ハーネス、プロトコル、データは解放される。
関連論文リスト
- Inverting the Bellman Equation: From $Q$-Values to World Models [57.827849584133425]
我々は、十分に豊富な報酬関数のセットで訓練された価値に基づくエージェントが、ユニークで正確な世界モデルを暗黙的にエンコードしていることを証明した。
ttReacherエージェントの暗黙の世界モデルにのみ訓練されたポリシーは、位置のみのトレーニングにもかかわらず、分布外、速度に基づく目標に準最適であることがわかった。
論文 参考訳(メタデータ) (2026-06-19T07:26:14Z) - Self-CTRL: Self-Consistency Training with Reinforcement Learning [45.9704217495657]
自身の振る舞いを忠実に記述した言語モデル(LM)は、ユーザがより容易に監査、理解、信頼することができる。
本稿では,LMの自己説明と関連する入力に対する動作の一貫性を最適化する自己整合性学習(Self-CTRL)について述べる。
論文 参考訳(メタデータ) (2026-06-16T17:59:40Z) - Scaling Self-Evolving Agents via Parametric Memory [69.96398842169002]
既存のメモリ拡張LDMエージェントは、過去の経験をプロンプト空間にのみ保存する。
自己進化型パラメトリックメモリフレームワークである textttTMEM を導入する。
textttTMEMは、様々なモデルスケールで要約ベースのベースラインと検索ベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-03T07:18:31Z) - Probing for Knowledge Attribution in Large Language Models [45.47366023067617]
大規模言語モデル(LLM)は、しばしば流動的だが根拠のないクレームや幻覚を生成する。
適切な緩和は、モデルの答えがプロンプトまたは内部の重みに基づいているかどうかを知ることに依存する。
モデル隠れ表現に基づいて訓練された単純な線形分類器であるプローブは、帰納的帰属を確実に予測できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:21:12Z) - MERGETUNE: Continued fine-tuning of vision-language models [77.8627788911249]
微調整視覚言語モデル(VLM)は、しばしば事前訓練された知識を破滅的に忘れてしまう。
ゼロショットモデルに適応した後に事前学習した知識を回復するための新しいパラダイムである連続微調整(CFT)を導入する。
論文 参考訳(メタデータ) (2026-01-15T15:15:53Z) - Memento: Fine-tuning LLM Agents without Fine-tuning LLMs [36.3424780932712]
本稿では,適応型大言語モデル(LLM)エージェントのための新しい学習パラダイムを提案する。
本手法は,メモリベースのオンライン強化学習により,低コストで連続的な適応を可能にする。
我々はエージェントモデルを,GAIA検証でトップ1に達するemphMementoというディープリサーチ環境でインスタンス化する。
論文 参考訳(メタデータ) (2025-08-22T07:25:30Z) - Harmonic LLMs are Trustworthy [3.8119386967826294]
我々は,ブラックボックスLLMの強靭性を実時間でテストする直感的な手法を,その局所的な調和性偏差を$gamma$と表現して導入する。
WebQA、ProgrammingQA、TrthfulQAの3つのドメインで、数千のクエリにまたがる10の一般的なLCMで$gamma$を測定します。
論文 参考訳(メタデータ) (2024-04-30T17:00:32Z) - Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning [54.585428241509234]
逆カリキュラム強化学習(RL)によるR$3の学習推論を提案する。
RLは、大規模言語モデルのプロセス監視の利点を達成するために、結果監視のみを採用する。
論文 参考訳(メタデータ) (2024-02-08T16:46:26Z) - ReLU Regression with Massart Noise [52.10842036932169]
本稿では、ReLU回帰の基本的問題として、Rectified Linear Units(ReLU)をデータに適合させることを目標としている。
我々は自然およびよく研究された半ランダムノイズモデルであるMassartノイズモデルにおけるReLU回帰に着目した。
このモデルにおいて,パラメータの正確な回復を実現する効率的なアルゴリズムを開発した。
論文 参考訳(メタデータ) (2021-09-10T02:13:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。