論文の概要: MemoryWalker: Stop Training Agents on Contexts They Never Saw
- arxiv url: http://arxiv.org/abs/2609.00865v1
- Date: Tue, 01 Sep 2026 08:01:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.444353
- Title: MemoryWalker: Stop Training Agents on Contexts They Never Saw
- Title(参考訳): MemoryWalker: 知らないコンテキストでエージェントを訓練するのをやめる
- Authors: Zinco J, Xunjie Zhu, Shen Huang, Zhenyi Wang, Pengjun Xie, Jieping Ye,
- Abstract要約: 生産エージェントは、ロールアウト中にClaude CodeやQwen-Agent圧縮コンテキストを使用する。
圧縮下でのトレーニングは条件付けの問題を発生させる: すべての信念は有効な歴史を分岐するので、学習対象は列ではなく木である。
我々は、LogitTree と SDCC の2つの正確な勾配等価補正を導入する。
- 参考スコア(独自算出の注目度): 63.70354425435078
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Production agent harnesses such as Claude Code and Qwen-Agent compress context during rollout, but training under compression creates a conditioning problem: every eviction branches the effective history, so the learning object is a tree rather than a sequence. Existing linearizations either retain the rightmost path, causing time-travel leakage, or replay a depth-first traversal, causing train-inference mismatch. We introduce two exact, gradient-equivalent corrections: LogitTree, a segmented K-forward traversal, and a packed 4D attention mask. LogitTree requires K+1 backward passes; the 4D mask requires a custom kernel and white-box eviction records. We also propose SDCC (Self-Distillation for Conditioning Consistency), a single-backward-pass variational relaxation. At each eviction, it minimizes forward KL between the compressed student and a stop-gradient teacher on the reconstructed pre-eviction prefix. A residual per-junction KL of epsilon_KL gives an O(sqrt(epsilon_KL)) bound on the train-deployment total-variation gap. SDCC also applies to black-box harnesses. On seven web-search benchmarks with TC-RAG, AgentFold, MemexRL, Claude Code, and OpenCode, naive training inflates the train-rollout log-probability gap, especially on eviction-heavy batches. The exact methods stay at the no-compression floor, and SDCC substantially closes the gap, with lower logit drift and higher rollout rewards.
- Abstract(参考訳): 生産エージェントは、ロールアウト中にClaude CodeやQwen-Agent圧縮コンテキストを利用するが、圧縮下のトレーニングでは条件付けの問題が発生する。
既存の線形化は、最右の経路を保持し、タイムトラベルのリークを引き起こすか、深度優先のトラバースを再生し、列車のミスマッチを引き起こす。
我々は2つの厳密な勾配等価補正、LogitTree、セグメント化されたK-forward traversal、および充填された4Dアテンションマスクを導入する。
LogitTreeはK+1の後方パスを必要とし、4Dマスクはカスタムカーネルとホワイトボックスの消去レコードを必要とする。
また,SDCC (Self-Distillation for Conditioning Consistency) も提案する。
各エヴィジョンにおいて、圧縮された学生と再構成されたプレエヴィジョンプレフィックス上の停止段階の教師との間の前方KLを最小化する。
エプシロン_KLの残差1接合KLは、O(sqrt(epsilon_KL))を列車分割全変分ギャップに結合させる。
SDCCはブラックボックスハーネスにも適用される。
TC-RAG、AgentFold、MemexRL、Claude Code、OpenCodeの7つのWeb検索ベンチマークでは、特に退行頻度の高いバッチにおいて、トレインロールアウトのログ確率ギャップが肥大化している。
正確な方法は圧縮されていないフロアに留まり、SDCCはロジットドリフトが低く、ロールアウト報酬も高く、ギャップをかなり閉じる。
関連論文リスト
- CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation [2.587194279527956]
CADENCEは統合されたフレームワークで、各障害モードに対してターゲットとなる修正を行う。
DRIFTは、学生サンプル軌道上の前方KLと逆KLのサロゲートを混合したトーケンの凸をスケジュールする。
A)COVA、(B)FTB、(B)大域正規化エントロピー参照による高エントロピー位置での勾配集中、(D)LAP、可視性優先正しいロールアウト強化、(E)エントロピー非依存キャリブレーション
論文 参考訳(メタデータ) (2026-07-18T20:16:26Z) - Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation [15.564152482735652]
本研究は, プレフィックスソースとトークンレベルKL方向の2つの選択肢を暗黙的に分けた, 代表的なパラダイム, オフ・ポリケーション蒸留, オン・ポリケーション蒸留について述べる。
KL混合とエントロピーゲート長のカリキュラムを提案する。
論文 参考訳(メタデータ) (2026-05-16T06:05:27Z) - TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment [20.277178104190536]
On-policy self-distillation (self-OPD)は、政策が特権的文脈下で自らを教えることによって、強化学習を検証可能な報酬(RLVR)で強化する。
本稿では, 注釈付き臨界スパンのみを蒸留する, 臨界rEasoning (TRACE) のためのToken-Routed Alignmentを提案する。
我々の分析では、TRACEは2つの効果によって説明されている: フォワードKLは、学生が下位に配置する教師支援トークンに対して、無消毒リフトを提供するが、マスキングと崩壊は累積特権-段階的露出を有限に保っている。
論文 参考訳(メタデータ) (2026-05-11T08:45:03Z) - Long Context Pre-Training with Lighthouse Attention [5.900714266080363]
極端配列長の訓練因果変換器は、スケールドドット積注意(SDPA)の2次時間と記憶によってボトルネックとなる
トレーニングのみの対称選択に基づく階層型アテンションアルゴリズムであるLighthouse Attentionを提案する。
階層的な選択もグラデーションフリーであり、複雑で潜在的に非効率な後方パスカーネルを扱うことを免除します。
論文 参考訳(メタデータ) (2026-05-07T16:49:28Z) - Decoupled Kullback-Leibler Divergence Loss [90.54331083430597]
我々は、クルバック・リブラー(KL)の除算損失がデカップリングカルバック・リブラー(DKL)の除算損失と等価であることを証明した。
我々はKL/DKLにクラスワイドなグローバル情報を導入し、個々のサンプルからバイアスを取ります。
提案手法は,新たな最先端の対人ロバスト性を公衆のリーダーボード上で実現する。
論文 参考訳(メタデータ) (2023-05-23T11:17:45Z) - Quick Dense Retrievers Consume KALE: Post Training Kullback Leibler
Alignment of Embeddings for Asymmetrical dual encoders [89.29256833403169]
我々は,高密度検索手法の推論効率を高めるための効率的かつ正確な手法であるKulback Leibler Alignment of Embeddings (KALE)を紹介した。
KALEは、バイエンコーダトレーニング後の従来の知識蒸留を拡張し、完全なリトレーニングやインデックス生成なしに効率的なクエリエンコーダ圧縮を可能にする。
KALEと非対称トレーニングを用いることで、3倍高速な推論を持つにもかかわらず、DistilBERTの性能を超えるモデルを生成することができる。
論文 参考訳(メタデータ) (2023-03-31T15:44:13Z) - SmartBERT: A Promotion of Dynamic Early Exiting Mechanism for
Accelerating BERT Inference [18.456002674399244]
本稿では,SmartBERT と呼ばれる BERT 推論のための動的早期退避と層スキップを併用した新しい動的早期退避法を提案する。
SmartBERTは、いくつかのレイヤを適応的にスキップし、終了するかどうかを適応的に選択できる。
GLUEベンチマークの8つの分類データセットについて実験を行った。
論文 参考訳(メタデータ) (2023-03-16T12:44:16Z) - Improve Agents without Retraining: Parallel Tree Search with Off-Policy
Correction [63.595545216327245]
木探索(TS)における2つの大きな課題に取り組む。
我々はまず、TSと事前学習された値関数による行動選択が、元の事前学習されたエージェントと比較して性能を低下させるという、反直感的な現象を発見し、分析する。
Batch-BFS(Batch-BFS)は,木の各深さのすべてのノードを同時に前進させるGPUワイドファースト検索である。
論文 参考訳(メタデータ) (2021-07-04T19:32:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。