論文の概要: Marginal Advantage Accumulation for Memory-Driven Agent Self-Evolution
- arxiv url: http://arxiv.org/abs/2606.20475v1
- Date: Thu, 18 Jun 2026 16:54:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:40.000292
- Title: Marginal Advantage Accumulation for Memory-Driven Agent Self-Evolution
- Title(参考訳): メモリ駆動型セルフエボリューションのためのマージナルアドバンテージ蓄積
- Authors: Mingyu Yang, Keye Zheng, Congchao Cheng, Yujie Liu, Xingkang Lu, Fan Jiang, Yefei Zheng,
- Abstract要約: マージナルアドバンテージ蓄積(英: Marginal Advantage Accumulation、MAA)は、バッチ式トレース蒸留のためのクロスバッチ、運用レベルのエビデンス蓄積機構である。
後処理アーキテクチャとして、MAAは4つのベンチマークと4つのターゲットモデルで16設定中14設定で最高の結果を達成する。
- 参考スコア(独自算出の注目度): 10.506938395588206
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In batch-style trace distillation, the same memory operation may receive contradictory feedback across different batches. Existing methods lack a cross-batch, operation-level evidence accumulation mechanism, making it impossible to distinguish stably effective operations from accidental hits. This paper formalizes the requirement as two structural conditions, alignability and comparability, and proposes Marginal Advantage Accumulation (MAA). MAA constructs differential signals to make them comparable across batches, accumulates signed evidence per operation via EMA, and ensures cross-batch traceability through semantic identity merging. As a post-processing architecture, MAA achieves the best results in 14 out of 16 settings across 4 benchmarks and 4 target models, consistently outperforming existing batch-level distillation baselines and matching or surpassing online alternatives in most settings, while reducing optimization-phase token consumption by approximately 75%.
- Abstract(参考訳): バッチスタイルのトレース蒸留では、同じメモリ操作が異なるバッチ間で矛盾したフィードバックを受けることがある。
既存の手法には、クロスバッチ、操作レベルのエビデンス蓄積機構が欠如しており、安定した効果的な操作と偶然のヒットを区別することは不可能である。
本稿では,この要件を整合性と整合性という2つの構造条件として定式化し,Marginal Advantage Accumulation (MAA)を提案する。
MAAは、バッチ間で比較できるように差分信号を構築し、EMAを介して操作毎に署名されたエビデンスを蓄積し、セマンティックIDのマージを通じて、クロスバッチトレーサビリティを保証する。
後処理アーキテクチャとして、MAAは4つのベンチマークと4つのターゲットモデルにまたがる16設定中14設定で最高の結果を達成し、既存のバッチレベルの蒸留ベースラインを一貫して上回り、ほとんどの設定でオンライン代替品をマッチングまたは超過し、最適化フェーズトークンの消費を約75%削減します。
関連論文リスト
- MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models [57.87791117741788]
本稿では,モダリティを考慮したPTQフレームワークを提案する。
Distribution-Aware Bias Compensation (DABC) は、長い尾の外れ値からチャネルのバイアスを選択的に吸収する。
また,量子化格子をバイアスマスクと共最適化するために,MDQFO (Morphology-Directed Quantization Function Optimization) を提案する。
論文 参考訳(メタデータ) (2026-06-03T02:05:10Z) - On Discriminative vs. Generative classifiers: Rethinking MLLMs for Action Understanding [53.55135022958052]
閉集合行動理解のためのGAD(Generation-Assisted Discriminative Discriminative)を提案する。
GADは微調整時にのみ動作し、MLLMの事前訓練と完全な互換性を保つ。
時間的行動理解ベンチマークの実験により、GADは生成法よりも精度と効率を向上することが示された。
論文 参考訳(メタデータ) (2026-03-03T03:02:01Z) - Symmetry Breaking in Transformers for Efficient and Interpretable Training [5.624886369964602]
我々は、バッチワイズで未学習なクエリと値バイアスを通じて、望ましい方向を回転空間に挿入する単純な対称性破れプロトコルを導入する。
第一に、単純なメモリ効率の性能を大幅に向上させることができる。
第二に、それ以外は冗長な自転自由度を解釈可能な利用を可能にする。
論文 参考訳(メタデータ) (2026-01-29T19:29:09Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - BEExformer: A Fast Inferencing Binarized Transformer with Early Exits [2.7651063843287718]
BAT(Binarized Early Exit Transformer)とEE(Early Exit)を統合した最初の選択型学習ベーストランスであるBEExformerを紹介する。
BATは符号関数に微分可能な二階近似を用い、重みの符号と大きさの両方を捉える勾配を可能にする。
EEメカニズムは、ソフトルーティング損失推定を伴う中間変圧器ブロック間のエントロピーの分数還元に係わる。
これにより、FLOPを52.08%削減して推論を加速し、深層ネットワークに固有の「過剰な」問題を解くことで精度を2.89%向上させる。
論文 参考訳(メタデータ) (2024-12-06T17:58:14Z) - Recall@k Surrogate Loss with Large Batches and Similarity Mixup [62.67458021725227]
微分不可能な場合、評価計量の勾配降下による直接最適化は不可能である。
本研究は,リコールにおける相異なるサロゲート損失を提案する。
提案手法は,複数の画像検索ベンチマークにおいて最先端の結果を得る。
論文 参考訳(メタデータ) (2021-08-25T11:09:11Z) - A Unified Framework of Surrogate Loss by Refactoring and Interpolation [65.60014616444623]
勾配勾配を有する深層ネットワークのトレーニングにおいて,サロゲート損失を発生させる統一フレームワークUniLossを導入する。
3つのタスクと4つのデータセットに対するUniLossの有効性を検証する。
論文 参考訳(メタデータ) (2020-07-27T21:16:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。