論文の概要: DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation
- arxiv url: http://arxiv.org/abs/2606.29961v1
- Date: Mon, 29 Jun 2026 08:38:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.131597
- Title: DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation
- Title(参考訳): DuoMem: デュアルスペース蒸留によるオンデバイスメモリエージェントの実現に向けて
- Authors: Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami, Andrea Maracani, Ignacio Castro, Matthew Purver, Mete Ozay, Savas Ozkan, Taha Ceritli,
- Abstract要約: DuoMemは、手続き的問題解決能力を大きな教師モデルからコンパクトな学生モデルに転送する二重空間蒸留フレームワークである。
ALFWorldで評価されている。
DuoMemで強化された4Bモデルは、72Bの教師より3倍早くタスクを完了している。
- 参考スコア(独自算出の注目度): 26.38620865128242
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM)-based agents can solve complex procedural tasks by interacting with environments over multiple turns, but this ability typically depends on large models, long contexts, and repeated inference calls. This makes advanced memory-augmented agents difficult to deploy on resource-constrained devices. We introduce DuoMem, a dual-space distillation framework that transfers procedural problem-solving ability from a large teacher model to compact student models. DuoMem distils in two complementary spaces: (1)context-space distillation, which replaces student-generated memories with higher-quality teacher-generated procedural memories prepended to the student's input, and (2)parameter-space distillation, which fine-tunes lightweight LoRA adapters on successful teacher trajectories. Evaluated on ALFWorld, a challenging embodied decision-making benchmark, DuoMem boosts a 4B-parameter model from 4.3% to 77.9% task success rate, closing most of the gap to a 72B teacher model (87.1%), while adding fewer than 10M trainable parameters and only a few megabytes of pre-computed teacher memories. Moreover, the DuoMem-enhanced 4B model completes tasks over 3x faster than the 72B teacher in wall-clock time, making it viable for real-time edge deployment, which would be challenging for the teacher.Extensive ablations across eight models spanning 2B-72B parameters reveal that both distillation axes contribute complementary
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのエージェントは、複数のターンで環境と対話することで複雑な手続き的タスクを解くことができるが、この能力は通常、大きなモデル、長いコンテキスト、繰り返しの推論呼び出しに依存する。
これにより、高度なメモリ拡張エージェントがリソース制約のあるデバイスにデプロイすることが困難になる。
二空間蒸留フレームワークであるDuoMemを導入し、手続き的問題解決能力を大きな教師モデルからコンパクトな学生モデルに伝達する。
DuoMemは,(1)学生が生成した記憶を教師の入力に合わせた高品質な手続き記憶に置き換えるコンテキスト空間蒸留,(2)教師の軌道上で軽量なLoRAアダプターを微調整するパラメータ空間蒸留,の2つの相補的な空間に分散する。
ALFWorldで評価されたDuoMemは、4Bパラメータモデルを4.3%から77.9%のタスク成功率に引き上げ、そのギャップの大部分を72Bの教師モデル(87.1%)に閉じると同時に、トレーニング可能なパラメータを10万未満に加え、数メガバイトの事前計算された教師の記憶を追加する。
さらに、DuoMemで強化された4Bモデルは、72B教師より3倍早くタスクを完了し、リアルタイムエッジ展開が可能となり、2B-72Bパラメータにまたがる8モデルにまたがる広範囲な改善により、両者の蒸留軸が相補的となることが判明した。
関連論文リスト
- Generalizable and Efficient Automated Scoring with a Knowledge-Distilled Multi-Task Mixture-of-Experts [5.109529226503146]
UniMoE-Guidedは複数のタスク固有の大規模モデル(教師)から単一のコンパクトでデプロイ可能なモデル(学生)に専門知識を移行する
i)クロスタスク表現のための共有エンコーダ、(ii)共有処理とタスク固有の処理のバランスをとるゲートされたMoEブロック、(iii)軽量タスクヘッドを組み合わせる。
論文 参考訳(メタデータ) (2025-11-18T04:55:44Z) - Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning [89.55738101744657]
大規模言語モデル(LLM)は、幅広いNLPタスクで印象的な機能を示しているが、基本的にはステートレスである。
本稿では,LLMに外部メモリを積極的に管理・活用する機能を備えた強化学習フレームワークであるMemory-R1を提案する。
論文 参考訳(メタデータ) (2025-08-27T12:26:55Z) - UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning [22.029614513198663]
メモリ層アーキテクチャは、非常に少ないメモリアクセスで魅力的な代替手段を提供する。
この性能ギャップを埋める再設計されたメモリ層アーキテクチャであるUltraMemV2を提案する。
また,UltraMemV2 は 8-expert MoE モデルと同等の計算量とパラメータを持つが,メモリアクセスは著しく低いことを示す。
論文 参考訳(メタデータ) (2025-08-26T07:33:11Z) - Asymmetric Decision-Making in Online Knowledge Distillation:Unifying Consensus and Divergence [18.640219880439062]
本稿では,中間空間表現を活用する革新的な手法を提案する。
本稿では,学生モデルの特徴コンセンサス学習を強化するために,非対称意思決定(ADM)を提案する。
論文 参考訳(メタデータ) (2025-03-09T16:32:25Z) - SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction [89.56181323849512]
SuperCorrectは、大きな教師モデルを使用して、より小さな学生モデルの推論と反映の両方を監督し、修正する新しい2段階のフレームワークである。
第1段階では、教師モデルから階層的な高レベルかつ詳細な思考テンプレートを抽出し、よりきめ細かい推論思考を導き出す学生モデルを指導する。
第2段階では、学生モデルの自己補正能力を高めるために、クロスモデル協調直接選好最適化(DPO)を導入する。
論文 参考訳(メタデータ) (2024-10-11T17:25:52Z) - Gap Preserving Distillation by Building Bidirectional Mappings with A Dynamic Teacher [43.678380057638016]
Gap Preserving Distillation (GPD) 法は、生徒にこのギャップを埋めるように訓練すると共に、スクラッチから追加の動的教師モデルを訓練する。
実験では、GPDはCNNとトランスフォーマーアーキテクチャの両方で既存の蒸留法よりも大幅に優れている。
GPDはまた、スクラッチからのトレーニングや微調整を含む事前訓練を受けた教師なしでシナリオを一般化し、ResNet18では1.80%と0.89%の大幅な改善を実現している。
論文 参考訳(メタデータ) (2024-10-05T12:29:51Z) - Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models [62.5501109475725]
知識蒸留(KD)は、より小さな学生モデルを模倣するように訓練することで、大きな教師モデルを圧縮する技術である。
本稿では、教師ネットワークが小さなオンラインモジュールを統合し、学生モデルと同時学習するオンライン知識蒸留(OKD)について紹介する。
OKDは、様々なモデルアーキテクチャやサイズにおけるリードメソッドのパフォーマンスを達成または超え、トレーニング時間を最大4倍に短縮する。
論文 参考訳(メタデータ) (2024-09-19T07:05:26Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z) - LightPAFF: A Two-Stage Distillation Framework for Pre-training and
Fine-tuning [146.51221523793342]
LightPAFFは、2段階の知識蒸留を使用して、大きな教師モデルから軽量の学生モデルに知識を伝達する。
LightPAFFはモデルサイズを5倍近く削減し、オンライン推論速度を5倍-7倍改善する。
論文 参考訳(メタデータ) (2020-04-27T14:00:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。