論文の概要: ALLOT: Budgeted Hybrid-Memory Routing for Knowledge Updates in LLMs
- arxiv url: http://arxiv.org/abs/2609.32344v1
- Date: Sat, 26 Sep 2026 08:07:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 17:33:32.427581
- Title: ALLOT: Budgeted Hybrid-Memory Routing for Knowledge Updates in LLMs
- Title(参考訳): ALLOT: LLMの知識更新のための予算付きハイブリッドメモリルーティング
- Abstract要約: ALLOTは、大規模言語モデルのためのハイブリッドメモリルーティングフレームワークである。
学習した書き込み優先度を、ハードパラメトリックな予算から分離する。
Qwen3-4B の CounterFact では、ALLOT は 20% のパラメトリック書き込み予算で 0.760 の精度に達する。
- 参考スコア(独自算出の注目度): 6.419623380798736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: For large language models (LLMs), parametric adaptation is costly when retrieval already suffices. We introduce ALLOT, a hybrid-memory routing framework that separates learned write priority from a hard parametric budget. A memory-aware router combines frozen text representations, retrieval confidence, and relation metadata; a single ranking supports multiple write budgets while preserving all facts in external memory. On CounterFact with Qwen3-4B, ALLOT reaches 0.760 accuracy at a 20% parametric-write budget and recovers 78.4% of the budget-matched oracle gain, with 80% fewer parametric writes than dual-writing every fact. At this budget, jointly adding retrieval and relation features to text improves normalized oracle gain by 6.2 percentage points. Complementary Qwen3-0.6B shared-store results achieve dual-write-level accuracy with 6-14.5% parametric writes, and cross-benchmark transfer retains approximately 88% of in-domain gain. These results support allocating adaptation capacity according to its incremental value rather than treating every factual update as an equally valuable training target.
- Abstract(参考訳): 大規模言語モデル(LLM)の場合、パラメトリック適応は検索が既に十分である場合にコストがかかる。
我々は、学習した書き込み優先度をハードパラメトリック予算から分離するハイブリッドメモリルーティングフレームワークであるALLOTを紹介した。
メモリ対応ルータは、凍結したテキスト表現、検索信頼度、関係メタデータを組み合わせたもので、単一のランキングは複数の書き込み予算をサポートし、外部メモリ内のすべての事実を保存する。
Qwen3-4BのCounterFactでは、ALOTは20%のパラメトリック書き込み予算で0.760の精度に達し、予算に適合したオラクルの利益の78.4%を回復する。
この予算では、テキストに検索と関連機能を共同で追加することで、正規化されたオラクルのゲインが6.2ポイント向上する。
相補的なQwen3-0.6B共有ストアの結果は、6-14.5%のパラメトリック書き込みで二重書き込みレベルの精度を達成し、クロスベンチマーク転送はドメイン内のゲインの約88%を保持する。
これらの結果は、すべての事実更新を等しく価値のあるトレーニングターゲットとして扱うのではなく、漸進的な値に従って適応能力の割り当てを支援する。
関連論文リスト
- HasMem: Hard-Origin Adaptively Softened Memory for Long-Term LLM Agents [21.47408873041601]
ハードオリジン適応軟化メモリ(HasMem)を提案する。
凍結した急激な埋め込みは、検証可能な初期状態を提供する。
500ドルのLongMemEval-Sの質問に対して、ローカルの語彙F1はハードリファレンスの3.4ドルから8.9ドルに上昇し、負のログ類似度(NLL)への答えは12.257ドルから5.274ドルになる。
論文 参考訳(メタデータ) (2026-09-25T04:22:05Z) - AVT-Fabric: Active Visuo-Tactile Perception via Adaptive Evidence Selection for Efficient Robotic Fabric Comparison [50.18779315745876]
AVT-Fabricは、各比較の難しさに応じて触覚証拠を割り当てるRGBファーストフレームワークである。
400のホールドアウト比較において、AVT-Fabricはコンパクトな7Bマルチモーダル大言語モデルで98.0%の精度を達成した。
このフレームワークは実際のロボットシステムにもデプロイされており、8つのアプリケーションシナリオのうち7つのシナリオで78.1%のペアのランキング精度と正しい布地選択を実現している。
論文 参考訳(メタデータ) (2026-09-18T06:43:04Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - AdaMem: Adaptive Memory Token Allocation for Soft Compression in Retrieval-Augmented Generation [0.924096104256891]
AdaMemは、言語モデルのための関連誘導型軟式圧縮フレームワークである。
学習したパス関連推定値を、固定メモリトーケン予算のクエリ依存の割り当てにマップする。
これは、一致したメモリ予算において、他のソフト圧縮手法よりも一貫して優れている。
論文 参考訳(メタデータ) (2026-08-12T13:07:54Z) - Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - How Small Can You Go? A Controlled Study of LoRA Rank, Target Modules, and Quantization Trade-offs for Text-to-SQL on a 60M-Parameter Model [0.0]
r=16のLoRAは11.6パーセントの精度(59.6%対71.2%の精度)で回復し、パラメータの1%未満をトレーニングし、31%のピークGPUメモリを消費する。
INT8 と NF4 の量子化による QLoRA は、メモリコストが劇的に低く (0.60 GB) 、同等の精度 (52.8% と 53.2%) を達成する。
論文 参考訳(メタデータ) (2026-07-28T11:12:03Z) - Human-Inspired Memory Architecture for LLM Agents [0.9507070656654629]
6つの認知機構からなる生体記憶アーキテクチャを提案する。
各メカニズムは、単純メモリ蓄積の特定の障害モードに対処する。
S層スケール(50セッション)では、デダップベースのコンソリデーションにより、好みのリコールが+13.3pp向上する。
論文 参考訳(メタデータ) (2026-05-08T22:52:37Z) - MemMachine: A Ground-Truth-Preserving Memory System for Personalized AI Agents [2.541923091180284]
大規模言語モデル(LLM)エージェントはパーソナライゼーション、事実連続性、長期的推論を維持するために永続記憶を必要とする。
本稿では,短期,長期,プロファイルメモリを統合したオープンソースのメモリシステムであるMemMachineを紹介する。
MemMachineは、コンテキスト化された検索を使用して、周囲のコンテキストにマッチする核を拡大し、関連するエビデンスが複数の対話にまたがる場合のリコールを改善する。
論文 参考訳(メタデータ) (2026-04-06T16:57:06Z) - MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning [73.27233666920618]
本稿では,メモリを反復的に保持し,現在のターンと組み合わせたエージェントワークフローであるMemSearcherを提案する。
それぞれのターンで、MemSearcherはユーザーの質問をメモリに融合させ、推論トレースを生成し、検索アクションを実行し、メモリを更新してタスクの解決に必要な情報のみを保持する。
我々は,MemSearcher Agents の推論,検索戦略,メモリ管理を協調的に最適化する,エンドツーエンドの RL フレームワークである Multi-context GRPO を紹介する。
論文 参考訳(メタデータ) (2025-11-04T18:27:39Z) - Learning Adaptive Parallel Reasoning with Language Models [70.1745752819628]
本稿では,適応並列推論(Adaptive Parallel Reasoning, APR)を提案する。
APRは、spawn()とjoin()操作を使用して適応的なマルチスレッド推論を可能にすることで、既存の推論メソッドを一般化する。
鍵となる革新は、親と子の両方の推論スレッドを最適化して、事前に定義された推論構造を必要とせずにタスクの成功率を高める、エンドツーエンドの強化学習戦略である。
論文 参考訳(メタデータ) (2025-04-21T22:29:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。