論文の概要: Making Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents
- arxiv url: http://arxiv.org/abs/2609.01272v1
- Date: Tue, 01 Sep 2026 14:04:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.720965
- Title: Making Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents
- Title(参考訳): 記憶型SLM型小型エージェント用型インテンションストアの開発
- Authors: Jinqing Zhao, Chengcan Wu,
- Abstract要約: ベストパブリッシュされたPM-ベンチの足場は65.1%のSet-F1に達する。
本稿では、ライフサイクルロジックをコードに配置し、モデルにスコープ言語を組み込む、Prospective Intention Store (PIS)を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prospective memory means carrying out a deferred intention at the right future cue while other work continues. Benchmarks now isolate it as an agent skill, yet frontier LLMs still struggle: the best published PM-Bench scaffold reaches only 65.1% Set-F1. We argue that this loop is schema-constrained state tracking rather than open-ended reasoning, and that small models can execute it when the action space is typed. We propose the Prospective Intention Store (PIS) that puts lifecycle logic in code and scoped language work on the model. The scaffold is agentic and training-free: no selector fine-tuning and no trajectory distillation. On PM-Bench, DeepSeek-Chat with PIS reaches 82.9% Set-F1. On Gemma-E2B, Set-F1 is only 4.2% without a store and at most 6.6% under seven retrospective memories, while PIS reaches 66.2%. PIS further reaches 70.1% Set-F1, where retrospective memory methods stay at most 54.4%. PIS sets a new state of the art on this benchmark and enables small models to surpass the published large-model scaffold.
- Abstract(参考訳): 予見記憶とは、他の作業が継続している間に、適切な将来のキューで遅延意図を実行することをいう。
ベンチマークではエージェントスキルとして分離されているが、フロンティアのLLMは依然として苦戦しており、最も優れたPM-Benchの足場は65.1%のSet-F1にしか達していない。
このループはオープンエンド推論ではなく,スキーマ制約のある状態トラッキングであり,アクション空間の型付け時に小さなモデルで実行可能である,と我々は主張する。
本稿では、ライフサイクルロジックをコードに配置し、モデルにスコープ言語を組み込む、Prospective Intention Store (PIS)を提案する。
足場は薬品と無訓練で、セレクターの微調整も軌跡蒸留も行わない。
PM-Benchでは、PSSのDeepSeek-Chatが82.9%のSet-F1に達した。
Gemma-E2Bでは、Set-F1はストアなしで4.2%、少なくとも7回の振り返りの記憶では6.6%、PSSは66.2%である。
PISはさらに70.1%のSet-F1に達し、レトロスペクティブのメモリメソッドは54.4%である。
PISは、このベンチマークで新しい最先端のモデルを設定し、小さなモデルが公開された大きなモデルの足場を超えることを可能にする。
関連論文リスト
- PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control [25.920573627524945]
PonderPounceはMLLMのネイティブ因果コンテキストをロボットメモリとして再利用する。
パウンスは現在の観察、指示、受容を直接受け取ります。
ベーススケールのトレーニングデータを持つRoboMMEでは、PonderPounceは同じPounceアーキテクチャとインターフェースの下で、9Bで60.83%、0.8Bで50.04%に達する。
論文 参考訳(メタデータ) (2026-08-25T06:24:36Z) - AgentWeave: Routing Before Reasoning for Efficient Function Calling in Tool-Rich Language Models [0.0]
我々は,有界モデル可視アクション空間を構成する決定論的事前推論ルーティング層であるAgentWeaveを紹介する。
オールツールの露出とは対照的に、AgentWeaveは70.18%のツールを減らし、61.70%の入力トークンを減らし、平均的なローカルモデルのレイテンシを50.95%低下させる。
論文 参考訳(メタデータ) (2026-08-24T10:38:08Z) - NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching [2.369705021757544]
量子化、より小さなモデル、オフロードといった既存のアプローチは、効果的なメモリ制限を上昇させるが、それでもいくつかの予算に収まるようにモデルを圧縮または分割できると仮定する。
実行中、モデルが常駐メモリよりも大きく、かつストレージがクリティカルパスの重み付けのアクティブな源となるような、厳密なモデル実行型メモリ設定を目標としています。
本稿では,この特性を予測的プレフェッチにより活用するストレージベース推論システムであるNeuroPrefetcherを提案する。
論文 参考訳(メタデータ) (2026-08-23T22:58:11Z) - Selective Memory Retention for Long-Horizon LLM Agents [0.0]
TraceRetainを使用して、機能を解釈してエントリをスコアし、キャパシティの低いものを削除します。
境界保持は、飽和クリーンベンチマークのメモリとステップ効率をタスクコストなしで購入し、ストリームがノイズを含むときだけキャッシュと区別する。
論文 参考訳(メタデータ) (2026-06-28T03:46:46Z) - Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents [0.0]
大規模言語モデル(LLM)エージェントは、事実が変化する長い多セッションの相互作用で機能する。
正しく行動するためには、事実の現在の値を使用し、置き換えられた値を捨てる必要がある。
この測定結果をトレーニング信号に変換するオープンな強化学習環境であるSupersedeをリリースする。
論文 参考訳(メタデータ) (2026-06-25T18:50:32Z) - GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection [133.45193150403537]
LLM(Large Language Models)のトレーニングは、重み付けやGPU状態の増大によって、メモリ上の重大な問題が発生する。
本研究では,メモリ効率のトレーニング戦略としてグラディエント・ローランド・プロジェクション(GaLore)を提案する。
私たちの8ビットのGaLoreは、BF16ベースラインと比較して、メモリを82.5%、トレーニング総メモリを63.3%削減します。
論文 参考訳(メタデータ) (2024-03-06T07:29:57Z) - BootsTAP: Bootstrapped Training for Tracking-Any-Point [62.585297341343505]
Tracking-Any-Point (TAP) は、ビデオ中の固体表面上の任意の点を追跡するアルゴリズムとして形式化することができる。
大規模でラベルなし、未修正のリアルワールドデータが、最小限のアーキテクチャ変更でTAPモデルを改善することができることを示す。
我々は,TAP-Vidベンチマークにおける最先端性能が,従来の結果よりも広いマージンで上回っていることを示す。
論文 参考訳(メタデータ) (2024-02-01T18:38:55Z) - Zephyr: Direct Distillation of LM Alignment [59.03530095974505]
ユーザ意図に合わせた,より小さな言語モデルの実現を目指しています。
従来の研究では、より大規模なモデルに教師付き微調整(dSFT)を適用することにより、タスクの精度が大幅に向上することが示されている。
蒸留直接選好最適化(dDPO)を用いて,意図のアライメントを大幅に改善したチャットモデルを学習する。
論文 参考訳(メタデータ) (2023-10-25T19:25:16Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z) - Combined Scaling for Zero-shot Transfer Learning [146.0851484769142]
我々は,ImageNet ILSVRC-2012バリデーションセットにおいて,85.7%のトップ1の精度を達成できるBASICと組み合わせたスケーリング手法を提案する。
この精度はCLIPとALIGNの9.3%を超える。
我々のモデルは、ロバストネスベンチマークの大幅な改善も示しています。
論文 参考訳(メタデータ) (2021-11-19T05:25:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。