論文の概要: ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models
- arxiv url: http://arxiv.org/abs/2604.08064v2
- Date: Wed, 15 Apr 2026 12:56:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-16 13:09:57.347767
- Title: ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models
- Title(参考訳): ImplicitMemBench:大規模言語モデルにおける無意識行動適応の測定
- Abstract要約: LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
- 参考スコア(独自算出の注目度): 60.14219417402433
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing memory benchmarks for LLM agents evaluate explicit recall of facts, yet overlook implicit memory where experience becomes automated behavior without conscious retrieval. This gap is critical: effective assistants must automatically apply learned procedures or avoid failed actions without explicit reminders. We introduce ImplicitMemBench, the first systematic benchmark evaluating implicit memory through three cognitively grounded constructs drawn from standard cognitive-science accounts of non-declarative memory: Procedural Memory (one-shot skill acquisition after interference), Priming (theme-driven bias via paired experimental/control instances), and Classical Conditioning (Conditioned Stimulus--Unconditioned Stimulus (CS--US) associations shaping first decisions). Our 300-item suite employs a unified Learning/Priming-Interfere-Test protocol with first-attempt scoring. Evaluation of 17 models reveals severe limitations: no model exceeds 66% overall, with top performers DeepSeek-R1 (65.3%), Qwen3-32B (64.1%), and GPT-5 (63.0%) far below human baselines. Analysis uncovers dramatic asymmetries (inhibition 17.6% vs. preference 75.0%) and universal bottlenecks requiring architectural innovations beyond parameter scaling. ImplicitMemBench reframes evaluation from "what agents recall" to "what they automatically enact".
- Abstract(参考訳): LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
効果的なアシスタントは、学習手順を自動適用するか、明示的なリマインダーなしで失敗する行為を避ける必要がある。
IndicitMemBenchは、非宣言的記憶の標準的な認知科学のアカウントから抽出された3つの認知的基礎構造から暗黙的記憶を評価する最初の体系的ベンチマークである。プロシージャメモリ(干渉後のワンショットスキル獲得)、プライミング(ペア実験/制御インスタンスによるテーマ駆動バイアス)、古典的条件付け(Conditioned Stimulus--Unconditioned Stimulus (CS-US))の関連性は、最初の決定を形作る。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
モデル全体の66%を超えず、トップパフォーマーのDeepSeek-R1 (65.3%)、Qwen3-32B (64.1%)、GPT-5 (63.0%)は人間のベースラインよりはるかに低い。
分析により、劇的な漸近(禁制17.6%対嗜好75.0%)と、パラメータスケーリング以上のアーキテクチャ革新を必要とする普遍的なボトルネックが明らかになった。
ImplicitMemBenchは、"どのエージェントがリコールしたか"から"それらが自動的に実行するもの"への評価を再設定する。
関連論文リスト
- Know It, Act on It: Investigating Memory Utilization in LLM Personalization [12.448786190019254]
大規模言語モデル(LLM)が,コンテキストに完全に存在する場合でも,関連するユーザの嗜好に反応しないことを示す。
我々は、同じユーザの好みに合わせて、ペア化されたノウテストとアクトテストを管理する分離された評価パラダイムを導入する。
我々は16のシステムと5つのメモリアーキテクチャにわたる大規模な実験を行い、1000の好みを3レベルの表現強度で評価した。
論文 参考訳(メタデータ) (2026-07-31T13:57:21Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Human-Inspired Memory Architecture for LLM Agents [0.9507070656654629]
6つの認知機構からなる生体記憶アーキテクチャを提案する。
各メカニズムは、単純メモリ蓄積の特定の障害モードに対処する。
S層スケール(50セッション)では、デダップベースのコンソリデーションにより、好みのリコールが+13.3pp向上する。
論文 参考訳(メタデータ) (2026-05-08T22:52:37Z) - MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval [37.54115468116941]
本報告では,Qwen3-Reranker を用いた多段 LLM 知識蒸留によるリグレードモデルファミリ MemReranker (0.6B/4B) について紹介する。
メモリ検索ベンチマークでは、MemReranker-0.6BはBGE-Rerankerを大きく上回り、オープンソースの4B/8BモデルとGPT-4o-miniをキーメトリクスでマッチングする。
MemReranker-4B はさらに 0.737 MAP を達成し、Gemini-3-Flash と同等のメトリクスを持つ一方で、推論遅延を10-20%の大型モデルで維持している。
論文 参考訳(メタデータ) (2026-05-07T12:33:57Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - Agentic Cognitive Profiling: Realigning Automated Alzheimer's Disease Detection with Clinical Construct Validity [66.94391219005291]
本稿では,臨床プロトコルロジックによる自動スクリーニングを実現するエージェント認知プロファイリング(ACP)を提案する。
我々の設計の中心は、すべての定量化を決定論的関数呼び出しに委譲することで、測定から意味的理解を分離することである。
ACPは、タスク試験で90.5%のスコアマッチ率、AD予測で85.3%の精度を達成し、一般的な基準を上回っている。
論文 参考訳(メタデータ) (2026-03-18T06:15:35Z) - Graph-Native Cognitive Memory for AI Agents: Formal Belief Revision Semantics for Versioned Memory Architectures [0.6091702876917279]
Kumihoは、形式的信念修正セマンティクスに基づくグラフネイティブな認知記憶アーキテクチャである。
アーキテクチャは、二重ストアモデル(Redisワーキングメモリ、Neo4j長期グラフ)を実装し、ハイブリッドフルテキストとベクトル検索を備える。
論文 参考訳(メタデータ) (2026-03-18T00:59:49Z) - MemPO: Self-Memory Policy Optimization for Long-Horizon Agents [52.00646524941419]
既存のメソッドは通常、外部メモリモジュールを導入し、格納されたメモリから関連する情報を検索する。
本稿では,自己記憶ポリシー最適化アルゴリズム(MemPO)を提案する。
MemPOはF1の絶対スコアが25.98%、SOTAベースラインが7.1%、トークン使用率が67.58%、73.12%である。
論文 参考訳(メタデータ) (2026-02-28T14:43:02Z) - The Algorithmic Self-Portrait: Deconstructing Memory in ChatGPT [17.579565226391146]
実世界の80人のChatGPTユーザの2,050個のメモリエントリを分析した。
私たちのデータセットの96%のメモリは、会話システムによって一方的に生成されます。
大部分のメモリ(84%)は、ユーザコンテキストで直接ベースになっています。
論文 参考訳(メタデータ) (2026-02-01T21:39:36Z) - HiNS: Hierarchical Negative Sampling for More Comprehensive Memory Retrieval Embedding Model [19.485780251890322]
既存のトレーニングデータ構築は、負のサンプルの階層的難しさという、重大な制限を見落としている。
本稿では, 負のサンプル難易度を明示的にモデル化し, 経験的基礎となる負の比率を組み込む, 基本データ構築フレームワークHiNSを提案する。
論文 参考訳(メタデータ) (2026-01-21T10:39:48Z) - Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution [52.76038908826961]
我々は静的ストレージと動的推論のギャップを埋めるため、$textbfReMe$ ($textitRemember Me, Refine Me$)を提案する。
ReMeは3つのメカニズムを通じてメモリライフサイクルを革新する: $textitmulti-faceted distillation$, きめ細かい経験を抽出する。
BFCL-V3とAppWorldの実験では、ReMeが新しい最先端のエージェントメモリシステムを確立している。
論文 参考訳(メタデータ) (2025-12-11T14:40:01Z) - CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs [62.116710797795314]
大規模言語モデル(LLM)は、パーソナライゼーションとタスクパフォーマンスを向上させるために、過去のインタラクションから永続的なメモリを使用することが多い。
タスクコンテキストに基づいて,LLMがメモリからの情報フローを適切に制御するかどうかを評価するベンチマークであるCIMemoriesを提案する。
論文 参考訳(メタデータ) (2025-11-18T21:51:23Z) - Early Detection and Reduction of Memorisation for Domain Adaptation and Instruction Tuning [4.145513103869504]
我々は、一般的な評価データセット上で1.4B-70BパラメータにまたがるPythia、Llama3、Mistralモデルを微調整する。
最初の数回は暗記が劇的に増加し、しばしば検証の難易度や評価性能が最適化される前に顕著に増加することが判明した。
我々は,n-gram-aware loss regulariserを導入し,最大40%までテストしたモデルファミリー全体の記憶を減少させることを示した。
論文 参考訳(メタデータ) (2025-10-13T13:12:46Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。