論文の概要: VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
- arxiv url: http://arxiv.org/abs/2608.26005v1
- Date: Wed, 26 Aug 2026 16:50:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.915833
- Title: VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
- Title(参考訳): VoiceMem: リアルタイムインタラクションのためのデュアルブレインメモリのストリーミング
- Abstract要約: VoiceMemは、並列情報脳、感情的右脳、ストリーミングメモリI/O機構を備えたメモリアーキテクチャである。
実験と実世界の展開には3つの利点がある。
- 参考スコア(独自算出の注目度): 92.2925193726566
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversational systems, such as duplex speech language models (SLMs), still lack a streaming, accurate, and empathetic memory system as their soul. We introduce VoiceMem, a simple memory architecture with a parallel informational left brain, an emotional right brain, and streaming memory I/O mechanisms. We further build a complete pipeline for memory-aware SLM training, long-horizon evaluation, and decoupled deployment with interchangeable memory backends. Experiments and real-world deployment show three advantages: i) Accuracy: under top-5 retrieval, the left brain outperforms classical systems such as Mem0 at top-200 by nearly 30 points; ii) Emotional & Personal: the right brain, with short- and long-horizon affective attribution and dual-node persona modeling, achieves state-of-the-art performance across three persona benchmarks and improves the aggregate score by 4.29 points over the previous best system; and iii) Real-Time & Cheap: VoiceMem completes retrieval in 134 ms, well within standard VAD latency, adding no extra conversational delay while maintaining high accuracy and low cost. These results show that VoiceMem provides a practical memory foundation for real-time, personalized, and emotionally aware speech interaction.
- Abstract(参考訳): 二重言語モデル(SLM)のような会話システムには、その魂としてストリーミング、正確、共感的な記憶システムがない。
我々はVoiceMemを紹介した。VoiceMemは、並列的な情報脳、感情的右脳、およびストリーミングメモリI/O機構を備えたシンプルなメモリアーキテクチャである。
さらに、メモリを意識したSLMトレーニング、長期評価、メモリバックエンドとの分離配置のための完全なパイプラインを構築します。
実験と実世界の展開には3つの利点がある。
一 左脳は、トップ5検索において、上位200においてMem0等の古典的システムを30点近く上回っていること。
二 感情的・人格的:右脳、短・長期的感情的属性及び二重極性ペルソナモデルにより、3つのペルソナベンチマークにおいて最先端のパフォーマンスを達成し、前回のベストシステムよりも4.29ポイント向上する。
三 リアルタイム・チープ:VoiceMemは134msで検索を完了し、標準VADレイテンシの範囲内で、高い精度と低コストを維持しながら、会話の遅延を余分に追加しない。
これらの結果は、VoiceMemがリアルタイム、パーソナライズされ、感情的に認識される音声対話のための実用的な記憶基盤を提供することを示している。
関連論文リスト
- WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - Emotion-Attended Stateful Memory (EASM):The Architecture for Hyper-Personalization at Scale [3.036596192442501]
本稿では,ユーザ固有の会話コンテキストを動的に構築する感情適応型ステートフルメモリアーキテクチャを提案する。
感情的に異なる6つのカテゴリーにまたがる30の非記述会話を対象としたA/B制御実験を行った。
その結果は、悲しみ、苦悩、不確実性を含む感情的敵対的な会話においても一貫していた。
論文 参考訳(メタデータ) (2026-05-14T13:39:19Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization [57.17751568928966]
自己進化型メタメモリでメモリシステムを拡張するフレームワークであるMetaMemを提案する。
メタメモリ最適化の間、MetaMemは異なるタスク間で伝達可能な知識利用経験を反復的に蒸留する。
大規模な実験ではMetaMemの有効性が示され、これは強いベースラインを3.6%以上上回っている。
論文 参考訳(メタデータ) (2026-01-27T04:46:23Z) - HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents [3.9396865837159822]
HiMemは、長距離対話のための階層的長期記憶フレームワークである。
メモリ構築、検索、持続的なインタラクション中の動的更新をサポートする。
その結果、HiMemは、精度、一貫性、長期的な推論において、代表的ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-10T01:26:01Z) - LightMem: Lightweight and Efficient Memory-Augmented Generation [72.21680105265824]
我々は、メモリシステムの性能と効率のバランスをとるLightMemという新しいメモリシステムを紹介した。
人間の記憶のアトキンソン・シフリンモデルにインスパイアされたLightMemは、メモリを3つの相補的なステージにまとめる。
GPTとQwenのバックボーンを用いたLongMemEvalの実験では、LightMemは高いベースライン(最大10.9%のゲイン)を上回り、トークンの使用量を最大117倍に削減している。
論文 参考訳(メタデータ) (2025-10-21T17:58:17Z) - EgoMem: Lifelong Memory Agent for Full-duplex Omnimodal Models [40.712154207072594]
EgoMemは、リアルタイムのOmnimodalストリーム用に調整された生涯記憶エージェントである。
本システムは,リアルタイムのパーソナライズダイアログにおいて,事実一貫性スコアを87%以上達成する。
論文 参考訳(メタデータ) (2025-09-15T13:33:29Z) - RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems [41.89907261427986]
エージェントは、部分的可観測性、空間的推論の制限、高速なマルチメモリ統合など、現実世界の環境において永続的な課題に直面している。
本稿では, 空間, 時間, エピソディック, セマンティックメモリを並列化して, 効率的な長期計画と対話型環境学習を実現する, 脳にインスパイアされたフレームワークであるRoboMemoryを紹介する。
EmbodiedBenchの実験によると、Qwen2.5-VL-72B-Ins上に構築されたRoboMemoryはベースラインを25%上回り、クローズドソース(SOTA)のGemini-1.5を超えている。
論文 参考訳(メタデータ) (2025-08-02T15:39:42Z) - MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation [15.64077949677469]
メモリ拡張対話システム(MADS)の有効性を評価するための新しいメモリ拡張対話ベンチマーク(MADail-Bench)を提案する。
このベンチマークは2つのタスクを別々に評価する: メモリ検索とメモリ認識は、パッシブとプロアクティブの両方のメモリリコールデータを組み込んだものである。
このベンチマークにおける最先端の埋め込みモデルと大規模言語モデルの結果は、さらなる進歩の可能性を示している。
論文 参考訳(メタデータ) (2024-09-23T17:38:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。